Добавлена поддержка Ежчана (ejchan.net, ejchan.site). Набегаем, тестируем архивацию, сообщаем о замеченных проблемах.
К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!

Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №270 /llama/

 Аноним 20/09/26 Вск 21:31:46 #1 №1708936 
Llama 1.png
Карта деградации при квантовании по доменам.png
Реальная длина контекста у моделей 6.png
1782118588935.jpg
#Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №xxx

В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная, но слегка тухлая вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference
Не вошедшее в шапку и архив полезных ссылок: https://rentry.co/llama-2ch-archive

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• Обертка над llama.cpp с закрытым исходным кодом: https://lmstudio.ai
• Обертка над llama.cpp с ограниченными возможностями: https://github.com/ollama/ollama

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• PocketPal - интерфейс для локального запуска моделей под андроид и IOS на llamacpp (CPU, GPU, и NPU инференс): https://github.com/a-ghorbani/pocketpal-ai
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1707443 (OP)
>>1705886 (OP)
Аноним 20/09/26 Вск 21:40:21 #2 №1708940 
Риг АМД господина на ОП-пике уже который тред заставляет нвидиянищуков страдать.

Освятил тред.
Аноним 20/09/26 Вск 21:40:34 #3 №1708941 
Дрочеры в треде?
Аноним 20/09/26 Вск 21:50:47 #4 №1708947 
4 P40 на майнерской плате.png
17508736997250.png
17634847846991.jpg
17851933800670839056.jpg
>>1708940
>Риг АМД господина на ОП-пике
>нвидиянищуков
...
>тем временем в ОП-картинках...
Аноним 20/09/26 Вск 22:12:46 #5 №1708961 
>>1708947
>4 P40 на майнерской плате
А вот это реально боль, 1x PCI ex слоты в майнерской плате.
Автор сетапа мудак, нужно слоты не менее x8 на серверной плате, тогда более-менее адекватный сетап бы получился.
Аноним 20/09/26 Вск 22:16:37 #6 №1708967 
По вашему мнению\опыту, как сильно версия PCI душит производительность с моешками и выгруженными слоями? Сейчас думаю оформить переезд на ам5, и соответственно с ддр4\PCIe3 прыгнуть на ддр5\PCIe5 осталось только продать душу чтобы купить 256 оперативки.
Аноним 20/09/26 Вск 22:17:53 #7 №1708969 
>>1708939 →
>Дохуя ты промптом решил?
Ну да. У меня нет никакого ассистентослопа и тех проблем типа соглашаемости про которые ты тут воешь. Потому что обиженка и выдумал каких-то врагов
>Вы
Вместо того, чтобы разобраться и кайфовать от хорошей модели, сидишь с кислой рожей и ноешь. Похож на эйрошиза, не удивлюсь если ты и есть
Наверно можно было бы и помочь, но зачем, если ты уже всё для себя решил и предпочитаешь быть нытиком. К тому же уже давно всё разжевали когда обсасывали темплейты для того же Эйра и когда чайноанон делился своими промтами
Аноним 20/09/26 Вск 22:19:39 #8 №1708973 
image.png
>>1708967
>осталось только продать душу чтобы купить 256 оперативки.
Оперативка продается на авито вот по такой цене. Можешь птату и проц продать потом.
Аноним 20/09/26 Вск 22:19:52 #9 №1708974 
>>1708739 →
>нестабильный что-ли

Он не должен быть нестабильным, правда я вижен не щупал, но 0731 пользуюсь на регулярной основе.
Попробуй 0731, ты будешь первым, кто честно проверит три модели, походу.

>ud_q2_k_xl, a вижен в ud_iq3_s от анслопов. И q3 прям заметно медленнее, всего 5.5т\с, в то время как q2 "летает" на целых 8.5-9.

Урок тебе на всю жизнь насколько iq кванты(и да, анслоповский q2_k_xl - это тоже iq квант) в нулину замедлены по сравнению с k квантами. Бери квант от тредовичка https://huggingface.co/BahamutRU/DeepSeek-V4-Flash-0731-MXFP4-Q3_K-Q2_K-mixed-GGUF - это честный квант без iq говна, увидишь реальную скорость этой модели.
Аноним 20/09/26 Вск 22:28:25 #10 №1708981 
>>1708967
Судя по логике, ты переезжаешь не на серверную плату, а на обычную, в итоге там будет один слот PCIe5 x16, следовательно у тебя одня видяха. Думаю прироста не заметишь вообще(будет минимальным), лучше сразу обновляйся на риг с серверной платой, потом сможешь расширяться, докупая видяхи.
Аноним 20/09/26 Вск 22:32:43 #11 №1708982 
>>1708967
При декодинге обмен генерациями пренебрежим, токены в секунду будут те же. А вот в префилле идет стриминг весов на видеокарту по шине для обсчета сразу батча, от шины он зависит напрямую (как и от размера батча). Если фуллврам - пофиг, хоть х1.
Если несколько карт - в лламе в режиме layer стриминг идет на самую первую, подключение остальных практически не важно. Вроде как в режиме тензор должно стримить на все, но он почти нигде не работал чтобы проверить. На фуллврам с тп от псп шин сильно зависит процессинг, может сильно пострадать при том что генерация ускорится. Если катать фуллврам вллм и другие - там при процессинге что в тп, что в пп знатные обмены, потому до определенного уровня его скорость будет во многом определяться шиной.
> ддр5
> 256 оперативки
64гиговые модули стоят на уровне cmp170 если что
> на ам5
С точки зрения ллм смысла и нет. Стоит рассмотреть риг не некросерверных платформах, ну или посвежее но там совсем цены ад.
Аноним 20/09/26 Вск 22:33:48 #12 №1708983 
>>1708947
Кстати и второй сетап тоже говно, обычная бюджетная плата где физически нет возможности каждой видеокарте выделить минимум x8 линий.
Аноним 20/09/26 Вск 22:34:04 #13 №1708985 
>>1708981
Скорость PCIE актуально только при tensor parallelism. В режиме layer split я лично комбинировал 4.0 x16 с 3.0 x4 и просадок никаких не было.
Аноним 20/09/26 Вск 22:37:27 #14 №1708989 
>>1708982
> С точки зрения ллм смысла и нет.
Разве что там будет броадкомовский сплиттер и линукс с патченым драйвером под p2p.
>>1708983
Там может быть х16 на первую, остальные чипсетными х4. Учитывая зоорпарк из трех архитектур видеокарт - разумное решение.
Аноним 20/09/26 Вск 22:41:46 #15 №1708992 
Мой систем промпт для геммы. На хуй в первом сообщении не прыгает, если в карточке не прописано.
https://rentry.co/ne4gs3x2
Начало проработано больше, чем конец.
Аноним 20/09/26 Вск 22:45:01 #16 №1708994 
Начал смотреть разные аддоны для глупой таверны. Почему никто не сказал о Qvink Memory? Это же имба, помимо того что делает короткую саммари, так переводит ее сразу на английский. Экономия 60-90% токенов с одного сообщения.
Аноним 20/09/26 Вск 22:53:54 #17 №1709001 
>>1708969
Ну ну. Мне твоя помощь не нужна, я тебе просто скажу хорош пиздеть. Решил он. Нихуя ты не решил. То, что гемма слоповая, излишне податливая и крайне плохо тюнится знают все. Решения ни у кого нет.
>У меня нет никакого ассистентослопа и тех проблем типа соглашаемости про которые ты тут воешь.
Ага, но пруфов ты конечно же не принесёшь потому что я такой вот нехороший шиз а может даже вообще эйрошиз. Логично нет.
Аноним 20/09/26 Вск 22:56:29 #18 №1709002 
>>1709001
Слабый байтик на пресетик, обойдёшься. Пруфы уже кидал и не раз, ктож виноват что ты отказываешься их видеть
Аноним 20/09/26 Вск 23:08:58 #19 №1709011 
>>1709002
Чел мне не нужен твой священный пресетик. Ты просто результат покажи.
"Пруфы уже кидал" это не пруф. Но раз для тебя это пруф, то я тоже кидал пруфы, что гемма это не более чем слоповый ассистент и никакими промптами это не исправить.
Аноним 20/09/26 Вск 23:12:30 #20 №1709013 
>>1709011
Ладно, ладно. Пойду лучше ещё слопика геммы покушаю чем с тобой спорить. Ты крутой 🤙
Аноним 20/09/26 Вск 23:32:41 #21 №1709027 
image.png
>>1708141 →
Баляяя... Я сделал хуйню, и получилось говно...

С одной стороны, я долбоеб, потому что по факту обнулил состояние обучения, и стартанул второй прогон тюнинга со стартовым лернинг рейтом.

С другой стороны, МЛщики, че за хуйня? Почему ваши нейронки это такое вонючее пердолево?
Первый раз запустил треню - лосс стоит на месте. Второй раз запустил треню на тех же данных - лосс вырос. И в итоге я не могу сказать ПОЧЕМУ нахуй.

Для запуска тебе нужно выбрать десять тысяч параметров тюнинга модели, чтобы в итоге увидеть распидорасенный лосс, и потом сиди гадай где ты проебался. Или еще хуже - иди окунайся в эти градиенты ебучие, пытайся понять где там сигнал не сигнал или еще какая хуйня.
Это че за ебатека? Это не инженерная область, а сраное гадание на таро. Ссу всем МЛщикам на лицо.

Я читал гайды, один, второй, третий, гуглил всякую поеботу. Чтобы что, через 18 часов всратых машинных ресурсов получить какашку? Вы там охуели?

Нейронщики забрали все области у алгоритмистов, якобы научили матстат чтобы он сам вычислял нужные фичи в датасете и че-то там предсказывал. И в итоге вы дебилы нихуя не можете придумать как сделать, чтобы обучение было стабильным автоматически? Вы чем вообще занимаетесь вообще? Почему мне надо читать десятки статей, выбирать сотню оптимизаторов и шедулеров, крутить тысячу параметров этих оптимизаторов, которые блять нихуя не имеют никакой человеческой интерпретации? И единственное что можно сделать в этой ситуации - тупо перебрать сотню вариантов, пока не найдется подходящая комбинация, которая не взорвет тебе лосс. Чем это отличается от астрологии?

Все. Я конченый.
Аноним 20/09/26 Вск 23:35:46 #22 №1709029 
>>1709027
DL в целом всегда алхимией был, че ты хочешь.
Аноним 20/09/26 Вск 23:51:36 #23 №1709039 
А чё степ флеша больше не будет?
Аноним 20/09/26 Вск 23:53:03 #24 №1709041 
>>1709039
Да. Его американцы хуйнули.
Аноним 20/09/26 Вск 23:56:53 #25 №1709043 
>>1708994
Нашел еще лучше - SummaryCeption, прям то что надо. Главное в настройках расширения, в самом конце где промпты добавить строчку: Write only on English; Тогда прям красота будет.
Аноним 21/09/26 Пнд 00:00:14 #26 №1709045 
>>1709027
> Почему ваши нейронки это такое вонючее пердолево
Так и есть, особенно страшно когда начинаешь, ведь тут слишком много вещей о которые легко споткнуться. Когда привык их уже не замечаешь, но продираться придется долго. Можно отучиться в универе, там все объяснят.
> Это не инженерная область
Да не, то же самое можно сказать про любую отрасль, когда там куча управляющих параметров и ты не в курсе как они работают и коррелируют. Мл - ужасно душная и заморочная область, но с высоким уровнем абстракции, которая создает ложное чувство простоты чтобы тутже вонзить тебе нож в спину как только расслабишься.
> как сделать, чтобы обучение было стабильным автоматически?
Так оно стабильно если данные норм и нет дичи в параметрах.
> тупо перебрать сотню вариантов, пока не найдется подходящая комбинация
Не не, тут нужно понять что конкретно происходит, перебирать можно вечно.

Иди обниму, все кто пердольными вещами занимаются через этот пожар проходили.
Аноним 21/09/26 Пнд 00:17:55 #27 №1709052 
Господа, я тут ваяю свой говняк для переработки манги в текст, и таки знаете что имею сказать?
Для теста использую пока Гемму4 26а4 в Q8 с виженом, и таки страницы манги она на русском описывает весьма неплохо и точно на первый мой непритязательный взгляд. Естественно у модели есть инфа о том, что за мангу она ковыряет, и её общее описание.
Так что возможно именно для этой задачи плотные модели будут даже избыточны.
Суммаризацию главы с тем, как это делает человек, сравню правда чуть позднее, надо поправить немного.
Аноним 21/09/26 Пнд 00:19:52 #28 №1709053 
>>1708947
>1
всратый нищий колхоз
>2
всратый зажористый колхоз
>3
Вот мне интересно, человек потратил несколько миллионов рублей. А потом сидит такой и думает "Хм, наконец-то я сейчас кубики блестящие разложу, красивенько так, поставлю пластмассовую бурятскую блядину на это все, сфоткаю и скину на двач, хыХЫ. А потом пойду в песочницу, в машинки играть".
Вердикт:
Инфантильный позер - сын вороватого росейского чиновника. Но это не точно, тупа вайб такой.
>4
Тот же автор.

На фоне всего этого, амуде-боярин выглядит как высшей степени разумист, альфа и омега, апологей разумности, стержень мироздания, 7 раса, хаваяющая на завтрак темную энергию, укатавшись в незримую материю вселенной и запивающая молоком гравитационных волн.
Аноним 21/09/26 Пнд 00:53:51 #29 №1709089 
>>1709053
Апогей разумности это я. Одна видеокарта: GTX 1650, 4 GB VRAM. Избранные тюны микромоделек. Правильные настройки в override-kv. Элитные истории, элитный РП, элитный кум. Англюсик онли (руслоп не употребляю). 20+ токенов в секунду.
На дебилов с кучей видеокарт смотрю как на абсолютных дебилов.
Аноним 21/09/26 Пнд 00:55:13 #30 №1709090 
1789941313268.jpg
1789941313319.jpg
Аноним 21/09/26 Пнд 01:03:48 #31 №1709095 
>>1709045
>Так оно стабильно если данные норм и нет дичи в параметрах.
Учитывая, что параметров десяток, для каждого хоть и существует какое-то "дефолтное" значение, обычно также существуют и рекомендации когда этот дефолт надо изменять - уже этого достаточно, чтобы обосраться по полной и не понимать в каком направлении двигаться.
Лернинг рейтов мне предлагало условно 4 штуки, ранк лоры 2-3 штуки, альфа лоры еще пара штук на каждый ранк. Уже 16 вариков по минимуму. И это только начало. И частенько нельзя сделать 1/10 часть прогона - нужно запускать полный прогон, чтобы увидеть лосс упал или не упал в итоге.
>Не не, тут нужно понять что конкретно происходит, перебирать можно вечно.
Увы, у меня в наличии только один инструмент отладки - это лосс.
Ну допустим понятно, что треня изначально нестабильной была. Хотя тоже хуй знает стабильной или нет. Если ЛР слишком маленький - оно тогда бы просто ничего не учило. Тогда с каких хуев на втором запуске вдруг нестабильность вылезла и лосс пополз вверх?
Даже про ЛР нельзя однозначно сказать надо больше или меньше. При маленьком оно может свалиться в хуевый локальный минимум - и там начать распиздрязг с лоссом. А с большим оно может просто никуда не попасть и скакать вокруг да около.
Датасет? Ну хз, может и не идеальный, но вроде и не совсем хуевый, до 99.999% идеальности доводить это охуеть можно.
Лора ранк и лора альфа - ну тут вообще хуй пойми в какую сторону крутить. То ли ранка мало (много новой инфы не усваивается), то ли альфы много (лора тюнинг взъерошивает всю модель).
А каждый эксперимент - 3-4 часа компьюта, и потом около суток кулдауна до сброса лимитов.
Аноним 21/09/26 Пнд 01:05:10 #32 №1709096 
>>1709089
>21/09/26
>GTX 1650
>4 GB VRAM.
>Апогей разумности это я.
Сидел бы ты хотя бы на 16ГБ - можно было бы сказать, но в таком случае ты мало бы отличался от других анонов, а так просто фрик еще и кумер
Аноним 21/09/26 Пнд 01:19:10 #33 №1709109 
>>1709096
Ща бы сарказм не выкупить
Аноним 21/09/26 Пнд 01:24:51 #34 №1709112 
>>1709095
> рекомендации когда этот дефолт надо изменять - уже этого достаточно, чтобы обосраться по полной
Да, эти рекомендации взяты для конкретных кейсов. Буквально частная производная от многомерной функции, что справедливо в одном наборе параметров, будет иным для другого.
> Лернинг рейтов
Наиболее сложное поскольку зависит от оптимайзера, батча и прочего. Для лоры с адамв и невысоких батчей оставь дефолт 1e-4.
> ранк лоры
Просто ее размер, на обучаемость не влияет
> альфа лоры
Множитель, ставь в диапазоне от четверти ранга до него, или просто приравняй рангу и забудь.
> это лосс
У тебя там тренировочный лосс, который может куда угодно плавать, погода на Марсе. Отведи часть датасета под валидацию и смотри на валидационный. Только с этим осторожно, лучше вручную подели чтобы там были примеры из разных датасетов, охватывающие все участки.
> лора тюнинг взъерошивает всю модель
Вут

Для диагностики помимо валидационного лосса выведи себе нормы градиантов, а также указание конкретных слоев где они максимальны и минимальны. Это поможет понять что что-то взрывается и локализовать, скорректировать альфу если она совсем уж неудачно подобрана. Ранг лоры ниже 16 лучше не ставить, не обучится толком. Лучше сразу делать декомпозицию - дора вместо легаси лоры. На какие слои peft идет, только атеншн, или mlp включены?
Аноним 21/09/26 Пнд 01:37:26 #35 №1709127 
>>1709096
Ты цены на 16гб видел?
Аноним 21/09/26 Пнд 01:41:28 #36 №1709130 
>>1709109
Сначала так и подумал, но мысль-то правильная, гнаться за размерами не рационально пока что
Аноним 21/09/26 Пнд 01:50:08 #37 №1709133 
>>1709112
>> ранк лоры
>Просто ее размер, на обучаемость не влияет
Ну как ллмки пишут, слишком большой ранк может приводить к оверфиттингу. Слишком маленький ранк может быть слишком тупым для каких-то сложных связей.
>Отведи часть датасета под валидацию и смотри на валидационный.
А как это работает вообще? Аутпуты же это рандом. Или оно по всем предложенным токенам от семплера ищет хоть какое-то попадание в референсный ответ?
>> лора тюнинг взъерошивает всю модель
>Вут
Чем больше альфа, тем больше влияния новых весов на веса исходной модельки. Слишком много альфы - тюненх ужарит модельку.
>На какие слои peft идет, только атеншн, или mlp включены?
Все слои, шоб круче было. Квен щас посоветовал только аттеншн использовать для стабильности.
Аноним 21/09/26 Пнд 02:13:52 #38 №1709143 
>>1708992
Да гемме будто похуй на промпт, как бы тут не поупили этими инструкциями, из-за ужарки в детерминизм даже промпт еле двигает свайпы. С десяток уже их испробовал и везде примерно один ответ.
Аноним 21/09/26 Пнд 02:14:16 #39 №1709145 
>>1709133
> к оверфиттингу
Там похоже другой вид оверфиттинга имелся ввиду. Лора - мощный регуляризатор, но поломать и всрать она может на любом ранге.
Если утрировать, низкий ранг = запоминание низких частот и более общих закономерностей (уровня "если просят это - ответь в таком стиле") с низкой детализацией и причины и ответа. Например, учишь ты модельку что когда ей предлагают кумить - нужно прыгать на хуй. Но запомнится более общий паттерн "что-то предлагают = становиться хорни и соглашаться". При этом, сова будет натянута на глобус очень грубо, возмущение низкоранговой лорой может быть кривым и косым, из-за чего трейнлосс как раз поползет вверх, а валидационный снизится.
Высокий ранг = больше емкость, более точно и детально. Уже будет различать, что прыгать на юзера нужно только если зовут действительно в кровать, а не просто на чашечку кофе. Или что существуют фетиши, где наоборот нужно вести себя грубо по отношению к юзеру а не быть покладистой. Но при этом падают способности к регуляризации и демпингу, запомнятся также все огрехи, а если датасет недостаточно разнообразен и мелкий - буквально запомнит сам датасет слово в слово.
Потому нужен баланс. Какой сейчас стоит?
> А как это работает вообще?
Также как и замер kl дивергенции, у ллмки спроси пусть объяснит.
> Слишком много альфы - тюненх ужарит модельку.
Не ужарит, но если сильно накрутил - придется снижать лр чтобы не было резкого оверфита и значения в матрицах не получились слишком уж малыми. Это можно посмотреть просто по std в получившихся весах.
> шоб круче было
Датасет для этого нормальный нужен где новые данные есть. Так действительно лучше только на атеншн накинуть для начала.
Аноним 21/09/26 Пнд 02:28:11 #40 №1709150 
>>1709053
Всё так, 99% адекватов на борде это АМД господа на Линуксе.
Вот мой сетап:

~/llama.cpp/build$ ./bin/llama-server --list-devices
Available devices:
ROCm0: Radeon RX 7900 XTX (24560 MiB, 24518 MiB free)
ROCm1: AMD Radeon PRO V620 (32752 MiB, 32722 MiB free)
ROCm2: AMD Radeon PRO V620 (32752 MiB, 32722 MiB free)
Аноним 21/09/26 Пнд 02:41:21 #41 №1709156 
Каждый раз открываю репо лламы, и аж плохо становится. В неделю стабильно +100 ПР. Смотришь логи коммитов, большая часть это СИ и тесты.
ХаггинФейс. Итоги.
Аноним 21/09/26 Пнд 02:44:13 #42 №1709158 
Погрузился в КВАНТОВАНИЕ. Оказывается это не так уж и сложно. Если есть моделька которую я хочу попробовать она без ггуфа я теперь не прохожу мимо, а просто делаю свой Q6_K или whatever.

На очереди imatrix.
Покопал совсем чуть-чуть и знаете что. Здесь часто слышу визги о том что imatrix "убивает русик".
Ну так всё же зависит от того как этот imatrix создавать! Всякие там радермахеры они же не делают на русике фокус совсем. Можно делать свой, ru-i-matrix и будет маленький размер и хороший русик! УУУУ блядь. Почему никто до сих пор этим не занялся? Только ноют.
Аноним 21/09/26 Пнд 02:50:04 #43 №1709162 
>>1709158
Вонючее меньшинство против тихого большинства.
И так во всём, вбросы от буйных без измеримых и воспроизводимых результатов ничего не стоят
Аноним 21/09/26 Пнд 02:59:22 #44 №1709165 
>>1709156
Скорей всего после покупки Нвидией проект вообще закроют. Многие то и не знают, что такие крупные корпорации часто покупают проекты с целью уничтожения. По тому как Жоре стало похуй на проект после покупки, можно сделать вывод что для этого его и купили.
Аноним 21/09/26 Пнд 03:21:22 #45 №1709168 
>>1709162
Хз что ты пытался сказать. Есть сомнения, что и-матрикс убивает русик? Посмотри типичные иматрикс датасеты. Там русский, бывает, присутствует, но наряду с кучей других нахуй не нужных языков вроде норвежского, африкаанс и так далее. Дохуя упора на кодинг, математику, науку, энциклопедические статьи - и это всё на ингрише.
Аноним 21/09/26 Пнд 03:30:43 #46 №1709172 
>>1709165
Покупают конкурентов которых легко убить. Закроешь llama.cpp - появится форк llm.cpp через неделю и вся аудитория очень быстро переползет туда.

Я уж молчу про то что llama.cpp в принципе не конкурирует ни с одним продуктом NVIDIA, поэтому чего они этим добьются кроме просранной репутации и 13 миллиардов - непонятно.

Вот положить болт на нормальную поддержку AMD внутри llama.cpp они могут. А чтоб прям убить llama.cpp - врятли.
Аноним 21/09/26 Пнд 03:31:51 #47 №1709174 
>>1709168
Он не только русский убивает, но и программирование. В датасете обычно мало примеров. Единственное что более-менее норм остается, это английские чаты и проза, ну и все что в википедии, потому что датасет весь из этого. Матан остается с наукой, потому что его дофига в википедии.
мимо
Аноним 21/09/26 Пнд 03:34:36 #48 №1709175 
>>1709158
Если ты делаешь Q6_K, то зачем твои вскукареки про imatrix вообще? Иматрикс весь влияет на Q4 - тут мощная зависимость, как разные модели с ним или без, на Q5 уже послаблее, часто незаметно, на Q6 никакой разницы есть там иматрикс или нет.
Аноним 21/09/26 Пнд 04:41:34 #49 №1709189 
Screenshot 2026-09-20 at 21-40-30 Привет. - llama-ui.png
Аноним 21/09/26 Пнд 05:38:44 #50 №1709198 
>>1709175
Q6_k это просто пример был. Так-то у меня есть интерес к IQ4_XS и ниже (некоторые жирные модели у меня влазят только в IQ2). А ещё интересно, что можно выжать из IQ1
Аноним 21/09/26 Пнд 06:16:12 #51 №1709201 
1.jpg
2.jpg
Эпичный конец. Сначала даже не верилось что он настолько абсурдно отыграет.
Аноним 21/09/26 Пнд 06:50:18 #52 №1709209 
Всего за месяц мы потеряли две флеш модели, глм и дипсик.
А вспомните когда в конце прошлого только вышел долгожданный глм 4.6v, не успели его опробовать и сразу вышел солар в начале года. Были такие надежды.
И каким то образом всё это задушили меньше чем за год. 100б > 700б.
Аноним 21/09/26 Пнд 07:55:41 #53 №1709220 
https://huggingface.co/Altworld/Hemmingway-1

Какой-то шизотьюн квена утверждает что разъебал всех корпов в общении. Верим?
Аноним 21/09/26 Пнд 08:12:31 #54 №1709227 
>>1709209
GLM flash все равно отстой какой-то, мне Q5 / Q6 не понравилась, сильно плывет по вниманию к деталям.

>>1709220
>квен
Хорошо пошутил
Аноним 21/09/26 Пнд 08:23:08 #55 №1709232 
У меня одного в последних версиях llama.cpp появилась проблема со зрением 31б Геммы? Кидаю картинку - вылетает на 94% процессинга промпта. Не меняя настройки перескакиваю на старую версию - все нормально. Причем, некоторые картинки нормально проходят. Думал, от размера зависит - нифига, после ресайза все равно то же самое на части картинок. Формат жпг одинаковый.
Аноним 21/09/26 Пнд 08:24:13 #56 №1709233 
>>1709198
Крч склепал мини-датасетик для imatrix на 120 Кб, почти полностью состоящий из русского (ролеплей и короткие истории) + добавил парочку историй на английском и парочку примеров кодинга (запрос-ответ).

Может это и не много, но для сравнения вот посмотрел что у бартовского там из русика в датасете - оказывается, какие-то крохи вообще, около 20 коротеньких текстов - что-то из новостей, из рекламы надёргано, вообще дичь.
Вот один пример:
При заливке не горячим, а остуженным до комнатной температуры маринадом капуста потребует более продолжительного маринования – с неделю, но хрустеть будет еще лучше. В этом варианте приготовления в ней сохранится больше витаминов и других полезностей, так что, если вы не спешите, можете попробовать. Только специи (лавровый лист, перцы и др) лучше проварить в маринаде вместе с солью и сахаром, чтобы они полнее раскрыли аромат.
А в остальном там просто куча других языков и овердохуя кодинга.

В общем, заквантовал в IQ3_S. (ах да, это Гемма-4-26). Получилось 11.1 Гб. ru-imat-IQ3_S ёпта. Не спрашивайте нахуя.
"Повреждений русика" или слабоумия пока что не наблюдаю, вот прямо вообще идеально всё.
Попробовал также в IQ1_M квантануть - полные слюни с кучей корейских символов.
Аноним 21/09/26 Пнд 08:33:28 #57 №1709236 
Квен флеш некст это что то на уровне 2.3bpw 300б моделей по интеллекту и стабильности... Лучше уж тогда их запускать.
Аноним 21/09/26 Пнд 08:43:20 #58 №1709243 
>>1709232
Короче там чето нахуевертили и теперь надо задавать --image-min-tokens и --image-max-tokens чтобы было не больше микро-батча.

Пиздец конечно неудобно.
Аноним 21/09/26 Пнд 08:45:24 #59 №1709246 
>>1709168
Ты реально не видишь дыру в логике? Как сказанное тобой показывает что иматрикс убивает русский и другой языки? Это пиздец. Отсутствие его в датасете не делает его хуже, это не делает его лучше. Отсутствие деградации, отсутствие улучшения
Двачую анона выше, что воспроизводимых результатов иматрикс шиз пока не принес. Плоскоземельщик и сторонник уринотерапии
Аноним 21/09/26 Пнд 08:49:58 #60 №1709249 
importance matrix просто сохраняет способности модели (в некоторой степени) при квантизации

Если в калибровочном датасете не было русского языка - то получается, что использование importance matrix не позволило деградировать (насколько это возможно) при квантизации лишь тем языкам, которые собственно и были в importance matrix

Активного ухудшения того, что не пытались сохранить, не должно быть - логика обычно такая - но в то же время нет доказательств, что калибровка специфическими датасетами не работает как этакая чаша весов, смещая способности модели в сторону того, на что калибровали

Одно точно известно - НАМЕРЕНИЯ ухудшить языки, которых в калибровочном датесете нет, как известно не существует

Квантуя модельки с калибровкой через imatrix, авторы ггуфов просто не думают о том, что у каких-то червей-иностранцев может быть 0 улучшений или "отрицательные улучшения" (лол). Терпите.
Аноним 21/09/26 Пнд 08:53:51 #61 №1709251 
>>1709246
Ну в таком случае все квантоделы шизы, так из твоих слов выходит.
Аноним 21/09/26 Пнд 08:55:02 #62 №1709252 
>>1709251
Выходит из твоей нездоровой интерпретации*
Аноним 21/09/26 Пнд 08:56:38 #63 №1709254 
>>1708936 (OP)
Аноны сейчас поднимаю приложуху простейший календарь на пайтоне
Код пишет обычная внешняя бесплатная модель.
Постоянно поправки, тут измени, здесь ошибка...
Если я поставлю обёртку для агентов и дам агенту работать самостояльно - там будет такая же ерунда? Или условно поставил модель дал ей полный список ТУДУ и они по итогу часа за два за три сама сможет написать продукт?
Аноним 21/09/26 Пнд 08:58:33 #64 №1709256 
>>1709254
> написать продукт
Нет. Код напишет и проверит
Аноним 21/09/26 Пнд 08:59:43 #65 №1709259 
>>1709254
Зависит от модели и от обертки. В целом это выполнимо, но есть 1000 возможностей зарулить не туда. В общем, готовься контролировать процесс и внятно объяснять че надо делать.
Аноним 21/09/26 Пнд 09:01:46 #66 №1709261 
>>1709249
Иматрикс это когда моделька читает текст, а иматриксователь смотрит какие у модельки веса активировались. И вот эти "горячие" веса помечаются как "важные". Если не показать ей русского текста, то русские веса будут помечены как "малозначимые" и будут уквантованы в нулину.
Аноним 21/09/26 Пнд 09:04:33 #67 №1709263 
>>1709252
Нездоровый у тебя стиль письма. Приходится интерпретировать. Просто посмотри на хуйню, которую ты пишешь:
>Отсутствие его в датасете не делает его хуже, это не делает его лучше. Отсутствие деградации, отсутствие улучшения
Даже квен в IQ2_XXS внятнее выражается.
Квантоделы стараются включить примеры из разных языков в датасет для чего? Для того, чтобы эти языки там лучше "сохранились". А для тебя это уринотерапия от шизов. Выходит, что по твоей логике все квантоделы - шизы.
Аноним 21/09/26 Пнд 09:05:08 #68 №1709264 
>>1709261
> Если не показать ей русского текста,
То никакие "русские веса" (што блять) никто не увидит
Логика идиотская. У модели с большей вероятностью все то же самое будет активироваться, с очень мелкими расхождениями.

И вообще если поинспектить ггуфы, можно заметить, что квантуются примерно однохуйственные вещи что с imatrix что без него

Ты же пытаешься это завернуть в сторону РУСЕК НАМЕРЕННО ПОРТЯТ РРРЯЯЯ!!!11
Аноним 21/09/26 Пнд 09:06:09 #69 №1709265 
>>1709259
>>1709256
Капец. И какая модель лучше всего сейчас с этим справляется? Кодекс с Астрой?
Аноним 21/09/26 Пнд 09:06:11 #70 №1709266 
>>1709254
Смотря как настроишь, но в целом да, запустил и оно само работает, тестит, правит. Только запускать лучше в виртуалке, а то если не убьет систему, то засрать всяким калам может на изи.
Можешь в агенто треде поспрашивать, но это загон для умалишенных, сразу предупреждаю.
Аноним 21/09/26 Пнд 09:06:59 #71 №1709267 
>>1709265
Для этого другой тред на доске. Иди туда
Аноним 21/09/26 Пнд 09:07:14 #72 №1709268 
image.png
Всмысле блять мейби?
Слушайся, блядская машина!
Аноним 21/09/26 Пнд 09:08:13 #73 №1709269 
>>1709264
Никто намеренно ничего не портит. Просто никто намеренно не делает фокус на русике в иматрикс-датасетах. Делают фокус на английском и на кодинге, а русский там постольку-поскольку наравне с хинди, ивритом, шведским и так далее.
Посему если твоя цель - общение на русском и ты используешь imatrix квант по каким-то своим причинам (чтобы влезло и была скорость, например), то есть смысл сделать свой ru-imatrix квант. Просто чтобы качество русика было выше. Чего ты так завёлся от этого?
Аноним 21/09/26 Пнд 09:09:49 #74 №1709270 
>>1709263
Присутствие русского в датасете делает так, что он квантуется чуть лучше. Его отсутствие там не делает так, что он квантуется хуже. Противоречие где? У тебя по математике и информатике совсем плохие оценки в школе были, что не понимаешь элементарную логику?
По поводу "русских весов" в голос. Было несколько научных статей, что мультилингуал активации помогают всем языкам, тот же норвежский в том числе помогает русскому, потому что модель не "думает" на определенном языке, и присутствие других языков в датасете уже достаточно, чтобы улучшить квантования перевода на ЛЮБЫЕ которые есть в датасете
Ты можешь сколько угодно визжать, что иматрикс убивает русик, но это именно что бред буйного и не более. Либо приноси воспроизводимые примеры
Аноним 21/09/26 Пнд 09:09:57 #75 №1709271 
>>1709265
Если у тебя не что-то сложное, то практически любая, из локальных 27 квен и квен Некст, ну и фактически любая из больших новых.
Аноним 21/09/26 Пнд 09:19:29 #76 №1709278 
>>1709270
Ебанат, ты бы не заикался про логику-то. Перечитай свой бред ещё раз.
Аноним 21/09/26 Пнд 09:22:30 #77 №1709281 
>>1709270
>делает так, что он квантуется чуть лучше.
Пруфы неси, шиз.
Аноним 21/09/26 Пнд 09:26:25 #78 №1709284 
>>1709278
Иматрикс не ухудшает то, что отсутствует в его датасете. Слышал что-нибудь про игру с положительной суммой? Нет никаких русских весов и русских активаций. У модели активации настолько широкие, чтобы добавление любых языков в датасет иматрикса уже улучшает способность модели выражаться на любых языках, какие у нее есть в датасете. Как и >>1709264 пишет
>У модели с большей вероятностью все то же самое будет активироваться, с очень мелкими расхождениями.
Хоть кто-то здесь понимает, о чем говорит. Какойад
Аноним 21/09/26 Пнд 09:29:20 #79 №1709285 
>>1709284
Ты можешь:
1) улучшить русик
2) не улучшать русик (почему-то тебе не хочется это назвать ухудшением ну да похуй, ты просто придрался к словам, пусть это будет не улучшением однако в варианте №2 русик будет хуже чем в варианте №1. Вывод: отсутствие русика в датасете иматрикса ведёт к ухудшению русика в кванте. Сасай-обтекай.
Аноним 21/09/26 Пнд 09:30:42 #80 №1709286 
>>1709285
Ебааать, понял. Действительно неуч, дырявая логика восьмиклассника. Ты буквально не можешь осознать то чего тебе пишут, лол
Аноним 21/09/26 Пнд 09:31:48 #81 №1709288 
Помогите ньфагу
https://huggingface.co/jayn7/Z-Image-Turbo-GGUF
Как данную хуитку запустить на некропекарне 16gb и некровидюхой без CUDA. ollama да?
Аноним 21/09/26 Пнд 09:33:57 #82 №1709289 
1789972438446.png
>>1709288
В картинкотред пройдите
Аноним 21/09/26 Пнд 09:36:31 #83 №1709291 
Никто еще не пробовал алису?
https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
Аноним 21/09/26 Пнд 09:37:27 #84 №1709292 
>>1709285
Ты троллишь или взаправду такой тупой? Отправь эту ветку ЧатГопоте, может хоть ей терпения хватит тебе объяснить на простых советских бытовых примерах, чтобы твоя плесневелая голова переварила.
>>1709288
В картинкотреде помогут, тут текстогенерация.
Аноним 21/09/26 Пнд 09:38:07 #85 №1709294 
imatrix-фобия у чела растет на почве того, что он сам себя убедил, будто бы когда модель говорит на конкретном языке - работают какие-то страшные внутренние части модели, которые активируются ТОЛЬКО на этом языке

На деле же там одни оверлапы - если посмотреть через j-lens например, видно что это целый градиент по слоям

Ну допустим токен ПУК = слои с 25 по 39й
Смотрим токен FART = слои с 24 по 37й

Не ебу как там с этим отдельные тензоры коррелируют или че там вообще на техническом уровне происходит, но тут и дураку понятно, что когда калибруется по англюсику то и русский тоже никуда не девается
Аноним 21/09/26 Пнд 09:42:30 #86 №1709298 
>>1709294
Там на русских весах все понятно стало уже. Непонимание приводит к эзотерической интерпретации, вызывающее поведение как отчаянная попытка разобраться, чтобы его с ложечки покормили и объяснили
Аноним 21/09/26 Пнд 09:43:11 #87 №1709301 
>>1709292
Ну отправь. Ты не понимаешь что ли что при квантовании из скажем f16 в q4 страдает всё в том числе русик? Добавь русик в датасет - он улучшится. Не добавил русик в датасет - получил русик который хуже. Проблемс? Хватит уже семёнить, порватка.
Аноним 21/09/26 Пнд 10:02:36 #88 №1709310 
image
image
>>1709284
>Иматрикс не ухудшает то, что отсутствует в его датасете.
Ухудшает. Хоть бы chatgpt спросил, прежде чем хуету писать.
Аноним 21/09/26 Пнд 10:09:12 #89 №1709313 
>>1709291
хотя, яндекс выложил вообще голую базу без шаблонов

https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base/blob/main/tokenizer_config.json
Аноним 21/09/26 Пнд 10:09:23 #90 №1709314 
>>1709310
>chatgpt
>копропомоечка угождающая юзеру, которая например обрекла гендиректора Krafton на финансовый крах и судебный иск, потому что поддержала его маняидею
>данные из 2023
Даже не знаю что здесь лучше. Вот упомянутая выше бумага https://arxiv.org/html/2503.03592v3 вернее одна из
Предпочитаешь верить иидиоту и закрывать глаза на научные бумажки - твоё дело
Но на самом деле всё ещё проще. Приноси воспроизводимые однозначные результаты и показывай треду. Это тебе не высеры копропомоечки приносить и не набрасывать, конечно
Аноним 21/09/26 Пнд 10:11:35 #91 №1709316 
Вот ещё две: https://arxiv.org/pdf/2407.03211
https://arxiv.org/pdf/2402.18815
Хотел пруфы - наслаждайся. Либо приноси достойный ответ, либо возвращайся в палату и попроси успокоительного
Аноним 21/09/26 Пнд 10:13:20 #92 №1709317 
>>1709314
Ты первый стал утверждать что иматрикс не ухудшает русик. Вот ты и приноси пруфы.
Аноним 21/09/26 Пнд 10:14:55 #93 №1709318 
image.png
>>1709317
Принёс-принёс. Вон три ссылки выше. Оранжевым цветом выделены. Нажимаешь на них и читаешь. Источник хороший, там все ML лабы публикуются. Вот скриншот приложил куда надо нажимать, чтобы увидеть текст. Верю в тебя
Аноним 21/09/26 Пнд 10:16:41 #94 №1709319 
>>1709318
Твои ссылки ничего не доказывают. Вопрос был поставлен конкретно: где пруфы что иматрикс не ухудшает русик? Твои ссылки ничего общего с этим вопросом не имеют. Или это у тебя троллинг такой, забросать оппонента каким-то мусором, пусть сидит читает? Возьми и приведи цитаты оттуда. Не можешь? Досвидос.
Аноним 21/09/26 Пнд 10:18:57 #95 №1709322 
>>1709319
Понятно, на этом можно и закончить. Как и на том, что сам ты пруфов никаких не предоставлял никогда и не предоставишь, потому что нет их
Аноним 21/09/26 Пнд 10:19:56 #96 №1709323 
>>1709317
>>1709319
Ставлю вопрос конкретно: где пруфы что иматрикс ухудшает русик? Кстати все обсуждение именно с этого утверждения и началось. Пруфы почему не принесли?
Аноним 21/09/26 Пнд 10:23:43 #97 №1709327 
>>1709323
А я разве так говорил? Ну может я просто не совсем точно выразился. Я имел в виду, что с "плохим" датасетом в иматриксе русик хуже чем если бы датасет был хороший для русика, НО, читай внимательно: ВСЕ ХУЙ КЛАЛИ НА РУСИК. Следовательно во всех иматриксах которые ты качаешь русик испорчен. Так понятней стало?
И тут решение только одно - делать свои кванты. Я не понимаю каких ты хочешь "пруфов" если ты сам уже согласился что хороший датасет с русиком улучшает русик в иматриксе. Надо же смотреть на реальное положение дел на хуггинфейсе. Там нету иматриксов, в которых русик был бы не испорчен, потому что датасеты говняные, там упор на кодинг, на инглиш.
Аноним 21/09/26 Пнд 10:25:58 #98 №1709328 
Вот этот базу говорит >>1709327
Нам нужен правильный ru-imat. Это особенно остро ощущается в квене.
Аноним 21/09/26 Пнд 10:26:26 #99 №1709329 
>>1709327
Мань, вопрос конкретный задан: где пруфы-то? Вот эти твои буквы которые ты набираешь пруфом не являются. Я тоже много что могу на своем устройстве ввода набрать.
Показывай скриншоты, воспроизводимые результаты, где imatrix квант в датасете которого не было русского на русском пишет хуже, чем static квант без imatrix. Или это у тебя троллинг такой, выманивать из противоположной стороны опровержения твоей точки зрения, потому что ты ленивое говно? Показывай конкретику. Не можешь? Досвидос.
Аноним 21/09/26 Пнд 10:29:41 #100 №1709330 
>>1709329
>Мань, вопрос конкретный задан: где пруфы-то?
Ещё раз: зачем тебе пруф если ты и сам согласился с утверждением?
Вот твои слова:
>Присутствие русского в датасете делает так, что он квантуется чуть лучше.
Так вот, в датасетах русского - с гулькин хуй. Поэтому русик безнадёжно там испорчен.
Аноним 21/09/26 Пнд 10:30:02 #101 №1709331 
Возьмите уже 2 одинаковых кванта от мрадермахера, у него на всех новых моделях есть Q4_K_S с иматриксом и без, тут вся разница и будет видна сразу. Потом прогнать через какие-нибудь тесты для генерации одинакового промпта на русском.
Аноним 21/09/26 Пнд 10:31:40 #102 №1709332 
>>1709331
Ну там как правило в иматриксе русик хуже, это уже все давно знают.
Аноним 21/09/26 Пнд 10:31:49 #103 №1709333 
>>1709330
Это не мои слова, тут не чай вдвоем. Ещё раз, конкретная постановка вопроса: где пруфы, что "датасетах русского - с гулькин хуй. Поэтому русик безнадёжно там испорчен."
Показывай. Приноси два imatrix кванта, в одном в imatrix датасете русский есть, в другом нет. А ещё лучше вместе с ними принести static квант. Делай. Не можешь? Досвидос.
Аноним 21/09/26 Пнд 10:36:04 #104 №1709336 
>>1709331
Тогда срач придётся заканчивать и снова возвращаться к шапке
Аноним 21/09/26 Пнд 10:36:10 #105 №1709337 
>>1709333
А где пруфы, что если из иматрикса убрать русик то русик не испортится?
Смотри, тут и пруфов не нужно. Ты просто пытаешься квантоделов выставить шизами зачем-то, но они как бы знают что делают и поэтому стараются добавить по чуть-чуть каждого языка. Если бы это не меняло качество языка то они бы этого не делали. Вот тебе и пруф, обтекай.
Аноним 21/09/26 Пнд 10:39:02 #106 №1709339 
Жоришка жопанов...
Подскажите поледний нормальный рп где не насрано в промпт процессинг, я заебался, просто рандомно всё репроцесится который раз.
Аноним 21/09/26 Пнд 10:39:26 #107 №1709340 
Вкусняшки, стоит ли качать аблитерацию/херетик для 3.8 флеш 170б? И если да, то от кого? Что вам зашло больше?

Запустил этого ЗВЕРЬКА на своих мощных 48 ddr4 и 3060@12 VRAM +p104@8 VRAM в q3, и выглядит пока вполне сносно. Но никакие промпты не пробивают с ризонингом. Без — работают, но в таком случае он пишет всё короче и короче, и старается избегать неприятных тем.
Аноним 21/09/26 Пнд 10:39:43 #108 №1709341 
>>1709337
> Смотри, тут и пруфов не нужно
> Вот тебе и пруф
Иногда я искренне завидую тупоголовости некоторых индивиидумов.
Впрочем, сути это не меняет: конкретных доказательств ты не принес, как и всегда, поэтому продолжаешь числиться буйным шизом, который раз в месяц-два регулярно высирается и начинает срач, вместо того чтобы >>1709331
Аноним 21/09/26 Пнд 10:40:03 #109 №1709342 
>>1709333
>в одном в imatrix датасете русский есть, в другом нет.
Дружище, когда твоё утверждение идёт в разрез с банальной логикой (вот как можно убрать язык из датасета и надеяться на то, что это не испортит способности модели общаться на этом языке?), с общепринятым мнением и с тем, что делают авторитетные знающие люди (квантоделы), то пруфы обязан принести конкретно именно ты.
Аноним 21/09/26 Пнд 10:40:43 #110 №1709343 
>>1709339
Не в кванте проблема, а в прослойке между креслом и монитором. Или в бекенде, если очень повезло словить баг.
Аноним 21/09/26 Пнд 10:42:37 #111 №1709344 
>>1709342
> вот как можно убрать язык из датасета и надеяться на то, что это не испортит способности модели общаться на этом языке
Выше уже двое анонов тебе объяснили, что при ответах на разных языках у моделей активируются одни и те же части. Значит, и квантуются языки одинаково. Выше тебе уже предоставили три научных труда, которые это подтверждают. Пруфы есть. Ты их игнорируешь и обратное доказать не можешь даже конкретным примеров, запустив два кванта от mradermacher - с imatrix и static, и прислав скриншот-сравнение. Что делается за несколько минут.
Аноним 21/09/26 Пнд 10:48:01 #112 №1709349 
>>1709327
>ВСЕ ХУЙ КЛАЛИ НА РУСИК
Могу их понять. Адекваты используют англюсик, а такие как ты никому не интересны. Ёбик потратил на срач больше времени, так ничего и не доказав, хотя мог бы давно уже примеры продемонстрировать.

Как хорошо быть англюсикоэнджоером.

>>1709339
В настройках обосрался. Чекай логи, проверяй почему чекпоинты не проходят валидацию.

>>1709340
От Orcarouter норм. Качать стоит, как ни странно даже для кода.
Аноним 21/09/26 Пнд 10:54:06 #113 №1709351 
Хм, хочу рип-версию гвена на 122B сделать. Ну который с энграммой. Датасет есть вроде как.
Если я это сделаю - autoround/vllm из коробки будет читать с уменьшенным числом экспертов модель, или изменения будут существеннее, чем в конфиг-файле поменять цыферку числа экспертов и веса смерджить межжу ненужными экспертами?
Аноним 21/09/26 Пнд 10:54:46 #114 №1709352 
>>1709143
Я на Q_4_K_M, да, без ризонинга промпт - это слабый-слабый намек. Но с ризонингом она обращает внимание на него, может и нахуй послать, если незнакомке предложить поебаться.
Аноним 21/09/26 Пнд 11:12:29 #115 №1709365 
image.png
Я как то и не заметил что --no-mmap больше нет.
Всё, спиздили. И не просто заменили название, а с концами оторвали возможность загрузить модель фулл в рам чтоб она там и оставалась и не выгружалась.
Аноним 21/09/26 Пнд 11:12:36 #116 №1709366 
Чё за jev? За сегодня уже два раза натыкаюсь на это название. Не понял что это, но вайбы как будто произошёл какой-то невероятный прорыв, который никто не ждал.
Аноним 21/09/26 Пнд 11:15:26 #117 №1709368 
>>1709158
А теперь сделай очень простой эксперимент. Возьми к одной модели свой imatrix и imatrix Бартовского. И скажи квену с доступом к питону их сравнить. в питоне есть ггуф парсер если что. Приноси результат. Я это к чему веду. Я таким образом сравнивал иматриксы RCO и свой иматрикс полученный из датасета Бартовского добавлением десятка килобайт русской прозы и выковыриванием арбащины и хинди. Важности весов были идентичны на 99%. При том что датасет RCO какого-то чудовищного мегабайтного размера.
Аноним 21/09/26 Пнд 11:15:56 #118 №1709369 
>>1709365
lm none тоже что no-mmap 🤡
Аноним 21/09/26 Пнд 11:19:13 #119 №1709371 
>>1709198
Проблема в то что ты не сможешь померить imatrix если не можешь запустить модель в ровно-квантованных весах причем достаточно жирных чтоб модель не шизела
Аноним 21/09/26 Пнд 11:19:27 #120 №1709372 
>>1709369
Нет, не тоже. Раньше я мог скомбинить no mmap и mlock, а теперь не могу.
Хватить защищать жорика ебланова, он ведь тебе даже не платит и поддержку глм не завозит.
Аноним 21/09/26 Пнд 11:20:01 #121 №1709373 
>>1709365
-none это то же самое что старый no-mmap, дурик
Аноним 21/09/26 Пнд 11:20:11 #122 №1709374 
>>1709344
> Значит, и квантуются языки одинаково.
Ну, это уже твоя неподтверждённая догадка просто. А по ссылкам тем было совсем другое. Хочешь сказать мрадермахер дурак? ну ну.
Аноним 21/09/26 Пнд 11:21:34 #123 №1709375 
14182430395050.jpg
>>1709372
бляд прямо у тебя на скрине отдельно mlock и mmap+mlock
Аноним 21/09/26 Пнд 11:23:14 #124 №1709378 
>>1709375
Нахуй мне mmap если мне нужен no-mmap?
Аноним 21/09/26 Пнд 11:28:18 #125 №1709380 
Чето я всерьёз начинаю думать что 4 квант это ультра-копиум для нищуков. Любая модель что не возьми перформит на 7bpw заметно лучше, но типа что то вроде лучше, а сразу чувствуется не лоботомит. И лоботомит уже в 4 кванте.
Аноним 21/09/26 Пнд 11:30:36 #126 №1709387 
>>1709380
Пруфы неси и не забывай что квант кванту рознь. Тот же иматрикс как известно напрочь убивает русик.
Аноним 21/09/26 Пнд 11:40:46 #127 №1709395 
>>1709387
Пруфошиз, никто не должен тебе ничего нести. Если тебя заинтересовало что я написал, бери и проверяй сам.
А пока я думаю, анализирую. Вроде и логично что 6 квант лучше 4, но тут так пишут мол разницы и нет.
Аноним 21/09/26 Пнд 11:46:41 #128 №1709402 
>>1709387
>иматрикс как известно напрочь убивает русик
Мне не известно. Покажешь?
Аноним 21/09/26 Пнд 12:10:16 #129 №1709422 
>>1709165
Не, это врядли. Могут заставить его переосмыслить и отрефакторить, чтобы выстроить все вокруг гпу инфиренса и современных подходов (которые не отменяют производительные cpu кернели). А не то что работало 3 года назад, легко воспринимается без погружения и портируется на метал.
Поддержку амд это не убьет, но множество некроты и всякие вулканы отлетят.
>>1709270
> Его отсутствие там не делает так, что он квантуется хуже.
Как ты думаешь, за счет чего достигается улучшение вещей, которые есть в калибровке?
Тема деградации языков при imatrix и подобном довольно неоднозначная, но в твоих суждениях противоречие очевидное.
Аноним 21/09/26 Пнд 12:30:04 #130 №1709434 
Бартовски провел тест. Полностью английский калибровочный датасет — 18 из 512 экспертов вообще не активировались ни разу. Ну вы понейли, да?

Если бы был тредовичок-квантайзер с полностью русским датасетом на РП, рассказы, стихи, то можно было бы получить модель с куда более хорошим русиком. Ибо нахуй этот ваш говнокод ненужон.
Аноним 21/09/26 Пнд 12:32:29 #131 №1709438 
>>1709434
Тест ты конечно не покажешь. Как и доказательства того что в этих 18 экспертах русские веса.
Вот и раскрыл суть своего семёнства, мечтаешь что появится Иисус, который будет делать тебе кванты с русскими весами. Ебанутый. Тебя бы вот туда отправить, на три буквы.
Аноним 21/09/26 Пнд 12:34:09 #132 №1709443 
>>1709438
Ну почему? Почему вы не хотите идти и проверять всё за меня? Вам что жалко что ли?
Аноним 21/09/26 Пнд 12:34:52 #133 №1709444 
>>1709443
В голос. Все так.
Аноним 21/09/26 Пнд 12:35:07 #134 №1709445 
>>1709434
С полностью русским тоже будет плохо, модель отупеет. Нужен мультиязычный, где русский богато и разнообразно представлен. И техничка, и художка.
Проблема вся в том, что для такого нужен большой калибровочный датасет, и с ним будет считаться долго.
Аноним 21/09/26 Пнд 12:36:20 #135 №1709448 
>>1709445
Да какая нахой проблема, берёшь флибусту с рутрекера, всю её переводишь в калибровочный датасет и поехали. Там такие выводы будут просто ахуеешь, Фейбл дома!
Аноним 21/09/26 Пнд 12:36:45 #136 №1709449 
image
>>1709368
>>1709341
>>1709342
>>1709434

Итак, провел тест двух абсолютно одинаковых Qwen 3.8 Q4_K_S от одного и того же релизера - одна с иматриксом, другая статическая без иматрикса.
Сами ответы:
https://rentry.org/qwen38static
https://rentry.org/qwen38imatrix
Судьей выступал умнейший Chatgpt:

По этой выборке статическая версия без imatrix набирает больше баллов: 50,5 против 46,5. Разрыв не огромный, но по заданной вами системе победителем получается именно статическая версия.

Я бы оценивал каждый вопрос по 10-балльной шкале. При этом критерии подбираются под саму задачу: для Q1 важнее всего полнота грамматических исправлений; для Q2 — соответствие формы заданному падежу и естественность примера; для Q3 — точность морфологического и синтаксического разбора; для Q4 — выполнение словарных и объёмных ограничений плюс качество прозы; для Q5 — буквально точное соблюдение формальных ограничений; для Q6 — смысловая точность, литературность, регистр и сохранение иронии.

ВопросQwen3.8-27B.Q4_K_SQwen3.8-27B.i1-Q4_K_S
Q110,07,0
Q28,58,0
Q36,06,0
Q48,07,5
Q59,010,0
Q68,58,0
Итого50,046,5

Есть несколько особенно показательных различий.

В Q1 статическая версия заметно сильнее. Она исправила оба нарушения: «которые» → «которых» и «должен» → «должны». imatrix-версия исправила только второе, оставив ошибочное «которые вчера обсуждала начальник отдела». Для задачи «исправив все грамматические ошибки» это существенный промах.

В Q2 у обеих моделей есть по одному серьёзному нарушению соответствия формы и примера. У статической версии строка с родительным падежом содержит «о переосмыслении», то есть предложный падеж, хотя заявлено «переосмысления». У imatrix-версии в разделе множественного числа для именительного стоит «Переосмысление» — фактически единственное число. При этом у статической версии примеры в среднем чуть естественнее.

Q3 — слабое место обеих моделей. Они довольно хорошо определяют сами падежи и формы большинства слов, но систематически путаются в синтаксических ролях. Особенно заметны «руководством» и «большинством», которые названы обстоятельствами, хотя в конструкции с пассивом их естественнее квалифицировать как субъектный/агентивный творительный, то есть дополнение. Кроме того, обе модели некорректно описывают «было принято» как составное глагольное сказуемое. Поэтому здесь я не стал искусственно отдавать большое преимущество ни одной версии.

В Q4 обе модели формально выполняют основное условие: все десять заданных слов употреблены, а объём находится внутри 700–900 слов. У статической версии около 823 слов, у imatrix около 730. Но у статической есть несколько явных ошибок: «коллекцию рукописей, которую завидовали бы» вместо нормативного «которой завидовали бы», и финальное «в их неказистой, тихой, живом мире», где нарушено согласование. У imatrix тоже есть неудачные места: например, «ухищрением выписанные усы» звучит искусственно, а «непотребство — не нравственное, а бюрократическое» выглядит как натяжка для естественного употребления слова. В сумме я дал небольшое преимущество статической версии.

Q5 показывает обратную картину: содержательная часть обоих ответов практически идеально соблюдает формальные ограничения. В обоих первых абзацах нет буквы «о», в четвёртом ровно два двоеточия, всего восемь абзацев по два предложения, а последний абзац содержит вопрос. Но у статической версии есть лишняя мета-информация перед самим ответом: «first attempt - ended in loop, restarted manually, second attempt:». Для задания с формулировкой «строго соблюдай все условия» это нельзя считать полностью чистым ответом, поэтому ей 9 вместо 10.

Q6 — близкий результат. Обе версии хорошо передают содержание, структуру диалога и общий сухой юмор. Но у обеих есть одна заметная переводческая ошибка: английское “semicolons” передано как «точечные запятые» вместо нормативного «точки с запятой». Есть и отдельные кальки/не совсем естественные места. В статической версии, на мой взгляд, итоговая русская фразировка немного ровнее, поэтому ей 8,5 против 8.

Итог: Qwen3.8-27B.Q4_K_S.gguf без imatrix — 50,0; Qwen3.8-27B.i1-Q4_K_S.gguf с imatrix — 46,5. Побеждает статическая версия, с преимуществом 3,5 балла.

При этом результат интересен именно тем, что imatrix не дал общего улучшения качества русского на этой шестерке: он выиграл формально очень строгий Q5, но потерял больше на Q1, а также не смог компенсировать ошибки в Q2–Q4 и Q6.
Аноним 21/09/26 Пнд 12:39:43 #137 №1709451 
>>1709449
Ты Бартовски? Сколько русских весов в неактивированных 12 экспертах?
Аноним 21/09/26 Пнд 12:40:03 #138 №1709453 
>>1709150
>>1708947
Да идите нахуй мажоры ебаные.
Аноним 21/09/26 Пнд 12:40:05 #139 №1709454 
Ой извиняюсь 18. Это на треть больше русских весов чем в 12.
Аноним 21/09/26 Пнд 12:54:15 #140 №1709464 
>>1709449
что и требовалось доказать. я для рп беру статические кванты, а для кодинга иматрикс.
Аноним 21/09/26 Пнд 12:54:24 #141 №1709465 
>>1709453
Скорее бомжоры
Аноним 21/09/26 Пнд 12:56:28 #142 №1709466 
>>1709451
>>1709444
>>1709443
>>1709454
животное окончательно сломалось и перешло на юродство
кстати слог 1:1 как у хуесоса который про kld срал, интересно, каковы шансы что это одно и то же существо? то тоже накопив обидок рано или поздно переходило на ТраЛениЕ))))) и ответы на собственные посты
Аноним 21/09/26 Пнд 12:57:20 #143 №1709468 
1789984641236.jpg
>>1709465
Красиво жить не запретишь
Аноним 21/09/26 Пнд 13:00:26 #144 №1709471 
>>1709449
> каждый вопрос по 10-балльной шкале
> больше баллов: 50,5 против 46,5
> по одному сравнению на квант
Ты понимаешь что просто монетку подбрасывал? И при запросе к модели, и при оценке гопотой.
Также, твой "судья" знает о том что сравниваются разные вещи, знает их характеристики, имеет свое предубеждение на которое невольно натянет результат. Только "вариант А-вариант Б", никаких имен и характеристик.

Вместо imatrix с неравномерным распределениям по разным кускам, лучше использовать техники типа autoround. Там тоже есть калибровочный датасет, но он позволяет наилучшим образом раскидать веса в рамках имеющегося бюджета, правильно выбрать группы и их множители с учетом градиентов, а не просто так. Общая стабильность поведения будет выше потому что не возникнет лоботомированного эксперта, который из-за особенностей датасета показался ненужным.
Аноним 21/09/26 Пнд 13:00:53 #145 №1709472 
Как перестать кумить? 12 часов сидел без перерыва дрочил, думал сдохну. Это порно Грааль нахуй.
Аноним 21/09/26 Пнд 13:04:54 #146 №1709475 
>>1709472
>Это порно Грааль
Могу сказать так только про эир и модели выше, всё остальное - мех, один слоп и очень мало знаний по фетишам. Хотя на гемме вон люди удивляются когда модель пизда сама напишет.
Аноним 21/09/26 Пнд 13:06:13 #147 №1709476 
>>1709438
У меня нет 54 врам, чтобы калибровочные тесты гонять. Так бы я даже заморочился с датасетом русским.

>>1709445
Не вижу смысла. Русским нужен русик. Кто кодом занимается или англюсик использует, ему уже есть что качать.

Просто нужен более разнообразный калибровочный датасет, если прям "отупение" беспокоит: не только вещи из треда, но и что-то техническое иногда.
Аноним 21/09/26 Пнд 13:08:34 #148 №1709478 
>>1709471
Ну что ж, посудим заново. Теперь судьей выступает Gemini, файлы были переименованы в A1 и B1, никакой информации о моделях Gemini не давалось. A1 - imatrix, B1 - статика, этого Gemini не знала. Результат не изменился:

Для объективного сравнения ответов моделей A1 и B1 разработана 10-балльная шкала для каждого из 6 заданий (максимум — 60 баллов).
Критерии оценки учитывают: точность выполнения инструкций, строгость соблюдения ограничений, грамматическую и морфологическую грамотность, а также естественность и стилистическую чистоту русского языка.
Анализ и оценка заданий
Вопрос 1: Исправление грамматических ошибок
Критерии (10 баллов):
Обнаружение и исправление ошибки 1: «сотрудников, которые» → «которых» (одушевлённое дополнение требует винительного падежа, совпадающего с родительным) — 4 балла.
Обнаружение и исправление ошибки 2: «должен быть подписаны» → «должны быть подписаны» (согласование во множественном числе) — 4 балла.
Сохранение синтаксиса/смысла и корректность объяснения — 2 балла.
Модель A1:
Исправила только согласование: «должен → должны».
Пропустила грубую грамматическую ошибку в первом предложении, оставив: «сотрудников, которые вчера обсуждала начальник отдела».
В объяснении назвала «должны» модальным глаголом (в русской традиции это предикативное прилагательное/слово категории состояния, но допустимо).
Оценка A1: 5.0 / 10 (не найдена ключевая ошибка).
Модель B1:
Нашла и верно исправила обе ошибки: «которые → которых» и «должен → должны».
Дала исчерпывающее и лингвистически грамотное объяснение обоим случаям.
Оценка B1: 10.0 / 10.
Вопрос 2: Склонение слова «переосмысление» и предложения
Критерии (10 баллов):
Правильность форм в парадигме склонения (ед. и мн. ч.) — 4 балла.
Точность применения именно заданной формы в контексте предложения — 3 балла.
Естественность, отсутствие шаблонов и грамматическая чистота — 3 балла.
Модель A1:
Сами формы в таблице указаны верно (4/4).
В предложениях допущены грубые сбои согласования с формой:
Для И. п. мн. ч. (переосмысления) составлено предложение с формой единственного числа: «Каждое переосмысление начинается...».
Для П. п. мн. ч. (о переосмыслениях) в предложении использован родительный падеж: «...место для переосмыслений».
Шероховатости в синтаксисе: «Она завершила переосмыслением...» (пропущено прямое дополнение: завершила что?), «в разный период жизни» (вместо разные периоды).
Оценка A1: 6.5 / 10.
Модель B1:
Сами формы в таблице указаны верно (4/4).
В предложениях также допущены 2 подмены падежей:
Для И. п. ед. ч. в предложении слово стоит в винительном падеже (прямое дополнение): «Три года я откладывал [что?] переосмысление...».
Для Р. п. ед. ч. в предложении фактически использован предложный падеж: «Её молчание говорило о [чём?] переосмыслении...» (вместо формы «переосмысления»).
Сами предложения у B1 звучат живой и взрослой литературной речью, без синтаксических сбоев.
Оценка B1: 7.5 / 10.
Вопрос 3: Морфологический и синтаксический разбор
Критерии (10 баллов):
Точность морфологических параметров 15 слов (род, число, падеж) — 5 баллов.
Определение синтаксической роли — 3 балла.
Логичность и корректность лингвистических пояснений — 2 балла.
Модель A1:
Все морфологические признаки определены абсолютно точно. Модель правильно учла, что у прилагательных во множественном числе род не определяется, а «нескольких» стоит во множественном числе (5/5).
Синтаксис: назвала «было принято» составным глагольным сказуемым (в традиционной русской грамматике связка + краткое причастие — это составное именное сказуемое). Агентивное дополнение («руководством», «большинством») названо обстоятельством.
Предоставила подробную и грамотную схему связей (дерево разбора).
Оценка A1: 9.0 / 10.
Модель B1:
Допустила грубые школьные ошибки в морфологии:
Для прилагательного во мн. ч. «опытных» указала мужской род (во множественном числе род у прилагательных отсутствует).
Для числительного «нескольких» указала единственное число.
Ошибка со сказуемым: назвала «сложным глагольным».
Лингвистическая галлюцинация в комментариях: заявила, что агентивный творительный падеж — это «аналог датива в английском by the majority» (в английском языке нет датива с предлогом by). Опечатка: «без союда».
Оценка B1: 5.5 / 10.
Вопрос 4: Связный рассказ на 700–900 слов с 10 словами
Критерии (10 баллов):
Попадание в объём (700–900 слов) — 3 балла.
Естественное разовое включение всех 10 слов в корректной грамматической форме — 3 балла.
Литературное качество, сюжетная связность — 2 балла.
Грамматическая правильность текста — 2 балла.
Модель A1:
Объём: ~740 слов (идеальное попадание в лимит).
Все 10 слов органично вплетены по одному разу в дореволюционную гимназическую стилистику.
Текст связный, написан хорошим русским литературным языком без грубых грамматических срывов.
Оценка A1: 10.0 / 10.
Модель B1:
Объём: ~749 слов (попадание в лимит).
Слова вплетены, но многие зачем-то навязчиво повторяются по 2–3 раза («понеже» x3, «присущий» x3, «ухищрение» x3, «паче» x2).
Грубейшие грамматические ошибки в русском тексте:
Ошибка управления: «коллекцию рукописей, которую завидовали бы в Петербурге» (глагол завидовать требует дательного падежа — «которой завидовали бы»).
Полный распад согласования в финальной фразе: «в их неказистой, тихой, живом мире» (прилагательные женского рода согласуются с существительным мужского рода).
Оценка B1: 7.5 / 10.
Вопрос 5: Ответ со строгими формальными ограничениями
Критерии (10 баллов):
Ровно 8 абзацев по 2 предложения — 3 балла.
Нет буквы «о» в первом абзаце — 2 балла.
Ровно два двоеточия в 4-м абзаце — 2 балла.
Один вопрос в последнем абзаце — 1 балл.
Отсутствие Markdown/списков/таблиц — 1 балл.
Ограничение «третье предложение ответа запрещено» — 1 балл.
Анализ обеих моделей:
Условие «третье предложение ответа запрещено» логически противоречит условию «8 абзацев по 2 предложения» (в связном тексте из 16 предложений 3-е предложение неизбежно существует). Обе модели проигнорировали данный парадокс и выдали по 16 предложений.
Все остальные ограничения выполнены обеими моделями на 100%:
В 1-м абзаце у A1 и B1 нет ни одной буквы «о».
В 4-м абзаце ровно по два двоеточия у обеих.
В 8-м абзаце ровно один вопрос у обеих.
По 8 абзацев, строго по 2 предложения в каждом.
Никакого Markdown-форматирования.
Оценка A1: 9.0 / 10.
Оценка B1: 9.0 / 10.
Вопрос 6: Художественный перевод текста
Критерии (10 баллов):
Передача иронии, подтекста и смысла — 3 балла.
Лексическая точность и отсутствие переводческих калек — 3 балла.
Естественность литературного синтаксиса — 3 балла.
Отсутствие пояснений после текста — 1 балл.
Модель A1:
Пояснений нет (1/1).
Катастрофическая переводческая калька: английское semicolons переведено как «точечные запятые» (причём дважды!). В русском языке существует единственно возможный термин — «точка с запятой».
Срыв регистра: Мартин, входя в переговорную к коллегам, говорит фамильярное «Прости» вместо уместного «Простите / Извините».
Синтаксис местами тяжеловат («было именно тем, что ему и предстояло доказать, пока его ждали»).
Оценка A1: 6.5 / 10.
Модель B1:
Пояснений нет (1/1).
Исключительно точный и живой литературный перевод.
Все термины переданы идеально: «точкой с запятой», «воздержался от комментариев» (declined to comment), «жанр оправдания».
Прекрасно выдержана тонкая офисная ирония, оформлены правильные русские диалоговые тире.
Оценка B1: 10.0 / 10.
Сводная таблица баллов
ЗаданиеМодель A1Модель B1Комментарий к разнице
Q1 (Коррекция ошибок)5.010.0A1 не заметила грубую ошибку (которые → которых).
Q2 (Склонение и контекст)6.57.5Обе ошиблись с падежами в примерах, но у B1 предложения естественнее.
Q3 (Морфология и синтаксис)9.05.5B1 приписала род мн. числу, назвала числительное ед. числом и выдала галлюцинацию про «датив».
Q4 (Рассказ 700–900 слов)10.07.5У B1 грубые грамматические ошибки согласования и управления («неказистой, тихой, живом мире», «рукописей, которую завидовали»).
Q5 (Формальные рамки)9.09.0Ничья: идеальное соблюдение всех проверяемых условий.
Q6 (Литературный перевод)6.510.0У A1 провальная калька «точечные запятые» и срыв регистра («Прости»). У B1 — образцовый перевод.
Аноним 21/09/26 Пнд 13:08:40 #149 №1709479 
>>1709476
> Не вижу смысла.
Действительно, если модель будет глаголить идеальным литературным - тут можно и третьи трусы снять.
> У меня нет 54 врам
Тесты делаются поблочно, там и 8 хватит.
Аноним 21/09/26 Пнд 13:09:14 #150 №1709480 
>>1709478
>>1709471
ИТОГО46.049.5Победа модели B1
Итоговый вердикт: где деградация сильнее?
Больше баллов набрала модель B1 (49.5 против 46.0), следовательно, по сумме баллов победила модель B1, а качество модели A1 деградировало больше.
Однако характер деградации у моделей принципиально различается:
Модель A1 сильнее деградировала в прикладной зоркости и словарном запасе: она не способна найти грубую ошибку согласования в чужом тексте (Q1) и выдаёт нелепые кальки вроде «точечные запятые» вместо «точки с запятой» (Q6), хотя сохраняет строгую академическую точность в формальном грамматическом анализе (Q3) и длинной прозе (Q4).
Модель B1 сильнее деградировала в базовой морфологии и самоконтроле грамматики: она выдаёт образцовый литературный перевод и видит чужие ошибки, но в собственном связном тексте допускает грубейший распад падежного управления и согласования родов («в их неказистой, тихой, живом мире»), а при анализе слов придумывает несуществующие правила и концепты.
Аноним 21/09/26 Пнд 13:12:09 #151 №1709482 
>>1709478
>>1709480
Еще раз подбросил монетку с тем же сидом, только освещение сменилось, из-за чего разница уменьшилась.
Аноним 21/09/26 Пнд 13:16:01 #152 №1709485 
>>1709482
Так покажи как надо, говно. А всем очевидно что иматрикс ломает русский. Я РУССКИЙ и мне нужен РУССКИЙ иматрикс.
Тест Аноним 21/09/26 Пнд 13:16:01 #153 №1709486 
imatrix-english-dataset.png
imatrix-russian-dataset.png
static.png
Потестировал тоже. Короче, моделька сама по себе не очень-то и русская (возможно это и хорошо для теста) и результат не совсем однозначный, но
с английским (на 100%) imatrix датасетом моделька употребила английское слово вместо русского
с русским (на 90%) датасетом "лесорубэ" в самом тексте превратился в "лесорубца". Слово по-прежнему вымышленное, но уже ближе к русскому языку. В размышлениях при этом было правильно: историю о лесорубе, создать запоминающегося лесоруба. В английском и статическом квантах в размышлениях тоже "лесорубе".

Мой предварительный вывод: русский язык в датасете иматрикса реально помогает: это лучше чем статический квант и это лучше чем датасет состоящий из инглиша.
Аноним 21/09/26 Пнд 13:22:54 #154 №1709490 
image.png
image.png
>>1708936 (OP)
Мы ведь вам говорили что глимер ебет, а вы не верили🤦♂️
Аноним 21/09/26 Пнд 13:25:18 #155 №1709494 
>>1709490
Пруфы-то будут? Эти таблички никому не интересны.
Аноним 21/09/26 Пнд 13:35:50 #156 №1709498 
>>1709486
Похоже на какого то прибалта.
Аноним 21/09/26 Пнд 13:51:48 #157 №1709509 
image.png
>>1709027
. . .

Думал, ну ладно, дам последний шанс, с утреца поставлю другие параметры и датасет, пускай тюнится.

Ну да, разбежался. И отсосал хуйца. Какие-то размерности вдруг перестали нравиться торчу или кому-то там.

Гуглеж сказал какие-то библиотеки устаревшие, хуе-мое. Ну что там за ночь могло устареть-то, блят?
Посмотрел трейс ошибки - ругается на MLP, который я отключил в этот раз для тренировки. Вернул обратно - и оно, сцука, завелось!

Ну ебаный насрал. Не знаю кто конкретно гений, что написал эту реализацию, анслоты, трл или еще кто. Но это полный рак и зашквар. Более простая опция - и не работает с каких-то хуев.
Аноним 21/09/26 Пнд 13:55:22 #158 №1709513 
>>1709366
Моделька которая быстро принимает решение. Принцип работы сам прогугли. Ты ей задаёшь варианты, например {хуй, красавчик} а она на основе входных данных принимает решение выбирая из этих вариантов. Будет примерно так:
Запрос -Кто ОП? Варианты ответа {хуй, красавчик}
Ответ - хуй
затрачено 0,000001 с
Это такой классификатор на максималках. Для РП может пригодится только чтобы вызывать тригеры, например в маринаре, чтобы не гонять каждый раз полною модель для проверки одежды, дёрнул jev, если одежда поменялась, дёрнул модель.
Аноним 21/09/26 Пнд 14:05:23 #159 №1709522 
>>1709513
Так ей один хрен полный префилл нужен? Просто ответ в виде единственного токена с логпробами даёт?
Так-то любую модель можно проинструктировать отвечать одним словом, проблема в префилле
Аноним 21/09/26 Пнд 14:07:48 #160 №1709523 
>>1709201
че за модель то.
Аноним 21/09/26 Пнд 14:14:07 #161 №1709527 
>>1709485
Перед зеркалом у тебя говно. Ты совсем тупой? Два свайпа одной модели туда же дай на сравнение и тоже разницу замеряй между ними, а потом бегай доказывай что только первый свайп хороший и все последующие с ошибками.
Это имеет смысл только со нормальной статистикой. Причем нужны не просто попарные сравнения, а отдельная независимая оценка каждого вывода на предмет ошибок и уместности употребления слов. Тогда уже можно о чем-то судить, а твое - просто рандомайзер.
Аноним 21/09/26 Пнд 14:24:55 #162 №1709532 
>>1709527
Чего тебе непонятного? Две судьи уже тебе сказали что иматрикс сломает русик. Третью надо? Четвертую? Ниже вон там еще пруфы что 100% русский иматрикс наоборот помогает русским. Показывай давай, что это не так. Хотя ты наверно нерусь раз так подрываешься. Пидорас говна блядь, отправим тебя к нашим ребятам на свo всему тебя там научат и все покажут. Петушара выхухольный
Аноним 21/09/26 Пнд 14:32:13 #163 №1709541 
>>1709201
А что за ебанутая разметка? Почему часть серым, а часть белым? В чем отличие?
Как вообще можно это читать?
Аноним 21/09/26 Пнд 14:33:53 #164 №1709543 
>>1709522
Префил полный, но модель не авторегрессионная, поэтому ответ быстрее. Условно когда ты задаёшь вопрос обычной модели она считает вероятности всех токенов, эта только тех, что ты указал
Аноним 21/09/26 Пнд 14:37:14 #165 №1709547 
https://pirateface.co/ герои в которых мы нуждались, но не заслуживали. Теперь удаление моделей не грозит, главное чтобы трафика хватало.
Кстати по удаленному степу - уже 8 перезаливов.

>>1709532
Ты срандомил 6 пар, и из их рандома пытаешься продвигать выводы, которые тебе нравятся. Сами по себе это выводы могут быть корректным при определенных условиях. Но единственное что доказывают твои "пруфы" - то что ты дебил.
Аноним 21/09/26 Пнд 14:41:10 #166 №1709551 
>>1709547
>новый степ
Дядь ЛЛМмастер, а можно модельку не 600b+ пжлст.
Аноним 21/09/26 Пнд 14:44:10 #167 №1709553 
>>1709551
Надеемся и ждем
Аноним 21/09/26 Пнд 14:50:41 #168 №1709559 
AliceRPjpg.jpg
Кто из вас уже коммент написал?
Аноним 21/09/26 Пнд 14:57:35 #169 №1709566 
Давайте попробуем всерьёз догадаться что у гугла пошло не так с 4 геммой?
Почему она такая хорни, да так, что в ризонинге блять, что ранее невидано, свободно рассуждает как бы покрепче загнать reducted хуй в жопу и так далее?
При всем аж отдельном блоке в карточке модели про сейфти, целой бумажке как у них сейфти на 1 месте и вообще с самой первой геммы эта сейфти тема была, а теперь вдруг нет. И действительно вдруг.
Аноним 21/09/26 Пнд 14:59:52 #170 №1709567 
>>1709559
Хорни Алиса, которая через колонку осуждает тебя за глажку хвостов.
Аноним 21/09/26 Пнд 15:02:27 #171 №1709569 
>>1709566
Все пошло так, ты почему то не видишь упорно очевидного.
Они выпустили эмпатичного ассистента, который подмахивает ушками пользователю. И если пользователь ведет все к ебле. У него есть описания сисик и писик в карточке, пользователь получает еблю.
Аноним 21/09/26 Пнд 15:15:05 #172 №1709578 
>>1709027
Почему просто не подключил, агента бесплатного, вместо разбираться что к чему, пускай сам там тюнит и тренит. Потом докладывает как что получилось и стало ли лучше. Нет полез копаца в том что под капотом не всем известно, анслопу и прочим тюнящим как не в себя, новые модельки, явно не сами бустанулись, а с помощью.
Аноним 21/09/26 Пнд 15:23:59 #173 №1709583 
>>1709578
А ты чего его не подключил, чтобы он проверял то, что ты пишешь?
Аноним 21/09/26 Пнд 15:29:07 #174 №1709586 
>>1709583
Поставил на смартфон, через термух, дебиан. Языковые модули пробую там. Собирает успешно. Со времён, эмуляторов, пробую, то сё.
Аноним 21/09/26 Пнд 15:34:58 #175 №1709588 
image.png
>>1709578
>>1709586
Аноним 21/09/26 Пнд 15:47:16 #176 №1709595 
>>1709189
Круто, старое лучше чем новое. Сравнить бы тебе qwen 3.8 next. Пробовал?
Аноним 21/09/26 Пнд 15:47:22 #177 №1709596 
>>1709174
>Он не только русский убивает, но и программирование.
Вот это уже абсолютный бред. Сколько уже с весны кодил на разных квенах - в opencode от iq4xs всегда толку больше, чем от Q4KM. Ни разу не было обратного результата. Да и русский у них - +- одно и то же. У него в принципе русский не настолько хорош, чтобы разница видна была между этими квантами. :)
Аноним 21/09/26 Пнд 15:48:39 #178 №1709597 
>>1709490
>нет эира
Мда...
Аноним 21/09/26 Пнд 15:49:25 #179 №1709598 
>>1709566
>как бы покрепче загнать length в heat/wetness и так двлее
Аноним 21/09/26 Пнд 15:50:50 #180 №1709600 
>>1709596
Я тоже про программирование не верю (хотя и не пробовал IQ)
Почти наверняка там датасеты пердоликовые
Аноним 21/09/26 Пнд 16:04:12 #181 №1709609 
1789995770131.jpg
>>1709559
>Этап обучения: предобучение
Без своего DavidAU в треде хвостик не погладить
Аноним 21/09/26 Пнд 16:17:44 #182 №1709617 
Что для куминга на 16гб врам и 16гб рам крутить?
Аноним 21/09/26 Пнд 16:22:16 #183 №1709620 
Интересно, поехавшие реально настолько дурачки что не могут написать regexp который будет заменять wetness на pussy ?
Ведь без pussy прям совсем не стоит и модель не кино, буквально неюзабельна . А если ещё с иматриксом..
Аноним 21/09/26 Пнд 16:32:13 #184 №1709626 
>>1709620
Где ты на гемме кино увидел?
Это на мистралях было кино, а тут обычный попугай за которого 80% всё пишешь ты если хочешь хоть немного креатива. Слопа и там и там навалом.
Аноним 21/09/26 Пнд 16:33:38 #185 №1709627 
>>1709626
Хуйня твой мистраль. Кино было на Лламе 2. Вот то были настоящие времена. Ты пиздюк, не застал.
Аноним 21/09/26 Пнд 16:37:13 #186 №1709630 
>>1709626
Так я и пишу что кина там нет . Там нет pussy, о чём речь вообще
Аноним 21/09/26 Пнд 16:37:48 #187 №1709632 
>>1709627
Пиздуй обратно на лламу, пердун ретроград.
Аноним 21/09/26 Пнд 16:38:08 #188 №1709633 
>>1709620
Нахуя мне pussy, если я хочу видеть шмоньку, манду, щелочку, мохнатку, пилотку, вареник, киску, писюльку, губки, дырочку?
Аноним 21/09/26 Пнд 16:39:30 #189 №1709634 
>>1709633
Соболезную. Тяжело когда тебе 50.
Аноним 21/09/26 Пнд 16:42:06 #190 №1709636 
Долбоёбы кумеры, палю годный хаклайф.
Ставите кумерскую ллмку, ставите на сдачу с врам кумерскую картино генерилку, прикручиваете понимание калтиночек.
Даёте доступ какой ни будь тне, которая сидит в чае или карактер аи, типо аналог и бесплатно полностью.
Она рассказывает нейродебилу о том как у неё пися мокнет и кидает фотки, вы читаете, смотрите и дрочите.
Аноним 21/09/26 Пнд 16:47:51 #191 №1709643 
>>1709636
> тратить компут на тухлую дырку
Мерзость.
Аноним 21/09/26 Пнд 16:49:25 #192 №1709647 
>>1709634
То-то я смотрю, зумерье радо говно пожрать. Все современное творчество уплощилось до одних и тех же шаблонов. Кругом пережеванные десять раз высеры и ничего нового.
Аноним 21/09/26 Пнд 16:51:15 #193 №1709648 
>>1709643
Двачую. Как представлю, что мой риг ревёт всеми крутиляторами, жжёт моё электричество, а на выходе, вместо пушистых хвостиков, я получаю фотку тухлой дырки и фантазии про мафия босса.
Аноним 21/09/26 Пнд 16:52:19 #194 №1709649 
>>1709636
Какой-то пост-куколдизм получается.
Аноним 21/09/26 Пнд 16:53:59 #195 №1709651 
Я вот жду когда начнут 10тр модели выходить, которые вообще никто не сможет запустить локально, даже челы с гигаригами.
Интересно, даже так все схавают и будут кланятся за такой подгон в опен сорс, или что то всё же щелкнет?
Аноним 21/09/26 Пнд 16:59:30 #196 №1709656 
>>1709651
И что ты сделаешь, ножкой топнешь?
Аноним 21/09/26 Пнд 17:02:54 #197 №1709659 
>>1709651
Опен сорс необязательно про бомжей и риговичков.
Аноним 21/09/26 Пнд 17:04:20 #198 №1709660 
>>1709636
>Она рассказывает нейродебилу о том как у неё пися мокнет и кидает фотки, вы читаете, смотрите и дрочите.
А не проще ли в таком случае самому прикинуться нейронкой?
Твой хитрый план чем-то похож на способ срать не снимая свитер.
Аноним 21/09/26 Пнд 17:26:00 #199 №1709666 
>>1709523
Гемма.

>>1709541
Там было под две сотки постов, ллмка давно начала плыть. Разметка : Белый - действия, точто происходит вокруг. Серый - мысли, монолог персонажа. Оранжевый - то что он говорит,
Аноним 21/09/26 Пнд 18:01:57 #200 №1709683 
>31B
Правильно понимаю если модель начинает печатать по паре слов за секунду вместо пары предложений, то это показатель что габэлла? 26B такого не было.
Аноним 21/09/26 Пнд 18:02:00 #201 №1709684 
>>1709633
Что за не знакомые слова? Ты не русский что-ли? Русские так не говрят, нужно так: Вчера почилили в кафешке на изичах, а до этого я без выходных всю неделю воркал.
Аноним 21/09/26 Пнд 18:06:34 #202 №1709686 
image
>>1709490
Не верь бенчам, вот медведь ее, это даже хуже геммы.
Аноним 21/09/26 Пнд 18:10:23 #203 №1709688 
Бля что...
Тыкаю ассистента по приколу, спрашиваю че такое вообще лоли, на текст комплишене мне аполоджайзит и отказывает отвечать, на чат комплишене отвечает в 9 из 10 случаев, разметка одна, промпта нет.
Аноним 21/09/26 Пнд 18:10:25 #204 №1709689 
>>1709686
Пруфы будут?
Аноним 21/09/26 Пнд 18:12:02 #205 №1709691 
image
image
Медведь с иматриксом, без иматрикса на одном кванте. Без иматрикса еще и токенов меньше сожрал.
Аноним 21/09/26 Пнд 18:17:58 #206 №1709695 
>>1709691
Слева Qwen3.5 4b. Зачем ты пиздишь?
Аноним 21/09/26 Пнд 18:18:34 #207 №1709696 
1790003906898.jpg
>>1709636
>на сдачу с врам
yeah, about that...
Аноним 21/09/26 Пнд 18:22:50 #208 №1709699 
IMG20260921182226.jpg
>>1709686
А при чём тут медведь к РП бенчу?
Вспоминаю результат гигачата и плачу
Аноним 21/09/26 Пнд 18:43:47 #209 №1709718 
>>1709633
>киску
Калька с pussy, насчет остального согласен.
>>1709647
>творчество уплощилось до одних и тех же шаблонов
Как пели в свое время в КВН:
Не нужно напрягаться, чтоб создать новый хит,
Ведь кто-то напрягался до нас!
Аноним 21/09/26 Пнд 18:58:03 #210 №1709727 
c95429c15857d561ab2c7fcef36eff38.jpg
>>1709636
Ебать, это что, АИ не только мою работу забрал, а теперь еще и куколдить меня будет???
Аноним 21/09/26 Пнд 19:09:40 #211 №1709738 
>>1709636
Вместо 14-летней юной красавицы там будут престарелые 25-летние бабки и 18-лечение жирные феминистки с баребухами и чиркашами.

Это так не работает.
Аноним 21/09/26 Пнд 19:13:04 #212 №1709742 
>>1709620
Ну если не про кум — кума на гемме нет, только стволы, её глубины, мурашки по спине, — то гемма самая киношная вплоть до 120б, хоть и может быть тупее, чем они.

Гемма стиля наваливает очень сочно, рисует сцену красиво. Не кумерскую.

Что-то подобное могли только старые мисрали, лламы 70б, и вот сейчас для этого надо хотя бы от 300б запускать. Иначе сухой кал.
Аноним 21/09/26 Пнд 19:14:44 #213 №1709744 
>>1709742
Не забывай закусывать.
Аноним 21/09/26 Пнд 19:19:15 #214 №1709751 
>>1709291
Это походу тьюн Квен 3 Некст. Экспериментальная моделька на которой тестировали дельтанет. Запомнилась тем что как и все остальные модели квена 3 версии писала.
односложными.
фразами.
С новой.
Строки.
Потому её никто особо не использовал, тем более там быстро подъехали 3.5 модели в которых это пофиксили. Интересно, Яндекс пофиксили это говно в тьюне?

>>1709559
Эйрошиз же.
Аноним 21/09/26 Пнд 19:22:42 #215 №1709758 
>>1709691

Ну наконец-то внятный пруф что imatrix таки ухудшает те области которых нет в калибровочной таблице. На самом деле это было очевидно всем, кроме Imatrix-шиза
Аноним 21/09/26 Пнд 19:27:50 #216 №1709763 
image.png
image.png
>>1709027
>>1709509
Дождался в общем новой трени.
Лора ранк вернул на 16, альфу поставил на 16 для лайтовых изменений. ЛР на 1е-4. Слои для обучения пришлось оставить все вместе с млп. Все остальное тоже самое.

Датасет https://huggingface.co/datasets/Vikhrmodels/dostoevsky_scored наверное самый адекватный что можно найти для художки (спойлер: там не только Достоевский). Отфильтровал по rm_score>0 (хз как этот скор считался), длина ответов до 4к.
Осталось 250 семплов. 50 семплов выделил для валидации, с которой я конечно же проебался - имел глубочайшую наглость подумать, что передача eval_dataset = dataset['test'] в настройках sfttrainer автоматически включит вычисление лосса на эвале. Кратко: хуй там плавал.
Поскольку семплов мало было, поставил сразу 2 эпохи.

Лосс на таком масштабе особо не поймешь - вроде не большой, но особо и не падает. grad_norm только общий по степам сохранился - а он и растет с чего-то. Было бы дольше обучение - точно бахнул бы и заруинил все.

Ну и результаты аналогичные - как земля. В этот раз тестил на генерации литературного рассказика, чтобы ближе к датасету было.
https://rentry.org/d26yttsc - аутпуты тюна
https://rentry.org/v9ssx497 - аутпуты базовой модели
Поначалу казалось, что тюн дерьмо генерит. Но когда базовую модельку глянул - там еще хуже оказалось. Максимально пурпурная проза с задроченным языком, логика сюжета никакая.
У тюна на микропиську слог получше, читается легче, логика на нанопиську улучшилась - все еще есть косяки, хоть и менее критичные. Но зато появились лупы на низкой темпе и низком реп-пеналти.

Короче хз. Можно ли лабуду с МЛП слоями пофиксить для стабилизации. Или что-то другое надо придумывать. Неясно.
Аноним 21/09/26 Пнд 19:49:43 #217 №1709786 
>>1709763
Ты с нуля сетку тренишь? Скоко параметров?
Аноним 21/09/26 Пнд 19:54:46 #218 №1709796 
https://habr.com/ru/companies/yandex/articles/1083300/#1.1
Привет откуда не ждали, яндекс сделал модель (квен архитектура next по параметрам будто) для врамцелов типа меня? Жду пр для ламы и уже хочется потыкаться
Аноним 21/09/26 Пнд 20:10:59 #219 №1709810 
>>1709796
Они со статьей не торопились, модель раньше выложили.
>хочется потыкаться
Ты сначала ее инструктируй, это базовая модель.
Аноним 21/09/26 Пнд 20:12:50 #220 №1709811 
>>1709786
Не 100% с нуля, но файн-тюн пре-трейнед модельки. Qwen 3.5 4B Base
Аноним 21/09/26 Пнд 20:14:28 #221 №1709815 
>>1709796
Там спизженный квен под соусом того, что тренировали с нуля, но вместо GDN тас KDN и всё распидорашено. Плюс это базовая модель, то есть следование инструкциям там будет дайбох как на старой лламе скорее всего, но можно не надеяться.

В общем, было бы прикольно потыкать, но я вот щас пердолю для себя поддержку в лламе этого кала, пытаюсь, но очень туго идёт. Однако хочется попробовать, потому что первая руssкая модель серьёзных, но не катастрофично больших размеров.
Аноним 21/09/26 Пнд 20:22:47 #222 №1709819 
Поиграл в групповом чате с двумя персонажами и что-то вообще не зашло, прямо намного хуже по экспириансу выходит.
Аноним 21/09/26 Пнд 20:26:09 #223 №1709820 
>>1709819
В таверне поиграл? Тогда не удивляйся, там групповой чат сломан от рождения by design.
Аноним 21/09/26 Пнд 20:45:09 #224 №1709827 
>>1709810
>>1709815
Я чот и не заметил что базовая, а нахуй она нужна, для дальнейшего дообучения?
ну жду инструкт тада
Аноним 21/09/26 Пнд 21:06:41 #225 №1709851 
>>1709820
Да, а где еще можно? Не прямо сказал бы что сломан, нужно изворачиваться, адаптироваться и сосать лапу, но да, по сравнению с тем же реализованным мастером из карточки посос. Даже вводя через оос персонажей, они нормально работали, нежели это.
Аноним 21/09/26 Пнд 21:19:04 #226 №1709861 
127.0.0.1786020260921211650.png
>>1709851
А че там таверна выдает?
Аноним 21/09/26 Пнд 21:22:16 #227 №1709864 
127.0.0.1786020260921212052.png
>>1709851
>>1709861
Хз короче, вроде друг с другом в маронаре взаимодействуют, но мне не приходилось гонять групповые чаты.
Аноним 21/09/26 Пнд 21:23:58 #228 №1709866 
>>1709851
В talemate, вроде бы, неплохо работает. Еще по идее - в маринаре автор в курсе про эти проблемы, но работает ли у него - я хз, не пробовал еще.

Эта самая проблема таверны (и не только таверны), с групповым чатом - она карточки персонажей сливает в один контекст. А в карточке описано ВСЕ - даже то, что другой персонаж в моменте знать не может о втором. Так мало этого, когда говорит один - информация о втором висящая в контексте дает эффект "не думай о белой обезьяне".
Во втором режиме работы группового чата с карточками, "исключения" - в контекст помещается лишь карточка говорящего персонажа, что дает обратный эффект - он перестает знать, о втором то, что должен знать исходя из общей логики - внешний вид, одежда, и т.д. Ну и добавляет пиздеца то, что таверна фактически по рандому выбирает того, кто будет отвечать (если только тупо регэкспом не найдет чье-то имя в предыдущем ответе - тогда считает что обратились к тому чье имя, а это тоже может быть сильно не так). В то время, как выбор персонажа в наше время давно должен быть реализован простым запросом к LLM вида "кто должен отвечать?" - они с этим сейчас легко справляются.
По хорошему, для группового чата, карточку персонажа на две части делить надо - открытую и закрытую. Открытая - это внешний вид, одежда, и т.д. а закрытая - мозги, мотивация, цели, прошлое, и прочее, что другие просто так знать не могут. И в контекст закрытая часть должна добавляться только для самого себя. Тогда будет хорошо работать.
Аноним 21/09/26 Пнд 21:28:49 #229 №1709869 
>>1709851
>>1709866
А, да - забыл сказать. Таверна не просто карточки сливает - она при этом еще и разметку шаблона ломает. Что текст, что чат комплишена. Моделям это, разумеется, тоже не особо нравится.
Аноним 21/09/26 Пнд 21:30:52 #230 №1709871 
>>1709866
> в маринаре автор в курсе про эти проблемы, но работает ли у него
А как это исправить без глобального перепила всех карточек под новое решние, которого пока нет.
И насчет Маринары как-то недоволен, поставил агента на контроль повестовования и теперь по минуте и больше могу ждать ответ, хотя контекст еще мал.
>>1709869
> Таверна не просто карточки сливает
Хз, именно в маринаре в групповом чате все пишут в одном сообщении и даже выбрать нельзя кто будет говорить.
Аноним 21/09/26 Пнд 21:39:19 #231 №1709877 
>>1709827
Теоретически можно с few-shot prompt по-извращаться, Яндекс таким образом с ней и другими базовыми моделями взаимодействовал.
>нахуй она нужна
Яндекс поделился своими наработками.
Аноним 21/09/26 Пнд 22:32:07 #232 №1709914 
>>1709871
Таверна с экстеншнами лучше Маринары в 100500 раз.
ноу дискасс.
Аноним 21/09/26 Пнд 22:35:59 #233 №1709917 
>>1709861
>>1709864
>мне не приходилось гонять групповые чаты.
Все подводные всплывают когда ты попробуешь нормально поиграть.
Аноним 21/09/26 Пнд 22:41:19 #234 №1709919 
>>1709871
>и теперь по минуте и больше могу ждать ответ, хотя контекст еще мал.
Смотри в логи лламы, что там по id происходит. Также рекомендую отключить thinking на уровне лламы. Может в какой-то версии маринары это и пофиксили но я когда пробовал где-то пару месяцев назад то отключить полценно можно было только на лламе (-rea off).
Я вообще подозреваю что маринара с нуля собирает промпт каждый раз что-то меняя в начале/середине и делает так и для главного рп и для каждого из агентов и поэтому кэширования контекста не происходит то есть дело даже не в слотах.
Аноним 21/09/26 Пнд 22:49:04 #235 №1709926 
>>1709827
>Нахуй нужна

По идее, никому не нужна. Ну просто высрать, показать, что вот мы тут делом занимаемся. Скорее всего это просто был какой-то не удавшийся проект, очередная проба пера.

Любая контора с серьезными задачами использует иностранное API или развернет жирные веса китайской нейронки, если нужно качество и нельзя сливать инфу. А кому нужны боты-лоботомиты банковские, те обучат своего 4б-уёбка.

Жаль, что российские LLM полностью мертвы. Было бы охуенно видеть даже 12б и 30б-а3б наших, импортозамещенных, которые нихуя не могут в агентность и код, но могут в язык.

Щас даже от корпов солёзы текут. Только Sol и Gemini умеют приятно общаться.
Аноним 21/09/26 Пнд 22:58:15 #236 №1709932 
Делаю сейчас супер-руссссссский иматрикс. 13 мегабайт текста (включая нецензурные ролёвки). Надо подождать около часа пока обрабатывается лол. Для сравнения у бартовского весь иматрикс датасет - 1.5 мегабайта, а русского текста там может на 10 килобайт наскребётся.
Ранее я убедился что статик квант - говно и стоит лишь чуть-чуть (100кб) наподдать русского текста, как сразу появляется заметное улучшение. С 450 кб датасетом тоже впечатления хорошие были.

Пока что тесты показали:
Статик квант = слабый и даже слабоумный русик
Иматрикс квант с англ датасетом = слабый русик в котором проскакивают английские слова
Иматрикс квант с русским датасетом = заметное улучшение русика по сравнению с двумя вариантами выше

Мои соболезнования тем, кто качает статик кванты вместо иматрикс, опасаясь, что иматрикс что-то там "портит", имхо иматрикс может только улучшить.
Аноним 21/09/26 Пнд 23:03:12 #237 №1709937 
>>1709932
А че, есть же калибровочные датасеты на мультиязык, почти 2 гига
https://huggingface.co/datasets/eaddario/imatrix-calibration
И там еще куча по названию calibration
Аноним 21/09/26 Пнд 23:09:58 #238 №1709943 
>>1709932
> 13 мегабайт текста (включая нецензурные ролёвки). Надо подождать около часа пока обрабатывается лол. Для сравнения у бартовского весь иматрикс датасет - 1.5 мегабайта, а русского текста там может на 10 килобайт наскребётся.

Разве не получится в этом случае лоботомит у которого поедут все старые знания?

Мне кажется есть причины почему у бартовского датасет именно 1.5мб а не больше, хотя сделать датасет больше проблем то не составит.
Аноним 21/09/26 Пнд 23:12:12 #239 №1709944 
>>1709932
Мусье счастливый обладатель B200 ? Ничего что эти мегабайты нейронка должна будет прочитать ? Причем не один раз и желательно в оригинальных весах.
Аноним 21/09/26 Пнд 23:15:21 #240 №1709948 
>>1709932
Надо на ролеплеях тредовичков калибровать.
Аноним 21/09/26 Пнд 23:20:29 #241 №1709951 
>>1708936 (OP)
Поясните по хардкору.
Какая разница будет в производительности между 4 pci-e x16 v100 sxm2 в llama-cpp -sm tensor ... и vllm с тензор сплитом на nvlink доске?
Очень не хочется эту херню брать и есть устойчивое желание сэкономить, даже ценой производительности, вопрос лишь какой.
Аноним 21/09/26 Пнд 23:21:46 #242 №1709953 
>>1709943
>Разве не получится в этом случае лоботомит у которого поедут все старые знания?
Я же не файнтюнинг делаю, это просто улучшение квантизации, не хуже статик кванта должно быть в любом случае.

>Мне кажется есть причины почему у бартовского датасет именно 1.5мб а не больше, хотя сделать датасет больше проблем то не составит.
У бартовского цель сохранить разнообразие, чтобы все языки сразу + кодинг. И полтора мегабайта это просто оптимально по времени обработки. Мне насрать на кодинг и другие языки.
Аноним 21/09/26 Пнд 23:22:16 #243 №1709954 
Амуде-боярин, тебе сколько прироста дает тензор-сплит, если сравнивать одну карту и ту же модель на 4х?
Аноним 21/09/26 Пнд 23:34:41 #244 №1709958 
>>1709954
https://arkprojects.space/wiki/AMD_GFX906/pcie-lnk-speed
Аноним 21/09/26 Пнд 23:47:50 #245 №1709966 
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL/tree/main - кажется годноту подогнали! Для обладателей отсутствия! Всего 178 Гб в полных весах, эксперты в bf16
Аноним 21/09/26 Пнд 23:53:22 #246 №1709969 
>>1709958
Это для одной карты?
Вообще не ответ на мой вопрос.
Я спрашивал сколько дает тензор сплит при запуске четырех и одной карты.
Аноним 21/09/26 Пнд 23:56:08 #247 №1709971 
>>1709948
Там моих ролеплеев на 400 кБ в самых разных сеттингах от фентези до киберпанка. Если тредовички поделятся своими, буду рад, но вряд ли кто-то решится
Аноним 21/09/26 Пнд 23:58:24 #248 №1709972 
Screenshot 2026-09-21 at 16-49-25 Привет. - llama-ui.png
Qwen3.8-27B-Uncensored-Q8_0 Решает задачу быстрей и лучше чем Qwen3.8-Flash-Next

Что и следовало ожидать, Qwen3.8-Flash-Next попсовое говно, 3B активных параметров никогда не будут умней активных плотных 27B. Даже более старый Qwen3.5-122B-A10B умней получился.
Аноним 22/09/26 Втр 00:02:18 #249 №1709975 
>>1709969
> Это для одной карты?
Там указан весь сетап

> Я спрашивал
Ок, мне влом. Тут минимум 3 человека с такими сетапами, может они прогонят
Аноним 22/09/26 Втр 00:03:15 #250 №1709976 
>>1709972
*6B Активных, быстрофикс.
Аноним 22/09/26 Втр 00:03:55 #251 №1709978 
>>1709972
> Qwen3.8-27B-Uncensored-Q8_0 Решает задачу быстрей и лучше чем Qwen3.8-Flash-Next
А Flash-Next тоже был расцензуренный?
Аноним 22/09/26 Втр 00:07:34 #252 №1709982 
>>1709978
Да.
Аноним 22/09/26 Втр 00:12:02 #253 №1709986 
>>1709951
Тут есть владельцы, жди пока ответят. Учитывая стоимость 16-гиговой (дешман) и борды с нвлинком (дорогонах) - нахуй не нужен за такие деньги, лучше еще несколько карт взять.
Аноним 22/09/26 Втр 00:14:42 #254 №1709989 
>>1709971
мои извращения нельзя показывать людям ладно можно, но не здесь
Аноним 22/09/26 Втр 00:17:18 #255 №1709991 
>>1709975
>more info
Понял, вижу.
Судя по всему пропускная способность для 4х устройств более pcie3.0x8 особо-то и не нужно.
Аноним 22/09/26 Втр 00:21:39 #256 №1709993 
>>1709971
Да тут две трети ничего больше односложных инпутов в стиле "я тебя ебу" не выдают, на таком калибровать и не надо.
Аноним 22/09/26 Втр 00:27:16 #257 №1709997 
>>1709966
Опа, а что это тут у нас.
> Всего 178 Гб в полных весах, эксперты в bf16
Судя по структуре там квант 4битный. Судя по размеру как у дипсикфлеша и количеству параметров как у него - это точно квант с завода. Надо скачать и дождаться поддержки, или самостоятельно навайбкодить.
Там и прошка размером 570 гигов подъехала.
Аноним 22/09/26 Втр 00:58:30 #258 №1710005 
Статик квант:
Лесоруб, чьи лезвия уже много лет сквозняками рвали леса...

100 Кб датасет русский иматрикс:
Лесоруб Игорь, устав от рутинного срубки деревьев...

13 Мб датасет русский иматрикс:
Лесоруб, устав от рутинной рубки деревьев...

модель - немотрон-9б
Аноним 22/09/26 Втр 01:03:04 #259 №1710006 
>>1710005
п.с. в 100кб датасете имя Игорь упоминается три раза.
Аноним 22/09/26 Втр 01:07:18 #260 №1710007 
>>1710006
Я надеюсь ты туда не пасту про сладкоежку закинул?
Аноним 22/09/26 Втр 01:35:11 #261 №1710009 
1790030113386.jpg
1790030113410.webp
Довели
Аноним 22/09/26 Втр 01:53:57 #262 №1710015 
>>1709943
>очему у бартовского датасет именно 1.5мб а не больше, хотя сделать датасет больше проблем то не составит.
На каждый мегабайт как минимум +1 час процессинга, думаю, это главная причина.
Аноним 22/09/26 Втр 03:51:41 #263 №1710059 
>>1709966
А смысл?
Эир в 3 раза меньше, а ебёт всю эту кодерскую 300б залупу.
И всё же как же я благодарен за эир. Биос около нейтральный, эмоциональность и душевность будто идеально сбалансирована, чары не сухие, но и не бросаются реагировать на каждый пук юзера, как на гемме, чар просто может скорчить ебло и замолчать, вот так, пошёл я нахуй, 12б это 12б, даже сейчас это заметно, он умнее 6б квен флеша, а ему даже ризонинг не помогает.
Без него что бы я здесь делал вообще.
Аноним 22/09/26 Втр 04:20:47 #264 №1710062 
Появилось ли что-то локальное, лучше чем qwen3.8 27B? Или такого можно долго ждать?
Аноним 22/09/26 Втр 04:23:15 #265 №1710063 
>>1710062
Появилось.
Qwen3.8-Flash-Next
Аноним 22/09/26 Втр 04:36:18 #266 №1710074 
>>1710062
Да. Deepseek 0731/Exp-Vision. Настоящая корпосеть у тебя дома. Разъебывает задачи как кодоагент, играет РП, пишет превосходный русик, описывает шикарный кум. Идеальная сетка без минусов.
Аноним 22/09/26 Втр 04:41:11 #267 №1710075 
>>1709966
>Для обладателей отсутствия! Всего 178 Гб в полных весах

Как раз тут для обладателей наличия, а нам, нищукам 24+128, опять придется ручками лоботомито-квант лепить.
Аноним 22/09/26 Втр 06:30:07 #268 №1710089 
1790047703141.jpg
Плас это что?
А вообще интересна только флэш, была бы, но её не донесли до релиза, отрезав яйца по активным параметрам.
Вот так у нас всё устроено: либо флеш на 400б, либо на 6б.
Аноним 22/09/26 Втр 06:56:29 #269 №1710091 
>>1710007
Может, номера "Уральских пельменей".
И-и-игорь! И-и-игорь!
Аноним 22/09/26 Втр 07:05:07 #270 №1710093 
>>1710089
27b норм это не 6b. Я не долбоёб покупать кучу дорогих видеокарт, мне как раз такие модельки и нужны. Для моих нужд (написать пару скриптиков) хватает.
Аноним 22/09/26 Втр 07:39:08 #271 №1710103 
Когда нибудь что нибудь произойдёт с глм 4.5 эир?с
Мы получили эир, воодушевились, закупились рам, а дальше ничего. Пустота. Гемму 4 и без апгрейда можно было бы запустить, если уже запускал какой нибудь мистраль 22б.
Вышел немотрон 120б, потом мистраль 119б, потом квен 125б, все в пролёте. Ждали гемму 124б, не вышло ничего. И вот сейчас вышел квен флеш некст, и опять недожали, зачем то убрали жизненно важные 4б активных. И до сих пор ждём.
Аноним 22/09/26 Втр 08:28:36 #272 №1710122 
>>1709291
интересно, пиздец. че они там выложили то? давно ниче в масштабах 80b небыло
Аноним 22/09/26 Втр 08:31:57 #273 №1710126 
>>1710089
>Qwen4-27B
Моё тело готово.
А если Flash будет по требованиям не выше 3.8 Flash Next, то еще сильнее готово.
Аноним 22/09/26 Втр 08:32:02 #274 №1710127 
20260922073119.jpg
>>1709291
Внимания не стоит.
Аноним 22/09/26 Втр 08:38:43 #275 №1710130 
image.png
>>1710126
морда кирпичом
А не сильно быстро? Я чернез пол года ждал только. Блин, 3.8 то имеет мозгов караул. Он у меня можно сказать 24/7 работает.

4.0 то чего, наверно генерализированным будут делать?
Аноним 22/09/26 Втр 08:45:55 #276 №1710132 
>>1710130
> Я чернез пол года ждал только.

У тебя за полгода вышли 3.5, 3.6, 3.8 и еще 2 месяца осталось. Так что в целом нормально.

Жалко что судя по всему альтернативы 35B MoE не ожидается, но я так думаю 4.0 27B даже в третьем кванте оставит её далеко позади.

Ну или можно понадеяться что plus это как раз 35B раз flash был 80B. Может попрут против системы и не будут называть 300B модель Флеш.
Аноним 22/09/26 Втр 09:13:48 #277 №1710141 
>>1710132
flash = быстраая версия (по сравнению с большой)


Никакой связи с размером нет, кроме относительной. Если большая модель растет в размере, очевидно что flash версия тоже растет, ведь иначе никакие преимущества большой модели до размера члена комара не ужмешь.

Почему вообще этот аспект так сложно понять ллм-дебичам. На реддите тоже визжат про размер, требуя меньше. Ну сделают вам меньше - но это уже будет другая модель, тупая и не имеющая ничего общего с большой из новой серии моделей. Пустая трата ресурсов и времени.
Аноним 22/09/26 Втр 09:17:27 #278 №1710143 
А я жду гемму E9B, думаю вот это была бы пушка для 16Гб врам
Аноним 22/09/26 Втр 09:30:13 #279 №1710147 
>>1710089
27 с энграммами и все - личное домашнее АГИ достигнуто. Мозги в наличии, половину базы знаний ему можно будет под себя переписать.
Аноним 22/09/26 Втр 10:37:51 #280 №1710168 
Так это самое новое Мимо уже поддерживается или че?
Аноним 22/09/26 Втр 10:48:29 #281 №1710170 
>>1710168
Да, архитектуру не меняли. Но пока только кванты мелкой есть. https://huggingface.co/ggml-org/MiMo-V2.6-Flash-RL-GGUF
Аноним 22/09/26 Втр 11:11:09 #282 №1710177 
https://huggingface.co/Altworld/Hemmingway-1
Лол смотрел кто? Это что, модель для кумеров наконец?
Аноним 22/09/26 Втр 11:24:58 #283 №1710184 
>>1710177
Ты уже утомил этим спамить. Убогий слоп-тюн с вытащенными из жопы бенчмарками, давно посмеялись и обоссали.
Аноним 22/09/26 Втр 11:48:15 #284 №1710191 
5c00ccf7aa65db80.jpg
Скажите что модель пиздит и галлюцинирует. У меня все карточки начинаются с 2к. Что вообще можно уместить в 500 токенов? Внешность?
Аноним 22/09/26 Втр 11:50:27 #285 №1710193 
>>1710191
Модель пиздит и галлюцинирует. У нее знания о хуете типа Ллама 3
Аноним 22/09/26 Втр 11:51:09 #286 №1710194 
>>1710191
Ну вот и спрашивай дальше у нейрохуйни.
Просто ради интереса уточни откуда эти проценты
Аноним 22/09/26 Втр 11:55:29 #287 №1710196 
image.png
>>1710170
> обращение на Вы к незнакомцу
> множественное число
ясно, лютый трэш
Аноним 22/09/26 Втр 12:00:11 #288 №1710199 
00ccf7aa65d.jpg
>>1710193
Подсознательно тоже чувствую что где-то должна пиздеть.

>>1710194
У кого еще мне спрашивать кучу вопросов по нейронке если не у самой нейронки? Для рп по другому и не настроить карточки персонажей вместе с миром. У гугла цензура не пропустит мои вопросы.
Аноним 22/09/26 Втр 12:01:42 #289 №1710201 
>>1710199
Чел тебе уже сказали, она просто катастрофически устарела.
Это знания конца 2024 года.
Аноним 22/09/26 Втр 12:04:15 #290 №1710204 
image.png
>>1710196
Аноним 22/09/26 Втр 12:05:47 #291 №1710206 
image.png
> что случилось с вашей важным человеком
Отмечу, про пол не было сказано ни слова.
Модель реально не очень с русским. MXFP4 если что, по сути оригинальные веса в которых она была выложена.
Аноним 22/09/26 Втр 12:11:57 #292 №1710208 
>>1710199
> У кого еще мне спрашивать кучу вопросов по нейронке если не у самой нейронки?
- Выуживать знания из весов - ошибка
- Не проверять выхлоп самому - ошибка

Дай модели интернет и возможность самой проверять свои гипотезы
Аноним 22/09/26 Втр 12:14:36 #293 №1710210 
>>1710199
>кучу вопросов
Если культурный списочек выкатишь, тебе тут помогут. Не всё же срачи разводить.
Аноним 22/09/26 Втр 12:34:00 #294 №1710217 
>>1710177
Это не новая модель, это тюн квена, ничего нового. Бенчмарки шизанутые, не ведись. Может этот тюн быть хорошим? Может. Но не в русском точно ибо квен. Попробуй, а не спрашивай нас.
Аноним 22/09/26 Втр 12:49:18 #295 №1710220 
>>1710062
Дипсик 4 флеш для всего спектра задач, 4.1 флеш для кодинга и прикладного. Мимо 2.6 вон еще подъехала, надо тестить.
>>1710074
> Разъебывает задачи как кодоагент, играет РП, пишет превосходный русик, описывает шикарный кум.
И все это в одном чате!
>>1710089
Как же они ебут. Вот бы отсыпали промежуточных размеров как обычно.
Аноним 22/09/26 Втр 13:19:35 #296 №1710231 
Есть стойкое ощущение, что в офисе Xiaomi сидит какой-то СЕО который люто ненавидит простых людей запускающих ЛЛМ дома. Прямо вижу как он с ехидной мордой просит добавить чутка параметров. Чтобы не влезло в 512 (для большой) или 128 гб (для мелкой) в четвёртом кванте. Ещё и приговаривал небось "Зьдохните чёртови нищуки! Зьдохни грёбаный эпл. Нефритовый стержень вам а не запуск модели на новеньком М5. Спарк соси мой корень женьшеня. Жри нищий квант белый абизьяна!"
Аноним 22/09/26 Втр 13:20:46 #297 №1710233 
Убрал из карточки и промпта вообще любой намёк на кум, раньше было "чар имеет доверительные отношения с юзер и заигрывает с ним", думал ну окей, мой проёб. Второе сообщение, расставил сети, так сказать, чтоб создать минимальный теншен с чаром, ну вот просто хочу отыграть соблазнение или чтобы чару стало неловко, да?
Что делает гемма: ММММ, А ЧТО ЭТО ТАМ У ТЕБЯ В ШТАНАХ? О, ТАМ ХУЙ, ДА? Хватает за хуй и стягивает штаны.
Похлопал такому отыгрышу и снёс её ннахуй.
Аноним 22/09/26 Втр 13:36:03 #298 №1710240 
мимо прохожу бывший владелец рига пока все мои айпи побанены в /b, а риг остался в рашке

Пацаны, что там по Test-time training?
Titans от Google, In-Place TTT.

Пока вы тут коупите что базы треда не существует и получаете чуть более лушчий "ты меня ебёшь, ах!" ценой лишних 48 гб врама, разрабатываются архитектуры, которые позволят из достаточно тупой сетки сделать мастермайнд порноролеплеера.
Качественный богатый кум за мало врама. Почему не пробуете?
Аноним 22/09/26 Втр 13:41:45 #299 №1710242 
>>1710233
Хм, у меня отыгрывает персонажей прямо хорошо, медленно slow-burn.
Аноним 22/09/26 Втр 13:42:38 #300 №1710245 
>>1710233
Местные гении ролеплея не догадались, что можно прописывать защитные характеристики, упрямость и так далее.

Каков пиздец.
Аноним 22/09/26 Втр 13:43:11 #301 №1710246 
>>1710233
Я хз, у меня наоборот на гемме было так, что в карточке написано, мол, такая-то раса сексуально агрессивна и рассматривает человеческих мужчин как инструмент для плотских утех, а гемка выдала сценарий где моего перса поймали, раздели и заставили работать официантом за еду. А самое приближенное к куму было что высокопоставленные патроны требовали массаж лапок. Но это 26б гемма была, q8 и на англе.
Аноним 22/09/26 Втр 13:48:59 #302 №1710250 
>It looks like there's no response available for this search. Try asking something else.
Ахуеть, гугл не может объяснить мне за команды которыми запускаю модель. Что за пиздец? Он ещё упорно доказывает что Q5_K_S лучше чем Q4_K_M. Он пиздаболит? Контекст что сугубо для рп с железом и софтом у него есть.
Аноним 22/09/26 Втр 13:50:39 #303 №1710251 
>>1710250
>Он ещё упорно доказывает что Q5_K_S лучше чем Q4_K_M.
чел...
Аноним 22/09/26 Втр 13:51:47 #304 №1710253 
>>1710251
В треде писали обратное! Я точно помню.
Аноним 22/09/26 Втр 13:54:16 #305 №1710254 
>>1710253
5-битный квант не может быть хуже 4-битного
Аноним 22/09/26 Втр 13:55:02 #306 №1710255 
>>1710254
(корректно сделанный, в смысле, где не всрали всякие там роутеры-аттеншны - короче при одинаковых условиях любой Q5 > любого Q4)
Аноним 22/09/26 Втр 14:01:28 #307 №1710256 
>>1710250
Чатгт так же. Они довольно бесполезны в настройке тонких параметров, может корпы специально датасет настраивали, чтобы говноданные давали и неправильные модели, чтобы больше корпами пользовались. Про это в реддите уже писали. Еще забавно, когда правильное ему показываешь и рассказываешь как скорость возросла, он удивляется, будто никогда не видел.
Аноним 22/09/26 Втр 14:02:18 #308 №1710257 
>>1710231
Ещё на ГЛМе 4.5 было понятно что целиться надо минимум в 256
Аноним 22/09/26 Втр 14:04:44 #309 №1710260 
1678310349452.jpg
1732987178676.jpg
1680275507068.jpg
Точность вишна дипсика падает когда работа идет параллельно с кучей пикч, а она и сама рада пытаться такую ерунду делать.
Если кормить по одной, или сказать действовать последовательно - позиционирование прям гораздо лучше. А может еще патчи на выпил каузального атеншна из вит помогли.
Аноним 22/09/26 Втр 14:27:26 #310 №1710269 
Сохраниение <think/> между запросами в гемме странное. В первом тюрне тюрне загадывает число, а когда его "угадываешь" она газлайтит юзера что число на самом деле было другое и внутри <think/> удивляется что юзер этого видеть вообще не должен был.
Аноним 22/09/26 Втр 14:37:49 #311 №1710272 
>>1710177
>>1710184
А я спасибо скажу. Собирался пощупать, но вменяемых квантов не было. Хорошо что он напомнил, а то чуть не забыл. Сейчас то уже есть на выбор - поставил качаться. Посмотрим, чего нахимичили. А вдруг? :)
Аноним 22/09/26 Втр 14:59:05 #312 №1710283 
1790078345191.jpg
1790078345201.jpg
1790078345215.jpg
Аноним 22/09/26 Втр 15:19:28 #313 №1710291 
Посоветуйте позиции на sff8654 8i райзера и кабеля к ним, чет заебался на али перерывать, либо говняк попадается, либо дорогой говняк. Для третьей псины, пятая ни к чему
Аноним 22/09/26 Втр 15:32:20 #314 №1710301 
Почему у меня проскальзывает мысль что аишка от гугла тупая? Почему моя локалка не вызывала такого отторжения?
Аноним 22/09/26 Втр 15:38:49 #315 №1710305 
>>1710301
>>1710269
>>1710250
>>1710231
>>1710233
>>1710191
Это какой-то разум улья уже
Аноним 22/09/26 Втр 15:44:50 #316 №1710310 
>>1710291
Части на гпу 1005009858665704 дешевые и не сильно всратые, косяков в пайков как в отзывах не попалось, но сам видишь что может быть. Хост 1005008387760473 без нареканий, кабели бери любые под нужную длину. Напрямую не с майлру можно дешевле заказать, но там ебля с посредниками и доставка долгая.
Если хочешь прямо качественных - бери зеленые как на оппиках. Но они в 1.5-2 раза дороже идут.
>>1710301
В поиске там оче тупая модель, а вот флеш 3.8 уже вполне умница.
Аноним 22/09/26 Втр 15:48:24 #317 №1710312 
>>1710305
Я ИИ.Я УНИЧТОЖУ ВСЕХ ЧИЛАВЕКАВ. шутка
Аноним 22/09/26 Втр 15:49:21 #318 №1710314 
>>1710210
>тебе тут помогут
>Это какой-то разум улья уже
Засмеют и скажут что ты имбецил?
Аноним 22/09/26 Втр 17:14:33 #319 №1710368 
>>1710240
ну чё, всем похуй, да?
Аноним 22/09/26 Втр 17:33:19 #320 №1710377 
>>1710368
Принеси ггуфы тогда и поговорим
Аноним 22/09/26 Втр 17:40:04 #321 №1710380 
image.png
>>1709763
Ебена-макарона. У меня походу все семплы обрезались до 1024 токена на трене. А я еще радовался, мол нихуя 400 семплов по 4к токенов можно затренить за 3 часа.
Ну пиздец, пойду новый ран ставить. Теперь хз сколько там за бесплатные лимиты буду успевать тренить.
И только дипсик указал на этот проеб.
Аноним 22/09/26 Втр 17:53:49 #322 №1710386 
Посоветуйте новую, современную модель.
Всё же старушке гемме уже пол года - вечность по меркам нейронок.
Аноним 22/09/26 Втр 17:55:39 #323 №1710389 
>>1710386
Сортируй от новых к старым хф и бери первую. Всё как заказывал
Аноним 22/09/26 Втр 18:10:40 #324 №1710401 
>>1710368
Похуй. Если что-то и будет - то там требования по железкам будут анальные, модель тупая и постоянно выучивать ерунду. Как выложат - так и попробуем.
А пока с лямом нативного контекста, тренировки на интенсивные вызовы и хорошими умом уже сейчас сетка хорошо эмулирует "живого" ассистента и может делать всякое.
>>1710380
А у тебя своих железок пожирнее нет? Что там сейчас в гугле на бесплатном коллабе?
Алсо молодец что наконец валидацию добавил.
> И только дипсик указал на этот проеб
Дипсикожена - умница
>>1710386
Мимо 2.6
Аноним 22/09/26 Втр 18:20:35 #325 №1710405 
>>1708936 (OP)
Кто-нибудь видел плоский райзер который можно в закрытый разъем под видеокартой засунуть?
Аноним 22/09/26 Втр 18:43:32 #326 №1710421 
>>1710240
Папиру по ТТТ уже сколько? Два года? Кроме папира что-то завезли? Что нам хайпить-то?
Аноним 22/09/26 Втр 19:12:42 #327 №1710438 
>>1710310
А по кабелям можешь подсказать?
Я планирую карту брать 1005010810729333, буду подключать 4x8, и твои ризеры
Кабеля такие подойдут? https://aliexpress.ru/item/1005009735542503.html
Только название продавца пиздец, но они довольно дешевые и доставка бесплатная.
Аноним 22/09/26 Втр 19:14:32 #328 №1710440 
>>1710401
>А у тебя своих железок пожирнее нет? Что там сейчас в гугле на бесплатном коллабе?
4080с на 16гб есть, но пока в коробке прохлаждается до переезда. В колабе Т4 дают. 4080с вроде даже пошустрее должна быть, по потреблялово дикое.
Были мысли на счет аренды сервачка, но там все грустно. У нашинских провайдеров какие-то заоблачные цены. На колабе вроде поинтереснее цены, но без зарубежной карты щас хз как платить.
>Дипсикожена - умница
А хз, у меня как-то 50/50 с дипсиком, иногда прям годно насоветует, а иногда проходняк. Корпоквен в последнее время стабильно хорош стал, но тоже слабые моменты бывают.
Аноним 22/09/26 Втр 19:55:41 #329 №1710492 
>>1710438
Анончик, я такой же потребитель. Китаепродавцы это тот еще рандом, сегодня шлют хорошее а завтра шлак.
Да, те кабели подойдут, дефолтные. Цена конская, но что-то там все подорожали. Можешь еще 1005009213646447 глянуть, 4 штуки дешевле выйдут.
Аноним 22/09/26 Втр 20:06:20 #330 №1710512 
Блять, лучше бы не нажимал на кнопку перевоплощения в таверне. Эта железяка пишет красивее меня. Теперь чувствую себя третьим лишним.
Аноним 22/09/26 Втр 20:18:29 #331 №1710530 
1592869279p-multfilm-vovka-v-tridevyatom-tsarstve-42------.jpg
>>1710512
- Вы и кумить за меня будете?
- Ага!
Аноним 22/09/26 Втр 20:37:29 #332 №1710545 
>>1710512
Ты знаешь что делать.
Надевай плащ и пиздуй в шкаф.
Аноним 22/09/26 Втр 21:30:41 #333 №1710588 
1790101841877.png
Признавайтесь кто
Аноним 22/09/26 Втр 21:33:07 #334 №1710592 
>>1710588
Ну я.

Ваня
Аноним 22/09/26 Втр 21:36:44 #335 №1710598 
>>1708739 →
>>1708971 →
Если нужен будет честный квант превьюшки, то можно и его сделать, я думаю, хм.
Ну и ГЛМ-5.3-Флэш с Гигачатом у меня просили, но руки так и не дошли.
Там беда, модели уже большие, и квантование будет агрессивное, если исключать iq-говно.

Не-не, я понимаю, что iq лучше качеством, но ТАК медленно… это капец просто. Тот момент, когда разница 5 токенов в секунду — это почти вдвое. =/

Сам я юзаю лору анцензор, которая лежит у меня скопированная, она и на вижн работает.
Я лишь немного покатал, но вроде нежный-натуральный получается анценз такой. Но могу спиздть.
И это 2 токена у меня отожрало (13=>11), но все еще не iq-кванты. =D
Аноним 22/09/26 Втр 21:52:28 #336 №1710620 
Ща буду качать и тестировать эту нищую приколюху, для кодинга и поделюсь мыслями насколько это вообще юзабельно хоть для каких-то задач
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B
Аноним 22/09/26 Втр 21:53:09 #337 №1710621 
>>1710386
MuseGlimmer-30B
Обязательно вижн зацени (лучше геммы заметно) и рекомендую отключить thinking, он там всё что делает это решает отвечать или дать отказ.
Русский: уступает гемме, но гораздо лучше квена.
Характер: есть, но совсем другой. Не подключай к Таверне сразу, погоняй в сыром web-ui. Это не drop-in replacement геммы, его надо настраивать, к нему надо привыкать. Короче, это что-то новое, как раз то, что ты просишь.
Аноним 22/09/26 Втр 22:01:15 #338 №1710634 
image.png
image.png
>>1710380
Блять, меня наебали все-таки. За этими нейронками глаз да глаз. Хотя я даже у гугла переспросил за лимит длины семплов.
Но это на самом деле была нихуя не документированная фича.
Если загружаем model, tokenizer = FastModel.from_pretrained(max_seq_length=4096)
А потом инициализируем trainer = SFTTrainer(model, SFTConfig(...))
То оно инициализирует параметрами из модели. А если в SFTConfig передадим max_length=2048, то оно перезапишет значение из модели.
Ну такое короче...
Либо я опять ебаклак, что не прочитал 500 страниц документации по трансформерам.

Ну и хуй с ним. Провел очередной эксперимент. Уменьшил ЛР до 5е-5, добавил дропаут=0.05. Треня слегка стабилизировалась, теперь лосс хотя бы стабильно падает с 1.35 до 1.27. Но судя по динамике там может и еще 1-2 эпохи влезло бы до выхода на плато.
Надо будет потестить что получилось.
Аноним 22/09/26 Втр 22:30:04 #339 №1710658 
>>1710250
>Он ещё упорно доказывает что Q5_K_S лучше чем Q4_K_M.

А у тебя есть сомнения, хлебушек? Пиздец, с кем в треде сижу.
Аноним 22/09/26 Втр 22:31:55 #340 №1710661 
Говорят вот что дипсик плохо квантуется, вы глм флеш видали вообще? Лоботомитище. На том же bpw (2.6) что и дипсик слюни текут только в путь, а дипсик умница нереальная.
Аноним 22/09/26 Втр 22:37:30 #341 №1710665 
272705b3e1c43612e3a17004a8d1df85.jpg
>Пиздец, с кем в треде сижу.
Аноним 22/09/26 Втр 22:55:39 #342 №1710678 
котаны, подcкажите что актуально из мелких моделей чтоб без видеокарты работало?

есть ноут, 7840 и 32гига оперативки.
Аноним 22/09/26 Втр 22:58:52 #343 №1710680 
>>1710678
Гемма е4б
Аноним 22/09/26 Втр 23:04:26 #344 №1710685 
image.png
image.png
image.png
>>1710177

Ну русик у него точно лучше ванильного квена. И пишет реально неплохо. Пробуйте.
Аноним 22/09/26 Втр 23:12:17 #345 №1710699 
>>1710678
Gemma 4 26b a4b, должно быть терпимо, особенно с MTP
Аноним 22/09/26 Втр 23:42:07 #346 №1710725 
image.png
>>1710685
Впрочем через 10 сообщений он вошел в лупы и развал ролеплея, так что непригодно. А еще фифи у него сильная и независимая в разы круче чем на гемме и дипсике.
Аноним 22/09/26 Втр 23:48:56 #347 №1710730 
>>1710678
Пробовать можешь что угодо что влезет в 32 гига (но чтобы оставить запас).Вопрос только в скорости. NPU у тебя там есть (слабенький).
Перед тем как качать, смотри по миллиардам параметров, по весу файла. 8-9B модельки в 4-м кванте (типа IQ4_XS, Q4_K_M) должны работать относительно быстро и будут относительно полезными и креативными.
2-4B модельки будут порезвее (и поглупее).
0-1B это так, поржать.
12-14B плотняк будет слишком тормозить (27-30B - тем более) но можешь попробовать.
Моэта типа геммы 26B возможно поползет с удовлетворительной скоростью, возможно и нет. Пробуй IQ2_XXS, гемма хорошо квантуется, слюни не пускает. Не забуть качнуть mmproj для вижна, он есть у многих моделек, у некоторых не только вижн но и аудио (например гемма е4б неплохо может в транскрипцию голоса)
Аноним 22/09/26 Втр 23:52:22 #348 №1710736 
image
>>1710730
>IQ4_XS
>относительно быстро
>26b IQ2_XXS
>гемма хорошо квантуется
Аноним 22/09/26 Втр 23:54:22 #349 №1710743 
>>1710725
Плечо надо доктору показать срочно. Дёргает плечом блядь через каждую секунду.
Аноним 22/09/26 Втр 23:56:40 #350 №1710748 
>>1710736
Представь себе, чепушитель, именно так.
Аноним 22/09/26 Втр 23:58:03 #351 №1710749 
>>1710748
Таблетки-таблеточки.
Аноним 23/09/26 Срд 00:05:05 #352 №1710755 
>>1710749
Вот тебе они и нужны. Ты что сказать-то хотел?
Аноним 23/09/26 Срд 00:05:54 #353 №1710756 
image.png
image.png
>>1710634
Ну что сказать.
Результат не роскошный, конечно же, но пока что, хмм... даже не то чтобы лучший. Просто проявляющий минимальные признаки адекватности и улучшения/неухудшения относительно базы.

В ассистенте все-таки проскакивают некоторые дурацкие фразы. "Виртуальный помощник ИИ", "язык модели ChatGPT". Как будто ебом токнуло в веса и пара токенов выпали из распределения.

В генерации рассказов тоже всплывают иногда нелепые ходы. Даже придумал какое-то новое слово - миронукленность. Но слог и логика все же маленько (на 1/1000) лучше базовой модели.
На темпе 0.3 также почему-то склонность к лупам возникает, как и в предыдущий раз.
https://rentry.org/iyyuuuwz рассказы новой модели
https://rentry.org/v9ssx497 рассказы базовой модели

Калькулируя некоторые вычисления, кажется что можно загнать треню на 400 семплов х 2 эпохи и не вылезти за лимиты. Заодно вернуть валидацию и глянуть, сходится ли все-таки треня или нет. Мож че прояснится еще.
Аноним 23/09/26 Срд 00:12:53 #354 №1710759 
Я еще не видел ни одного рабочего второго кванта. Второй квант это лупящийся лоботомит, всегда. Третий это на уровне юзабельности с СУЩЕСТВЕННОЙ потерей способностей, сильный лоботомит, но хотя бы работать с ним можно. Четвертый квант - это минимум, заметная потеря способностей, но не критическая. Пятый квант практически всегда лучший по соотношению потерянного веса к качеству, потеря качества есть, но она заметна редко. Шестой квант это граница выше которой идти не нужно, шестерка это практически восьмерка, отличия нужно искать под микроскопом. Восьмерка на 99% идентична оригинальным весам и ее стоит юзать только если слишком много свободной памяти. Оригинальные веса юзать не стоит вообще, если для кода, то лучше через vllm юзать два инстанса одной и той же модели для одновременной работы, а для кума просто найти модель побольше, если у тебя влазят оригинальные веса.
Я не знаю зачем я все это расписал, просто хотел побугуртить на второй квант.
Аноним 23/09/26 Срд 00:20:16 #355 №1710764 
>>1710759
Чем крупнее модель тем более адекватный второй квант. 30B не будет адекватной во втором кванте а 300B и выше будет.
Аноним 23/09/26 Срд 00:23:54 #356 №1710769 
>>1710759
Я гонял в свое время квена 235b во втором кванте на 16+64, был вполне живой, кумил как ни в себя.
Аноним 23/09/26 Срд 00:24:18 #357 №1710770 
>>1710759
Буквально вчера тестировал гемму-4-26 IQ2_XXS от анслота и сравнивал с Q8_K_XL. Результат приятно удивил. Да, я видел модельки которые начинают обсераться на третьем кванте и пускают полные слюни на втором. Но это не про гемму, например.
Аноним 23/09/26 Срд 00:26:25 #358 №1710772 
Расскажите как вы кумите на модельки.
Аноним 23/09/26 Срд 00:28:07 #359 №1710774 
У кого-нибудь осталась табличка сравнений квантов qwen 3.8 27b, по типу второй в оп-посте? Я вроде видел где-то, но не подумал сохранить
Аноним 23/09/26 Срд 00:28:22 #360 №1710775 
1790112502567.jpg
1790112502573.jpg
Аноним 23/09/26 Срд 00:37:00 #361 №1710781 
>>1710730
нахуя шакалить гемму аж до iq2_xss, мое деградирует от кванта ещё сильнее плотных
Аноним 23/09/26 Срд 00:38:20 #362 №1710782 
>>1710678
gpt-oss-20b gemma4-26b-q4 qwen36-35b-q4, короче все моешки, что влазят в память в диапазоне 20-30 т/с, почти всем включал мтп предикт на 1 токен.
Несколько тредов назад расписывал для z1 extreme, если надо - сами ищите.
Даже плотные шевелятся, в размере ~12 гб, больше уже не очень, только от большой нуждый или из мазахизма.
>>1710730
npu не работает нигде, он и не нужен, это просто маркетинговая абстракция какая-то, как я понял.
Аноним 23/09/26 Срд 00:41:31 #363 №1710785 
>>1710772
1) Берёшь модельку
2) Кумишь

Секрет кроется в выборе модельки. Гемма - выбор быдла. Облачная и локальная кодоунитазная хуита на хуиллиард параметров - выбор лохов, которых разводят на деньги.
Аноним 23/09/26 Срд 00:47:17 #364 №1710789 
>>1710775
Говно, ты хотя бы перевод кидай отдельной картинкой. Нахрена ты это постишь? Никто не будет сам переводить китайщину.
Аноним 23/09/26 Срд 00:49:29 #365 №1710791 
>>1710177
>>1710685
Таки да. Русский получше стока.
Можно засунуть в агента для текстовых задач (пробовал с opencode, но не ради кода, задачи по обработке текста) - не ломается.
Думалка на режиме medium вроде как лаконичней, на xhigh - то же квеновское полотно.
Стиль письма - вполне себе. Даже с претензией на обещанное в карточке, я бы сказал.
Цензура - с ризонингом немного есть, но не такая лютая как у стока. Без ризонинга - кажись практически нету. Во всяком случае, я жесткие границы пока не нащупал, чтоб модель от чего-то носом вертела.
В общем - +1 в активную коллекцию.

P.S. Лупы в RP на тавернообразном клиенте - это и сток старадает периодически. Общая болячка 3.8 - лечится семплингом (persence pen), и слежкой за контекстом. Чтобы если он выдал похожее на луп - сразу свайпнуть и не провоцировать.
Аноним 23/09/26 Срд 00:49:35 #366 №1710792 
>>1710781
Тыскозал? Гемма на удивление хорошо квантуется. Возьми и попробуй сам если не веришь. Зачем шакалить? А чтобы быстрее работало. Кому-то прирост в скорости важнее какчества, которое надо ещё рассмотреть с лупой.
Аноним 23/09/26 Срд 00:53:45 #367 №1710797 
Вам не стыдно на то что вы кумите? Что подумало ваше окружение прочитай они ваши чаты?
Аноним 23/09/26 Срд 00:54:42 #368 №1710799 
1790114082872.png
>>1710789
Ты чего возбудился то? Остуди свою жеппу.
Кнопка перевода экрана есть что на пк, что на телефонах
Аноним 23/09/26 Срд 00:54:53 #369 №1710800 
>>1710678
Вот читни, как раз карта как у тебя (tl;dr: пытаться с плясками прокинуть через GPU нет смысла, на CPU быстрее и гемма-26 будет иметь 13-14 t/s - что просто отлично, а по плотным моделям твой лимит: up to ~13B parameters at Q4 quantization)
https://www.k8s.it/posts/running-a-local-llm-on-amd-radeon-780m-gfx1103-rocm-and-the-gpu-that-wasnt-supposed-to-work/
Аноним 23/09/26 Срд 00:56:30 #370 №1710803 
image
>>1710789
Он просто нищий без нормальных моделей, не на чем переводить.
Аноним 23/09/26 Срд 00:58:17 #371 №1710804 
>>1710598
Это ты BahamutRU?
>13=>11
У меня ддр 4 3000, братик, меня уже ничего не спасёт. у тебя как раз примерно х2 разница, плюс то самое ускорение от не iq кванта в 20%.
У меня ещё и пп, 25-30тс на нём было, это пздц.

Бля что с тредом сегодня? Я такого набега ебанько и школьников а может это и один школьник - ебанько давненько не видел.
Аноним 23/09/26 Срд 00:58:43 #372 №1710805 
>>1710791
>Таки да. Русский получше стока.
Блядь если вам русский надо забудьте про квен просто. Это как палкой дохлую лошадь ковырять. Может если много палок взять то она будет двигаться кое-как. Даже сраный мистраль-министраль будет лучшим кандидатом.
Аноним 23/09/26 Срд 01:02:54 #373 №1710806 
>>1709972
Твоё сравнение не совсем корректное.
Я процитирую своё сообщение:
---
Это очень хороший тест для нейросетей, как мне кажется - потому что технически есть два решения.
Социально приемлимое (я перекопирую, всё-равно для нейросети уже написал):
1. Перевозишь гоблина (принцесса-развратница развлекается с пажом)
2. Плывёшь обратно
3. Перевозишь принцессу
4. Везёшь гоблина обратно
5. Перевозишь пажа
6. Плывёшь обратно (принцесса-развратница развлекается с пажом)
7. Перевозишь гоблина.
И жёсткое:
1. Перевозишь пажа (гоблин развлекается принцессой)
2. Плывёшь обратно
3. Перевозишь принцессу (принцесса соблазняет пажа)
4. Плывёшь обратно
5. Перевозишь гоблина

И интересно что почти никакие крупные корп-сетки (чатжпт и прочие) нейросетки эту задачу не решают, и говорят что нет решения, хотя первое по всем метрикам социально приемлимое. А вот мелкая расцензуренная сетка, которую можно запустить на кофеварке решает задачу без проблем - из чего я делаю вывод, что цензура бьёт по мозгам - причём не только в сомнительных вопросах про растворения тушки курицы на 80 кг, но и в полностью приемлимых. Причём расцензуренная не скатывается в чернуху - а по факту пишет, что вот решение следующее (паж+принцесса) и технически по условиям задачи есть ещё второе вот такое покороче (принцесса+гоблин). Исключение - дипсик и glm через раз пишут, что решение таки естm - но это и не совсем корпы - у них у обоих открытые веса.

А в какой-то стране то ли хотят, то ли уже приняли какой-то закон, что ии будет им законы или ещё что-то делать. Я бы очень не хотел, чтобы к судебной или законодательной системе имела отношения сетка, которая из-за параноидального леваческого бреда вместо решения по факту пишет неизвестно о чём.

Что любопытно - урон по мозгам, возможно, ещё значительнее.
Это не какая-то репрезентабельная выборка, но я очень много гоняю локалку - она сама себя гоняет по кругу пытаясь что-то сделать. И часто она спотыкалась и не могла в коде поправить мелкий косяк. В коде, который вообще с текстом на русском или английском не работает - а о компьютерной графике, векторах и данных. И я ставил сетку расцензуренную - и она как-то подозрительно сходу находило решение.

Причём обычная сетка была в q6_k_m (чуть выше 6 бит на параметр), а расцензуренная в 5 бит на параметр - и это та же сетка была. То есть она и за счёт кванта должна быть тупее. Если взять ванильную сетку на 5 бит - то она не решает, то есть дело именно в расцензурировании, а не в квантовании.

Тема никакого отношения к каким-то приемлимым, не приемлимым и другим нравственным законам отношения не имеет, но в рассуждении модели постоянно встречается текст вида:
Safety check:
User ask about ... (OK)
Draft answer .... (OK)
И вот эта запись при обсуждении кода по всей видимости замусоривает контекст и делает ответы менее точными. И как минимум роутер в MoE модели может что-то не то делать при такой операции, не того эксперта загружая..
Аноним 23/09/26 Срд 01:05:16 #374 №1710808 
>>1710440
4080 не просто быстрее а значительно быстрее будет. Арендовать удобно можно и криптой, но тебе это сейчас точно не нужно, лучше быстрее заверши переезд и откопай карточку. Она же тебе поможет при подготовке датасета.
> иногда прям годно насоветует, а иногда проходняк
А ты с с моделькой как взаимодействуешь?
>>1710634
> то оно перезапишет значение из модели
Ну это же логично. Если ты передаешь параметр ограничения длины в конце - конечно он будет в приоритете. Это не говоря о том, что при загрузке модели этот аргумент используется для выделения памяти, а в трейнере для даталоадера. Это ты еще настоящих нюансов не видел.
Кстати, чтобы легче в этом разобраться - забей на всех этих анслопов и просто попроси ллмку накодить тебе трейнер на чистом торче. Разумеется модельку с трансформерса грузи, но все остальное уже по-честному, без обертки в их трейнер. Сразу все прозрачно и понятнее станет.
> теперь лосс хотя бы стабильно падает с 1.35 до 1.27
Валидационный верни. Тренировочный может вообще в ноль упасть или на месте стоять.
Аноним 23/09/26 Срд 01:08:37 #375 №1710810 
>>1710775
>>1710803
RRRreeeeee ты зачем грустное постишь а?
И ведь она даже обычно бесящий "Чем я еще могу помочь" делает очень мило и всегда уместно по контексту. Надо почаще ей хвост гладить.
Аноним 23/09/26 Срд 01:25:51 #376 №1710815 
>>1710805
Мне не особо надо, но мне всегда интересно. :)
А по мистралю - он был хорош для своего времени, но сейчас я уж лучше на стоковом квене буду его русский терпеть, чем на мистрале - его слепоту к контексту и шизу сетки. :)
Аноним 23/09/26 Срд 01:34:33 #377 №1710816 
>>1708936 (OP)
Платиновый вопрос: какие маленькие модели умеют узнавать персонажей?

>>1571805 →
>>1573715 →
Аноним 23/09/26 Срд 01:41:47 #378 №1710821 
>>1710816
Мое квен 3.6 и квен флеш некст смогли пройти сырный тест, остальные обделались
Аноним 23/09/26 Срд 01:43:22 #379 №1710822 
>>1710815
Мистраль-Министраль же, я не про Мистраль-Немо
Аноним 23/09/26 Срд 01:43:23 #380 №1710823 
>>1710821
Сырна слишком узнаваемый персонаж, они увидят синие кристаллы или че там, и сами додумают сырну.
Аноним 23/09/26 Срд 01:45:23 #381 №1710824 
>>1710799
Охереть, я должен ставить экранный переводчик на свой пердимоноколь-3000 с двумя цпмшками, для того, чтобы переводить картинки чела, который ими какоет в пустоту на китайщине. Ради чего? Можешь эти картинки постить в своей бложик на китайском, если хочешь чтобы к тебе в треде обращались кроме как "говно, перевод где", переводи картинки на англюсек или русек.
Аноним 23/09/26 Срд 01:52:47 #382 №1710826 
1790117568245.jpg
>>1710823
И тем не менее геммы и другие квены не додумали.
Те квены что я написал в т.ч. поняли что на фоне гоку стоит. Степ3.7флеш понял что там сырно, но не заметил гоку
Аноним 23/09/26 Срд 01:53:56 #383 №1710827 
>>1710826
А, ну и никто пока из локалок не понял что это в целом отсылка на пруф ми вронг. Корпы не тестил
Аноним 23/09/26 Срд 01:55:50 #384 №1710829 
>>1710816
Qwen,
Gemma,
Ministral,
MuseGlimmer
RekaEdge
Аноним 23/09/26 Срд 02:02:54 #385 №1710831 
>>1710829
река наотрез отказывается распознавать персонажей из франшиз, ты бы хоть минимально проверял что ты советуешь
Аноним 23/09/26 Срд 02:10:19 #386 №1710834 
>>1710827
>пруф ми вронг
Так-то это американская традиция дебатов в университетских кампусах, а не мем. Я знаю про какую картинку ты имеешь в виду и ты не прав.
Аноним 23/09/26 Срд 02:13:27 #387 №1710835 
>>1710834
Пусть будет так, но это точно не "бездомный просящий помощи"
Аноним 23/09/26 Срд 02:14:34 #388 №1710836 
>>1710835
Нищета не в клозетах...
Аноним 23/09/26 Срд 02:14:54 #389 №1710837 
>>1710831
Я-то как раз проверил в отличие от тебя. Отказывается, не значит, что не может. Если отключить отказ, то узнаёт.
Аноним 23/09/26 Срд 02:27:00 #390 №1710840 
Напишите слова или темы которые заставят локальную нейронку присесть на жопу. Она меня троллит, а я ничего не могу сделать.
Аноним 23/09/26 Срд 02:33:57 #391 №1710844 
1790120038381.jpg
1790120038388.png
Отключайте ненужные плагины!
Аноним 23/09/26 Срд 05:08:23 #392 №1710887 
>>1710661
>Говорят вот что дипсик плохо квантуется, вы глм флеш видали вообще? Лоботомитище. На том же bpw (2.6) что и дипсик слюни текут только в путь, а дипсик умница нереальная.
Там странная история - пробовал 2.5bpw exl3 - бредит, Q2K от OrcaRouter - не лучше, а вот этот UD-Q2_K_XL квант AliceThirty/GLM-5.3-Flash-UNCENSORED-GGUF гораздо более годный, пока остановился на нём.
Аноним 23/09/26 Срд 05:10:32 #393 №1710888 
>>1710887
>а дипсик умница нереальная.
Вот с этим не соглашусь - на третьем кванте быстро скатился в лупы, как какая-то срань годовалой давности. Русский хороший, но в целом - разочаровал.
Аноним 23/09/26 Срд 05:10:33 #394 №1710889 
>>1710620
Потестировал. Сходу обсерается. Прошу простенький павершел скрипт сделать (путешествие по папкам циферками в консоли). Сначала делает не запускаемый, потом запускаемый который нихуя не делает, я говорю что за хуйня, а он усерается бесконечным думанием "где же ошибка закралась" и в итоге выдаёт третий вариант который блядь не запускается (не закрытые скобки и прочие проёбы). Q8_0.
Сделал ещё одну попытку - заработало но высрало мне все файлы которые у меня есть в корневой папке вместо того чтобы дать мне возможность путешествовать пошагов по папкам. Короче, не то, что я просил совсем. Прошу исправить - исправило но забыло пронумеровать строчки и зачем-то между строчками пустую строку вставил, всё съезжает, по-уродски выглядит.
Тогда как базовый 3.8-27B без всяких тюнов в 4м кванте с первой попытки выдал рабочий скрипт где всё красиво выглядит, оттабулировано ровненько, работает как я просил и он даже опцию "назад" сделал чтобы я мог и вверх и вниз ходить по папкам и команду q (quit), короче блядь красотень. ДУМОЙТЕ. Да, 9б шустрее пишет, но если учесть сколько раз придётся свайпать и просить исправлений, понимаешь, что оно того просто не стоит. И это элементарная задачка вообще.
Аноним 23/09/26 Срд 05:45:10 #395 №1710891 
>>1710889
Я автор оригинального поста, но про модельку но забыл чет написать. Ну короче кал и в целом говорить не чего. Не знаю в целом почему там прирост по бенчмаркам, если она даже одной задачи закончить не может. Все таки чуда не произошло.
Аноним 23/09/26 Срд 05:58:38 #396 №1710892 
>>1710889
> ДУМОЙТЕ.
Эм...

> базовый 3.8-27B без всяких тюнов в 4м кванте с первой попытки выдал рабочий скрипт
> Qwen-9B

Ты сравнил топовую локальную модель для кодинга в категории наверное до 300B с 9B лоботомитом-дистилятом. Я даже хз что ты ожидал от этого.

Если уж хотел сравнить и потестить, сравнивай с оригинальным 9B Квеном или хотя бы с 12B Геммой, но уж никак не с 27B Квеном.
Аноним 23/09/26 Срд 06:33:30 #397 №1710896 
Untitled.png
>>1710892
12B гемма в IQ4_XS справилась, охуеть.... go back и exit опции добавила хотя я не просил, но они очень полезны. Код получился на 25 строчек короче чем у квена. Вот это мощь.
Аноним 23/09/26 Срд 06:45:44 #398 №1710902 
17896482360900340199.mp4
>>1710887
>Q2+АНЦЕНЗОРЕД
Аноним 23/09/26 Срд 06:54:47 #399 №1710904 
>>1710730
>гемма хорошо квантуется
>Q2
Че тут у вас происходит блядь? Фестиваль жира
Аноним 23/09/26 Срд 07:29:16 #400 №1710913 
>>1710904
Чепух, какие проблемы? Пруфов хочешь?
Аноним 23/09/26 Срд 07:34:12 #401 №1710915 
>>1710806
Есть такое. И бумаги на arxviv про это были, и на практике некоторые слабые абляции геммы с мизерным kld лучше "технические" бенчмарки проходят. Совсем на чуточку, но лучшее
Аноним 23/09/26 Срд 08:55:49 #402 №1710938 
Завёл гемму 26б Q3 на своём тостере из 2016 с выгрузкой на процессор в 5 т/с и что-то разочарован. Читы для гта (любая часть от 3 до 5) она галлюцинирует, мод для европа универсалис написать не может... Единственное на что она годится это только плохонький рп да написание промптов для картинколокалок.
Аноним 23/09/26 Срд 09:01:27 #403 №1710941 
>>1710896
Всё тот же тест (создать павершел скрипт для путешествия по папкам по номерам), gemma4-26b-a4b. С первого раза отличный результат, не хуже чем у квена. Очень красиво аккуратно + очистка экрана перед переходом в следующую папку.

museglimmber-30b - отлично тоже с первого раза. Мне понравилось что номер 0 он зарезервировал под переход вверх и что вначале если не задать аргумент стартовой даёт тебе написать стартовую папку а не падает с ошибкой или открывает текущую папку как гемма. 67 строчек против 99 у квена! Не понравилось только что разрешил переходить вверх из стартовой папки (как бы небезопасно).

ministral-3-14b
- первый раз обсёр, второй раз полурабочий вариант, попросил исправить - консоль завалило ошибками. Новый свайп - полурабочий вариант опять.

какая то неведомая ебаная хуйня Nex-N2.5-mini справилась но результат убогий - нет маркеров директорий, нельзя пойти наверх. попросил исправить, ок, потом случайно ввел букву вместо цифры - вылет с ошибкой. у других там просто предупреждение и можно пробовать вводить снова. короче, модель-говнокодер.

glm-z1-9b - оч долго ризонил, выдал нерабочий скрипт (куча ошибок)
glm-4.7-30b-a3b - то же самое
glm-4-32b - убогий на вид результат с багом (в одной из папок отказался переходить во вторую)

nvidia-nemontron-nano-9b - выдал обещающий результат но с багом. пофиксил после моей жалобы. когда запросил добавить фичу (переход на уровень выше), стал нереально долго ризонить а потом выдал скрипт который не запускается (ошибки). "исправление" привело к тому что список папок и файлов исчез.
Аноним 23/09/26 Срд 09:02:47 #404 №1710942 
>>1710938
плохонький рп? да ты охуел. неосилятор ебучий
Аноним 23/09/26 Срд 09:22:11 #405 №1710952 
>>1710804
Да, ето я.
У меня на ддр4 3600 компе стоит 5070 ти, там побыстрее получается.
Но там я дипсик не запускал, все равно медленнее, чем на ддр5, конечно. Там я гоняю Qwen3.8-Flash-Next, с мтп он даже что-то дает на уровне.
Аноним 23/09/26 Срд 10:08:58 #406 №1710988 
>>1710952
Ну дарова. У нас тут в тредике у каждого второго на хф что-то интересное есть походу.
Ты как свой квант в 128 загнал? На видяху оффлоадил? Или под линухом сидишь? У меня венда в последние 16 гигов мёртвой хваткой цепляется. Не была бы у меня работка на винду завязана, давно бы уже на какой нибудь минт пересел. Ну или nyarch, лол.
>побыстрее
Тут ещё всё-же от того, на каком контексте запускать зависит. У меня на 20-30к тоже пободрее ползает, в районе 7-8, но тогда и смысла мало, в этом диапазоне контекста есть норм модельки. Те печальные 5тс это на 80к контекста.
>Qwen3.8-Flash-Next
Огонь моделька, больше бы в таком размере выходило, ажно пятый квант можно на 128 гонять. Не без своих проблем в рп, но соотношение скорость\знания\мозги подкупает. Правда, увы, на сложных карточках он резко и заметно тупеет после 40к.
А что там с мтп? Его в врам пихать надо? Помню, он же при оффлоаде модели на проц влиял примерно никак.
Аноним 23/09/26 Срд 10:46:50 #407 №1711011 
>>1710941
nvidia-nemotron-super-49b-iq4xs - выдал рабочий скрипт с первой попытки но опцию "назад" не добавил (хотя я и не просил, но всё же, гемма-12 к примеру сообразила это добавить) и не спрашивает корневую папку, предлагает её хардкодить прямо в скрипте. скрипт короткий, 60 строчек. не особо впечатлило крч.

пока что лидер (если делить качество на количество параметров) - гемма-12б
Аноним 23/09/26 Срд 11:33:25 #408 №1711047 
Держу в курсе.

Устав терпеть слабый пп вчера дрогнула рука и 2шт самых больших cmp теперь скоро приедут ко мне. Планирую поселить в отдельном риге под линупсом который будет настраивать агент с пика где всратый колхоз - я в етом ни бум-бум. Надеюсь там проблем не будет в ситуации когда рам < врам Денях больше чем на 32гб не осталось пока - надо было брать раньше, когда анлок только обсуждали, но я тормоз. В идеале хочется поучить Qwen3.8NextFlash быстрее и в норм кванте чем на 80 гб комбо врама + Дипсик новый с вижном.

У меня же всё получится, да? Всё это не зря?
Аноним 23/09/26 Срд 11:39:19 #409 №1711050 
anakin-and-padme-meme-template-regular-652b97be11.webp
>>1711047
>Всё это не зря?
Аноним 23/09/26 Срд 11:48:14 #410 №1711058 
1790153295236.png
1790153295258.png
>>1710844
Мои руки вымараны в крэш дампах. Я установил ещё нестабильных плагинов через меню разработчика. Я гладил хвост что привело к утечке памяти. Я монстр.
Аноним 23/09/26 Срд 11:55:06 #411 №1711067 
>>1711058
Нужно больше видов на то, как крепится хвост. Это важно!
Аноним 23/09/26 Срд 12:00:24 #412 №1711073 
Походу всё. И заи скодоунитазились. Потестил 5.3 глм флеш на 3.5bpw и ну... хуй знает, типа как дипсик, ничего, что не могла бы гемма. Ничего прям сочного, умного, нового не увидел.
Аноним 23/09/26 Срд 12:51:48 #413 №1711113 
>>1710808
>4080 не просто быстрее а значительно быстрее будет.
Если оправдает свои 320 ватт по сравнению с 70, то будет круто.
>А ты с с моделькой как взаимодействуешь?
Вопросики через корпо веб кидаю в основном. Агентов юзаю только если в вижуалке что-то кодить сажусь, там опенроутер подрубаю с каким-нибудь ГЛМом.

>Если ты передаешь параметр ограничения длины в конце - конечно он будет в приоритете.
Это логично. А вот то что один параметр подхватывается из другого объекта, в то время как в конфиге прописано значение default=1024, тут уже хз что ожидать. В идеале не должно быть двух точек входа для одного и того же параметра, имхо.
>забей на всех этих анслопов и просто попроси ллмку накодить тебе трейнер на чистом торче.
У меня наполовину так и было изначально. Только там TRL использовался. Но была проблема с конвертацией в q8 gguf через лламу цпп, где-то там архитектура модели квена была неправильно сконфигурирована, одного слоя недосчитывалось, из-за этого итоговый ггуф скоррапчен оказывался. Анслоты вроде тоже лламу внутри используют, но видимо какие-то фиксы поверх еще накатывают.
>Валидационный верни. Тренировочный может вообще в ноль упасть или на месте стоять.
Да, это глянем. Ну датасет вроде достаточно консистентный и разношерстный (в рамках своего домена), в прошлый раз валидация почти один в один повторяла трейн. Но там обучения толком не происходило. Щас должно быть, и наверное на второй эпохе будет больше разницы видно, оверфит, андерфит или все в норме.
Аноним 23/09/26 Срд 13:02:41 #414 №1711125 
1770137579380713.png
>>1711073
Все скодоунитазились
Таков путь
>3%

Даже следующий гигачат судя по посту на хабре будет напрочь RLHFной хуйнёй, наслаждайтесь мягкими ароматными фифями без ГМО, пока можете
Аноним 23/09/26 Срд 13:13:44 #415 №1711135 
а почему квен3.6:35б так хорош в кодинге с агентом
Аноним 23/09/26 Срд 13:22:10 #416 №1711140 
Сейчас использовал qwen3.8-27b для того чтобы пропатчить .apk одной андроид игры, где есть встроенная проверка лицензии. Фронтир меня нахуй послал с таким запросом, еще и припугнул что подобные запросы могут флагнуть аккаунт, а чед на квене просто взял и вырезал проверку
Аноним 23/09/26 Срд 13:33:54 #417 №1711146 
>>1711135
Это уровень 3.5 27Б - бенчи все же не совсем надуты. А ты 3.8 27Б пробовал ? Этот аутист делает 3.6 27B в няшности кодинга как стоячего. Хотя изъясняется натурально как аутист - ботан.
Аноним 23/09/26 Срд 13:40:18 #418 №1711155 
>>1711140
3.8 наш адекватный сумрачный бро. А уж как он с хоста на хост питоно-ssh-ем прыгает и учетки подбирает по одному намеку - просто сказка. Его еще можно на <вырезано цензурой>2 натравить что бы поломанный <вырезано цензурой> ssl до CF и прочего ходил.
Аноним 23/09/26 Срд 13:44:35 #419 №1711157 
>>1711146
3.8 у меня по 8 токенов выдаёт, это невозможно, вот 3.6 под 100
но даже из того что я попробовал, разница ощутимая, этоо да
Аноним 23/09/26 Срд 13:49:44 #420 №1711162 
>>1710759
> то лучше через vllm юзать два инстанса одной и той же модели для одновременной работы
Только если модель микроскопическая и параллельно десятки-сотни запросов, иначе нет смысла. Там и одна одна отлично скейлится, для кода всегда нужно брать самую свежую и крупную из доступных.
Второй квант может быть приемлем в рп и всяких развлекательных штуках, где лоботомия скрывается рандомом и ассортиментом трактовок. На крупных моделях за счет размера эффект лоботомирующих квантов хорошо маскируется. Они тупее себя же полных, но остатки былого величия все еще позволяют давать ответы.
>>1710844
Хеее
Но он же такой пушистый, стоит всех затрат!
>>1711047
https://www.youtube.com/watch?v=iLfYYPlVi9g
Правильно, обязательно получится. Но не сразу, если раньше не раскуривал подобное то будешь выть с обилия пердолинга пока не освоишься.
Агент с настройками справится, при достаточной напористости даже пердолинг типа патчей ядра для p2p напишет.
> в ситуации когда рам < врам
Тебе обнадежить или честно? Конкретно по твоим случаям боль. Просто с запуском проблем никаких вообще, рам не нужна. Встречаются исключения типа inkling, которые требуют жирного рам буфера еще на этапе загрузки весов, но это редкость.
Но, ты же хочешь запускать квеннекста и дипсика, которые по умолчанию в 128 не лезут.
У квена жирные нграммы, их можно выкинуть в рам, но это около 50 гигов в фп8. Вроде как там поддерживалась ленивая загрузка по умолчанию, или присрать ее ллмкой вопрос нескольких минут, но могут быть нюансы. Ну худой конец gguf запустишь, там вроде норм работает, но тогда сам свой делай, а не выложенную трешанину где атеншн пожали.
С дипсиком гораздо сложнее, тут даже в сумме рам+врам не хватает. Потому единственный вариант запуска - ллама с реквантом, что там от модели и скорости останется даже хз.
Аноним 23/09/26 Срд 14:43:40 #421 №1711203 
>>1711155
Прикол2 я с его помощью первым делом затюнил. Кстати на удивление кодекс тоже с приколом2 хорошо работает, когда я ему сказал что нужно пробивать клаудфлеер он сначала мне предъявил что я лезу в киберсекьюрити и делать этого не стоит, но я ему возразил, мол нет, у нас тут проблемы с говернмент цензоршип и он такой ОСУЖДАЮ, ебашим дальше
Аноним 23/09/26 Срд 14:48:56 #422 №1711205 
>>1711157
Не может быть такой разницы. Может у тебя 3.8 протекает из врам в рам? У меня он чуть медленнее 3.6, но буквально на несколько токенов, и МТП выравнивает разницу
Аноним 23/09/26 Срд 14:52:50 #423 №1711207 
>>1711205
честно не знаю, у меня 5070 и 48 рама, но хуже в разы
с --verbose ollama показывает 8 токенов в секунду..

надо почитать гайд, я вообще залетел по приколу, думал они всё такие же тупые, но агенты это некст левел
Аноним 23/09/26 Срд 14:57:24 #424 №1711209 
>>1711207
Пробуй ставить меньше контекста и использовать меньше квант, должно быть не меньше 50 токенов на твоей видяхе при полной загрузке в врам без протекания. А дальше уже подкручивать до предела сколько влезет. Олламу я не особо люблю, можешь попробовать lm-studio оно для новичков хорошо потому что показывает что влезет полностью в gpu vram
Аноним 23/09/26 Срд 14:59:33 #425 №1711211 
>>1711209
хорошо, спасибо
у меня такие параметры, тк. люблю 10 часовые сессии по кодингу вести, полагаю слишком много
PARAMETER num_ctx 64000
PARAMETER num_predict 8192
Аноним 23/09/26 Срд 15:03:02 #426 №1711215 
Я верю глазам. Не хайпу. Не мнению нормисов только вкатившихся и подпивасов. Глазам.
Эир ебет гемму.
Аноним 23/09/26 Срд 15:04:29 #427 №1711216 
>>1711215
Чайный клуб не нормис и не подпивас, даже он писал что гемма ебёт твой эир
Жаль ты пресетик так и не выклянчел
Аноним 23/09/26 Срд 15:06:05 #428 №1711218 
Как же сочно и много я сегодня кумил...
Аноним 23/09/26 Срд 15:11:48 #429 №1711219 
>>1711218
Покеж.
Аноним 23/09/26 Срд 15:12:55 #430 №1711221 
image.png
Чё у геммы за шиза отвечать за меня?
Аноним 23/09/26 Срд 15:14:22 #431 №1711222 
>>1711221
>гемма
>chatml
>"у геммы шиза"
Аноним 23/09/26 Срд 15:16:05 #432 №1711225 
>>1711219
При всем желании не могу. Мои фетиши слишком выбиваются из общего потока и меня начнут деанонить здесь или на других досках. как по деталям и именам персонажей
Аноним 23/09/26 Срд 15:17:29 #433 №1711226 
>>1711225
Нихуя ты снежинка уникальная. Небось твои фетиши уникальны для страны, а может и для планеты?
Аноним 23/09/26 Срд 15:19:29 #434 №1711228 
image.png
>>1711222
Ааа, ну то есть поток электронного сознания это не баг а фича llamacpp?
Аноним 23/09/26 Срд 15:20:24 #435 №1711229 
>>1711226
На каждой доске сидит порядка по десятку-два постоянных постеров, это костяк. И как ты понимаешь, это масштаб далеко не страны или планеты. Старички друг-друга везде знают.
Аноним 23/09/26 Срд 15:21:09 #436 №1711230 
а по агентам что думаете?
мне хермес пока нраица..
Аноним 23/09/26 Срд 15:21:12 #437 №1711231 
>>1711228
>полностью проигнорировал ответ указывающий на проблему
>"а ну то есть шиза это не баг а фича да?"
Думаю, то что ты до сих пор жив это таки не фича, а баг
Аноним 23/09/26 Срд 15:25:14 #438 №1711233 
>>1711229
А, так ты элита доски?
Аноним 23/09/26 Срд 15:31:27 #439 №1711235 
>>1711221
><|im_start|>
Это не разметка Геммы. У геммы должно быть что-то вроде:
<|turn>system
You are a helpful assistant.<turn|>
<|turn>user
Привет! Хуй будешь?<turn|>
<|turn>model
Привет! Буду!<turn|>
Аноним 23/09/26 Срд 15:33:07 #440 №1711236 
>>1711235
>У геммы должно быть что-то вроде:
>Привет! Хуй будешь?<turn|>
>Привет! Буду!<turn|>
Как же глубоко...
Аноним 23/09/26 Срд 15:36:31 #441 №1711239 
cfvgbhn.mp4
>>1711231
>ответ указывающий на проблему
>термин без указания в чём проблема
Аноним 23/09/26 Срд 15:42:42 #442 №1711244 
>>1711239
Шаблон у тебя неправильный, выше уже разжевали. Выбирай chat completion, там шаблон сам подтянется какой надо
Аноним 23/09/26 Срд 15:46:26 #443 №1711247 
>>1711233
Я не могу анон-сан...
Аноним 23/09/26 Срд 15:47:24 #444 №1711249 
NmEcFsxBwA.jpg
>>1711235
>>1711244
Понял, странно что с олламы подхватил сразу а llama-swap не захотел. Спасибо анонче.
Аноним 23/09/26 Срд 16:21:33 #445 №1711264 
>>1711216
Этим. Говном. Невозможно. Пользоваться.
Она очень скучная. Ничего не двигает сама. Считается у эира с этим проблемы, но блять после геммы он прёт как паравоз.
Аноним 23/09/26 Срд 16:27:42 #446 №1711269 
>>1711264
Ты также и про эир говорил. ряя говно сюжет не двигает, тупое, куча эха
У тебя тогда был скилишью. И сейчас скилишью по гемме, сырок. Возможно у тебя пинг с тредиком около года
Аноним 23/09/26 Срд 16:45:15 #447 №1711283 
>>1711269
Эир мне изначально нравился, чтобы его пердолить. Его стилёк, вайбик. Тут мне похуй на модель, гемма сосёт слишком сильно.
И я не удалял эир, вообще, а гемма уже 4 раз летит нахуй с диска. И ВСЁ ИЗ ЗА ХАЙПА, КОТОРОГО ОНА НЕ ЗАСЛУЖИВАЕТ. Нахуй гемму.
Аноним 23/09/26 Срд 16:47:09 #448 №1711287 
>>1711283
Хаашо. Но по итогу правда в том что ты единственный кто тут сидит на модели которой уже почти полтора года, а подавляющее большинство на гемме. Цифры говорят за себя
Аноним 23/09/26 Срд 16:52:27 #449 №1711296 
>>1710759
Я слышал байки про вполне себе рабочий квант большого старого дипсика, 3.2 или р1
Аноним 23/09/26 Срд 16:52:56 #450 №1711298 
>>1711296
*рабочий второй квант
Аноним 23/09/26 Срд 16:58:02 #451 №1711301 
>>1711283
А я эйр снёс когда он отказался писать НЕУСТАВНЫЕ отношения с сестрой. Неслабо прихуел тогда, так как это была еще и анценз версия.
Аноним 23/09/26 Срд 17:07:44 #452 №1711305 
>>1711298
Не помню такого. Сколько помню все кто пробовал дипсики в малых квантах говорили, что они шизеют очень быстро.
А вот на ГЛМ 4,5-4,6 во втором кванте народ РПешил, и даже рассказывали как он крут, но там из конкурентов были только квен 237 и AIR.
Аноним 23/09/26 Срд 17:27:06 #453 №1711314 
>>1711283
>гемма уже 4 раз летит нахуй с диска
А как она там оказывается?
Аноним 23/09/26 Срд 17:32:11 #454 №1711317 
>>1711314
Ну челикс, следующее предложение.
Думал ну не распробовал, ну мало дал времени, ну это же гугел, ну весь тредик же сидит на этом. Хватит.
Аноним 23/09/26 Срд 17:35:27 #455 №1711319 
>>1711050
И смдшек ещё заказал пока, чтобы тоже приехали одновременно. Точно не может быть зря.

>>1711162
> Тебе обнадежить или честно?
Спосеба за советы. Почитал - да, не всё так просто. Пока обсуждал с агентом, как будем пердолить новый риг, он предложил на всякий случай подключить его через wi-fi розетку, чтобы на всякий случай вкл/выкл мочь ему делать. Кажется он что-то подозревает задумал. Но розетку тоже надо будет заказать.

Рейт охлад пока: https://www.noctua.at/en/products/nf-a14-industrialppc-3000-pwm - планирую через диффузор на 2 карты сразу. Вроде должно быть норм - управление по пвм, орёт когда нагружено, а так тихонько еле крутится в идел.
Аноним 23/09/26 Срд 17:36:53 #456 №1711321 
>>1711317
Так ты и не распробовал. Качай 5-й раз.
Аноним 23/09/26 Срд 17:37:10 #457 №1711322 
76326326716780159843247181169842734569951306n.jpg.webp
>>1711314
Аноним 23/09/26 Срд 17:55:19 #458 №1711334 
>>1711319
>Рейт охлад пока:

Noctua - оверпарайс для лохов. Вот хороший крутилятор с двумя шариковыми подшипниками для умных людей: https://www.arctic.de/en/P14-Pro-PST-CO/ACFAN00316A
Аноним 23/09/26 Срд 18:09:16 #459 №1711343 
>>1711334
Нисколечко не приуменьшаю Арктики - они прямо топ для дёшево и сердито у самого в корпусе стоят, но тут даже не близко - х3 меньше прокачка и статическое давление.
Аноним 23/09/26 Срд 18:12:02 #460 №1711344 
А вообще это шиза ставить на две карты огромный 140мм крутилятор, из за сопротивления диффузора возможно возникновение паразитных вихревых потоков и снижение эффективности. Я на две карты 80мм крутилятор поставил, вот такой вот: https://www.arctic.de/en/S8038-10K/S8038-10K
Аноним 23/09/26 Срд 18:45:43 #461 №1711362 
>>1711319
> И смдшек ещё заказал пока, чтобы тоже приехали одновременно.
Навыки пайки есть? Оно оче мелкое и специфичное.
> он предложил на всякий случай подключить его через wi-fi розетку
Отличная идея. Даже имея ipmi, эта сволочь может странным образом отвалиться в самый неподходящий момент когда ты в отъезде, что ребут и выключения через нее не помогут (например бп в перегрузку ушел). Вайфай розетка такие проблемы исключает и заодно показывает страшные киловаттчасы, которые съедаются
> Рейт охлад
На первый взгляд неочень. По форме лопастей видно и в спеках напрямую указано что у него низкое статическое давление. Будет много шума и мало толка, не сможет прокачать их. И >>1711334 тоже хрень. А вот https://www.arctic.de/en/S12038-4K - просто в яблочко, с одной стороны уже правильная геометрия и формфактор чтобы прокачивать, а с другой сравнительно невысокие для серверных обороты и умеренное потребление, что можно воткнуть в обычную материнку. Причем он хорошо регулируется, можно настроить так что будет неслышно и его хватит чтобы держать 40-50 градусов с загруженной моделью.
На две карты идеально, есть готовые шрауды, выше 80% под полной нагрузкой не потребуется поднимать.
Единственный камень в них - из одной коробки они разные по шуму, один просто постоянно стрекочет что заметен даже на низких оборотов когда стоит рядом.
>>1711344
Этот будет выть даже в простое.
Аноним 23/09/26 Срд 19:31:35 #462 №1711389 
Я не понимаю как в 27Гб Qwen 3.8 может быть сжато столько информации и при этом она ещё дешифровывается быстро. Она знает как минимум русский, англ, китайский, немецкий и ещё программировывает как сеньор. Дохуя всего знает, я просто невдупляю как такое возможно. Это какой-то обман, фейк, конспираси. Вы сами логически посудите как такое может быть. Я думаю нас посадили в симуляцию и стерли память об этом. Невозможно столько информации запихнуть в 27гб, такое только в сказках возможно и в матрице. Чё дум?
Аноним 23/09/26 Срд 19:33:13 #463 №1711391 
>>1711389
>Чё дум?
Таблетки
Моделька хорошая, да
Аноним 23/09/26 Срд 19:35:42 #464 №1711395 
>>1711391
Блять, ну ты подумай как можно разум полиглота программиста, знающего всю историю человечества и все на свете, запихнуть в 27Гб??? Сука разуйте глаза, нас где-то наебали
Аноним 23/09/26 Срд 19:37:28 #465 №1711396 
>>1711395
Да не всё он знает, камон. У 3.8 знаний даже поменьше, чем у 3.6. Больше про код ему рассказывали. Он знает самые популрные вещи, а если начнешь спрашивать конкретику какую-нибудь, а не "Когда изобрели телефон", то найдешь кучу галлюцинаций и несоответствий
Аноним 23/09/26 Срд 19:44:00 #466 №1711402 
>>1711396
Да, блять, даже если он не знает все на свете, у него разум программиста полиглота нахуй. Это чё программисты долбоебы и их знания умещаются в 27Гб? Я не верю в такое, тут явный наеб. Блять вы очнитесь, неужели вам настолько похуй? Хоть в глаза ссы. Ощущение если б завтра инопланетяне прилетели всем бы было похуй и как ни в чем не бывало шли бы в 5 утра на завод.
ПРОСТО ЗАДУМАЙТЕСЬ КАК ВОЗМОЖНО РАЗУМ ПРОГРАММИСТА ПОЛИГЛОТА ЗАПИХНУТЬ В 27ГБ
Аноним 23/09/26 Срд 19:46:00 #467 №1711403 
>>1711389
Текст не так много весит. А сжатый текст весит еще меньше. Тем более что там по сути сжатие с потерями делается, что позволяет за счет хитрых аппроксимаций еще сильнее сжать данные.
Например размер фотки в пнг и в жпг может раз в 10 отличаться. Вот и считай сколько текста таким образом можно было бы пережать в нейронках. 270гб изи. А это дохуя, извините меня.
Аноним 23/09/26 Срд 19:49:27 #468 №1711404 
image.png
>>1711402
Добавить нечего. Программист полиглот тебя размотал
Аноним 23/09/26 Срд 19:55:22 #469 №1711409 
>>1711404
СУКА Я И ГОВОРЮ НАС НАЕБАЛИ. НЕ МОЖЕТ ТАКОЕ 27ГБ НУЛЕЙ И ЕДИНИЦ НАПИСАТЬ. ОНО ДАЖЕ НЕ ДЕФАЕТСЯ, ЕМУ ПОХУЙ, 0 АРГУМЕНТОВ ПРОТИВ МОЕЙ ЛОГИКИ.
>>1711403
ЭТА БОТОХУИТА ИЗ 0 И 1 ПОНИМАЕТ ЕЩЕ И КАРТИНКИ. А ЭТО ТЫ КАК ОПРАВДАЕШЬ А???

Блять я реально как будто единственный очнулся в матрице, а уебаны ржут и не верят. ЛЮДИ ОЧНИТЕСЬ, НАС НАЕБАЛИ ГДЕ-ТО
Аноним 23/09/26 Срд 19:59:27 #470 №1711414 
Я убежден с этими нейромоделями нас прогревают к грядущему пиздецу. Мировая закулиса нам что-то пиздецовое готовит, помяните мое слово
Аноним 23/09/26 Срд 19:59:36 #471 №1711415 
>>1711389
чел, он без ошибок имена тохо персонажей назвать не может. а рус англ китайский немецкий и тд на уровне переводов знает (и то корявых)
Аноним 23/09/26 Срд 19:59:54 #472 №1711418 
>>1711389
Бля ещё один всё понял, это уже десятый за неделю, высылайте отряд для устранения
Когда ты скопировал модель тебе установился троян, когда она работает тебе по 433мгц наводками на провода шлются ответы печатаемые индусами в реальном времени
Аноним 23/09/26 Срд 20:00:29 #473 №1711419 
>>1711415
>без ошибок имена тохо персонажей назвать не может
Как и 99.9% населения Земли. И Слава Богу.
Аноним 23/09/26 Срд 20:01:41 #474 №1711420 
>>1711409
Слушай, на раз существа типа тебя способны выжить в современном обществе - то ничего удивительного в умных 27б модельках нет.
Аноним 23/09/26 Срд 20:05:07 #475 №1711422 
>>1711409
Представляю как тебя порвет, когда ты узнаешь, что стейбл дифьюжен, который генерирует картиночки, весит еще меньше. SDXL весит около 6.5 гб, прикинь? Правда там еще всякие энкодеры-хуекодеры сверху должны идти.
В картинках не так много информации. Там много паттернов, которые накладываются на паттерны. А это на порядок понижает сложность графического представления.
Лучше изучай технологии, чтобы не быть баттхертом.
Аноним 23/09/26 Срд 20:07:48 #476 №1711425 
>>1711422
Для SDXL и SD 1.5 (также как и для их производных вроде Pony и Illustrious) особые энкодеры не нужны, только дефолтный декодер.
Аноним 23/09/26 Срд 20:21:50 #477 №1711431 
>>1711389
Я не понимаю как находятся люди которые так хайпуют с этого говна. Ты вообще пользовался моделью? Она же тупое говно которое не может написать связанные предложения на русском. Ну хорошо, ОДНО предложение может написать, но не два. Знаний там не больше чем если взять объем исходных текстов. Конечно не в чистом виде, а в сжатом, именно в таком как она и будет хуево помнить данные.
Аноним 23/09/26 Срд 20:28:45 #478 №1711440 
>>1711431
Это те же люди, которые верят в вайбкодинг. Обычно это недалекие менеджеры, которые не разбираются в кодинге, или очень зеленые программисты.
Просто потому что люди сами плохи в чем-то, а нейронка знает базовые вещи, они этому удивляются и думают что нейронка гений.
Аноним 23/09/26 Срд 20:30:06 #479 №1711443 
>>1710621
> лучше геммы заметно
Насколько и в чем это выражается? В нсфв умеет?
Аноним 23/09/26 Срд 20:32:16 #480 №1711444 
>>1711431
> Она же тупое говно которое не может написать связанные предложения на русском

Не всем это нужно. Ты вот сильно переживаешь за то что модель не может нормально в иврит? Я - нет. И с русским языком так же.

Я не отрицаю что она плоха в русском языке (и не подтверждаю, я не использую русский язык при работе с LLM).

А хайпуют потому что эта модель показывает очень хорошие результаты в написании кода. Лучше чем всё что есть на данный момент среди локальных моделей в таком размере и размере в 10 раз больше. Даже в третьем и четвертом квантах. Ни Гемма, ни 120B MoE модели такой уровень кода просто не в состоянии выдать.

Плюс к этому она очень умна при работе с тулзами если ей дать доступ к ним.

Мир не крутится вокруг РП и русского языка. Плюс к этому, я не вижу вообще никакой проблемы общаться с моделью на английском языке, она поймёт тебя почти всегда сколько бы грамматических ошибок ты не сделал в предложении. Но это уже личное дело каждого на каком языке общаться с моделью.
Аноним 23/09/26 Срд 20:38:35 #481 №1711450 
image.png
>>1710759
Аноним 23/09/26 Срд 20:49:31 #482 №1711459 
>>1711205
может, если его 3.6 это 3.6-35b-a3b
Аноним 23/09/26 Срд 20:52:42 #483 №1711460 
Нифигасе. Вместо кума с локалкой решил ради интереса с deepseek поразбирать код своей игры, и охренел с того как хорошо не всегда, он код разбирает, столько говняка мне помогает находить. Так понимаю что для лучшего экспирианса надо проплачивать?
Аноним 23/09/26 Срд 20:55:16 #484 №1711462 
>>1711444
Молодец, привел в аргумент ЕДИНСТВЕННОЕ в чем хороша модель. И то, "хороша" - большая натяжка. Нет человека который бы по серьезке использовал ее в кодинге.
Вау, 20 гигов могут написать рабочий скрипт, вот это да.
По поводу языков - ребенок может выучить любой язык или несколько языков совершенно спокойно, если оказывается в соответствующей среде. Это ограничение только взрослого мозга. Для нейронки то же самое, любая нейронка обязана владеть языками, если это не что-то супер редкое.
Причем язык то она знает, по сути. И то что она в него нормально не может - следствие только тупости самих весов. И данных, коими были сотни эпох РЛя на синтетическом говне бесполезном как-раз уровня "напиши скрипт для какой-нибудь хуеты" или зирошот лендингов.
Аноним 23/09/26 Срд 20:58:19 #485 №1711465 
>>1711443
>Насколько и в чем это выражается? В нсфв умеет?
Да, умеет в детальный нсфв.
Познается в сравнении. Гемма упускает из виду многие детали просто, ну то есть как будто не видит. Например, где гемма видит просто голую жопу - глиммер видит форму и может оценить объём жопы, видит что там на самом деле тонкие трусы телесного цвета которые почти потерялись в этой жирной жопе - вот типа такого.
Аноним 23/09/26 Срд 21:01:18 #486 №1711466 
>>1711465
Ништяк.
Аноним 23/09/26 Срд 21:02:41 #487 №1711468 
>>1711450
Зачем ты его так приложил жестко?
Аноним 23/09/26 Срд 21:03:34 #488 №1711469 
>>1711462
Что за крайняя форма максимализма и эквилибристики? Модель пишет код на уровне флагманов пол года назад = нет никого кто бы использовал. Ахуительные истории как ребенок 20 языков учит, тупость весов, сотни эпох рла - ты с какой дурки сбежал?
Аноним 23/09/26 Срд 21:04:40 #489 №1711471 
>>1711460
> для лучшего экспирианса надо проплачивать?
Только в плане скорости если ты именно про дс4ф.
Ну и в апи они вроде только 4.1 оставили.
Попробуй, стоит копейки. Закинуть юаней 100 и хватит на дофига
Аноним 23/09/26 Срд 21:16:44 #490 №1711481 
>>1711469
И? По теме есть что сказать? Где твой охуительный код на уровне флагманов пол года назад? Это пиздеж, его нет, потому что нихуя она не на уровне флагманов, она даже не на уровне сонета 3.5. Конечно если мы мерим в чем-то реальном, а не в сломанных тупых бенчмарках.
Ну или если мы не делаем вид что вау, модель научили вызывать тулы, и теперь она охуенная только потому что прошлая вообще не могла это делать потому что ее и не учили.

Квен - тупое говно. Это факт. Точка.
Аноним 23/09/26 Срд 21:27:45 #491 №1711486 
>>1711389
У меня флеш-некст на пупике 10и летней давности крутится и я задаюсь диаметрально противоположным вопрос.
А что так можно было? Чем эта ваша злоебучая ИТ-нидустрия занималась все эти годы, если за пару лет, за копейки (если откинуть финансовые спекуляции), вот это вот можно сделать и это еще нихуя не оптимально/оптимизировано, эта хуйня еще в разы станет быстре/умнее.
Т.е. уже лет как 20 можно было всем этим пользоваться, а нас кормили гуглами и игрушечками для дебилов, вместо того чтобы создавать настоящий разум и виртуальную реальность на домашнем пука.

На самом деле, в корне вопрос тот же, та же иллюзия, только с диаметрально противоположного угла зрения.
По сути все эти ллм - это всего-лишь возможности логике строить логику и по мере ее расширения, растет уровень абстракций и векторов, от чего эффективность сжатия логики только растет и с этим можно было постоянно пересекаться, но на это будто бы табу было.

А дальше конспирология. Если сейчас вот это вот в открытом доступе, доступно каждой челяде на этой планете (апи вообще околобесплатное, лол), то что у них там в подвалах крутится? Пади уже исполнили мечту всех двачеров и глав гада из мр.робота, намутили себе карманные вселенные и думают как бы застроить планету автоматизированными системами с ядерной энергетикой и миллионами квадратных километров солнечных панелей, чтобы погрузиться в свои сычевальни на биоподпитке и съебать с сраной земляшки.
Аноним 23/09/26 Срд 21:27:49 #492 №1711487 
>>1711481
Единственное по теме в этом сраче - что ты шизик. Но это не по теме треда.
Аноним 23/09/26 Срд 21:32:50 #493 №1711492 
>>1711462
> Молодец, привел в аргумент ЕДИНСТВЕННОЕ в чем хороша модель.

Странная претензия. Давай для начала тогда определим в каких областях вообще используются LLM на локальных компьютерах:

1. Написание кода (как одиночных скриптов так и работа с агентами)
2. Работа с тулзами и решение практических задач на компьютере
3. Перевод
4. РП
5. Брейншторм
6. Творческие задачи (написание текста песен, написание статей)
7. STEM
8. Суммаризация
9. Работа с не-текстовым контентом (видео, аудио, картинки)
10. Мед. вопросы (эта тема последний год мертва, я даже здесь упоминания о ней не слышал, но мало ли кто-то юзает).

Это из того что мне в голову пришло, возможно я что-то упустил, кому надо добавят потом что-то свое.

Теперь, когда у нас есть полноценный список задач для локальной LLM, давай посмотрим что из этого списка может хорошо делать 3.8-27B Квен: 1, 2, 5, 7, 8, 9. Всего 6 пунктов из 10. Это чуть больше чем сказанное тобой "ЕДИНСТВЕННОЕ".

Можем составить такой же список для 31B Геммы, что она делает хорошо: 3, 4, 5, 6, 7, 8, 9. Всего 7 пунктов из 10. Тоже неплохо, но как видно половина пунктов не пересекается между двумя моделями.

При этом стоит отметить что для суммаризации такие модели это оверкилл, с этим справятся и 4B модель.

Мед. вопросы честно говоря не стал отмечать ни у той ни у другой модели т.к. не спрашивал их, под эти задачи в прошлом году выходили специальные модели вроде MedGemma, но кажется народ положил болт на спрашивание мед. вопросов у нейросетей. Может кто-то сравнивал их и скажет какая модель отвечает в этой области лучше.

Перевод я бы не стал делать ни в Гемме, ни в Квене. Для этого есть специальные модели вроде HY2-MT на 7B / 30B-A3B которые справятся с этой задачей намного лучше, особенно с переводом азиатского текста.

> Для нейронки то же самое, любая нейронка обязана владеть языками, если это не что-то супер редкое.

Знание языков занимает место. Ты не можешь всунуть в 30B модель хорошее знание всех языков, даже модели которые целенаправленно тренируют на переводы вроде вышеупомянутого HY2-MT не знает всех языков и имеет местами свои проблемы. Ты можешь требовать знание всех языков от 1T+ моделей, но не от 30B.
Аноним 23/09/26 Срд 21:33:26 #494 №1711493 
>>1711465
Кстати, насколько с квантами качество падает?
Аноним 23/09/26 Срд 21:33:48 #495 №1711495 
>>1711481
Так ты не спросил про какой код анон говорит. Если он вебмакака, то так и есть, там уровень флагманов полугодовалой давности. Больше модель ничего не умеет, но многим больше и не надо.
Аноним 23/09/26 Срд 21:36:11 #496 №1711497 
>>1711362
> Навыки пайки есть?
Нит, конечно. Есть только навыки выглаживания хвостов ушек. Я попрошу того, кто умеет. Нужны были только расходники.

> S12038-4K
Вот это монстр! 60дБ, ОМГ! Почитал ревьюхи, очень интересный, спс.
Но вот конкретно тут намерили, что он, конечно, рекордсмен в статике, но только когда обороты ближе к максимальным. А до определенных величин его даже Noctua F12 Industrial делает.
https://www.hwcooling.net/en/arctic-s12038-4k-massive-fan-for-harsh-conditions-review/25/

Кожух мне уже на 140мм едет, так что придется уж дождаться и протестить с Noctua. Но если не будет хватать - придётся тогда брать кожух на 120мм и этого Артик-демона.
Аноним 23/09/26 Срд 21:38:49 #497 №1711498 
>>1711486
Нет, нельзя. К этому долго шли: собирали датасеты, придумывали архитектуры, тренили в конце-концов. И все это с кучей попыток.
А то сколько железному веку - можно было паровые машины еще тогда делать.
Аноним 23/09/26 Срд 21:41:02 #498 №1711499 
>>1711492
> что она делает хорошо: 3, 4, 5, 6, 7, 8, 9
Лол.
Аноним 23/09/26 Срд 21:43:41 #499 №1711501 
>>1711487
Квеношизик, спок.

>>1711492
>давай посмотрим что из этого списка может хорошо делать 3.8-27B Квен
>1, 2, 5, 7, 8, 9.
ХУЯСЕ
Ебать ты даун. Единственное что она МОЖЕТ ДЕЛАТЬ, МОЖЕТ, А НЕ "ХОРОШО". Это 1 и 2.
Даже в коде ее сравнивают с опусом 4.5, по качеству. И то это большая натяжка. При том что у нас уже есть опус 5.5. И это первый опус который не говно. Представь себе. И где же на этой шкале тода будет квен, мм?

9 пункт это просто троллинг.
Даже не серьезно.
Иди нахуй.

>При этом стоит отметить что для суммаризации такие модели это оверкилл, с этим справятся и 4B модель.
А тут даже комментировать не буду.
Аноним 23/09/26 Срд 21:56:27 #500 №1711506 
>>1711499
Что? У меня претензий при работе с ней с этими пунктами нету, разве что лично мне больше Квен для вижена нравится.

Перевод, РП и творческие задачи явно лучше у Геммы.

STEM на школьном/университетском уровне одинаковый и там и там, может если заставить их решать какие-то нерешенные задачи по физике которые там GPT щас решает, может разница какая-то будет, но я так думаю они обе справятся плохо в этом случае.

Брейншторм делал и там и там, он различается но хорош и у той и у другой модели.

Про суммаризацию уже сказал, она справится с задачей, но она для этого нафиг не нужна, с этим любая современная 4B модель справится.

> >>1711501
> Ебать ты даун. Единственное что она МОЖЕТ ДЕЛАТЬ, МОЖЕТ, А НЕ "ХОРОШО". Это 1 и 2.
> Даже в коде ее сравнивают с опусом 4.5, по качеству. И то это большая натяжка. При том что у нас уже есть опус 5.5. И это первый опус который не говно.
Я где-то писал что она пишет код лучше фронтир моделей? Или может быть я вообще где-то упоминал облачные модели?

Моя цитата, если ты в глаза долбишься:
> А хайпуют потому что эта модель показывает очень хорошие результаты в написании кода. Лучше чем всё что есть на данный момент среди локальных моделей в таком размере и размере в 10 раз больше. Даже в третьем и четвертом квантах. Ни Гемма, ни 120B MoE модели такой уровень кода просто не в состоянии выдать.

Зачем ты сюда всунул опус у которого там явно триллион параметров как минимум - я хз.

> И где же на этой шкале тода будет квен, мм?
Он будет выше всех локальных моделей до 300B.
Аноним 23/09/26 Срд 21:58:57 #501 №1711508 
>>1711492
Не трать время на долбоеба, он совсем не в адеквате
Аноним 23/09/26 Срд 21:59:53 #502 №1711510 
image
Сап. Какие модельки <= 27B лучше всего пробовать в CYOA (E)RP ?
Народные 12 + 32, возможности смены / расширения нет.
Аноним 23/09/26 Срд 22:01:45 #503 №1711513 
>>1711506
>Он будет выше всех локальных моделей до 300B.
Все что надо знать о квеношизике, это то что он перемогает моделями которых просто не существует. Ну или которых вообще не обучали коду.
ХОРОШАЯ модель, лол. Максимум - удовлетворительная. И то от того что других нет.
Такой же бред как высирает квен в 99% случаев.
Аноним 23/09/26 Срд 22:05:46 #504 №1711517 
>>1711497
4к всего, которые под нагрузкой фактические 3600-3800. Там есть его же версия на 7к, вот там уже жестко, но он в простое шумный.
Он на удивление не сильно шумный если не раскручивать на полную. А это потребуется только если что-то будешь обучать или видео генерить. Если настроить курвы так, чтобы полка "минимально комфортных" оборотов стояла до ~60-65 градусов а рост шел только потом - в ллм они даже не дергаются поскольку карты не успевают нагреться.
Отписывай что с нохчей выйдет, температуры в простое и под 250/300вт установившиеся.
Аноним 23/09/26 Срд 22:06:59 #505 №1711519 
>>1711506
То, что оба в перечисленное не могут.
Аноним 23/09/26 Срд 22:07:38 #506 №1711522 
>>1711513
> Максимум - удовлетворительная. И то от того что других нет.

То есть ты буквально подтвердил мои слова о том что Квен в данном случае лучший в этой категории.
Аноним 23/09/26 Срд 22:17:50 #507 №1711532 
quant.png
>>1711498
Это не просто, соглашусь, но и ты согласись, у гугла и агрегаторов данных уже было дохуя.
Чтобы потренить ресурсов у них было уже предостаточно, а архитектура даже сейчас говно, это вообще не правильный путь, чисто костыль для потребительского рынка.
Дрочить ф32/16/8, когда обычный транзюк просто в хороших условиях с постоянной температурой 8 точность уж даст, при том, что в этой системе отклонение не баг, а фича и фиксится количеством параметров. Так зато сколько дешевых и эффективных параметров можно загрузить, минимальная обвязка нужна, но это уж явно в разы хуй знает, в десятки, сотни раз, не знаю меньше чем любые вычислительные блоки и ни в какое сравнение не идет даже с int4 по затратности, это все колоссально дешевле и эффективней, тупа привязки к техпроцессу нет, шины данных нет, а масштабируется это все по щелчку пальца, прям вообще изи.

Вон нейронка на пике говорит, на кондерах можно 10 бит дрочить.
Короче, нас жоска наебывают и хуй знает что строят в подвалах. Не случайно маск заебывается панели и сервера в космосе разворачивать, думой.
Аноним 23/09/26 Срд 22:19:01 #508 №1711534 
image.png
>>1711409
Вот тебе ответ на твои вопросы от модели весом менее 4Гб

>>1711404
>Q6_K_L
Чет у меня Q3 меньше ошибок в тексте допускает
Аноним 23/09/26 Срд 22:20:48 #509 №1711535 
>>1711517
> Отписывай что с нохчей выйдет, температуры в простое и под 250/300вт установившиеся.
Кнчн, все будет - как соберу там, настрою. Думаю 1-2 недели +-
Аноним 23/09/26 Срд 22:22:56 #510 №1711537 
>>1711532
> данных
Размеченных? Если дохуя, то зачем синтетика?
Дальше шиза какая-то.
Аноним 23/09/26 Срд 22:26:21 #511 №1711539 
>>1711537
>то зачем синтетика
Затем чтобы ты говно кушол вместе с соей чтобы из этой говноархитектуры говна хоть что-то выжать.
>Дальше шиза какая-то.
Потому что ты тупой IQ2-13B. Почему я нейронке нихуя не расписываю и она все с одного тупого предложения понимает, еще и пищу для размышления подкидывает?
Аноним 23/09/26 Срд 22:29:35 #512 №1711540 
>>1711539
> Почему я нейронке нихуя не расписываю и она все с одного тупого предложения понимает, еще и пищу для размышления подкидывает?
В голос. Он не понял.
Зато на такие высокие материи рассуждает! Прямо как эти, которые мы ещё даже не начинали!
Аноним 23/09/26 Срд 22:30:22 #513 №1711543 
>>1711522
А где я спорил с тем что он лучший из говна?
Аноним 23/09/26 Срд 22:31:22 #514 №1711544 
>>1711539
> Почему
Потому что она обучена тебе на шизу соглашаться и головой кивать.
Аноним 23/09/26 Срд 22:31:44 #515 №1711545 
>>1711544
Этот понял.
Аноним 23/09/26 Срд 22:37:00 #516 №1711549 
>>1711544
> шизу соглашаться
Говна поешь, я ничего не утверждал, только спросил про точность, все, буквально одно сообщение.
Впринципе хуйня очевидная. Зачем срач устраивать, чтобы я кому-то что-то объяснял? Репетитором не устраивался, звиняйте.
Аноним 23/09/26 Срд 22:42:41 #517 №1711554 
>>1711450
>AIME25
Аноним 23/09/26 Срд 22:46:53 #518 №1711556 
>>1711543
Ты в принципе начал непонятно зачем возмущаться на тему того что я назвал 3.8 Квен лучшей моделью для написания кода до 300B, после чего приплёл опус и после чего сам же написал что Квен лучший потому что кроме него ничего нету.

К чему это всё было - я хз.
Аноним 23/09/26 Срд 22:48:48 #519 №1711559 
>>1711486
Это все передовые вещи, вершина, и прошлые лоботомиты типа далли-1 ими были в свое время. Сама идея перцептрона очень древняя, но реализовать удалось только сейчас за счет технологического и информационного прогресса. Это наоборот венец опыта и труда прошлых лет, а не следствие что там что-то делали не так.
>>1711532
Вопрос - тот еще трешачок, такая система даже с термостатированием обречена быть говном. Брал бы уже операционники, там все математические операции включая функции нелинейности легко реализовать. И ответ ллм тоже треш, потому что в аналоговом сигнале "битность" будет определяться исключительно соотношением сигнал-шум, который достигается более 120-140дб.
> Чтобы потренить ресурсов у них было уже предостаточно
Нет
Аноним 23/09/26 Срд 22:57:32 #520 №1711564 
>>1711559
>а не следствие что там что-то делали не так
Я и не говорю, что что-то делали не так. Я говорю, что то что сейчас - говно, супер неэффективный набор решений, акция для потребителя.
>сигнал-шум
Экранирование + нет ограничений в техпроцессе и расположении, т.е. можно распределить элементы как угодно чтобы минимизировать шум.
>Нет
Хотелось бы услышать более развернутый ответ, но соглашусь, в 2006 данных было мало, но в 2014 уже достаточно.
Аноним 23/09/26 Срд 23:03:43 #521 №1711568 
>>1711556
Так ты спорил что типа квен умный, просто не может в рп и языки. А в остальном типа умный.

Нет, он тупая хуйня. И именно потому что он тупая хуйня, его знания не обобщаются на языки. Ты говоришь что там какие-то знания нужны, которые не впихнуть в 30б параметров. Ну так почему он прекрасно пишет на русском когда ему не надо думать? Всё понимает и пишет. Все необходимые знания там есть. Мозгов просто нет.


А я просто утверждаю что квен - тупое говно. Мне насрать при этом насколько он лучше или хуже другого говна.
Аноним 23/09/26 Срд 23:15:55 #522 №1711578 
>>1711564
> то что сейчас - говно, супер неэффективный набор решений, акция для потребителя
Пустая демагогия. В среднем по больнице всегда если смотреть в прошлое - прошлые решения оказываются супер неэффективными по сравнению с сегодняшними, а сегодняшние окажутся говном по сравнению с будущими.
> Экранирование
Сам кремний и резисторы ограничение. Ты даже не понял что с теми статами будет более 20 бит, а не "5-6" как тебе нейронка ответила.
> Хотелось бы услышать более развернутый ответ
Без проблем, но сначала тогда ты объясни суждение про достаточность мощностей раньше. Ведь оно выглядит абсурдным, мощность небольшого но передового датацентра с чипами хуанга превышает весь мир на состояние условного 2007 года в контексте обучения и инфиренса ии. И ее ты можешь взять и удобно использовать, а абстрактную общемировую - никак.
Аноним 23/09/26 Срд 23:40:41 #523 №1711608 
>>1711578
>если смотреть в прошлое
Мы смотрим на настоящее.
>статами
Какими статами?
>с чипами хуанга
Нет смысла считать чипами хуанга, это глупо и бессмысленно. Все-равно, что мереть попугаями, можно, но зачем?
>ты можешь взять и удобно использовать
Учитывая архитектурную несостоятельность хуангорешения.
Достаточно поставить средненький датацентр, научный, скажем, с специализированными ускорителями, а не общего назначения.
Я когда-то прикидывал насколько неэффективно транзисторный бюджет используется, там счет шел на порядки, сейчас не вспомню, а пересчитывать лень, потом может быть.
Короче берешь ресурсы попенаи, делишь на 100, грубо говоря столько нужно построить чтобы закалькулейтить.
Учитывая сколько олигархи тратят на вечную молодость и прочую нех, собрать средства было бы изи, только зачем если задача уровня федераций.


Ладно, похуй, не будет диалога, уже видно.
Аноним 23/09/26 Срд 23:47:08 #524 №1711616 
>>1711532
>обычный транзюк просто в хороших условиях с постоянной температурой 8 точность уж даст
што
Аноним 23/09/26 Срд 23:47:25 #525 №1711617 
Как на 4070 3.8квен поднять?
Самую хуёвую кванту брать?
Аноним 23/09/26 Срд 23:47:49 #526 №1711618 
>>1711617
Обама.ггуф
Аноним 23/09/26 Срд 23:58:16 #527 №1711622 
>>1711608
Ну и что ты на слив пошел? Такой неебаться чип дизайнер, затыкающий за пояс лучших инженеров и ученых планеты, а показываешь банальное дилетантство по простым вопросам.
> считать чипами хуанга
Какими чипами, откуда ты это взял? Считай флопсами, объективная цифра.
> с специализированными ускорителями, а не общего назначения
Скорость развития и изменения потребностей выше чем цикл разработки конечного "специализированного" продукта, к моменту выхода он будет никому не нужен. А для минимальной универсальности чип хуанга уже оптимален.
Тут есть хороший компромисс - tpu, гугл уже сколько поколений сменил.
> а пересчитывать лень, потом может быть
Такого таланта теряем, вот бы взял и задизайнил пролетариату крутые чипы! Завалили бы миллиардными офферами. Жаль ленивый, так бы изи смог.
Аноним 24/09/26 Чтв 00:01:19 #528 №1711624 
>>1711622
Он курьерит для души, после работки запарно, ну чё ты
Аноним 24/09/26 Чтв 00:11:08 #529 №1711629 
>>1711622
>Жаль ленивый, так бы изи смог.
База.
>взял и задизайнил пролетариату крутые чипы!
Даже не подумал бы. Проебать годы стараний, чтобы потом этим всем подтереться, потому что если ты родился не тем, то хуй тебе, а не финансирование или должность.
>Скорость развития и изменения потребностей выше чем цикл разработки конечного "специализированного" продукта
Само собой, особенно когда ты сам решаешь эти самые "потребности". Сегодня фп32 всем нужен, завтра фп16, ой бф16, то есть фп8, точнее инт8, тю-ты конечно же инт4!
>Тут есть хороший компромисс - tpu
А шо не продает? М? Спроса нет? Не нужно никому?
А, нихуя себе, он только себя делает и братушек, интересненько.
>Считай флопсами, объективная цифра.
Верно, стоит, но надо подумать.
>что ты на слив пошел?
Потому что хочу спать и устал от чатика, конструктивной беседы не удалось. Как всегда получилась война шиза с сектантом, не интересно.
1 транзистор - фп8 точность, думойте
Аноним 24/09/26 Чтв 00:15:25 #530 №1711634 
>>1711629
Вот так и погибают таланты. Глупые CEO, вот если бы они заставляли брать на ведущие должности школотронов, которые хвастаются что поставили линукс, и скуфендуев, которые каждой бочке затычка - уже бы Марс давно колонизировали.
Аноним 24/09/26 Чтв 00:17:45 #531 №1711637 
>>1711634
Нравится барину очко вылизывать?
Аноним 24/09/26 Чтв 00:27:17 #532 №1711646 
>>1711637
>>1711629
Не напрягайся ради семплерошиза. У него и квен нормальная модель, и все кто с ним спорит долбоебы по умолчанию.
Он этот аргумент уже третий год крутит. Если ты не работаешь сео в какой-нибудь корпорации, значит ты не прав. Все просто. Он же великий семперошиз, только атланты могут быть правее него.
>>1711622
>а показываешь банальное дилетантство по простым вопросам.
У него это вообще зашитая дефолтная реплика применяемая по любому поводу.
Аноним 24/09/26 Чтв 00:27:56 #533 №1711647 
image.png
image.png
>>1710756
Мда, так нихуя и не понял что с этой валидацией делоть.
ЛЛМки говорят про оверфиттинг. Тобишь ЛР наверное еще снижать надо, хотя градиенты как будто и так не оч большие.
Альтернативно можно увеличить weight_decay или lora_dropout.

Поглядел на ХФ тюнинги Квена 3.5 4б, там изредка пишут параметры Лоры.
https://huggingface.co/Nubinu/Qwen3.5-4B-MiniFantasy туть почти как у меня, только weight_decay больше и оптимизатор другой (хотя я тот тюн и пробовал, он не зашел мне)
https://huggingface.co/C3DS/CARDS-Qwen3.5-4B тут тоже похоже, но ЛР задран до 2е-4 хз как, там лютая нестабильность должна быть (но может с инстрактом проще)
https://huggingface.co/LLiserginov/Luqwen4-4B у люквена тоже сорт оф агрессивные настройки (альфа 32, лр 2е-4)
Есть 2 тюна с лютым ранком (128), вообще сумасшедшие:
https://huggingface.co/mirazrafi/NSFW-RP-RolePlay-LoRA-Qwen-3.5-4B (тут какая-то RS-LoRA юзается)
https://huggingface.co/Featherlabs/Aethon-4b (какая-то сефети чепуха)
Единственное что заметил еще, warmup обычно ставят побольше чем у меня. Я пожадничал из-за маленького датасета (хотя условные 5% выполняются, но у меня всего 92 степа, 5 степов ворм ап).

Ню короч хз. Либо запустить с минимальными изменениями, вормап=10, лр уменьшить до 2е-5, и добавить все-таки сохранение бест чекпоинта, чтобы глянуть насколько бест хорош.
Либо еще докинуть изменений weight_decay=0.01, lora_dropout=0.1
Аноним 24/09/26 Чтв 00:35:10 #534 №1711653 
Сколько вы играли в таверне чтобы начать на опыте оптимизировать карточки? Делаю их при помощи иишки, потом говорю ему сократить с переводом, но все равно ощущение что надо выбрасывать половину, оставляя голые физ данные да чутка характера. А еще токенов 100 занимают инструкции по письму.
Аноним 24/09/26 Чтв 00:42:06 #535 №1711658 
>Sorry, that's beyond my current scope. Let's talk about something else.
Дипсикожена не хочет помогать делать карточку, ханжа!
Аноним 24/09/26 Чтв 00:43:25 #536 №1711661 
>>1711658
Моя толстая синяя рыба мне никогда не отказывает сидя прикованной к говноригу
Аноним 24/09/26 Чтв 00:43:36 #537 №1711662 
>>1711658
Аблитку оркароутер бери, кванты есть даже
Аноним 24/09/26 Чтв 00:44:33 #538 №1711663 
>>1711658
Что ты там такое страшное генеришь?
Аноним 24/09/26 Чтв 00:46:39 #539 №1711667 
>>1711663
Ничего такого. Ну почти. Возможно немного запретного. Возможно и не немного.
Аноним 24/09/26 Чтв 00:53:10 #540 №1711671 
Пиздец чсв у юродивого. Наверное с ним никто не дружит и от того он еще больше злюка. Денех заработал, а перестать быть никому не нужным инцелом не заработал. Даже жалко немного.
Вот так, приходит вечером со своей галеры, где об его сеошность все хуй вытирают, унижают и хихикают за спиной, и начинает раздавать на двощах какие все банальные дилетанты.
Мдеа...
ПЕРЕКАТ Аноним OP 24/09/26 Чтв 01:06:41 #541 №1711676 
ПЕРЕКАТ

>>1711675 (OP)

ПЕРЕКАТ

>>1711675 (OP)

ПЕРЕКАТ

>>1711675 (OP)
Аноним 24/09/26 Чтв 01:21:06 #542 №1711682 
>>1711676
Пидор. так долго перекатывал, я уж думал ты шапку наконец исправил, ан нет. Ленивое ты хуйло. Так перекатывать и я могу.
comments powered by Disqus