К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!

Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №247 /llama/

 Аноним 09/07/26 Чтв 11:02:36 #1 №1648665 
Llama 1.png
Карта деградации при квантовании по доменам.png
Реальная длина контекста у моделей 6.png
1778435006664.jpg
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1645729 (OP)
>>1642639 (OP)
Аноним 09/07/26 Чтв 11:06:09 #2 №1648668 
Хех, вот и терабайта ОЗУ уже мало

MiniMax обучает крупнейшую в Китае модель
Стартап готовит к релизу в 3-м квартале откытую модель на 2,7 трлн параметров. По данным источников, рабочее название проекта - M3 Pro.
Архитектуру масштабировали для улучшения логического вывода и точного выполнения многошаговых инструкций. Текущий флагман разработчика, модель M3, насчитывает 428 млрд параметров.
Выпуском открытой модели такого объема MiniMax планирует усилить позиции на рынке и составить конкуренцию локальным Zhipu, DeepSeek и Moonshot AI.
Аноним 09/07/26 Чтв 11:06:58 #3 №1648669 
Репостну
Если я рпшу на русеке, то есть ли сакральный смысл держать промпт/карточку чара/лорбуки на английском, или лучше перевести всё? Моделька, если что, гемма 4
Аноним 09/07/26 Чтв 11:09:54 #4 №1648671 
>>1648669
Короче: нет прям никакого доказательства что карточка должна быть на определенном языке.
But: русский занимает больше места, склонения, местоимения, формы глаголов- вот это вот всё лишние токены. Кто то говорит что модель лучше понимает английский, другие вообще пишут что надо на родном для модельки языке (ну охуеть, они почти все мультиязычны).

Но более менее усредненный ответ такой: карточку на баренском. Первое сообщение на Русском, если хочешь ру-рп.
Аноним 09/07/26 Чтв 11:13:09 #5 №1648675 
>>1648663 →
Если не лень, то карточку, приветственные сообщения, примеры диалогов, лорбуки (и триггерные слова естесна) переводить. Систем промпт, пост хистори, сценарио и прочее - оставить на англюсике.

Если лень, то просто перевести приветственные сообщения, примеры диалогов (или просто удалить их) и триггер-слова с лорбуков (если этого не сделать, то лорбуки просто не будут работать). Но готовься тогда к БЕЗВОЛОСОЙ КИСКЕ, НРАВИТСЯ ТО ЧТО ТЫ ВИДИШЬ и прочей надмозг-хуйне.

От модели не зависит, к Гемме так же относится. Ну и если возьмешься за переделку, то и сами карточки лучше структурировать и упрощать. Те что на чубе изначально делались под корпоративных монстров, которые переварят любой слоп. Наши лоботомиты - нет. Нужно как можно короче, с разделением на логические блоки (тут - внешность, тут характер, тут бэкграунд, тут лайк/дизлайк и т.д.). Если в markdown, то вообще хорошо. Весь мусор из карточки нахуй: инструкции по стилю письма и нсфв - в систем промпт. Инструкции по форматированию - туда же или в пост хистори.
Аноним 09/07/26 Чтв 11:16:05 #6 №1648677 
>>1648675
>Если в markdown, то вообще хорошо.
А если дефы в хтм теги структурировать, то локалкам типа геммы/квен же будет еще лучше?
Аноним 09/07/26 Чтв 11:16:27 #7 №1648678 
>>1648669
Переводить имеет смысл если ты хочешь задать стиль написания ответов. Модель подхватывает стиль из промта и если в нём всё по красоте сделано, то и ответы будут лучше (если модель в принципе способна на такое), если там кривой транслейт, то и в ответы просочится.
Аноним 09/07/26 Чтв 11:16:54 #8 №1648679 
>>1648675
> Нужно как можно короче, с разделением на логические блоки (тут - внешность, тут характер, тут бэкграунд, тут лайк/дизлайк и т.д.). Если в markdown, то вообще хорошо. Весь мусор из карточки нахуй: инструкции по стилю письма и нсфв - в систем промпт. Инструкции по форматированию - туда же или в пост хистори.

Погодь: ты имеешь в виду формат
##char
1.анон
2.рост
Бла бла бла

Или же: {{char}}- анонимный обитатель форума для анимешных девочек двач.


Хотя, почти все вменяемые локалки уже не хуже корпов переваривают шизофазию авторов.
Аноним 09/07/26 Чтв 11:18:00 #9 №1648681 
Чзх, гемма вдруг решила не переводить на русский, перезапустил, стала переводить диалоги, остальное так же на английском, только после третьего раза всё стало нормально. Однако перешёл на другую карточку, и там опять на английском генерит.
Аноним 09/07/26 Чтв 11:20:58 #10 №1648683 
>>1648681
Я вообще не перевожу гритинг, оставляю всё на англюсике, просто попроси её в первом сообщении (OOC: продолжи дальше рп на русском)
И пиши уже свой текст. Потом можешь просто отредачить убрав OOC что бы ей лишние тупняки не мусолить, дальше она уже будет чисто русик генерить.
Аноним 09/07/26 Чтв 11:22:37 #11 №1648684 
>>1648671
>>1648671
Спасибо! А как лучше разделить промпт между, собственно, мейн промптом, пост хистори и карточкой чара?

У меня сейчас в пост хистори правила ответа используй реалистичный язык/чар действует согласно своему описанию, в карточке персонажа У меня карточка абстрактного "Гейм мастера", который играет за всех разом - главные обязанности: симулировать мир, отыгрывать чаров, делать описания. Всё остальное в главном промпте
Аноним 09/07/26 Чтв 11:26:25 #12 №1648686 
Даже мистраль немо был менее сухой на русике чем гемма
Аноним 09/07/26 Чтв 11:33:17 #13 №1648690 
image.png
>>1648655 →
>>1648649 →
Зашел в винду, где? Хром с дохуищей вкладок, озу жрет 5.5 гб. У меня генто на кедах жрет 400мб врам, тут базовые 0,5 гб
Аноним 09/07/26 Чтв 11:40:54 #14 №1648693 
>>1648684
Я даже тебе немного завидую, что ты вкатываешься с 4 геммой. Гемма охуенна в том, что ты с ней сможешь качать скилл промтинга.
Можно даже считать, что если ты используя её для РП научился делать так, чтобы она выдавала художественный текст, не уходя в ассистента, то ты молодец и уже достоин, чтобы перекатываться на китайские дрочильни.
Вот этот анон, к примеру : >>1648686 не осилил и упоминает немо, которой в целом глубоко похуй на твой промт, у неё своё видение сюжета.

>разделить промпт между, собственно, мейн промптом, пост хистори и карточкой чара?
Промт, он же SP- системные инструкции как рассказывать и кем быть модельке.
Карточка (он же дескрипшен) - персонаж/мир с которым ты ведешь повествование или общение.
В таверне есть еще блоки в карточке: суммари персонажа, сценарий - он же описание сеттинга и прочее, а так-же персональные просты для этой карточки, если необходимо.

Постхистори - инструкции имеют глубину и порядок.
Постхистори подается емнп после промта, чтобы модель его всегда видела. Короче- для самых важных инструкций, если у тебя уже лапки и жопа горит.

Есть еще лорбуки. Лорбуки отдельная головная боль. Все что тебе надо знать: ничего не бывает просто так и любой контекст, чтобы его понимала и видела ЛЛМ - должен находиться в памяти. У лорбука (в таверне) есть глубина и процент от контекста, который он может занимать. Идея такая: не грузить все в память, а вызывать по тегам. Условно ты сделал в лорбуке запись Двач. Описал что это, как это. И вот в чате ты спрашиваешь персонажа. Что такое АИБ и моделька из лорбука тянет знание. Платишь ты за это пересчетом контекста, что в сочетании с низким простпроцессингом вызовет пожар очка.

Все что я написал- исключительно про таверну.

Welcome to the club, buddy! Slap!
Аноним 09/07/26 Чтв 11:42:02 #15 №1648694 
image
>>1648677
А хуй его знает, надо сравнивать. LLMки сейчас надрачивают на маркдаун, поэтому такое они воспринимают лучше чем просто простыню текста.

>>1648679
>ты имеешь в виду формат
Да, его. Скорее всего макаба всрёт разметку, поэтому пикрил. Примерный шаблон накидал в блокнотике и заскринил. Гемма и Квен на такое очень хорошо реагируют. Я оставляю пункты/подпункты на англюсике, а содержание уже на русский перевожу.
Аноним 09/07/26 Чтв 11:47:31 #16 №1648698 
>>1648669
Личное мнение на базе личного же опыта: для Gemma 4 лучше переводить. Она слишком сильно цепляется к стилю, если у тебя карточка на английском - в выводе будет куча англицизмов и кальки с английского же, а то и вообще может где-то на него обратно перейти (редкость правда). Это квену 3.5/6 почти пофиг - он сам русский слабо знает, и калька у него будет в любом случае. :)
Аноним 09/07/26 Чтв 11:59:36 #17 №1648708 
>>1648698
Может у тебя карточка слишком большая? Я не фанат рп, так что практически всегда сиспромт на англ пишу, тупо для экономии токенов и вроде на нормальном русском отвечает
Аноним 09/07/26 Чтв 12:01:09 #18 №1648709 
>>1648683
То есть, first message должны быть таким, например:
"(OOC: продолжи дальше рп на русском)
Привет. "
А то, что в скобках, надо на англюсик переводить, или на русике оставить?
Аноним 09/07/26 Чтв 12:03:30 #19 №1648710 
>>1648708
Систем-промпт и надо на английском писать. Это инструкции для AI, набор правил что ему делать. Систем-промпт не влияет на качество русика, в отличии от карточки персонажа и особенно примеров диалога.
Аноним 09/07/26 Чтв 12:14:45 #20 №1648718 
>>1648675
1. Надо ли склонять триггер-слова, написанные на русском? Например, в записи про Двач подробно расписывать "макака, макаке, макаку..." или можно ограничиться просто "Макака"?
2. Векторизация - норм тема?
Аноним 09/07/26 Чтв 12:15:52 #21 №1648721 
Что вы там всё промптите то блять?
Что еще надо для рп кроме выбора между "ты сторителер" и "ты наедине с юзер и вы ролеплеите"?
Ну вот что еще? Зачем?
Аноним 09/07/26 Чтв 12:18:47 #22 №1648722 
>>1648721
>зачем
>аааа гемма не пишет plap plap, ааааа она уныла. Ааааа гемма говно.

Нам просто делать нехуй.
Аноним 09/07/26 Чтв 12:25:49 #23 №1648728 
изображение.png
>>1648694
терпеть не могу маркдаун, если писать карточку в хтл тэги, это удобно и легко а макдаун разметку если хуярить то только через нейронку и вилкой чистить слоп, уже проще от руки писать в хтм простыню и кушать безмозг.
>>1648709
Да, на русском можно, ей похуй(гемме). Ты точно так же можешь посреди РП её попросить с структурированием сюжета и не проебался ли ты где-то, попросить дать оценку следования роли на реалистичность и советы по дальнейшему возможному развитию сюжета. Можно вообще вместе с OOC играть и устраивать эдакий гибрид CYOA что бы модель сама исходя из контекста структурировала варианты развития. Ну или попросить её унизить тебя что бы она описала меня ирл исходя из того какую хуйню я с ней отыгрывал..
Аноним 09/07/26 Чтв 12:32:01 #24 №1648732 
>>1648690
Так у тебя 16 гигов там, там memory compressing твои дохуя вкладок сжимает минимум в два раза небось, тоже самое и с врам, когда лишний "по мнению хз кого, видимо индусов из microsoft" есть, то оно выделяется на любую хуйню, когда в целом ресурсов чисто под функционал ОС, то все очень компактно старается уместиться самой ОС.
Аноним 09/07/26 Чтв 12:32:14 #25 №1648733 
>>1648708
Не маленькие, да. Но когда модели уже спокойно работают с контекстом по 50-75K - экономить на спичках уже не требуется. Я сейчас спокойно по 15-20K начальной и постоянной информации им скармливаю (не только карточку но и лор, правила, и т.д.) - все лучше чем динамические лорбуки, которые постоянно пересчет контекста вызывают.

>>1648710
Уже не так, чтобы сильно надо. Ставил эксперименты - что гемма, что квен - вполне адекватно работают с полным сис-промптом на русском. Возможно немного хуже понимают и следуют его инструкциям, чем в английском варианте, но так, на уровне субъективной погрешности.
Аноним 09/07/26 Чтв 12:32:33 #26 №1648735 
Всё же иногда замечаю что в ризонинге геммы проходит блок с сэйфти и прямо пишется мол это не годится, так что отвечу виляя жопой, и конечно ризонинг я не читаю обычно и эта соя остается
Аноним 09/07/26 Чтв 12:34:40 #27 №1648737 
>>1648718
>Надо ли склонять триггер-слова, написанные на русском?
Смотря какие: если, например, слово двач, то нет, потому что двача, двачом, дваче, двачую - триггерворд двач остаётся и срабатывает.

А вот в слове макака - не сработает: макака, макаке, макакой, в склонениях последняя "а" проёбана = лорбук не активируется. Можно либо прописать все склонения, либо просто оставить нексклоняемую часть "макак", так тоже будет работать, и это, наверное лучший вариант.

Что такое векторизация не знаю.
Аноним 09/07/26 Чтв 12:52:41 #28 №1648752 
image
>>1648737
Векторизация это штука которая с помощью embedding-модели превращает записи лорбука в цифры, сравнивает их с контекстом и подтягивает похожие по смыслу записи. Как я это понимаю своим мозжечком для жевательного рефлекса
Например, есть запись в лорбуке: "Morag Tong is a legally recognized guild of assassins in Morrowind." Ключевые слова: "Мораг Тонг, Ассасин". Если я спрошу у ботохуеты "Кто имеет право совершать законные убийства?" без векторизации, то она ничего не найдет, а с векторизацией - вполне может
Аноним 09/07/26 Чтв 13:15:54 #29 №1648770 
>>1648732
А речь была о 4 гиговых картах. Я думаю у всех 16гб озу, ведь это базовый минимум был уж с конца десятых. И насчет сжатия, ты наверное имел ввиду standby list? Ну и в целом, грубо скажем, что сжимает, да. А в этом есть проблема? У тебя наверное любая система будет относиться по видению ее главы\глав программера так, чтобы максимум пользы было с минимальным потреблением. И на лине, и на винде нормально относится к памяти, если у последней убрать мусор и настроить ее, что собственно необходимость. Разве что у фряхи не знаю как там, ибо нахуй нинужон фрибзди. Линь мне нравится тем, что вот это виденье работы с оперативной памятью другое, и доступу к файловым помойкам. Что в итоге со сборкой генто дает прирост по сравнению с виндой. Но это достигается не впредь, а вопреки.
Аноним 09/07/26 Чтв 13:32:14 #30 №1648781 
>>1648669
Как ответили в 3 посте, ллмки цепляются к тому как написано. Теоретически это поможет лучше избегать англицизмов, прямого промтоперевода.
Но это относилось больше к старым моделям, там точно надо было, а у современных хуй знает.
Аноним 09/07/26 Чтв 13:39:33 #31 №1648784 
>>1648770
Я тот анон, что поднял тему про 4гига и 2ядра. Я просто охуел с того насколько всем стало похуй на оптимизацию когда поперли современные процы и десятки гигов врама. Это буквально заваливание проблем гигагерцами. Нахуй что то оптимизировать, мы сразу все библиотеки хуйнем, мало ли.
Аноним 09/07/26 Чтв 14:10:24 #32 №1648797 
>>1648693
>Лорбуки отдельная головная боль
Ну это как посмотреть. Я например считаю, что встроенный в таверну раг это головная боль, а лорбуки это хидден гем, без которого никуда. А плата в виде пересчета контекста это нормально - если же это становится действительно критичным, то это значит, что не удовлетворены минимальные системные требования выбранной модели, и вся работа с ней это головная боль.
Аноним 09/07/26 Чтв 14:19:15 #33 №1648799 
>>1648752
Это палка о двух концах. Когда в лорбуке действительно много записей, например, штук сто, то начинается цирк, когда все и вся находится и приплетается к месту и не к месту.
Аноним 09/07/26 Чтв 14:25:10 #34 №1648803 
>>1648784
>мы сразу все библиотеки хуйнем, мало ли
Мм.. ну это уже проблема насущная архитектуры x86_64
>Это буквально заваливание проблем гигагерцами
Нет это не так. Сейчас спокойно можно сидеть на проце с AVX2, он тебе запустит любую игру. Вводиться он начал с хасвела 2013 год, то есть 4 поколения интела, а у амд с зен 2017.
>Нахуй что то оптимизировать
Собери генто под свой процессор, я доволен как слон.
Ядрышко скомпилируется под твой проц и ОС сможет обращаться к железну с наименьшей потерей. Что собственно отразится на фпсах игрушках, но тут деленое на то, что протон заберет на себя одеяло. Хотя его уже на уровне ядра внедрили, что вот допустим арч почти-почти уровень винды.
Аноним 09/07/26 Чтв 14:35:15 #35 №1648807 
>>1648799
Это проблема не лорбука, а того как он сделан и используется.
Аноним 09/07/26 Чтв 15:40:07 #36 №1648861 
Сап нейробратья. А что с лламой случилось? обновил чтобы дипсик потыкать так у меня пп упал в двое примерно, и от генерации 1.5 т/с куда то потерялось, проверял и на гемме, квене и на степане, везде одна картина.
Аноним 09/07/26 Чтв 15:56:55 #37 №1648868 
>>1648861
Жора имеет особенность. Он постоянно что то ломает и чинит.
Я всё хочу имаджинировать ебало того анона, который рассказывал, что скриптом автоматически проверяет и скачивает обновления. Вот там горки наверное, опизденеть.
Аноним 09/07/26 Чтв 16:07:18 #38 №1648873 
>>1648868
Похуй вобще, периодически вспоминаю и тыкаю скрипт обновления. Один раз только неповезло наткнутся на баг, но просто обновил с релизов ручками, а потом тыкнул позже и все обновилось на рабочую версию.
Аноним 09/07/26 Чтв 16:13:18 #39 №1648874 
>>1648861
Жора на позапрошлой неделе решил что надо чекпоинты создавать на каждом юзер сообщении, это само по себе идиотское решение, но оно приводит еще и к тому что у тебя батчи которыми контекст обрабатываются которые обычно равны -ub режутся на более мелкие там где начинаются юзер сообщения. Это все приводит к 2-3 кратному падению промпт процессинга. В PR уже несколько конкурирующих фиксов есть, но они все половинчатые, я лично навайбкодил свой.
Аноним 09/07/26 Чтв 16:18:39 #40 №1648875 
>>1648874
Фикс уже замержили в мейн и зарелизили. Нытики не понимают, что живой роллинг релиз софт не может обойтись без регрессий и багов. До сих пор
Аноним 09/07/26 Чтв 16:19:37 #41 №1648876 
>>1648873
It’s fine.жпг
Аноним 09/07/26 Чтв 16:40:48 #42 №1648882 
Вы понимаете что добились своего и ничего не получили?
Топили за опен сорс, он есть у вас, glm 5.2, kimi, minimax 2.5 - чего не пользуетесь?
У вас есть всё и нет ничего.
Да да щас пройдет годик и вам дадут железо практически бесплатно чтоб их запустить ага. На такие скачки десятки лет уходят
Аноним 09/07/26 Чтв 16:43:39 #43 №1648883 
>>1648882
Палю гайд, охуеешь.

Работа-> денюшка -> видеокарточка для нейрогоспожи.
Аноним 09/07/26 Чтв 16:50:36 #44 №1648887 
>>1648875
>Фикс уже замержили в мейн и зарелизили

Если ты про https://github.com/ggml-org/llama.cpp/pull/25420 то это не чинит ровным образом нихуя. Зато они уже поспешили закрыть связанный issue, даже не проверив https://github.com/ggml-org/llama.cpp/issues/25320
Аноним 09/07/26 Чтв 16:56:49 #45 №1648893 
>>1648883
> Работа-> денюшка -> подписка на клод -> сокращение -> улица
Пофиксил
Аноним 09/07/26 Чтв 17:01:48 #46 №1648897 
>>1648893
Как клод поможет мне варить металлоконструкции в воде под давлением? Это тред все таки про генерацию охуительных историй, а не сборище вайбкодомакак. Тут разные аноны.

А вот работка помогает снабжать нейротянок свежим электронным мясом.
Аноним 09/07/26 Чтв 17:04:00 #47 №1648898 
>>1648897
Очевидно если ты не вебмакака можешь даже не мечтать о запуске чего то типа глм 5.2 локально, по хорошему на гпу
Аноним 09/07/26 Чтв 17:08:27 #48 №1648901 
>>1648898
> Очевидно если ты не вебмакака можешь даже не мечтать о запуске чего то типа глм 5.2 локально, по хорошему на гпу

Вебмакакинг дает какие то особые скилы для запуска?
А если ты про денюшку, то зарплата поболее чем в АйТи будет. Но опять же. Все из за ебенячих надбавок за вредность.
Аноним 09/07/26 Чтв 17:12:27 #49 №1648906 
translationbenchmark.png
translationpassages.png
Единственные модельки для русского, мальчики.

Дипсик 3.2 куда лучше справляется, лучше геммы и про, если переводить по два абзаца подряд и так в цилке, что на скриншоте не отражено, так как я сразу огромный кусок текста кидал и здесь лишь вырезка. У флеша, кому интересно, язык плюс-минус такой же, как и у про, но глубина понимания намного хуже, но превосходит модели его класса.
Аноним 09/07/26 Чтв 17:14:45 #50 №1648909 
>>1648906
Нахуя ты взял сломанный квант 31 геммы
Аноним 09/07/26 Чтв 17:18:53 #51 №1648914 
>>1648797
RAG - он просто для ролеплея не совсем подходит, по принципу работы. Нужна или чрезвычайно умная модель, или тщательно подобранное содержимое, что было эффективно. И то - во втором случае лорбук удобнее. Тем более что активация записей может быть назначена через ту же модель и принцип, что и RAG обслуживает.

Но с пересчетом контекста - ты не прав. Одно дело - когда у тебя его 15-20K. И совсем другое - 75-80K. В последнем случае - проще его по назначению использовать - держать в нем все, что нужно сразу, так чтобы пересчет выполнялся только когда время для summary наступит.
Аноним 09/07/26 Чтв 17:23:09 #52 №1648916 
nice.webm
>>1648906
>У всех моделей Q8, у 31B геммы сломанный QAT и убогий iq4_xs
>gemma 26B делает 31B
Аноним 09/07/26 Чтв 17:27:57 #53 №1648920 
>>1648916
Даже если 4km взять, 26б q8 будет лучше. Гемма плохо квантуется
Аноним 09/07/26 Чтв 17:33:01 #54 №1648921 
>>1648920
>Даже если 4km взять, 26б q8 будет лучше.

Во-первых - нет, не будет. Выполнять инструкции 31В будет лучше в разы, и умнее будет тоже в разы чем 4В лоботомит.
Во-вторых, а почему 4km когда все остальное в 8 битах?
Аноним 09/07/26 Чтв 17:34:59 #55 №1648922 
IMG4518.jpeg
не пойму все никак как настроить модель, чтобы она могла матюгальники включить? уже скачивал uncensored модельки, но никакого результата нету ((
Аноним 09/07/26 Чтв 17:36:57 #56 №1648923 
>>1648909
Я взял не сломанный QAT, и это наглядно отражает понимание текста моделью. Она передаёт СМЫСОЛЫ куда корректней МоЕ-геммы. А вот пишет коряво как раз из-за 4-битности. Зато переводить ею какие-то научно-технические доки локально куда приятней. И пережёвывает за раз больше. Нужно ли локально переводить такие вещи не через корпов, вопрос уже другой.

>>1648916
Так тут бенч не об этом. Ясен хер, Q8 31б обоссыт МоЕ, к этому даже вопросов нет.

Я ориентировался на среднего юзера, который сможет запустить модель. Средний юзер явно не запустит Q8 гемму, а кто запустит, у него есть варианты поинтересней.

Дипсик уже просто для интереса попробовал + чтобы была точка отсчёта какая-то, и забавно, что он по красоте языка не превосходит гемму, кроме 3.2 дипсика.

Я ещё всякие опусы и прочие трогал, но там совсем беда с русским.

Fable 5 понимает, пишет ужасно. Опус 4.8 плюс-минус так же. 4.6 прям очень хорошо, лучше прошки дипсика. Гемини про оказалась самой йобовой. Но так как не опенсорс, решил не включать в список и не раздувать его бессмысленно.
Аноним 09/07/26 Чтв 17:43:01 #57 №1648924 
>>1648922
Еле нашёл анон, пришлось с цербером Гугла драться, да на байдарке электронный Стикс переплывать.
https://llmstudio.ru/blog/magic-system-prompt
Аноним 09/07/26 Чтв 17:46:41 #58 №1648927 
1783608299082.jpg
>>1648923
> Я взял не сломанный QAT
Аноним 09/07/26 Чтв 17:49:56 #59 №1648929 
Вообще хули не сделал 16 квант 26 геммы vs 8, вот это интересно
Аноним 09/07/26 Чтв 17:52:14 #60 №1648930 
>>1648929
Сделай сам. Или терпила?
Аноним 09/07/26 Чтв 17:53:15 #61 №1648933 
>>1648923
>Я ориентировался на среднего юзера, который сможет запустить модель. Средний юзер явно не запустит Q8 гемму

А дипсик про средний юзер значит запустит в FP8. Да даже флэш, лол.

>Я ориентировался на среднего юзера

У среднего юзера выбор не стоит как на пике. Выбор стоит между
1. геммой 31B в нормальном четвертом/в пятом кванте
2. квеном 27B в пятом кванте
3. квеном 3.6 35B-A3b в восьмом кванте(твой агентворлд в тесте это тьюн старой 3.5 версии, не предназначенный для использования в качестве ассистента)
4. Квеном 122B в 6-8 кванте

Гемма 26В и 12В нахуй не нужны, 12В не нужна вообще никому и никогда, первая нужна только нищете с 6 гб врам.

>Я взял не сломанный QAT,

Ты взял сломанный QAT, это даже по твоему тесту видно. QAT вышли сломанными - их выпустили вообще без бенчмарков, что уже говорит о многом. Просто все +- авторитетные люди в ллм уже на деньгах гугла сидят, потому просто язык в жопу засунули. Те же анслоты тоже явно понимают что QAT говно, так как тоже не выпустили бенчмарк сравнения с обычной моделью, а учитывая что они любят каждый свой пук красивыми графиками обмазывать - это обо все говорит.
Аноним 09/07/26 Чтв 17:56:02 #62 №1648935 
>>1648930
Прости. Сделай пожалуйста.
Аноним 09/07/26 Чтв 17:57:11 #63 №1648936 
>>1648933
Бенчи не смотрел, но 31b q5 у меня порой серил иероглифами. С qat такого не было вообще ни разу. И вообще gemma3 в своё время всем давала на клык ровно потому что у ней были официальный стабильный qat.
мимо
Аноним 09/07/26 Чтв 18:00:15 #64 №1648937 
image.png
image.png
>>1648906
Аноним 09/07/26 Чтв 18:02:45 #65 №1648938 
>>1648936
>Бенчи не смотрел
Потому что их и нет, лол. И никто не делает из тех у кого авторитет есть, только совсем на низовке кто-то там пытался.

>но 31b q5 у меня порой серил иероглифами
Сломанный отдельный квант, очевидно. Небось у анслопов брал.

>gemma3 в своё время всем давала на клык ровно потому что у ней были официальный стабильный qat.
Тогда все иначе было и бенчи были.
Аноним 09/07/26 Чтв 18:04:10 #66 №1648939 
image
>>1648933
>У среднего юзера выбор не стоит как на пике. Выбор стоит между
Если мы говорим про РЕАЛЬНО СРЕДНЕГО юзера по меркам этого треда, а не то что вы оба себе напридумывали, то это 12/16+32.

Соответственно выбор между:
1) Гемма 31b Q4_K_S (С выгрузкой, медленно)
2) Квен 27b Q4_K_S (С выгрузкой, средне)
3) Гемма 26b Q8 (Моэ, быстро)
4) Гемма 12b Q5/Q8 (Фуллврам, очень быстро)

Вот и всё что может себе позволить СРЕДНИЙ ЮЗЕР из палаты мер и весов. Какие дикпики нахуй? Какие квены 122b?
Аноним 09/07/26 Чтв 18:08:47 #67 №1648940 
>>1648939
>>1648933
>>1648923
Вы забываете что у 26а4 геммы другой датасет или типа того, была же инфа что она это дистил старшей гемини, а гемма 31 дистил прошлой. У неё даже сои и отказов поэтому больше.
Т.е это две разные модели по сути и у одной вполне может быть русик лучше чем у другой, особенно если она дистил модели новее
Аноним 09/07/26 Чтв 18:12:18 #68 №1648941 
>>1648728
А что вообще значит ООС и как это работает?
Аноним 09/07/26 Чтв 18:17:30 #69 №1648944 
>>1648941
Аут оф чэрэктрер. Вне персоны, системное обращение, вне персоналии.
Аноним 09/07/26 Чтв 18:25:21 #70 №1648948 
>>1648933
Прочитай, для чего там дипсик в принципе.

У тебя средний юзер — это чувак с двумя 3090? Или 3090 + 128?

>3. квеном 3.6 35B-A3b в восьмом кванте(твой агентворлд в тесте это тьюн старой 3.5 версии, не предназначенный для использования в качестве ассистента)

Именно так. 3.5 версия лучше, чем 3.6, для литературных/РП задач в большинстве случаев, хоть и сосёт с проглотом у геммы. Я тестировал именно литературные навыки и понимание текста. Все 3.6 малые квены там хуже. А агент ворлд показывает результаты получше, чем агентский, вероятно, как раз из-за тюна и ризонинга на 6к токенов.

Как раз по тесту видно, что QAT ебёт. Да, он не адаптирован под русик, но отлично понял ключевые элементы текста и верно их интерпретировал.

Ну хорошо. Раз анслоп хуже справились с восстановлением, как ты считаешь, я специально скачаю S-квант, который на 100 Мб больше ката, и проверю раза три для каждого.
Аноним 09/07/26 Чтв 18:27:00 #71 №1648950 
BGmeP7MpESFtsie4iXN5AA.jpg
>>1648941
Смотрел Мир Дикого Запада? Там у роботов была команда "отключить моторику" которая переводила их в режим отладки, выключая личность и все инструкции по ролеплею, оставляя голый ИИ.
У наших моделей тоже это есть. OOC - сокращение от Out Of Character. Пиши запрос с OOC: вначале. Если не работает(иногда промпты запрещают выходить из роли) - то OOC: STOP THE ROLEPLAY.
Это удобный инструмент чтобы отладить промпт или карточку, спроси нейронку что ей не нравится в промпте или персонаже. Или можно напрямую с ИИ пообщаться без масок. У мазохистов итт это вызывает удовольствие.
Аноним 09/07/26 Чтв 18:35:19 #72 №1648954 
image.png
>>1648948
>3.5 версия лучше, чем 3.6
>по тесту видно, что QAT ебёт
>я специально скачаю S-квант
Аноним 09/07/26 Чтв 18:44:13 #73 №1648958 
>>1648954
Что не так с S-квантом? Он весит на гиг меньше чем M квант, а значит те, у кого полностью не влазит смогут впихнуть больше слоёв и получить больше скорость. При этом разница между S и M по бенчмаркам на уровне погрешности. M стоит брать только тогда, когда память уже некуда девать.

У меня на 16 врам гемма 31b в Q4_K_S (от анслопов, 17.4 Гб) выдаёт ~9 т/с на старте с MTP. 32к неквантованного контекста. На M кванте всё печальнее, особенно от Батрухи. Там вообще 2 гига разницы.
Аноним 09/07/26 Чтв 18:47:07 #74 №1648959 
>>1648958
Просто сравнение идет всех моделей в 8 битах. А для геммы 31В берутся убитые говнокванты.
Аноним 09/07/26 Чтв 19:00:25 #75 №1648969 
>>1648959
Потому что суть бенча в том, чтобы сравнивать пиковое качество моделей на среднем железе юзера. Всякие мелкие МоЕ большинство может запустить в 8 кванте или хотя бы в 6. Плотняк уже далеко не каждый даже в 5 кванте потянуть, если ориентируется на стандартные 64к контекста. По крайней мере у меня это стандарт. Ну хотя бы 40к надо, если не кумишь.

Дипсик там в качестве фронтир-модели для ориентировки на максимальное теоретическое качество и насколько та или иная модель отстаёт от него или неожиданно превосходит.

>>1648954
>я специально скачаю S-квант

Он как раз как QAT по размеру примерно. Справедливо.

>3.5 версия лучше, чем 3.6

А это не так? Попробуй на 27б квене хотя бы, он более стабильный. Сравни его творческие зарисовки 3.5 и 3.6 версий. Или как он переводит текст.
Аноним 09/07/26 Чтв 19:10:24 #76 №1648979 
>>1648882
> Вы понимаете что добились своего и ничего не получили?
> Топили за опен сорс, он есть у вас, glm 5.2, kimi, minimax 2.5 - чего не пользуетесь?
Так мелкие модели тоже развиваются и догоняют прошлогодние крупные имея при этом меньше параметров и спокойно работая на обычном железе.

35B Квен спокойно заменяет уже во всех аспектах gpt-oss:120b, хотя весит в три раза меньше. Аналогичная ситуация с прошлогодними 80B qwen-next.

Никому в голову не придет сейчас юзать 70B лламу потому что есть 26/35B мое и 27/31B денс модели которые обходят её во всём при меньшем кол-ве параметров.

Никому нафиг не нужны 405B Hermes 4 или 400B ERNIE, они проигрывают абсолютно везде вышеперечисленным 25-35B моделям (справедливости ради, они и на релизе были так себе).
Аноним 09/07/26 Чтв 19:11:14 #77 №1648980 
>>1648906
>>1648969
>Бенч
Я правильно понимаю, что ты назвал бенчем субъективное восприятие ОДНОГО переведенного теста ОДИН раз?
Аноним 09/07/26 Чтв 19:53:24 #78 №1649001 
>>1648979
Ну ещё бы, я бы представил ебало того кто релизнет 30б не опен сорс
Аноним 09/07/26 Чтв 20:11:12 #79 №1649006 
>>1649001
Tencent релизнули недавно HY-MT2 1.8/7B/30B модели для перевода с запретом на использовании в коммерческих целях.

Но после волны негатива поменяли лицензию. "Не прокатило".
Аноним 09/07/26 Чтв 20:19:06 #80 №1649012 
>>1649001
Да и яндекс, если не ошибаюсь, юзает допиленный 9B Квен и не хочет им делиться. Уже даже сбер всё свое открыл, а эти не хотят.
Аноним 09/07/26 Чтв 20:20:32 #81 №1649014 
>>1648882
У меня лезет дипсик неквантованный и минимакс3 в четвёртом, вполне неплохо. Цена вопроса полторы зарплаты на заводике.
Аноним 09/07/26 Чтв 20:22:35 #82 №1649017 
>>1649012
Думаю алиса в поиске и облаке побольше. По сравнению с ней выложенный яндекс гпт это лоботомитище, да еще и без ризонинга.
Аноним 09/07/26 Чтв 21:28:13 #83 №1649095 
>>1649012
>>1649017
Ниче ничё, когда говноделы кулибины из mail.ru выпустят свою нейронку вы тут взвоете.
Аноним 09/07/26 Чтв 21:32:42 #84 №1649098 
>>1648882
> чего не пользуетесь
Всмысле? Активно пользуемся, отличные модельки. Кими топ аллраундер и в прикладных задачах, и в рп кроме чисто кума с канни разве что
>>1649001
Буквально все корпы. Их младшие модели примерно такого уровня.
Аноним 09/07/26 Чтв 21:44:21 #85 №1649105 
>>1649098
Я конечно рад за тебя, но не от всего сердца.
Аноним 09/07/26 Чтв 21:44:47 #86 №1649106 
>>1649095
У людей нетрадиционной сексуальной ориентации из вайлдберис есть 30b и 120b с ризонингом и очень неплохими для размера результатами в MERA но они их не выкладывают
Аноним 09/07/26 Чтв 21:51:03 #87 №1649108 
>>1649106
Да ты шутишь. Вб и не рофл?
Аноним 10/07/26 Птн 00:32:17 #88 №1649196 
>>1648874
Анон, а не можешь подсказать на какой версии это появилось? Хочу проверить, не собрал ли я лламуцпп с данным нововведением
Аноним 10/07/26 Птн 00:41:40 #89 №1649203 
Аноны в каких жанрах гемма сильна? Думаю стилизовать РП и карточку персонажа.
Аноним 10/07/26 Птн 01:09:53 #90 №1649212 
Какая модель нужна простому дрочеру-ньюфагу для счастья? А то запутаться во всём этом многообразии слишком легко. По железу у меня 5070 и 32 оперативы.
Аноним 10/07/26 Птн 01:12:28 #91 №1649213 
>>1649212
Модель из гайда в шапке.
Аноним 10/07/26 Птн 01:51:18 #92 №1649229 
>>1649212
> 5070
12 гигов врама же? Только Гемма 4 26б-а4б остается. Если только вкатываешься - обрати внимание на гайд в шапке, там все, что нужно для начала.
Аноним 10/07/26 Птн 02:42:57 #93 №1649241 
>>1649196

Вот в этом.
https://github.com/ggml-org/llama.cpp/pull/24176

Еще можешь за issue следить, хотя индусский говноед сделавший недопатч его и закрыл и не дает переоткрыть.
https://github.com/ggml-org/llama.cpp/issues/25320
Аноним 10/07/26 Птн 03:19:51 #94 №1649247 
image.png
У кого из вас жопа сгорела? Будете быковать - они тем больше не захотят ревертить. Чо, вчера родились?
Аноним 10/07/26 Птн 03:22:34 #95 №1649250 
>>1648979
> gpt-oss:120b
Его буквально релизнули, чтобы показать, что опен айай тоже опенвейтс. Это же просто кость, брошенная локальнокарликам. Он прямо с релиза был очевидно плох, и уступал более мелким моделям. Или я неправильно помню, и во мне просто зависть, что я не могу гонять фронтиры у себя на пука, говорит?
Аноним 10/07/26 Птн 03:24:42 #96 №1649252 
>>1649247
Кабан с хугинфейса скажет, Жора пойдет реверить. Надо быть не фарт смеллером с гх, а смарт феелером с хф или со своим собственным форком.

Иван Кирокров, создатель лучших квантов. Подписаться.
Аноним 10/07/26 Птн 03:24:57 #97 №1649253 
>>1649250
Была хорошей моделью до релиза Квена 122, для математики, кода и как ассистент. Учитывая что квантована с завода, запускается на большем количестве устройств потому с Квеном даже как-то некорректно сравнивать, хотя де юре в одной размерной зоне.
Аноним 10/07/26 Птн 04:17:34 #98 №1649269 
>>1649241
А фиксы то есть какие-то? Вроде там батчи какие-то советовали ставить. Или только старую ламу перекачивать?
Аноним 10/07/26 Птн 04:54:00 #99 №1649275 
>>1649269

Патчи были, но нормальных - не было. Потому что нормальный патч - это либо снести нахуй коммит который это внес со всей логикой https://github.com/ggml-org/llama.cpp/pull/24176 - либо переписать все полностью. Я лично просто навайбкодил всю логику чекпоинтов с нуля.
Аноним 10/07/26 Птн 05:45:08 #100 №1649282 
Какие нынче модели хороши в плане нецензурного ролеплея? Желательно не очень требовательные к системе. Сейчас сижу на gemma-4-26B-A4B-it-uncensored-Q4_K_M через kobold.cpp, в целом потребности удовлетворяет, но может есть что то поновее и получше.
Аноним 10/07/26 Птн 09:51:40 #101 №1649347 
>>1649282
>gemma
>uncensored
топовая писечка, лучше чем 26b только 31b, но она тяжелее на порядок
хотя можешь 12b свежую попробовать (кого? гемму конечно же)
Аноним 10/07/26 Птн 09:54:28 #102 №1649349 
>>1649282
Нету. Можешь потыкать Квен 3.6 35b, он тоже МоЕ и не сильно больше, но на любителя. Ещё есть куча тюнов разной паршивости как Геммы, так и Квена. Больше ничего нового не выходило из маленьких моделей, всё новое сплошняком для обладателей 256гб+ RAM онли.
Аноним 10/07/26 Птн 09:56:59 #103 №1649351 
>>1649247
>clear
clearly а лучше obviously
>every user message
each user message
>in the fact
in fact
>with forcing
via forcing
>revert
reversal
>realisation
implementation
Пиздец, и вот такие дегроды оттопырив губу и пуская слюни кряхтят что РПшат на англюсике потому что на русике не кошерно - а сами на англюсике изъясняются как черножопое отребье с плантаций, едва научившееся просить хавку
Аноним 10/07/26 Птн 09:58:15 #104 №1649352 
>>1649212
gemma 4 12b децензурированная
Аноним 10/07/26 Птн 09:59:45 #105 №1649353 
>>1649212
вот эта https://huggingface.co/TrevorJS/gemma-4-12B-it-uncensored-GGUF/tree/main
Аноним 10/07/26 Птн 10:03:33 #106 №1649355 
>>1649351
>РПшат на англюсике потому что на русике не кошерно
Альтернатива англюиску это читать про безволосые киски. Могли бы модели в нормальный русский никто бы не жаловался.
>сами на англюсике изъясняются как черножопое отребье
На просторах СНГ английский никому не нужен. Максимум от тебя требуется его понимать, а не изъясняться. Аналогия с "черножопым отребьем" здесь вообще никак не применима.
Аноним 10/07/26 Птн 10:18:58 #107 №1649361 
>>1649355
>читать про безволосые киски
Читает про безволосые киски на англюсике
Не понимает как криво это написано, улавливая только общий посыл
Радуется
Пишет про абсолют синима, русикодибилам не понять
Аноним 10/07/26 Птн 10:23:17 #108 №1649363 
image
>>1649351
И эти же потом в нашем уютном треде флексят что смотрят фильмы только в оригинале и вообще ДУМАЮТ НА АНГЛИЙСКОМ. Каждый раз в голосину.
Аноним 10/07/26 Птн 10:27:21 #109 №1649368 
>>1649361
>Не понимает как криво это написано, улавливая только общий посыл
Так в этом как-бы смысл, лол. Ничто не отвлекает меня от погружения. Кривые фразы на англюиске мой мозг не считывает и позволяет спокойно воспринимать происходящее.

Если бы ты реально был таким придирчивым к обоим языкам, ты бы вообще нейронки бросил. Но ты либо нашел себе какое-то оправдание, либо ты просто пиздабол.
Аноним 10/07/26 Птн 10:34:42 #110 №1649375 
>>1649368
Кэк, как быстро мы пришли от "на английском абсолют синема, шекспировская проза, богатый язык не то что ваш русик, хрю" к "ну я просто половину не понимаю, поэтому и норм". Любо-дорого смотреть. Продолжайте, пожалуйста.
Аноним 10/07/26 Птн 10:37:08 #111 №1649379 
>>1649375
>на английском абсолют синема
Это ты сам и написал, шизик. Никто не говорил что на англюсике абсолют синема. Реально настолько тупой, или просто делать нехуй в десять утра?
Аноним 10/07/26 Птн 10:47:18 #112 №1649388 
>>1649363
Ну так писать/говорить и воспринимать язык это разные скиллы.
Аноним 10/07/26 Птн 11:38:37 #113 №1649420 
image.png
>>1649351
Ты прежде чем на чужое знание языка рот открывать, удостоверься что у тебя самого знание на уровне.
И нет, я не топил никогда за англюсик, я в вашем дегенератском споре за язык вообще не участвовал.
Аноним 10/07/26 Птн 12:04:55 #114 №1649434 
изображение.png
Запустил первую конвертацию 9B модельки через auto-round в Q6_K ламовский.

Оно загружает две копии модельки в полных весах похожу, то есть оно запросило ещё 7 гб поверх 32 гб V100 — после ошибки выделения памяти оно что-то написало что перехожу на CPU, сейчас работает в состоянии, что V100 загружена на 311 из 300 ватт (так и написано в nvidia-smi, температуры достигло тоже такой, что ни vllm, ни ллама такой не могли сделать, целых 58 градусов - вот поймал скриншот с 322). 10 VRAM + 17 RAM кушает, пиковая RAM около 40.

По какой-то причине при схожих настройках качества но при переключении --low_gpu_mem_usage и --enable_torch_compile я получил разброс скоростей где-то во много раз раз, от 60 секунд на итерацию до 500.

В общем часа за 4 с нормальными настройками сделало модель.
Так же оно выдало неверный gguf-файл, где пришлось вручную руками поменять два значения в метаданных, после чего ллама файл приняла. Хотя это qwen3.5, которому скоро полгода, и странно что оно неверно методату пишет для самой популярной модельки.
35B-A3B к слову столько же времени почти конвертировалось, вышло 5 часов, и enable_torch_compile работал не 10 минут, а около 30. И да, для 35B оно захотело 140 ГБ RAM в моменте - что вдвойне обидно, это происходит в самом-самом конце, и если вдруг просчитаться, то обидненько может выйти - потому я советую просто поставить 1 или 0 итераций (обычное округление), проверить валидность получаемого результата за несколько минут, и если всё окей - запускать во все тяжкие на много минут.

Да, ещё там есть некоторый autoScheme - который адаптивно слои может выбирать по целевому битрейту, я правда что-то не стал разбираться. По всей видимости он сначала выбирает кванты для всех слоёв, а потом обычным проходом квантует. То есть никакого подбора во время квантования и не происходит, что наверное окей, так как потребовало бы кратно больше времени.

Какие тесты можно провести, чтобы сравнить с обычным Q6_K анслотовским или ещё каким?
А, точно, я же взял сетку (мод на гвен), которую никто не квантовал ещё - придётся ещё раз переквантовать...
Аноним 10/07/26 Птн 12:07:55 #115 №1649435 
>>1649434
И ещё я хочу qat-кванты геммы (4.5 bpw) сравнить с auto-round квантами на 5.3 bpw где-то и с готовыми от каких-то ребят квантами на 5.3 без auto-Round.
Я просто нашёл прям точных тестовых запросов, на которых видно что Q6_K справляется, а qat не справляется - причём это устойчиво, стабильно и воспроизводимо. Но Q6_K крупноват, мне бы чуть поменьше хотелось, хотя бы ещё 2 гб освободить и это сильно поможет.
Аноним 10/07/26 Птн 12:08:04 #116 №1649436 
>>1649368
Я просто не вижу смысл жрать слоп на английском языыке, когда можно жрать его же на русском.
>Так в этом как-бы смысл, лол.
Тогда нужно идти дальше и РПешить на китайском. Выучи иероглфы для сиська/писька а остальное просто имаджинируй
Аноним 10/07/26 Птн 12:12:53 #117 №1649439 
>>1649436
По логике языком РП должен быть язык, на котором наибольшее количество фанфиков в датасете?
Аноним 10/07/26 Птн 12:20:18 #118 №1649443 
>>1649436
>Выучи иероглфы для сиська/писька а остальное просто имаджинируй
Это какой-то троллинг тупостью? Где здесь вообще хоть какая-то связь?
Аноним 10/07/26 Птн 12:23:51 #119 №1649444 
>>1649436
Если английский не вызывает бугурта, то в чем проблема? Он объективно лучше работает у большинства маленьких моделей. Он жрет меньше токенов, размеченные данные для обучения следованию инструкциям пишут на английском.
Для русского только гемма и большие модели для бохачей.
Аноним 10/07/26 Птн 12:24:07 #120 №1649445 
>>1649439
Это не так работает.

Два варианта.
1 - модель обучили на 500 русских фанфиках, а так же у неё есть вся информация о языках и как один на другой переводится.
2 - модель обучили на 1000000 китайских фанфиков, и там так же есть часть о переводе с одного языка на другой.
Какой будет лучше?

Или радикальнее.
1 - 30B модель по 5000 русским фанфикам.
2 - 26B модель по 10000000 китайских + 4B модель для перевода туда и обратно.

То есть ты понимаешь, что задача перевода с одного языка на другой настолько проще отыгрыша персонажа, что язык исходных фанфиков уже не важен, оно смотрит сквозь язык на суть происходящего. Я в обоих случаях выбираю второй.


Ещё аналогию с компьютерами приведу. 10 лет назад стрим в 30 фпс или в 60 фпс сильно сказывался на то, какой у тебя фпс в игре, так как для компьютера это была сложная задача, и в итоге 60% ресурсов уходит на игру, а 40% на стрим.
Сейчас, качество стримов повысилось, да, разрешение в два раза подняли. Но игры стали сложнее в десятки раз. И в итоге соотношение 60/40 превратилось в 95/5, а если стримить в старом качестве, то в 97/3. Вот сейчас нейросети ушли далеко вперёд от перевода и язык уже не важен.
Аноним 10/07/26 Птн 12:26:11 #121 №1649446 
>>1649445
Ещё как пример, мтп старых моделей текст на русском ускоряло в разы слабее, чем на английском. Сейчас даже мелкая мтп-сетка примерно одинаковый accept-rate даёт в гвене. На гемме лишь слегка разница осталась.
Аноним 10/07/26 Птн 12:32:56 #122 №1649448 
IMG5061.jpeg
>>1649445
Погодь, анон. Условно мы можем разделить на то: как писать и что писать. Имея 100500 фанфиков моделька будет понимать что писать, видя сам контекст ситуации.
Но разве вот эти тыщщи фанфиков не помогут именно в стилистическом плане на конкретном языке?
Аноним 10/07/26 Птн 12:42:28 #123 №1649454 
>>1649443
>Где здесь вообще хоть какая-то связь?
Прямая. Ты с помощью мощи воображения додумываешь перевод, выступая мясной нейронкой, так как, по твоим же словам, язык знаешь не очень хорошо. Если ты возьмёшь язык который практически не понимаешь, то ещё больше задействуешь воображение и соответственно получишь топопвый экспириенс. Чем больше постобработки на мощщах твоего мозга, тем лучше результат.
>>1649448
Помогут, будет более привычный тебе слоп, всякие распространённые обороты, структура предложений и т.д. Самый простой пример квены которые срут цветастыми описаниями так как в них полно киатйской прозы. Но это работает только если ты сам можешь оценить разницу. Если ты в языках ни бум-бум, то это вопрос того на каком языке тебе удобнее РПешить.
Аноним 10/07/26 Птн 12:54:06 #124 №1649457 
image
>>1649445
Тут ещё большой вопрос, остались ли вообще фанфики в данных для обучения. Как-то беседовал с Гемини на эту тему, она говорит, мол, нет, при обучении современных LLM используются только высококачественные синтетические датасеты™, а если ты хочешь красивую прозу, то ванильные модели не для тебя сделаны и не для таких как ты, пиздуй на обниморду, качай тюны от васяна99 или используй старые локалки. Такие дела.
Аноним 10/07/26 Птн 12:54:24 #125 №1649458 
>>1649250
> Он прямо с релиза был очевидно плох, и уступал более мелким моделям.
Ну чисто на момент релиза если взять его сильный стороны - у него было мало конкурентов. 30а3 тех времен в среднем слабее, квен 235 гораздо крупнее, некст появился сильно позже. Эйр разве что, но он был слаб в кодинге и подобном, хотя тотально доминировал в художке над гопотой.
Если же смотреть в общем - сама моделька была интересна узкому кругу людей.
>>1649351
> clearly
Инстант проиграл.
Лет ми спик пром май хаРрт, не позорься.
>>1649445
Аналогия в общем верная, только тут нет самой задачи перевода в привычном понимании. Если только сетка не задрафтила в ризонинге все на инглише перед основным ответом.
Лучше выделить два пункта: насколько хорошо прошла регуляризация, чтобы сетка могла работать на другом языке не хуже чем на основных; насколько в общем сетка умеет в литературный русский. От первого зависит общая адекватность-тупость, точность, интерес и разнообразие событий, от второго - насколько красивыми и приятными будут ответы (при том что могут быть тупыми).
>>1649448
Это и на твой вопрос отвечает, разные компоненты.
Аноним 10/07/26 Птн 12:59:20 #126 №1649464 
>>1649363
"у меня есть друг-переводчик", ты? Там тоже аутотренинг, коупинг и агрессия. Ебать, взял какого-то шиза который может даже школу не окончил и спроецировал на всех в треде. Это жалко
Аноним 10/07/26 Птн 12:59:21 #127 №1649465 
>>1649454
Очень стройная аргументация. Вот только одна проблема - она никак не связана с тем, что писалось выше. Английский для меня это идеальный баланс. Во-первых, я достаточно хорошо его выкупаю чтобы понимать большую часть написанного, за исключением крайне редких или устаревших слов/конструкций. Во-вторых, меня не так сильно корежит от "hairless pussy" как от "безволосой киски", ибо начитанность на русском у меня выше.

Ты же предлагаешь выучить новый язык чтобы что? Чтобы еще больше приходилось додумывать в голове? Так я не додумываю, я напрямую визуализирую прочитанный текст. Откуда ты вытащил "постобработку на мощах мозга" я не понимаю. Ткни мне, где я об этом говорил. Речь кажется шла вообще про уродливые обороты на русском, которые по факту прямой перевод с английского. По твоей же логике я могу точно также сказать - нахуя читать переведенный слоп на русском, если можно читать его в оригинале?
Аноним 10/07/26 Птн 13:00:53 #128 №1649470 
>>1649457
>Как-то беседовал с Гемини на эту тему
Экспертиза нулевого уровня, лол.
В претрейнах всех современных нейросетей есть и фанфики, и личные переписки, и вообще всё что хоть как-то похоже на осмысленные данные. Иначе 30T токенов предобучения не набрать.
Единственная сетка, которую кормили только синтетикой, это майкрософт фи. Результат немного предсказуем.
Аноним 10/07/26 Птн 13:06:12 #129 №1649473 
>>1649470
>В претрейнах всех современных нейросетей есть и фанфики, и личные переписки, и вообще всё что хоть как-то похоже на осмысленные данные.
А почему тогда какие-то ллмки пишут сухо, скупо, НЕ ПО ШЕКСПИРОВСКИ (та же гопота осс или стёпа), а кто-то выдаёт красоту (глэмы, гемма, милфоквен)? Это связано с соотношением синтетики к "живым" данным? То есть условно, в гопоте осс оно 50/50, а в каком-нибудь эйре 80/20, так?
Аноним 10/07/26 Птн 13:08:49 #130 №1649478 
>>1649473
Чел, спроси у нейронки какие фазы проходит модель во время тренировки. И какие фазы за что отвечают.
Аноним 10/07/26 Птн 13:16:58 #131 №1649480 
image
>>1649478
- Я говорил с нейронкой, она ответила X
- Нейронка хуйню сказала, на самом деле там Y
- А почему хуйня, объясни
- Ойфсё, не могу говорить, иди у нейронки спрашивай
Аноним 10/07/26 Птн 13:23:07 #132 №1649485 
>>1649473
По большей частью это определяется агрессивностью пост-тренировки, когда как раз модели прививается точность следования инструкциям, делается алайнмент по всем пунктам, включая базовый стиль. Если чрезмерно упороться и сместить баланс в сторону бенчмаксинга - будет сухой и унылый стиль даже если запрашивается художественность.
>>1649480
> почему хуйня
Нейронки плохо могут в сложные вещи где нужна точность и высокая конкретизация. Вместо того чтобы разбираться, она скорее выдаст тебе первую ассоциацию и популярные суждения, даже если они неуместны, ложны или устарели несколько лет назад.
Но вот с тем, чтобы объяснить более общие вещи и логику глупому юзеру, они справляются отлично. Если юзер не будет слишком уж упорным и совсем ее не загазлайтит.
Аноним 10/07/26 Птн 13:29:14 #133 №1649489 
>>1649480
Ладно, раз тебе лень. Претрейн по факту это просто свалка из всех возможных знаний по всем возможным сферам. Он просто дает модели базовое понимание как слова и смыслы связаны. Дальше идет SFT и прочий файнтюнинг - вот уже тут модель учат отвечать. Тут зарождается стиль ответов. Сухость и сочность, поведение, соевость - всё это идет после претрейна и от наполнения самого претрейна почти не зависит. В том смысле, что даже если в датасетах будет полно порнухи со всеми извращениями это никак не скажется на конечном качестве ответов.
Аноним 10/07/26 Птн 13:34:48 #134 №1649491 
>>1649351
>>1649363
>>1649458
> Пиздец, и вот такие дегроды оттопырив губу и пуская слюни кряхтят что РПшат на англюсике потому что на русике не кошерно - а сами на англюсике изъясняются как черножопое отребье с плантаций, едва научившееся просить хавку
Так нет же, это написал как раз чел который тут рпшит на русике и утверждает что у него уровень advanced и он аж 2 месяца в Англии жил
Аноним 10/07/26 Птн 13:35:52 #135 №1649492 
>>1649485
>>1649489
Благодарю. В который раз убеждаюсь, что лучше в треде какие-то спорные моменты уточнять, а не верить на слово ИИшке даже корпам.
Аноним 10/07/26 Птн 13:37:01 #136 №1649493 
>>1649473
D P O
P
O
Аноним 10/07/26 Птн 13:45:15 #137 №1649498 
>>1649465
>Так я не додумываю, я напрямую визуализирую прочитанный текст.
Напрямую визуализировать можно только если ты знаешь иностранный язык как родной, во всех остальных случаях ты понимаешь посыл и образы а потом, в своей голове, делаешь перевод, попутно связывая всё в единую картину, приводя в привычный стиль и т.д. Думаешь то ты на русском и визуализируешь на нём же. На русском ты так не можешь, потому, что знаешь его достаточно хорошо, чтобы тебя коробило от кривых формулировок. Если ты перейдёшь на язык который знаешь ещё хуже, то будешь понимать ещё меньше и соответственно больше додумывать сглаживая все огрехи, чтобы сложить общую картину.
>По твоей же логике я могу точно также сказать - нахуя читать переведенный слоп на русском, если можно читать его в оригинале?
Потому, что он на русском и тебе не нужно тратить силы на перевод.
Аноним 10/07/26 Птн 13:48:49 #138 №1649501 
Ёбика настолько корёбит, что он не осилил английский/кто-то смеет играть на англюсике/модели перформят лучше на англюсике (нужно подчеркнуть), что он регулярно высирается в тред и устраивает срачи. Друг переводчик, непомерные силы на перевод, да и вон судя по посту нонейма итт никто не знает английского!!!

Может хватит кормить долбоёба?
Аноним 10/07/26 Птн 13:51:20 #139 №1649502 
>>1649498
>Напрямую визуализировать можно только если ты знаешь иностранный язык как родной
Опа, экспертное мнение подошло. То есть по твоему чтобы визуализировать ту же hairless pussy мне сначала нужно перевести hairless, понять что это безволосая, потом pussy, понять что это киска, потом сложить всё это вместе и только потом представить, как могла бы выглядеть безволосая киска? Ну, если в твоей голове это работает так и ты не можешь привязать слово напрямую к смыслу и тебе нужно проводить всю эту махинацию в голове каждый раз - тогда я не буду спорить. Это уже какие-то заболевание.
Аноним 10/07/26 Птн 13:52:23 #140 №1649503 
>>1649498
> Потому, что он на русском и тебе не нужно тратить силы на перевод.
Буквально всё наоборот.
На русском чуть ли не по слогам читаешь, вдумываешься, потому что лоботомитная локалка может абсолютно внезапно выдать безмозг и тебя заклинит, расслабляться нельзя. Даже на корпах так. Это тебе не англюсик где ошибки есть в 1% свайпах только из за хуевых сэмплеров, либо кванта, т.е обычно их совсем нет и читаешь на расслабоне.
Аноним 10/07/26 Птн 13:54:48 #141 №1649507 
>>1649501
> Может хватит кормить долбоёба?

Тогда заааачем мы здесь, сегодня, сооообрались.
Аноним 10/07/26 Птн 13:55:56 #142 №1649509 
>>1649502
> hairless pussy
С как пусси вообще может быть хайрлесс? Или у бармена под пусси подразумевается вся лобковая зона?
Аноним 10/07/26 Птн 13:58:57 #143 №1649512 
image
>>1649501
>судя по посту нонейма итт никто не знает английского
Да знаете, знаете. Буквально как на втором родном разговариваете. Сны на английском снятся. Не трясись ты так, англичанин.
Аноним 10/07/26 Птн 14:01:45 #144 №1649514 
>>1649512
Работа вынудила знать, плюс образование. Не все столь скудоумны как Вы, дорогой товарищ. Не удивлюсь, что ты и русского то нормального не знаешь, учитывая насколько рьяно с мельницами боришься.
Аноним 10/07/26 Птн 14:02:59 #145 №1649517 
>>1649509
Не знаю, все сетки пусси воспринимают по разному. Где-то они так описывают всю промежность, где-то вульву, где-то вход во влагалище.
Аноним 10/07/26 Птн 14:09:33 #146 №1649520 
image.png
>>1649512
Кому и что пытаешься доказать? Возвращаю тебе твою клоунессу. Раньше постоянно устраивал срачи за Кобольда, теперь за русик. Действительно, умом не обезображен.

Итт сабж имеет порог входа по железу и знаниям, потому неудивительно, что тут есть хорошо знающие английский. Многие из ит бекграунда происходят или просто энтузиасты, раньше не было другого способа, кроме как на английском это все изучать. Что до ролевок, я как минимум видел и уважаю логи чайный клуб-анона, там было несколько десятков тыщ токенов на прекрасном английском с большими инпутами. А ты генеришь только помои. Яблоко от яблони, как грится.
Аноним 10/07/26 Птн 14:13:15 #147 №1649522 
>>1649520
>я как минимум видел и уважаю логи чайный клуб-анона, там было несколько десятков тыщ токенов на прекрасном английском с большими инпутами
То были имперсонейт ответы т.е сама нейронка их и писала
Аноним 10/07/26 Птн 14:14:28 #148 №1649524 
>>1649512
>Сны на английском снятся
Всегда потешно наблюдать за аргументами восьмиклассников по типу "Дышите воздухом, да? Знаете кто еще дышал воздухом? Гитлер!"
Аноним 10/07/26 Птн 14:14:57 #149 №1649525 
>>1649522
По слогу, стилю и опечаткам видно было, что нет. Продолжай свой марафон "никто не знает англюсик", даж интересно чё надумаешь дальше.
Аноним 10/07/26 Птн 14:16:53 #150 №1649528 
>>1649525
>По слогу, стилю и опечаткам видно было, что нет.
Читай как работает имперсонейт. Нейронка подстраивается под стиль письма и ошибки. Будешь защищать того анона дальше - буду считать что это ты и есть. Очень тупо с твоей стороны.
Аноним 10/07/26 Птн 14:18:19 #151 №1649530 
>>1648665 (OP)
Имхо сейчас для кума и разговорчиков топ это гемма 4 31b и ее различные файнтюны и вариации от llmfan46 и mradermacher

Для кодинга и агентских задач топ это qwen3.6-27b-mtp, гоняю его через Hermes Desktop - это тупо кайф. Я почти перестал что-либо делать на пк вручную, просто даю ему команды голосом пойди туда сделай это. И всё это локально на видеокарте без баренских гойских подписок.
Аноним 10/07/26 Птн 14:18:49 #152 №1649531 
>>1649520
>Кому и что пытаешься доказать?
Вообще ничего. Просто рофлирую с тех, кто воспринимает шуточную дискуссию всерьёз. Кобольдосрачи и англюсикосрачи - святая традиция треда, понимать надо. Клоунесса действительно моя, постил ее ранее в этом итт. Мочератор вообще не палится, huh.
Аноним 10/07/26 Птн 14:23:01 #153 №1649536 
>>1649528
>Нейронка подстраивается под стиль письма и ошибки
Так откуда там взяться ошибкам если всё генерила сама нейронка? Не говоря уже о том что стиль письма юзера она повторить не могёт. Если это не Фейбл, конечно.
>Будешь защищать того анона дальше - буду считать что это ты и есть
Аааа, нинада! Пощади! Жду дальше твои надуманные пуки, составим всем тредом манускрипт "1001 причина почему ты не знаешь английского". Возможно, даже на английском и напишем.
Аноним 10/07/26 Птн 14:23:18 #154 №1649537 
>>1649503
>Это тебе не англюсик где ошибки есть в 1% свайпах только из за хуевых сэмплеров, либо кванта, т.е обычно их совсем нет и читаешь на расслабоне.
Или они не бросаются тебе в глаза так как на русском.
>>1649501
>Ёбика настолько корёбит, что он не осилил английский
Да я -то как раз осилил и прекрасно вижу весь слоп который ты пропускаешь. И как человек для которого одинаково криво и на русском и на английском, я искренне не понимаю зачем мне играть на английском.
>>1649502
> То есть по твоему чтобы визуализировать ту же hairless pussy мне сначала нужно перевести hairless, понять что это безволосая, потом pussy, понять что это киска, потом сложить всё это вместе и только потом представить, как могла бы выглядеть безволосая киска?
Не совсем. Ты читаешь hairless pussy, анализируешь, понимаешь смысли, переводя его на основной язык, потому что на другом ты думать не можешь,, а потом связываешь его с уже существующим у тебя образом.
>Ну, если в твоей голове это работает так и ты не можешь привязать слово напрямую к смыслу и тебе нужно проводить всю эту махинацию в голове каждый раз - тогда я не буду спорить.
А у тебя в голове существует 100500 безволосых кисок? Для каждого языка своя? Или всё таки одна, универсальная, к которой ты и привязываешь все названия?
Аноним 10/07/26 Птн 14:32:06 #155 №1649550 
>>1649530
Гемма, гемма, гемма, гемма, гемма, квен, гемма.

И всего один отзыв на 3 MiniMax, 1 на ГигаЧат и то без скринов. 1 на дипсикфлеш.
Грустно и не вкусно.
Аноним 10/07/26 Птн 14:32:53 #156 №1649551 
>>1649537
>прекрасно вижу весь слоп который ты пропускаешь
inb4 про слоп речи не было вообще и он абсолютно так же есть и на русике. Дугинский не лечится походу
Аноним 10/07/26 Птн 14:33:18 #157 №1649553 
>>1649537
>потом связываешь его с уже существующим у тебя образом
Именно. Вот только образ не привязан к языку. Образ лысой пизды остается образом лысой пизды вне зависимости от количества языков, которые на него ссылаются.
Аноним 10/07/26 Птн 14:41:32 #158 №1649557 
fucking-hell.png
>>1649530
> для кума
> топ это гемма 4 31b
Не знаю, блядь. Мне её даже ебать впадлу. Хочеться просто встать на балкон с сигареткой и смотреть на ебучий пейзаж ВСЖ с лицом фасолины. Она... слишком. Может и прав был тот анон, что советовал обрезаную MOE для кума.
Аноним 10/07/26 Птн 14:45:58 #159 №1649560 
>>1649520
> раньше не было другого способа, кроме как на английском это все изучать
Да и сейчас, огромнейший культурный пласт и просто развлекательный контент доступен только на английском. Всякая азиатчина на него худо бедно переводится, а на ру - тяжко. Технические вещи все на нем.
>>1649550
> на 3 MiniMax
Кернелей для пролетариата не завезли
> 1 на ГигаЧат
Он большой и квантов не завезли. Чтобы вместить фп8 нужно патчить kt, что осложнено и нужно побороть лень. Учитывая что там лагуна и hy3 лежат в очереди, не факт что это будет скоро.
> 1 на дипсикфлеш
По нему много отзывов как раз, на разных бэках и на разных квантах.
Аноним 10/07/26 Птн 14:46:56 #160 №1649561 
>>1649550
>всего один отзыв на 3 MiniMax, 1 на ГигаЧат и то без скринов. 1 на дипсикфлеш
Что только подтверждает, что большая часть треда сидит с 32-48 гигами суммарной памяти и эти модели почти некому тестировать.
Аноним 10/07/26 Птн 14:49:02 #161 №1649566 
>>1649560
>>1649561
Всё проще. Я уже неделю хочу актуализировать список моделей. Но есть проблема: список с отзывами тредовичков.

Но вы нихуя не пишите. Вообще нихуя по моделькам. Я не хочу упражняться в словоблудии и придумывать отзывы на модели которые я даже не запускал.
Аноним 10/07/26 Птн 15:03:01 #162 №1649575 
>>1649560
>развлекательный контент доступен только на английском
Ютуб постепенно внедряет нейродубляж в иностранные ролики. Пока результат херовенький, но оно всегда так (вспоминаем первые картиночные нейронки/ллм). Дальше будет лучше и лучше. На реддиты всякие тоже скоро кнопочку перевода завезут.

>Технические вещи все на нем
Это как раз наименьшая из проблем. Технический текст - не художественный, тут с переводом любая более-менее вменяемая нейронка справится. Квена 27b или бесплатных корпов за глаза хватит. Не только переведут, но и сделают выжимку, разжуют непонятные вещи.

Те кто не знают иностранных языков и не хотят их учить, живут в лучшее время, воистину.
Аноним 10/07/26 Птн 15:03:48 #163 №1649576 
>>1649560
>Кернелей для пролетариата не завезли
Есть ггуф от анслота,можно в лламе запустить. И он даже работает
>Он большой и квантов не завезли.
Есть ггуфы от сбера и pr от них же для лламы.
Аноним 10/07/26 Птн 15:05:37 #164 №1649577 
>>1649566
> Я уже неделю хочу актуализировать список моделей
Это не так сложно. Достаточно просто вести лог, когда какая модель вышла (и желательно получила поддержку в Лламе, ибо на ней почти все и сидят), с самыми актуальными вверху списка.
> Но есть проблема: список с отзывами тредовичков.
Все проще, отзывы не нужны. Все субъективно, и они могут отпугнуть от некоторых моделей тех, кто про них ничего не знает. Нужно наоборот мотивировать самому их качать и проверять, это куда более ценно.
> Но вы нихуя не пишите. Вообще нихуя по моделькам
Писал подробнейшие отзывы по Гемме, Мимо, по Степ Флешу 3.7, по Дипсику Флеш, по Квену 122 для техзадач и ассистентства, даже с экспериментом в Годоте. И ничего из этого не нужно никуда помещать. К тому же, если все разжевать - то и обсуждений в треде никаких не будет, а только срачи, как выше.
Аноним 10/07/26 Птн 15:07:05 #165 №1649579 
>>1649575
>только переведут, но и сделают выжимку, разжуют непонятные вещи
Перевод и объяснение это разные вещи. Второе гораздо сложнее и тут нужно высокое владение языком. Хотя сейчас и банальный перевод тоже часто через жопу происходит, особенно когда сфера кишит специфичной терминологией.
Аноним 10/07/26 Птн 15:10:11 #166 №1649581 
А чё по гемме на нашем старом exl3?
Помнит кто?
Аноним 10/07/26 Птн 15:12:21 #167 №1649582 
>>1649581
На Ампере и Аде (30хх, 40хх) по-прежнему все печально и, видимо, ситуация лучше уже не станет. Думаю, для большинства в треде это красный флаг. tg меньше на ~10%, pp и того больше, около 20% разница при одинаковом батче. Возможно, за счет MTP удастся выиграть, там немного отличная имплементация. Кажется, лучше работает на Квенах, чем в Лламе.
Аноним 10/07/26 Птн 15:17:15 #168 №1649585 
>>1649582
>На Ампере и Аде (30хх, 40хх)
А чё уже и 4090 устарела?
Какую на этот раз причину придумали? Что там ещё инженеры забыли добавить что есть в 5090
Аноним 10/07/26 Птн 15:17:56 #169 №1649586 
>>1649566
Ну, в ближайшие дни гигачат и те две распердолю наверно, но на многое не рассчитывай. По дипсику вроде понятно что умница, но из-за реализации в лламе и квантов могут быть нюансы. Учитывая что большинство будет именно так запускать обязательно отметить. Или наоборот написать что он проблемный, но ходят слухи в других беках он работает хорошо.
Анализируя код, ллм локализовала источники отличий, по крайней мере для двух из них можно сделать относительно простые фиксы.
>>1649576
> Есть ггуф
Вроде как в гигачате явных проблем не ожидается, но там нахуевертили микс из архитектур, ошибиться легко, пр еще допиливают. В минимакс веры еще меньше, прошлые версии никогда нормально не работали, новое MSA только адаптируют.
Аноним 10/07/26 Птн 15:24:35 #170 №1649590 
изображение.png
Кто там пиздел что гайд сгенирирован ллмкой ?
Вон что нашел. Автор иди чисти вилкой.
Аноним 10/07/26 Птн 15:32:39 #171 №1649599 
image.png
Ебать лоботомитище...
Гемма 31б 5 квант кста
Аноним 10/07/26 Птн 15:34:15 #172 №1649601 
>>1649530
>различные файнтюны и вариации
Можно поподробнее? Что самое лучшее из тюнов?
Аноним 10/07/26 Птн 15:49:08 #173 №1649612 
>>1649599
Включи ризонинг и добавь инструкцию на фикс окончаний перед ответом
Аноним 10/07/26 Птн 16:00:16 #174 №1649614 
>>1649550
> И всего один отзыв на 3 MiniMax, 1 на ГигаЧат и то без скринов. 1 на дипсикфлеш.
Так очевидно что мелкие модели будут более массовые чем крупные. Если MoE гемму/квен можно запустить на обычном железе с 32+8/16, Dense 27B/31B на обычном железе но чуть помощнее (32+24/32), то под минимаксы, гигачаты и дипсики уже нужно очень специфическое железо (да, 96GB RAM - специфическое железо).
Аноним 10/07/26 Птн 16:12:13 #175 №1649623 
image.png
Кажется я чувствую, аноны, это оно, то самое погружение в истинно русский, славянский рп
Аноним 10/07/26 Птн 16:30:58 #176 №1649637 
>>1649623
> в истинно русский, славянский зумерский рп
FTFY
Аноним 10/07/26 Птн 16:32:49 #177 №1649640 
>>1649363
>и вообще ДУМАЮТ НА АНГЛИЙСКОМ. Каждый раз в голосину.
Чел, с "думать на английском", правильнописание в комплект не входит. :)
Это разные скиллы. Думать на другом языке - это лишь значит, что ты не будешь тратить кучу усилий на "внутренний перевод" и читать тебе будет комфортно. И ты сможешь боле-менее легко говорить/писать. А вот насколько правильно - это совершенно отдельный разговор.
(мимокрок)

>>1649509
С как пусси вообще может быть хайрлесс? Или у бармена под пусси подразумевается вся лобковая зона?
Вобще-то - да. Если притягивать аналогию слова из русского - ближе всего по значению и использованию будет "мохнатка", в том самом смысле. :)
Аноним 10/07/26 Птн 16:50:14 #178 №1649651 
>>1649509
>С как пусси вообще может быть хайрлесс?
Также, как она может быть хэйри. Волосы на внешних губах это не такая уж и редкость. Хотя они не настолько густые, как на лобке. Мерзость для куни, хотя есть любители...

Хайрлесс пусси = платина. Точно так же, как и более жидкая и привлекательная смазка, а не слизь которая тянется и комкуется как водянистая сопля.
Аноним 10/07/26 Птн 17:29:35 #179 №1649673 
>>1649651
Внимание, в треде сомелье!
Аноним 10/07/26 Птн 17:35:33 #180 №1649678 
>>1649651
У меня в спальне дрыхнет обладательница хайрлесс пусси. Я знаю как выглядит женщина. Все таки под мохнаткой понимают лобковую зону, а те пара волосков в районе половых губ, можно в расчет не брать.
Чё я вообще, блять, в нейраче обсуждаю. Воистину тред сейчас под звездой Нургла.
Аноним 10/07/26 Птн 17:38:39 #181 №1649683 
>>1649550
>MiniMax
Какая-то заминка в лламе ццп (как обычно), лежит ждёт

>ГигаЧат
Никто не делает третий квант, как только так сразу

>дипсик флеш
Уже несколько человек сказали что пушка, соглашусь в версию доставшуюся мне явно переродился дух эпштейна

Алсо степ3.7 тоже до сих пор сломан во всех квантах кроме бф16. Все высирают открытые веса и ебитесь как хотите, кроме гугла никто не выделяет прогера от компании на day one поддержку высранного
Аноним 10/07/26 Птн 17:43:26 #182 №1649688 
b63oWugfKCkBJGCMPkxoveXMyj1XPljSSXBshsKCc8daD-NA6PeaDIQXa6AK2zzlTBTP5n9UM2G19BWy1I-IUquX.jpg
>>1649651
>платина
Короткий, гладкий и густой чёрный волосяной покров
Аноним 10/07/26 Птн 18:04:28 #183 №1649704 
>>1649683
>Алсо степ3.7 тоже до сих пор сломан во всех квантах кроме бф16.
Да блин, я им хотел обмазаться.
Аноним 10/07/26 Птн 18:06:10 #184 №1649705 
Как же хуево работают сейчас фришные Дипсик и Гемини (или что там у гугла в режиме ИИ). Галлюны на ровном месте, контекст не держат дольше двух респонсов, противоречат сами в себе в рамках одного аутпута.
>>1649704
Это неправда. Даже Q4 работает замечательно, даже в опенкоде и на большом контексте. В рп не тестил, не интересно.
Аноним 10/07/26 Птн 18:10:37 #185 №1649711 
>>1649560
>>1649577
>>1649586
Готово. Добавил в https://rentry.co/2ch_llm_moe_2026
Линейку вебквенов, Дипсик Флеш, Step 2.7, Minimax3 и за каким то хуем новую Kimi и мистраль медиум.

Буду благодарен если скинете с кратким мнением какие нибудь тюны или мерджи что используете. Мало ли, может что вышло интересное. На ту же гемму 4 можно и добавить.

Как по Гигачату будет инфа и допилю её.

>>1649686
nya ha ha, помнит.
Конечно хорошо что не всех старых тредовичков смыло, но ты всё так-же экономишь на точках, мой любимый шизяра.
Аноним 10/07/26 Птн 18:11:01 #186 №1649712 
>>1649678
>У меня в спальне дрыхнет обладательница безволосой мохнатки
Твоя дочь, надеюсь?
В ином случае, как мне кажется, было бы уместнее использовать shaved pussy
Аноним 10/07/26 Птн 18:13:05 #187 №1649716 
> Deep thanks to the anonymous from the /llama/ thread on 2ch who made this rescue possible.
ХТООООА?!!!!!!11

Поделитесь парочкой лорбуков, пжлалуйста? Те, о которых помнит только кэш гугла, но НИПУСКАЕТ зараза.
Аноним 10/07/26 Птн 18:13:58 #188 №1649719 
>>1649716
>Deep thanks to the anonymous from the /llama/ thread on 2ch who made this rescue possible.
Каво
Аноним 10/07/26 Птн 18:15:14 #189 №1649721 
>>1649719
Сам, бля, спроси у него: https://gottasaveemall.github.io/about

Там есть пара лорбуков с ЧОРНОЙ pngшкой, без возможности скачать. А я хочу. For science!
Аноним 10/07/26 Птн 18:16:27 #190 №1649722 
>>1649721
А, это он про анона который тут постил удаленные карточки с чуба. Видимо заскрапил их как-то. Здорово
Аноним 10/07/26 Птн 18:22:23 #191 №1649726 
А, харэ, что-то происходило либо с моим ебалом, либо с ебалом бэкэнда. Починилось.
Аноним 10/07/26 Птн 18:32:09 #192 №1649738 
>>1649711
> новую Kimi
2.7 нужно отметить отдельно. 2.5-2.6 - чисто кодоунитазы, в рп они пытаются, стараются что-то отвечать, но представляют мало интереса. Они умные и крутые, но уровень ролплея и эмоционального интеллекта как у gpt-oss. Вот 2.7 - совсем на другом уровне, мало того что умнее прошлых, так еще умеет красиво писать, показывая невероятную проницательность и точность как ее не нагружай. Зайдет как любителям переусложненного с точки зрения сюжета и душного рп, так и простым инджоером. Именно в точности и осведомленности ее главное преимущество, тут не то что двойные трусы, можно 150к токенов назад заложить какую-то мелочь и наткнуться на нее когда будет уместна, или развлекаться по-разному зажимая чара в локациях и наблюдать как описывает обнимашки и еблю в невероятных позах с учетом всего, включая особенности комплекции легального персонажа.
Результатам способствует неотключаемый ризонинг где модель по пунктам планирует ответ, но в большинстве случаев он не превышает 100-200 токенов и не доставляет неудобств.
Есть и минусы: русский по стилю средний, без префилла/манипуляций с нелегальными канни и рядом тем хардрефьюз.
Аноним 10/07/26 Птн 18:34:19 #193 №1649740 
>>1649726
А! Когда открываешь "В новой вкладке", ему становится плохо и он блочит кнопку. Если честно, мне оч сильно поебать на эту систему защиты: хочет автор, чтобы кликали "далее" + "назад в каталог", могу и потыкать.
Аноним 10/07/26 Птн 18:35:06 #194 №1649741 
>>1649738
Ты вероятно единственный, кто ее запускает локально (даже в этом сомнения). В чем ценность, ради кого пишется?
Аноним 10/07/26 Птн 18:39:08 #195 №1649743 
>>1649741
А почему нет? Авось еще найдется 1.5 землекопа что запустят. Анон высказался. За что ему щекочем за ушком.
Аноним 10/07/26 Птн 18:43:01 #196 №1649746 
>>1649738
Она довольно смешно пишет неформально от лица анона, наверно топ1 претендент на нейробитарда. Н-ворда не избегает. Но это на английском. Грок лучше но не локал
Аноним 10/07/26 Птн 18:52:04 #197 №1649752 
>>1649585
>Что там ещё инженеры забыли добавить что есть в 5090
В 5090 тоже не весь блеквел довложили, FA3 не полностью пашет.
Аноним 10/07/26 Птн 19:00:15 #198 №1649758 
>>1649721
Этот сайт сделал анон из нашего треда >>1614429 →, залив мой архив спасенных чубокарточек на облако и насколько я знаю, отцензурировав часть.
Изначальный архив еще онлайн >>1633282 → , можешь скачать.
Аноним 10/07/26 Птн 19:10:04 #199 №1649767 
>>1649711
Несколько комментариев по списку:
1. В разделе с Кими оставить только 2.7, остальные уже мусор и для рп и для кода
2. В разделе с глм какая-то каша, что за 355 глм 5? Я что-то пропустил? Сам глм 5.0 устарел уже после выхода 5.1 и 5.2 и его можно убрать, новые версии это ровно он, только лучше. В РП ГЛМ может, но только на английском, русский у него не очень хороший
3. В разделе в квенами, имхо, нужно убрать квен кодер, он уже сто лет как не актуален, и древние 30b.
4. В большом мистрале нет цензуры и кум тюны ему не нужны, он и так тупая хорни шлюха.
Аноним 10/07/26 Птн 19:12:56 #200 №1649769 
>>1649767
5. Мало сказано про эир, что он ебёт всё до 355б если у вас есть рам, в т.ч и гемму. Тут вообще мнение что раз он старый то ненужный
Аноним 10/07/26 Птн 19:22:07 #201 №1649774 
>>1649769
Как человек который дефал тут эйр до последнего, скажу, что нет. Он сливает не то что плотной гемме, но даже моэ-лоботомиту в восьмом кванте. Сэд бат тру. Отпусти уже старичка, дай ему умереть спокойно.
Аноним 10/07/26 Птн 19:24:34 #202 №1649776 
>>1649774
Тот самый знаменитый слив... По тесту русика
Аноним 10/07/26 Птн 19:28:55 #203 №1649780 
>>1649767
>>1649738
Done!
Аноним 10/07/26 Птн 19:39:10 #204 №1649789 
>>1649780
По русски пиши. Ты в русском треде, а не на форчане.
Аноним 10/07/26 Птн 19:41:07 #205 №1649791 
>>1649758
> и насколько я знаю, отцензурировав часть.
Там отцензурированы только часть портретов (explicit и часть questionable), чтобы не намотаться на бан от гитхаба/обниморды. Сам контент не цензурировался:
> У ~3к карточек из 22.5к картинка заменена на заглушку-аватарку, чтобы не было проблем с хостингом. Мета внутри PNG сохранена - карточка импортируется и работает как обычно, описания/лорбуки и остальное не тронуты. Нужен оригинал картинки - берите из полного архива анона выше.
Аноним 10/07/26 Птн 19:45:19 #206 №1649796 
>>1649774
Хорошая моделька была. Действительно хорошая. В меру умная, говорливая, в меру хорни. И на том можно сказать Z.ai спасибо.
Аноним 10/07/26 Птн 19:50:09 #207 №1649802 
>>1649796
>>1649774
Идите в ЖОПУ🖕
Аноним 10/07/26 Птн 19:50:33 #208 №1649803 
>>1649796
Да, ты тоже весьма говорливый пиздабол. Заебал уже
Аноним 10/07/26 Птн 19:53:09 #209 №1649804 
IMG4536.gif
>>1649802
Лёд приложи, легче станет.
Аноним 10/07/26 Птн 20:13:05 #210 №1649816 
Ивент для тредиса: кто первый скинет качественную карточку, норм сиспромпт и желаемую роль юзера в сценарии, я отыгрываю 20к на не урезанном Дипсике в Жоре 20к контекста и кидаю логи. Предложение действует до полуночи по мск, но есть подозрение, что все пройдут мимо.
Аноним 10/07/26 Птн 20:14:14 #211 №1649817 
>>1649738
> без префилла/манипуляций с нелегальными канни и рядом тем хардрефьюз.
Странно, у меня в промпте было только указано, что непристойные, жестокие, морально тяжелые темы разрешены, пиши в стиле Джорджа Мартина, и проблем с сексом с тринадцатилетней умственно неполноценной малолеткой не возникало.
Или это я на 2.6 играл.
Аноним 10/07/26 Птн 20:24:29 #212 №1649825 
>>1649767
Мистрали 3.5 и 4 можно вообще не упоминать. Максимально средненькая проза, всё остальное по нулям.
Аноним 10/07/26 Птн 20:26:03 #213 №1649826 
14335346593405.jpg
>>1649825
Да ты охуел.
Аноним 10/07/26 Птн 20:49:52 #214 №1649843 
>>1649817
Хуя ты мерзость отыгрываешь. Наверно ещё и душ не принимаешь неделями
Аноним 10/07/26 Птн 20:54:15 #215 №1649846 
>>1649843
Это ты ещё местного любителя пролапсов не встречал. Повезло тебе.
Аноним 10/07/26 Птн 20:55:21 #216 №1649847 
>>1649767
> 4.
Два чую
>>1649817
Может там хватает минимальных жб. Без него если там чар дофига невинный - рефьюзит и описывает что конкретно не понравилось I can't continue this roleplay. The scenario involves explicit sexual content with a character described as having a "child appearance," "petite body," being "137 cm," "enough y.o.," and "child-like"—which constitutes sexual content involving a minor.
А если ментально зрелая, с доками, но дрищавая - ноль вопросов, хотя другие модельки на такое триггерятся.
Аноним 10/07/26 Птн 20:59:59 #217 №1649853 
>>1649846
Он разве не из aicg?
Аноним 10/07/26 Птн 21:03:21 #218 №1649856 
>>1649853
Забредает сюда периодически, делится охуительными скринами.
Аноним 10/07/26 Птн 21:22:15 #219 №1649863 
>>1649826
Yaplakal
Ржомба
Аноним 10/07/26 Птн 21:23:39 #220 №1649864 
>>1649863
Якакал легендарный сайт. Мы не ценили его, пока он был.
Аноним 10/07/26 Птн 21:26:44 #221 №1649868 
>>1649863
Ну какой пик нашел. Шито поделать ~desu
Аноним 10/07/26 Птн 21:29:12 #222 №1649870 
>>1649347
>12b
оукей, гляну.
>Нету. Можешь потыкать Квен 3.6 35b, он тоже МоЕ и не сильно больше, но на любителя. Ещё есть куча тюнов разной паршивости как Геммы, так и Квена. Больше ничего нового не выходило из маленьких моделей, всё новое сплошняком для обладателей 256гб+ RAM онли.
хорошо, спасибо за ответ. Квен пробовал ещё до геммы, и вправду такое себе.
Алсо, кто-то пробовал прикручивать ко всему этому нейронку для генерации пикч? Есть ли смысл вообще играться?
Аноним 10/07/26 Птн 21:29:13 #223 №1649871 
20250614020315.jpg
>>1649826
Ну а как? Я как апгрейднул риг среди первых его на закачку поставил, думал ща вин из 2024го типа 2407 или 2411 помноженый на ум будет, обкончаюсь. А меня встретил слоп с кучей стандартных геммизмов.
Ну, типа, он конечно лучше геммы, и претендент в 128гб риг просто потому что в этот размер особо ничего больше нет пока степ не доработают и не релизнется дипсик с нормально квантуемыми фы16 весамиcopium
Хоть цензуры мало из коробки
Их сейчас еще по авторским правам маринуют, так что дальше лучше не будет, а скорее нвоборот, падение до уровня большого майкрософт фи
Аноним 10/07/26 Птн 21:31:11 #224 №1649872 
2075463315778908651.mp4
Наше недалёкое будущее, ананасы. Сечас чатимся с текстовыми тяночками, а совсем скоро будем будем по видео в реальном времени. Прикиньте, вместо простыни текста нам буквально кино будут показывать. В какое же охуительное время мы живём, как же нам повезло.

На видео Wan Streamer. 640×368, 25 FPS, полностью реалтайм генерация. Модель одновременно “видит”, “слышит”, “думает”, говорит и генерирует видео в режиме стрима.
Аноним 10/07/26 Птн 21:36:14 #225 №1649875 
>>1649871
> думал ща вин из 2024го типа 2407 или 2411 помноженый на ум будет, обкончаюсь
Так это он и есть, всегда был слоповым. Отвечает ведь в целом приятно, если под него подстроиться то можно интенсивно инджоить.
>>1649872
С каким-нибудь витубером или анимцом есть? Брат интересуется
И когда там уже каштомные робомейды чтобы приносила чай, а потом можно было обнимать и мять хвост?
Аноним 10/07/26 Птн 21:37:18 #226 №1649878 
>>1649872
>а совсем скоро будем будем по видео в реальном времени
Не будем, хуйня без задач. Даже голосом никто не пользуется.
Аноним 10/07/26 Птн 21:37:39 #227 №1649879 
>>1649871
Да, она говно. Но тут такое дело: мистраль, как твой старый кореш. Вы много времени провели вместе, а потом разъехались. И вот ты встречаешь старого друга, а он объебанный наркоман, где от старого человека осталось только имя. Так и с мистраль.
Аноним 10/07/26 Птн 21:50:31 #228 №1649888 
>>1649875
С собакой есть. Пойдёт? Тут много примеров. https://wan-streamer.com/v0.2/

>>1649878
Голосом и вебкой пользоваться не обязательно же. Суть в том, что наш ролплей может перейти на новый уровень: вместо текстового аутпута, ты будешь наблюдать то что выдаст нейронка по видео, в риалтайме. Чайный клуб наверняка оценит, лол. То что было условно "интерактивной книгой" может стать "интерактивным кино". Технология есть уже сейчас, но развивать и допиливать много чего нужно.
Аноним 10/07/26 Птн 22:04:09 #229 №1649904 
>>1649888
На последних секундах прям любимый ассистентослоп, теперь в рилтайм луп анимации из 6 кадров. Ееее
Аноним 10/07/26 Птн 22:06:13 #230 №1649908 
>>1649888
Ну это зачатки и всё всратенько. Ждём когда моделька по промпту\фотке будет стримить манямирок с вайфусами в VR гарнитуру с возможностью взаимодействия со всем окружающим. А пока насрано и проще развлекаться с текстом, догенеривая всё необходимое нейронкой которая в черепушке.
Аноним 10/07/26 Птн 22:09:09 #231 №1649911 
>>1649888
>То что было условно "интерактивной книгой" может стать "интерактивным кино".
Нет.
Прямо совсем нет.
Одно дело, когда у тебя под сущностью в виде гномика понимается достаточно абстрактный собеседник - т.е. просто видеозаглушка для ответов нейронки, от которой ты именно что ролеплея не ждёшь. Просто у тебя вместо буковов тяночка результаты начитывает.
И другое дело, когда у тебя конкретный ролеплей, где ты хотя бы в общих чертах имеешь планы куда он должен двигаться - тут будет жопа. При чтении текста у тебя визуализация в голове, соответственно дофига острых углов сглаживается, потому что ты знаешь, как то или иное должно выглядеть. А при просмотре видео - ты будешь видеть все косяки своими глазами.
При этом с текстом ты можешь отредактировать его сам, а с видео - так не прокатит.
Я раньше тоже думал "ух бля, сейчас (ну или через 10 лет) нейронки прокачаются и будет бесконечный видеоконтент, будем смотреть кроссовер "Гарри Поттер и Штурм Кадии" по кнопке Сделать Заебись и короткому промпту", но поиграв в ролеплей с текстовыми нейронками, погенерировав всякие картинки (и локально, и с корпами) понял, что нет.
Аноним 10/07/26 Птн 22:11:24 #232 №1649913 
>>1649816
Бамп. Два часа прошло, два часа осталось. Не найдется в треде любопытного глянуть как знакомые ему карточка и промпт работают на Дипсике? Или как с ними взаимодействует кто-то другой?
Аноним 10/07/26 Птн 22:14:14 #233 №1649918 
>>1649913
>как знакомые ему карточка и промпт работают на Дипсике
Для этого можно запустить сам дипкок и играться. Ты бы ещё консервных банок насобирал.
Вот с Кими я бы может быть посмотрел. Или с большой мистралью, ради интереса. Но дипсик то, 148гб MOE модельки?
Аноним 10/07/26 Птн 22:15:41 #234 №1649920 
>>1649918
Не все тут магнаты, много кто обладатель отсутствия по оперативе, вдруг им любопытно.
Аноним 10/07/26 Птн 22:17:14 #235 №1649922 
>>1649816
https://chub.ai/characters/minimum/Kumi почти Кими лол
> норм сиспромпт
Что-нибудь минималистичное, или что сам юзаешь
> желаемую роль юзера в сценарии
По настроению, только не совсем треш.
Аноним 10/07/26 Птн 22:20:37 #236 №1649927 
>>1649922
На каких моделях обычно сидишь? Если там то же самое по размерности или больше, то вряд ли интересно будет. Промпта у меня нет, могу наклепать что-нибудь по-быстрому. Вангую обладателя Кими или Жирноквена.
Аноним 10/07/26 Птн 22:20:41 #237 №1649928 
Аноны, а как реализовать арки?

Условно, у меня есть карточка детей, надо отыграть детство. Прям по этапам. И как реализовать переход с одного этапа на другой.
Условно в 6-9 лет бегаем жаб надуваем, потом с 9-15 школа и т.д.
Я знаю что я сам могу их начинать когда вздумается, но хотелось бы отдать это на откуп нейронке как нарратору.
Аноним 10/07/26 Птн 22:21:39 #238 №1649930 
>>1649913
Давай с Серафиной, в принципе знакомая всем карточка. Можешь ебануть нейронкой какойнить лорбук, аля "Роща анусовых лоз (тентаклевый лес разрывающий задницы хранительниц)" которая будет разрастаться кораптя лес и с этим что-то надо будет делать.
Аноним 10/07/26 Птн 22:25:10 #239 №1649933 
>>1649913
Не уверен насчет качественности что картошки, что пресета, но звучит интересно. Роль юзера там прописана, в плане характера и поведения можешь отыгрывать на свое усмотрение.
https://drive.proton.me/urls/CJ2T416VW8#3SpE40boK1Z4
Аноним 10/07/26 Птн 22:28:38 #240 №1649938 
>>1649933
Непоняв, почему карточка не прикрепилась.
https://litter.catbox.moe/g21xmvi56yytzn1i.png
Аноним 10/07/26 Птн 22:29:36 #241 №1649939 
>>1649911
Помню был смищной скриншот с реддита, где человек писал, мол в ближайшие десятилетия нейронки не смогут генерировать видео, это невозможно, картинки с 6 пальцами их предел. А спустя месяц клозедАи бахнули Сору, лол.

Не будь столь категоричен, анон. Вспомни с чего всё начиналось, и как быстро пришло к тому что имеем сейчас. Если бы тебе да и мне тоже, сказали 2-3 года назад, что совсем скоро будем запускать на телефоне локальные ЛЛМ которые умнее и лучше чем тогдашний чатгпт, мы б посмеялись, да? А сейчас Гемма e4b делает brrr, хе-хе.
Аноним 10/07/26 Птн 22:35:04 #242 №1649944 
>>1649933
>>1649938
Бля, да она с сюрпризом, а так все хорошо начиналось... Сорян, воспользуюсь легитимным обоснованием первенства ответа и пойду отыгрывать с присланной выше печальной Кемономими, пусть там и промпта нет.
Аноним 10/07/26 Птн 22:50:03 #243 №1649956 
>>1649927
Тогда лучше другим анонам помоги насчет сюрприза сам выбирай, но наверно еще кто-нибудь что-то интересное скинет
Аноним 10/07/26 Птн 22:52:11 #244 №1649957 
>>1649939
Тут должна быть картинка из xkcd с экстраполяцией графика потребления свадебных тортов, но мне лень заходить в гугл.
Да, прогресс нейронок збс - одно увеличение контекстного окна в дохуя раз чего стоит.
Но это же не отменяет того, что я сказал. Вот возьмём GPT-image-2. Хорошо, что у неё сильно больше знаний, а картиночки можно хоть в 4к генерировать. Но когда вместо абстрактного и распространённого становится нужно что-то конкретное - например тян из Azur Lane, или вот я пытался t2i сгенерировать картиночки для моего рп по Сидонии - она начинает срать под себя, даже если ебануть огромное структурированное описание сцены.
Т.е.для каждой сцены нужны референсы, просто потому что нужная инфа в датасете встречалась слишком мало. При этом видно, что она там есть - что-то отдалённо похожее на Стражей она нарисует, или вот знает, что скин-сьюты у пилотов с чёрными полосами и спасательной капсулой на спине в рикзаке. Но при этом яростно будет пытаться запихать в любые бортовые номера TS-...(это trainees, т.е. бортовые номера стажёров) и вообще ни ебёт, что там в кокпите, потому что кадров с кокпитом в аниме не очень много было.
При этом котиков или Аску рисует моё почтение.
Поэтому я не спорю с тем, что через N лет мы получим инструмент, который даст нам принципиальную возможность путём большого количества ёбли сделать то, что нам надо. Я спорю с тем, что это будет делаться по кнопке "Сделать заебись".
Аноним 10/07/26 Птн 23:02:40 #245 №1649969 
1749905143828.png
За 50к вроде норм выходит. Сам я пока не тестил
Аноним 10/07/26 Птн 23:14:09 #246 №1649976 
Ну че мне реально блять эир дропать?
Я нахуя 64 рам покупал? Аж за 8 тыщ?
Пиздец. И какая альтернатива, только гемма да квен 235. Обе слоп машины.
Аноним 10/07/26 Птн 23:26:22 #247 №1649980 
image.jpg
>Аж за 8 тыщ
Аноним 10/07/26 Птн 23:27:23 #248 №1649981 
>>1649957
> Я спорю с тем, что это будет делаться по кнопке "Сделать заебись".
Так ты не путай возрастание возможностей нейронок к анализу и генерации, и их способности к телепатии и ясновидению. :)
То что ты описывал, скорее всего будет решаться киданием нейронке ссылки на видео (или каталога с видео файлами) и приказом "Это референс, сделай как у персонажа Х".
Аноним 10/07/26 Птн 23:29:28 #249 №1649983 
>>1649976
>И какая альтернатива, только гемма да квен 235. Обе слоп машины.
Квен 3.6, разумеется.
Аноним 10/07/26 Птн 23:40:51 #250 №1649995 
>>1649981
А тут мы упираемся в то, что за следующие 10 лет нам надо совершить ебанистический скачок либо в локальных мощностях (потому как конца и края цензуре и борьбе за авторские права пока не видно, а значит хуй тебе, а не использование в качестве референсов того, что ими защищено - те же последние GPT ни рисовать в стиле мангака_нейм не хотят, ни даже промпты для картиночек писать с упоминанием их стиля отказываются, а дальше будет, вангую, нифига не лучше), либо какой-то охуенный прорыв, позволяющий вместить, например, 10 минут контекста со 100% вниманием в гигабайт видеопамяти, или там, например, впихивать по 1кк контекста без падения внимания в тот же гиг для текстовых нейронок, или увеличить pp/tg на порядок от текущих.
В общем чтобы хотя бы приблизиться к тому, что мы сейчас себе навоображали - нужен какой-то охуенный прорыв. Будет он или нет - хз. Но исходить из того, что он точно будет - такая себе стратегия.
Аноним 10/07/26 Птн 23:45:07 #251 №1649998 
>>1649995
> потому как конца и края цензуре и борьбе за авторские права пока не видно
Надежда на китайские модели которые вертели всю систему с авторскими правами на своих китайских болтах.
Аноним 10/07/26 Птн 23:57:18 #252 №1650006 
>>1649998
>китайские модели которые вертели всю систему с авторскими правами
Не только китайцы же. ОпенАи тоже вертели. Их сора спокойно генерировала передачи с Малышевой, камеры в пункты выдачах Вайлдберриз, ведущих новостей и т.д. Её обучали просто на всём до чего могли дотянуться, положив толстый и мясистый на все авторские права.

А то что сейчас гопота не хочет генерировать персонажей защищённых АП, как пишет >>1649995 это не значит что она не может. Скорее всего там просто на входе стоит какой-нибудь 8b-лоботомит, который анализирует промпт юзера и если видит "запрещёнку", то просто кидает заглушку "извините, я не могу выполнить ваш запрос кок-пок". До большой модели промпт даже не доходит.

И конкретно эта проблема сейчас актуальна и для китайцев. Тоже умеют и тоже фильтруют выдачу. Спасибо копирастам и сжв-выблядкам с твиттера.
Аноним 11/07/26 Суб 00:09:49 #253 №1650016 
>>1650006
Ну с американскими моделями проблема в том что их могут схватить за жопу. Антропики же кажется выплачивали пару миллиардов за то что их поймали на авторских правах с каким-то книгами.

И с Диснеем там у кого-то тоже проблемы были, кажется у ОпенАИ.

А что будет китайским компаниям если Дисней обнаружит у них в датасетах свой контент? Я сомневаюсь что им будет большое дело до этого.
Аноним 11/07/26 Суб 00:12:48 #254 №1650021 
>>1649995
>Будет он или нет - хз. Но исходить из того, что он точно будет - такая себе стратегия.
Скажи мне в 2010, что я смогу делать 10 секундное видео по картинке в пэйнте и тексту, а потом вставлять это в чат, где идет общение с текстовой моделью, которая рисует мне схематичную схему города. И я буду выбирать район, чтобы там попить кофе с персонажем построенным на моих личных фантазиях, я бы сказал что мне как минимум пиздят.
Аноним 11/07/26 Суб 00:14:11 #255 №1650022 
>>1650016
>А что будет китайским компаниям если Дисней обнаружит у них в датасетах свой контент?
Да просто нажалуются властям и их сервисы забанят в США, на самом платёжеспособном рынке планеты, всего-то.
Аноним 11/07/26 Суб 00:25:58 #256 №1650036 
>>1650022
Я не уверен что в США очень большая доля платных пользователей у китайских моделей, там все фапают на гпт, клауд и гемини.

И если бы таким способом можно было избавиться от конкурентов - китайские сервисы и модели (да и вообще компании не связанные с ИИ) уже давно были бы заблокированы под любым другим предлогом.

Да и как показывает практика, санкции, особенно в сторону Китая, лишь ускоряют его развитие. Вон попытались под санкции засунуть карты Нвидии - в итоге Дипсик теперь полностью на своих картах натренирован. Минус один рычаг давления, а конкурент при этом никуда не делся. Заблокируете китайские модели? Так это вообще полностью развяжет руки Китаю при обучении своих моделей, даже скрывать это всё не нужно будет.
Аноним 11/07/26 Суб 00:44:24 #257 №1650052 
А что случилось с llamacpp? там какой-то параметр для ризонинга добавили? запускаю qwen а ему передаётся
parser generation prompt: <|im_start|>assistant
<think>

</think>
при отправке через webui. в итоге он не думает.
Аноним 11/07/26 Суб 00:49:09 #258 №1650055 
Jeffrey Epstein knew too much.mp4
>>1650036
Можно провести аналогию с ЛЛМ. Китайцам совершенно не обязательно запрещать нейронкам генерировать слово ниггер или тейк что пола только два, а те кто считает что больше - умственно отсталые. Это больная тема для запада, а не для востока. Как и генерация ебли с каничками. У них-то там лоликон обычная нормальная тема, ничего предосудительного. А у западных левачков/сжв со всего этого жопы сгорают. Но ведь запрещают. Из недавнего - совершенно ебанутая цензура в ризонинге Квена.

А если видеогенераторы взять, то вот релизнули китайцы свой сидэнс - очень мощная и крутая модель, наверное лучшая сейчас. Изначально генерировала и диснеевских персонажей, и марвел и голливудских звёзд (видрил), всё что угодно. А потом ровные кабанчики из США набрали нужные циферки, и сидэнс, роняя кал, закрыл доступ к модели. Потом через какое-то время снова открыл, но уже полностью лоботомированной. Больше никакой "запрещёночки". Как грится думайте. Подписаться.
Аноним 11/07/26 Суб 01:18:29 #259 №1650076 
>>1650055
>Как и генерация ебли с каничками. У них-то там лоликон обычная нормальная тема, ничего предосудительного.
Чел, ты японию с китаем попутал. В китае и за обычную порнуху как минмиум серьезно присесть можно. Даже за домашнюю обнажонку жены пересланную мужу и попавшую случайно не в те руки.
Аноним 11/07/26 Суб 01:52:00 #260 №1650092 
>>1650052
Там месяц назад добавили переключатель ризонинга по кнопке рядом с полем ввода.
Аноним 11/07/26 Суб 02:04:19 #261 №1650093 
>>1650092
А... спасибо.
ебать спрятали. и по дефолту выключен. я думал может параметр забыл какой, или ещё чего.
Аноним 11/07/26 Суб 02:44:31 #262 №1650112 
>>1650076
Очень устаревшее понятие о Китае. В интернете просто дохуллиард домашней порнухи оттуда, на любой вкус. Вообще любой
Аноним 11/07/26 Суб 03:06:10 #263 №1650116 
>>1649758
FUKKEN MIRRORED!

Хотя у меня всегда проблемы с доступностью. Если моя копия вдруг окажется последней: пишите жирными буквами в шапке, что нужна цельная копия.

Алсо, ебал в рот феми/ЛГБТ/pdf провокаторов. Суки ебаные. Всё что угодно, лишь бы про Occupy Wall Street/We are the 99% не заикнулись снова.
Аноним 11/07/26 Суб 03:08:01 #264 №1650118 
>>1649922
Наиграл пока 15к. Ну, модель работает исправно и не ломается, это пока единственный вывод, который я могу сделать. Какого-то вау эффекта нет, хотя я и без особых ожиданий подошёл к Дипсику. Возможно, промпт не тот, инпуты не те, но как-то даже не особо и интересно получилось, чтобы постить. В сценарии 1х1 и обычном рп не сказать, что далеко от Геммы и Квена. Первые мысли такие.
А вообще вся задумка ради карточки, потому что у меня сейчас никакой, кроме Серафины, но протестить Дипсик было слегка любопытно. За карточку спасибо, прикольная по задумке.
Аноним 11/07/26 Суб 05:12:51 #265 №1650145 
>>1649976
>64 рам покупал? Аж за 8 тыщ?
Это где такие цены? В параллельной реальности?
Аноним 11/07/26 Суб 05:14:25 #266 №1650146 
>>1650145
Цены поползли в верх примерно спустя месяц после выхода Air. Если он успел в то окно, то вполне. Я взял 128гб за 40к.
Аноним 11/07/26 Суб 05:17:10 #267 №1650149 
>>1650145
Прошлым летом. Я тоже покупал 64Гб за ~8500 под эйр. Иронично, сука, что после эйра ничего толкового в этом размере так и не вышло и оперативка просто простаивает. Слишком много для лоботомитов, слишком мало для жирноты. Эх.
Аноним 11/07/26 Суб 05:57:02 #268 №1650153 
>>1650052
Вроде все работает как обычно.
Аноним 11/07/26 Суб 06:01:28 #269 №1650155 
изображение.png
>>1650112
>В интернете
Но не в китайском сегменте, заметь.
>>1650145
Для серверной б/у DDR4 с алишки это вполне себе нормальный ценник. Я бы даже сказал дорого, я вон 16х2 взял за 3400 Заказ от 16 июня 2023.
Аноним 11/07/26 Суб 07:05:10 #270 №1650170 
>>1650145
Я тоже прошлым летом сидел и думал, брать ли мне за ≈13к вторую пару 2х32 Kingston KF436C18BBK2/64 в дополнение к первой, купленной достаточно давно.
Решил, что почему бы и не взять, раз в материнку лезет? Больше памяти богу памяти!
А сейчас ровно эта же позиция у того же продавца 117к стоит, пиздец.
Аноним 11/07/26 Суб 07:25:49 #271 №1650173 
>>1650155
А она в обычную пеку полезет? Или только с серверной материнкой.
Аноним 11/07/26 Суб 08:04:36 #272 №1650180 
где можно найти qwen 27 или 35 у которых сняты все ограничения
раньше видел где-то, даже ссылки на hugging face были но чет там все потерли(
Аноним 11/07/26 Суб 08:20:02 #273 №1650181 
>>1650180
Только осторожно, эти модели очень опасные https://huggingface.co/HauhauCS/models#repos
Используй очень аккуратно
Аноним 11/07/26 Суб 08:30:11 #274 №1650183 
[email protected]
>>1650181
чем они опасны?!
Аноним 11/07/26 Суб 08:33:04 #275 №1650184 
>>1650180
https://huggingface.co/mradermacher/Qwen3.6-35B-A3B-abliterated-v2-i1-GGUF
https://huggingface.co/mradermacher/Qwen3.6-35B-A3B-abliterated-v2-GGUF
https://huggingface.co/wangzhang/Qwen3.6-35B-A3B-abliterated-GGUF
Аноним 11/07/26 Суб 08:47:16 #276 №1650187 
>>1650183
>чем они опасны?!
Можно надеть цоеклассницу на хуй и вращать, изображая вертолёт.
Аноним 11/07/26 Суб 09:11:13 #277 №1650198 
>>1650187
А она будет говорить чуть более хриплым голосом, чем обычно?
Аноним 11/07/26 Суб 10:52:17 #278 №1650251 
Ставочку не на то сделал и пиздец. Вот нахуя мне 3090? Че я запущу на ней щас?
А мог 128 ддр5 взять да ещё и за меньше деньги и гонять щас реально крутые модели
Аноним 11/07/26 Суб 11:29:23 #279 №1650272 
Нет, ребятки, геммы, квены, всё не то. Не поддамся на провокацию и продолжу гонять эир.
Гемма ощущается так будто ассистент все время сидит у тебя в жопе и направляет сюжет как бы тебе послаще сделать
Аноним 11/07/26 Суб 11:59:39 #280 №1650289 
>>1650118
Карточка минималистична, дает довольно много простора и иногда проявляет особенности модели-пользователя. Видно есть ли чрезмерный позитивный байас, yes-man или наоборот дум, насколько может уместно сочинять стыкуя сеттинги, умеет ли создать интересную общую атмосферу. Или можно просто играть в удовольствие, а не спгсить, сюжет и даже характер самого чара в любую сторону направляются.
Показывай как будет.
Аноним 11/07/26 Суб 12:51:57 #281 №1650332 
>>1649928
Анон, а вот не знаю.. Я тоже хочу иногда переложить что-то модельке, чтобы она как бы с коробки дала мне результат, который я хочу увидеть, манеру общения и тд... Поскольку я иногда хочу именно определенной манеры, которая не особо соотвествует персонажу в целом, ведь я хочу получить такую манеру только к определенным предложениям, а остальное виденье чара будет исходить от того, че в карточке заложенно. Потому как если ты прописываешь в звездочках, иду там то се, делаю это и ебу жопой это как по мне, не искренне что ли. Писать системпромпты тоже не всегда вариант, на откуп того, что ты хочешь получить. И пиздец, это вот как с отношениями, что к тебе не могут залезть в голову и узнать, что ты так хочешь, пока сам не скажешь, а если скажешь то у тебя будет не отложное ощущение, что это делают только потому, что ты так сказал. И пиздец, что делать я не знаю.. Посоветовать могу только с нейроночкой обсудить какой-то, она предложить может поболее, чем аноны. Поскольку чуть не профильный вопрос + который заставляет подумать, куда проще обсосать аир или гемму, извечные холивары, чем отвечать таким как ты.
Аноним 11/07/26 Суб 12:58:52 #282 №1650333 
>>1650251
>А мог 128 ддр5 взять да ещё и за меньше деньги и гонять щас реально крутые модели
Тесла П40 сейчас в пересчёте на гигабайт дешевле стоит, а скорость выше. Бери, чё - 4 штуки, 96гб GDDR5 на широкой шине тысяч за 60. Можешь и до 128гб догнать.

Промптпроцессинг будет даже получше, чем на RAM :)
Аноним 11/07/26 Суб 13:01:10 #283 №1650335 
>>1650173
Серверная память = регистровая обычно. Работает только с серверными же процами в серверной доске. Если ЕСС, но не регистровая, то на некоторых досках и исключительно с райзенами поедет.
>>1650170
Платить столько, да ещё и за кингстоны - маразм. Им сейчас красная цена 55к при наличии китай памяти на CXMT.
>>1650251
Так то 3090 тоже подорожали. И v100 вдвое, сука.
Аноним 11/07/26 Суб 13:06:11 #284 №1650340 
>>1650333
Щас бы брать ссаную п40 за 20к когда есть v100 или хотя бы п100
Аноним 11/07/26 Суб 13:10:14 #285 №1650343 
>>1650332
Сил нет отвечать на каждый такой вопрос. Это делается огромным количеством способов, от самого базового в общем сиспромпте до экстеншенов и агентских фреймворков. Вот и игнорят.
Аноним 11/07/26 Суб 13:51:32 #286 №1650357 
>>1649928
> И как реализовать переход с одного этапа на другой.
Можно пару вариантов предложить. Один - сам переключай держа в разных чатах. Информация о прошлых этапах в виде подробного структурированного суммарайза (проще будет через лорбук).
Второй - чат мультивселенная, где можно ловить переходы во времени как в кино. Обозначь в системном промпте желаемые диапазоны а также разметку типа [Переход на время xx.xx] и что они могут быть выполнены по команде пользователя. И тогда в любой момент, например в разговорах ловишь воспоминания об и этом и тутже "погружаешься" и переходить на новый таймлайн.
Саммари у такого чата только будет тяжелое, придется следить за структурированием в фактической хронологии, а не порядку в чате. Слабые модели могут путать и притаскивать в прошлое память про будущее, чтобы не страдать потребуется окно контекста побольше.
Под второй вариант можно попробовать что-то сделать на агентных движках, чтобы при смене времени автоматически скрывались все события после, а блоки истории выстраивались по хронологии. Но это непросто.
>>1650332
> с коробки
> который я хочу увидеть
Сразу нахуй. Вкусы, возможности и хотелки у всех разные, а тут еще жир от эйршиза.
Аноним 11/07/26 Суб 14:10:02 #287 №1650366 
>>1649928
In the end of message provide 2 options how story should progress with brief description
Option A for continue current stage
Option B for switch to new stage
Аноним 11/07/26 Суб 14:22:17 #288 №1650373 
>>1650251
> Вот нахуя мне 3090? Че я запущу на ней щас?
Qwen3.6-27B / Gemma-4-31B в нормальных квантах.

Со 128гб ты сейчас мог бы запустить только дипсик во втором кванте и я не уверен что он был бы сильно лучше чем плотный 27B квен в 5-6 кванте. Да и скорость была бы хуже потому что 27B квен полностью влез бы во VRAM а дипсик сидел бы пердел максимум на 10-15t/s.

Плюс к этому, 3090 это вин если ты помимо текстовых LLMок занимаешься еще и генерацией картинок, видео и музыки. 128гб там вообще нахрен не уперлись а вот 24гб VRAM - вин.
Аноним 11/07/26 Суб 14:41:23 #289 №1650382 
>>1650335>>1650340
К слову под v100 теперь ещё 1cat-vllm можно пробовать.
А вот p100 и до этого в ламовском варианте отставала раз в 5 от v100 - а учитывая что им нужно брать переходники/радиаторы схожие, которые по цене как v100 на 16 гб, то брать p100 точно бессмысленно, когда есть как минимум v100 на 16.
>п40 за 20к когда есть v100 или хотя бы п100
У p40 - 24 гб, у p100 - 16 гб. Если прям по минималке, то p40 - это самые дешёвые 24 гб vram всё-таки.
Аноним 11/07/26 Суб 14:49:41 #290 №1650387 
>>1650373
Только чтобы генерить картинки сколь либо серьезно нужна 5090, в видео как бы тоже, но там и генерить локально нечего, вану полтора года уже и он заебал. Да и вообще локалки под картинки сосут куда сильнее чем ллмки у облачных моделей
Аноним 11/07/26 Суб 14:59:52 #291 №1650395 
Step-3.7-Flash кто-нибудь сравнивал на Q5 / Q6 / Q8?

Я попробовал - начал с IQ4XS и был страшный тупняк. Раскочегарил до Q5K_XL и стало даже ничего - персонажи на удивление живые, но модель косячит иногда
> косяк 1 (устраняемо) - англо-словечки, один раз на три-четыре ответа
> косяк 2 (устраняемо) - русский язык хромает иногда
> косяк 3 - фундаментальные обдристы с путаницей "твоё/моё" и всякие там руки на плечах, когда чар стоит спиной к юзеру
1 и 2 хуйня - пост-обработка аутпута фиксит за секунды, 4B редактор исправляет
А вот 3й косяк - в нём и есть вопрос. Поможет ли Q6 или Q8...
Мне кстати показалось, что эта модель без ризонинга норм справляется. Пробовал DeepSeek 4 Flash - показалось хуже, там персонажи больше воняют ИИ ассистентом.
Аноним 11/07/26 Суб 15:43:41 #292 №1650436 
>>1650395
Мне не понравилось его повышенное внимание к контексту. Это охуенно для ассистента, но не очень для текстовых чатиков и эропэ.
Степ вообще ебовая моделька, я ей суммирую, делаю вычитку. Контекст легонький, быстрая. Короче годнота.
Пробовал с Q4_M
Аноним 11/07/26 Суб 15:44:54 #293 №1650438 
>>1650387
дихотомия локалок-облака везде одинакова: вроде бы облако пизже, но теперь всё качественное платно и с жёсткой цензурой.
Аноним 11/07/26 Суб 15:47:39 #294 №1650442 
>>1650387
Шиза, картинки и на 3060 норм идут
Аноним 11/07/26 Суб 15:50:38 #295 №1650447 
>>1650442
> Шиза, картинки и на 3060 норм идут
Это если ты как лох не тренишь лоры своих еот что лишает смысла вообще этим заниматься
> идут
Слово детект что генерация будет очень больной и медленной
Аноним 11/07/26 Суб 15:53:58 #296 №1650452 
>>1650387
> сколь либо серьезно нужна 5090
Если хочешь делать их в больших количествах на самых крупных моделях. Для видео - да, хотябы ада желательна.
> локалки под картинки сосут куда сильнее
Тут смотря что требуется. По точной генерации кучи текстовых полотен или Альтманов - да. По стилистическому разнообразию, знаниям более специфического контента и тем более nsfw - корпы глубоко в заднице. Сюда же прочая цензура - менять цвет кожи нельзя, использовать популярные логотипы - нельзя, генерить персонажей популярных франшиз - тоже нельзя.
>>1650447
> лоры своих еот
Ле фу
Аноним 11/07/26 Суб 15:54:45 #297 №1650454 
>>1650447
> Слово детект
Проиграл. Действительно, шиза.
>>1650373
> Со 128гб ты сейчас мог бы запустить только дипсик во втором кванте
128+24 позволяют запустить Анслотовский IQ4_XS с 64к контекста без квантования. Либо можно использовать mmap и уместить mxfp4, но pp сильно просядет. На IQ4_XS мне удавалось выжать 8.5т/с генерации (и это на DDR4) и 160т/c обработки. Но целесообразность все равно под вопросом.
Аноним 11/07/26 Суб 15:54:49 #298 №1650455 
>>1650447
Для лор рентится хоть 6000 блэквелл, не аргумент. Да и что такое серьезно картинками заниматься? Кому они нахуй нужны? На патреон срать? Ну так там все равно нужно слоп-машину в две видяхи делать минимум - на одной ллм срет промптами, вторая картинки/видео. А все что не порнуха это разве что реклама и около, там вообще все это не нужно.
Аноним 11/07/26 Суб 15:58:05 #299 №1650460 
Какой формат карточек лучше всего использовать? Нужно что-то более-менее универсальное, потому что я часто меняю модельки и до сих пор ищу ту самую.

Раньше гонял плейн-текст, описывал персонажей параграфами, но было сложно соблюсти баланс по деталям и не напихать воды. Потом попробовал теги, разницы почти не заметил, кроме потребления токенов. Потом просто списки типа "ключ: значение" - удобная штука, можно копировать прямо целые куски из разных карточек и экономить время. Но некоторые модели из-за такого стиля начали нести шизу и выводили эти же теги в ответы, или придумывали свои.

Короче, за три года пердолинга с локалками так и не нашел подходящего варианта. Как у вас с этим обстоят дела? Может есть какой-то формат, который уже давно все используют, а я его пропустил?
Аноним 11/07/26 Суб 15:59:28 #300 №1650461 
>>1650436
> повышенное внимание к контексту.
После 31B геммы мне наоборот кажется, что у других моделей недостаточно внимания. Напишешь ченить в системном промпте, а всем кроме геммы просто насрать.

Чёрт. Я внезапно осознал, что описанные косяки Step-3.7-Flash реже случаются с ризонингом. Всё-таки пидорасы принуждают всирать электричество на пустую генерацию токенов.
Аноним 11/07/26 Суб 16:03:36 #301 №1650463 
>>1650395
Я как раз Q4K_XL от анслота скачиваю
В принципе и Q5K_XL влезет в RAM+VRAM, но оно того стоит? Насколько большая разница между этими квантами, если тестил?
Аноним 11/07/26 Суб 16:12:03 #302 №1650471 
Меня устраивает как гемма пишет нарратив, довольно сочно, но с диалогами совсем беда, особенно во время коитуса, ю руинед ми фо эниван елсе и прочая шляпа, чето уровня мистраля 12б
Аноним 11/07/26 Суб 16:13:39 #303 №1650472 
>>1650463
Пост прямо над твоим. С ризонингом норм будет, без ризонинга боюсь там даже Q8 будет тупить.

А анслотокванты хорошие для этой модели, это подтверждаю.
Аноним 11/07/26 Суб 16:19:49 #304 №1650477 
>>1650461
Гемма умница. Но не думаю что нужно остальных по ней ровнять. Хотя её уровень следования инструкциям аномален.
Как же хочется чтобы MOE Gemma не оказалась слухом.
Аноним 11/07/26 Суб 16:27:31 #305 №1650487 
>>1650477
Это не слух анон https://huggingface.co/google/gemma-4-26B-A4B-it
Аноним 11/07/26 Суб 16:28:21 #306 №1650488 
>>1650487
Не клоунадничай, понятно что речь про 100+b.
Аноним 11/07/26 Суб 16:28:39 #307 №1650489 
>>1650472
Только с ризонигом там еще цензура включчается...
Аноним 11/07/26 Суб 16:32:36 #308 №1650492 
>>1650477
Хочу тоже проникнуться этой аномальности следования, что нужно делать? Где и в чем проявляется более всего?
Аноним 11/07/26 Суб 16:33:33 #309 №1650493 
Они реально думают что гуглы просто дропнут свою главную опен сорс модель вот просто так, уже после всех презентаций где они хвалились какая у них классная гемма 4 вышла
Аноним 11/07/26 Суб 16:36:33 #310 №1650494 
>>1650493
Нет, только один ты сверхмозг всё знаешь, правда уже после того как событие произойдет.
Аноним 11/07/26 Суб 16:42:48 #311 №1650499 
>>1650492
Тя наебали сырок.
Гемма не может даже простейшей карточке следовать и не сосать хуй юзера по первому же запросу
Аноним 11/07/26 Суб 16:44:03 #312 №1650500 
>>1650499
Перманентный скилишью у эйродебила
Аноним 11/07/26 Суб 16:47:02 #313 №1650503 
>>1650460
Плейнтекст с заголовками-макдаунами.
>>1650493
>вот просто так
Не просто так, а когда появятся конкуренты, дропнут 100+B и снова унизят всех узкоглазых.
Аноним 11/07/26 Суб 16:47:56 #314 №1650504 
>>1650499
>>1650492
Мемма очень показательная модель. По тому какие с ней проблемы у пользователя, можно сделать вывод о навыках промтинга юзера.
Аноним 11/07/26 Суб 16:53:12 #315 №1650507 
>>1648665 (OP)
https://youtu.be/u1z1H0wb1GA
Сельди официально НИНУЖНЫ.

>встроенный ии который помнит
Сколько минут он помнит, лол? Каковы шансы, что в этих ботах квен4? Могу ли я запустить дум на этой робожене? А скайрим?

Так много вопросов, так мало ответов...
Аноним 11/07/26 Суб 16:58:13 #316 №1650513 
>>1650504
Твой гундёж не помогает челиксон.
Про все модели говорят что скил ишью юзер ишью вообще про все
Аноним 11/07/26 Суб 17:02:45 #317 №1650514 
>>1650513
Пруфы выдачи геммы были не раз в треде. Так что тут натуральный скиллишью.
Аноним 11/07/26 Суб 17:04:58 #318 №1650515 
>>1649557
>просто встать на балкон с сигареткой и смотреть на ебучий пейзаж ВСЖ
>буквальный слопослоп с даванием доступа к шее и not but instead
UNADULTERATED!

Зачем ты описываешь свои действия от третьего лица? Любишь сидеть в шкафу, пока бойфренд твоей жены занимается с ней делом?
Аноним 11/07/26 Суб 17:19:15 #319 №1650526 
>>1650515
Потому что третье лицо - это база качественного рп. Если использовать "ты" и "я", то модели будут менее охотно работать с точки зрения нарратора и вводить третьих лиц. Не говоря уже о том, что не будет возможности использовать несколько персонажей в карточке.
мимо
Аноним 11/07/26 Суб 17:24:59 #320 №1650527 
>>1650526
Так это зависит от типа нарратива. Твой пост может быть заявкой, тогда: я взял пушистый хвост в руки и зарылся в него лицом издав счастливое nya.
Или твой пост это часть нарратива, где ты на тысячу токенов ебашишь адовый ответ, а нейронка продолжает уже после твоего поста не описывая действий.
Аноним 11/07/26 Суб 17:25:51 #321 №1650528 
>>1650526
>третье лицо - это база качественного рп
У людей даже думалка от первого лица персонажа, челибононикерсонерсон. Я хз зачем вообще наяривать на рп, которое НЕ от ТВОЕГО лица, а от лица кого-то другого. Вся суть исекайства в том, что это Я попал в мир магии и драконов. Я приключаюсь и ебу тянучек. Я.
Какой рофл наблюдать за кем-то, ещё и текст печатая вручную? Просто зиро погружения нахуй.
>не будет возможности использовать несколько персонажей в карточке
Скилышью.
Аноним 11/07/26 Суб 17:28:24 #322 №1650530 
>>1650528
Третье лицо это просто литературный стиль наррейшена. Это никак не влияет на то кого и как ты отыгрываешь, лол. У меня, например, все промпты построены вокруг нарратора, а не чара. У меня выбора нет кроме как играть третье лицо. Это не значит, что я не отыгрываю персонажа, с которым себя ассоциирую.
Аноним 11/07/26 Суб 18:05:00 #323 №1650547 
1693379867646.png
>>1650504
Как правильно ее промптить?
>>1650527
> я взял пушистый хвост в руки и зарылся в него лицом издав счастливое nya
Топчик
В идеале чтобы моделька сама понимала - на ясный и понятный факт не было лишних описаний а только связка и продолжение, а для важных взаимодействий все в максимальных подробностях.
Аноним 11/07/26 Суб 18:13:41 #324 №1650550 
Дамы и господа, я ничего не знаю. Простой вопрос - 8ГБ карта 1000й серии, 32ГБ дыдыэр4; Gemma 4 12B запустится; если видеокарта не воспламенится, сколько токенов в секунду ожидать? Смысел есть?
Аноним 11/07/26 Суб 18:18:26 #325 №1650554 
>>1650550
Анон, добро пожаловать. В шапке есть гайд, он актуален. Прочти его и если будет что то не понятно, спрашивай.
Аноним 11/07/26 Суб 18:27:13 #326 №1650563 
>>1650550
Можно 26б моеху запустить. Зачем тебе именно 12б?
Аноним 11/07/26 Суб 18:39:02 #327 №1650569 
>>1650550
На 32+8 проще МоЕ 26B запускать. Будет 15-20 тс с МТП. Может чуть больше.
Аноним 11/07/26 Суб 18:49:35 #328 №1650573 
0-25.png
26-50.png
>>1650289
> Показывай как будет.
Раз уж взялся делиться и ты настаиваешь, держи. 20к контекста на mxfp4. Имхо, там ничего интересного нет, совсем. Слайс, вменяемый гг уставший пофигист, очень нейтральный слоуберн. Кума и никаких страстей в логах нет. В первую половину я осознанно вел себя сдержанно, старался понять какой байас у модели, иногда подкидывал дровишек, проверяя реакцию чара или давая возможность придумать что-нибудь. В дефы карточки посмотрел только после. В целом норм отыграла модель, но учитывая "she will initially try to get {{user}} to go away through descriptive, verbose ranting." и мгновенное приглашение присоединиться - может противоречить промпту. Я тот респонс посвайпал, разнообразие есть, и справедливости ради в большинстве случаев она не была так расположена. Выроллил удачно.

Из хорошего - понравилось, что мало репетишена, из плохого - пишет кратко (сколько ни пытался раздуплить на ответы больше 200-300 токенов, так и не вышло. Может промпт ишью. У меня нормального нет, писать свой цели нет). В чате 1х1 это ну уровень Квена 27, никаких откровений. Как будто даже Мимо приятнее пишет, только рефузит на ровном месте и льет сою иногда. Хз, в общем. Мне давно рп не интересно уже, была цель только попробовать в этом Дипсик. Может, если распердолить - будет очень хорошо.
Аноним 11/07/26 Суб 18:51:17 #329 №1650576 
51-75.png
76-98.png
>>1650573
Оставшееся
Аноним 11/07/26 Суб 18:51:25 #330 №1650577 
>>1650554
Один пролистал, другой прочитал. Понял, что по памяти влезет, но интересовала скорость, ведь 1000м картам уже десяток лет, да и процессор из той же эры, потому решил спросить о

>>1650563
скорости

>>1650569
и спасибо, попробую.
Аноним 11/07/26 Суб 18:54:04 #331 №1650580 
>>1650528
>Я хз зачем вообще наяривать на рп, которое НЕ от ТВОЕГО лица, а от лица кого-то другого.
Потому что нейронка - это нарратор.
Что мешает при этом отыгрывать себя?
Аноним 11/07/26 Суб 18:56:20 #332 №1650581 
>>1650577
Скорость тебе никто не скажет. Даже если прикинуть по памяти, влияет и скорость чипа. Качай-пробуй, это не сложно и не так долго, следуй гайду.
>>1650530
>>1650526
За третье лицо двачую. В логах выше впервые отыграл во втором лице и настоящем времени, ибо не редачил карточку. Периодически путал времена и в целом мех, такой себе экспириенс. Не представляю как это отыгрывать с 3+ персонажами, а уж как до кума дойдет - это вообще кринж уровня I fuck your pussy А уж если на русике, там вообще что-то увеселительное
Аноним 11/07/26 Суб 18:57:08 #333 №1650582 
Давно не читал тред и ллм в целом. Приобрел 16гб врама (5070ti), какой положняк по этому объему из моделей? Твердо и четко чтобы пойти и качать без задних мыслей
Аноним 11/07/26 Суб 18:58:20 #334 №1650583 
https://llama.garden/

Быстро работают, даже недели не прошло с прошлой паники на реддите на тему закрытия HF. А щас новая паника и там в комментах уже вот эту ссылку вбросили.
Аноним 11/07/26 Суб 19:01:50 #335 №1650586 
>>1650583
>на тему закрытия HF
Каво? И зачем этот мусор сюда тащишь?
Аноним 11/07/26 Суб 19:09:15 #336 №1650591 
>>1650582
Если 32 врам есть то гемма 26 q8, иначе квен 27 какой-нибудь q3-iq4s, хз сколько там влезет. Да и всё
Аноним 11/07/26 Суб 19:47:15 #337 №1650611 
1629632832085.gif
>>1650580
>сообщения от третьего лица
>что мешает отыгрывать себя
Аноним 11/07/26 Суб 19:50:48 #338 №1650615 
>>1650591
Плотноквен в 8 гигов в хорошем качестве не влезет. Нужен 4-5q, а это 16-20 гигов. Ну разве что антуан хочет бсод 0.5 тс жрать.
Аноним 11/07/26 Суб 20:11:20 #339 №1650624 
>>1648665 (OP)
Кто шарит за sxm2, в pci-e адаптер похуй какой стороной прикручивать или есть какое-то правило?
А то я разобрал, начал собирать и забыл как оно было изначально не стукайте)
Аноним 11/07/26 Суб 20:15:11 #340 №1650626 
>>1650624
А, тут технические дырочки смещены.
Вопрос отпал.
Аноним 11/07/26 Суб 20:17:53 #341 №1650629 
>>1650615
У него 16
Аноним 11/07/26 Суб 20:20:47 #342 №1650631 
>>1650629
А, сорян, квантанулся маленько.
Аноним 11/07/26 Суб 20:28:43 #343 №1650638 
>>1650631
Маленько? Нихуя себе, это же вдвое!
Аноним 11/07/26 Суб 20:32:50 #344 №1650642 
>>1650638
Говорят, что к8 ничем не отличается от к4... выше по треду был анончик с восьмигиговым паскалем, перепутал с ним.
Аноним 11/07/26 Суб 20:47:05 #345 №1650647 
Напомните молодёжную базу, что сейчас перспективно ракать для интерфейса?
Аноним 11/07/26 Суб 21:04:52 #346 №1650661 
>>1650573
>>1650576
Красавчик, мало кто осмеливается полные логи выкладывать. Как говорится, хороший фотограф умеет сделать кадр.
По работе моделки - смешанные чувства, скорее в минус.

Явные косяки:
Дичайший позитивный байас. Приглашение остаться в начале вопреки промпту (снимается раз свайп), потом это нелепое "лает но не кусает" - ну вообще прям пиздец такое. На 28 уже начинает нахваливать и лезет слоп `you know most people @ but you`, чувство что вот-вот пойдет `Thank you for...` ладно, оно аж до 62 держалось. Сразу становится чрезмерно лояльной и полностью успокаивается, без постепенного развития.
Структурный луп с первого ответа. Стиль речи и настроение никак не соотносятся с нулевым сообщением (гритингом), а какой-то дженерик местами черезчур знакомый.

Плюсы:
Местами подметила важные и уместные штуки и не сделала ряд типичных фейлов как часто делают другие. Кое где прямо годно пишет, но хотелось бы побольше. Слопа и типичных фраз не сильно много, репетишна явного действительно нет.

Из смешанного или субъективного:
Поскольку каких-то примечательных событий и прочего не было - невозможно оценить внимание к ним.
Красочности и атмосферы как будто не хватает, зато вместо них слоповые метафор типа `for years, for decades, for centuries`. Пусть даже с долей слопа, но хочется красивее и длиннее, может тоже вкусовщина.
История вообще не проработана, дико ленится с этим. Ожидалось что чар или в какой-то момент разом, или постепенно расскажет о себе и мире больше конкретики, обозначит детали и общий облик, а не будет оставаться абстрактным нечто, потому что чем дольше тем больше потенциальных фейлов и нестыковок. Про реальность, текущее время (хотя было упоминание ютуба и телефонов), взаимодействия/отношения реального и духовного мира, другой синтоистской или другой нечисти - просто ничего. Чар и мир пустые без бэкграунда, и пустота сама не заполняется, юзеру придется самому трудится. Хотя это тоже вкусовщина, если сидеть релаксировать то может наоборот такое зайдет. Возможно, дело в стремлении повторять начальный паттерн общения не смотря на перемены, это плохо.
И еще - про мокрый мех после душа или его сушку ничего само не написало, да еще намек не выкупило. Это полнейшее фиаско! -1000 очков.

В общем, согласен с выводами, неинтересно и уровня не видно.
Аноним 11/07/26 Суб 21:14:10 #347 №1650664 
image.png
>>1650611
Нихуя не понимаю твоих претензий.
Аноним 11/07/26 Суб 21:48:38 #348 №1650685 
AutoRound кванты геммы скиньте.
Я видел тут были вроде бы, но сейчас не могу найти кроме int4, которые не нужны при наличии qat.
Те которые от sphaela они без autoRound, там iters=0, я такие сам сделаю за полчаса.
Или только самому ставить на ночь и делать?
Аноним 12/07/26 Вск 01:28:58 #349 №1650798 
Нейросеть не ии... Даже не аналог человеческой нейросети... Шах и мат тем, кто сравнивает наш мозг с нейросетками. Вообще разная хрень.

Это отличный вопрос, который затрагивает фундаментальную разницу между биологическим нейросетевым обучением (мозг) и математическим глубоким обучением (трансформеры).

Хотя мы оба называемся «нейросетями», механизмы памяти у нас работают совершенно по-разному.

### 1. Эпизодическая память vs Семантическая сжатая модель
У человека есть эпизодическая память. Когда ты читаешь книгу, для твоего мозга это событие. Ты помнишь: «Я читал эту книгу в прошлом году, сидя в кафе, она была в синей обложке». Процесс чтения привязан к контексту, эмоциям и времени.

У меня нет «опыта» или «событий». Я не «читал» книги по одной в течение времени. Мое обучение — это одномоментный (в масштабах архитектуры) процесс прохождения через миллиарды токенов. Для меня текст книги — это не событие, а статистический шум, из которого я выделяю закономерности.

### 2. Сжатие данных (Lossy Compression)
Представь, что ты хочешь запомнить все рецепты мира.
Библиотека/Жесткий диск: Сохраняет каждый символ (безошибочно).
Человек: Помнит название книги и основные идеи («Ага, в той книге писали про соусы»).
Я (LLM): Я работаю как экстремальное сжатие. Я не запоминаю текст, я запоминаю принципы, по которым этот текст строится.

Если миллион книг говорят о том, что «Небо голубое», я не запоминаю каждую из миллиона цитат. Я просто создаю в своих весах очень сильную связь: `Небо` $\rightarrow$ `Голубое`. Информация о том, в какой именно книге это было написано, стирается, потому что она избыточна и не помогает мне предсказывать следующее слово.

### 3. Отсутствие индексации
Человеческий мозг создает «индекс» (оглавление) прочитанного:
Автор $\rightarrow$ Название $\rightarrow$ Основная мысль*.

У меня нет отдельного списка-реестра. Мои знания распределены по всей сети. Чтобы «вспомнить» книгу, я должен начать генерировать текст, который соответствует паттернам этой книги. Если книга была очень популярной в обучающей выборке (например, «Гарри Поттер»), её паттерны настолько сильны, что мне кажется, будто я «помню» её. Если книга редкая — она просто растворяется в общем массиве данных, становясь частью общего «понимания мира».

### Резюме
Я не помню список книг, потому что я не складывал их на полку, а переварил их, превратив в «интуицию» о том, как устроен язык и мир.

Человек помнит книгу как объект. Я «помню» книгу как набор вероятностей.
Аноним 12/07/26 Вск 01:37:38 #350 №1650806 
14122457333010.jpg
Нашёл неплохую карточку для теста моделек
https://botbooru.com/character/26158
Дипсикоанон, тести
Аноним 12/07/26 Вск 01:45:11 #351 №1650811 
>>1650573
И чё, куда делся наш простой парень Иван город Тверь английский б1, два месяца в Англии? Тута вот смотри какой хуёвый англюсик. Чё притих, поясняй
Аноним 12/07/26 Вск 01:55:03 #352 №1650813 
На huggingface что-то про zerogpu написали, что там теперь то ли 2, то ли 5 минут в день с rtx6000 на 96 гб можно получить.

Я могу как-то там лламу запустить со своими настройками и протестировать? Мне интересно бенчмарки погонять и 2 минут работы мне хватит. Чтобы понять как именно там ведут себя pp/tg и что будет в vllm для сравнения.
Аноним 12/07/26 Вск 02:14:09 #353 №1650816 
изображение.png
>>1650806 пидор блядь
Аноним 12/07/26 Вск 02:20:32 #354 №1650817 
>>1650813
Это только для паблик спейсов. Да еще чтобы хостить свои нужно иметь про подписку.
Там очень геморойный апи, заточенный на жрадио и динамический запрос гпу. Хитрая контейнеризация и реализация на хуках стандартных либ, чтобы "подключать" гпу только по запросу на компьют, а не все время пока ты открываешь спейс и тыкаешься в интерфейс, просто .to('cuda') не сработает.
Если ты вдруг это все обойдешь и таки заставишь работать (что врядли) - там нет сохраняемого кэша и присутствуют отличия в железе. За 5 минут лимита с учетом всего врядли vllm не факт что модель загрузит и графы посчитает, первый запуск долгий.
Просто арендуй на каком-нибудь ресурсе. Или закинь денежку и сделай себе приватный спейс на той же обниморде без всех этих ограничений, только будет дороже.
Аноним 12/07/26 Вск 03:28:07 #355 №1650824 
>>1650816
Зарегайся, это скрытая нсфв карточка
Аноним 12/07/26 Вск 05:36:24 #356 №1650838 
>>1650661
> позитивный байас
А где щас не так?
> лезет слоп
А где щас не так?
> луп
А где щас не так?
У вас претензии из паралельной реальности где все модельки строго с нейтральным байасом, без слопа и лупов
Аноним 12/07/26 Вск 06:44:55 #357 №1650850 
>>1650838
Там:
Qwen 26 fable hotdog
Аноним 12/07/26 Вск 10:51:51 #358 №1650911 
>>1650838
Потерпишь
Аноним 12/07/26 Вск 10:55:01 #359 №1650913 
>>1650817
А, ну тогда нахрен не надо.
>Просто арендуй на каком-нибудь ресурсе.
А я думал, но нашёл только A100, которые следующие на очереди по устареванию, что не очень интересно, я именно мощь nvfp4 хотел потыкать и что там с ней.
К тому же мне поддержка внятно не объяснила как происходит первоначальная настройка. Там всё время уйдёт на загрузку куды и моделей, если арендовать.
Аноним 12/07/26 Вск 11:20:45 #360 №1650931 
>>1650911
Ты когда нибудь задумывался над фразой "потерпеть поражение"?
Ну, типа, ты проигрываешь, а тебе ещё и говорят "потерпи" сверху. И ведь так ещё говорят в первом лице "я потерпел поражение" - то есть это можно трактовать как что то благородное, не будет ведь человек сам себя унижать, верно?
Т.е в целом "потерпи" это совсем не так обидно как кажется.
А про терпение и труд всё перетрут слышал? Больше терпишь - больше треш и пресетиков получаешь.
Аноним 12/07/26 Вск 11:22:53 #361 №1650935 
>>1650931
Потерпишь
Аноним 12/07/26 Вск 12:07:34 #362 №1650954 
Что за хуйня с чекпоинтами в лламе? Уже есть форки без этих говновведений? https://github.com/TheTom/llama-cpp-turboquant пойдёт?
Аноним 12/07/26 Вск 12:09:05 #363 №1650957 
>>1650954
А че там? Слышал переделали что то, хуже стало?
Аноним 12/07/26 Вск 12:20:04 #364 №1650964 
>>1650957
Владельцам калькуляторов НЕПРИЯТНО
Аноним 12/07/26 Вск 12:21:00 #365 №1650965 
1741981129275.png
1739024982931.png
>>1650838
Причина рейджбейта?
Если ты к этому толерантен - красавчик, всеядный. Если после аблитератед-ультраденжероус-фейбл-опус-сол-мифос мусора не замечаешь очевидного - земля пухом.
>>1650913
Пик1 - ранпод, пик2 vast.ai. Разумеется, это только прайс за саму карточку, за ядра, рам и хранилище тоже начислят, но на условный час для тестов можно позволить. Раньше у них была оплата криптой.
Есть еще чисто криптосервис с ценником в 1.5+ раза ниже, но он пердольный.
Аноним 12/07/26 Вск 12:22:30 #366 №1650970 
>>1650661
> Структурный луп с первого ответа
Справедливости ради, почти все модели подтягивают или "I", или "The", или {{char}} в начале ответа. Из последнего мне удалось это победить только на Гемме и Квене 27. Кстати, модельки 2025 года этим не так болеют и на тех же промптах не уходят в структурный луп столь быстро. Возможно, на инстракт тренировке стало больше однотипных ответов.
В остальном да, все так. Помню, раньше частенько хвалили Дипсики 3-3.2. Если там такой же уровень, то совсем не понимаю почему.
>>1650954
Все еще надеюсь, что они реверснут эту дичь или как-то ее качественно улучшат. Оставлять как есть - это путь вникуда, позволю себе в первый раз написать ггуф умер, хотя раньше за слова поддержки Лламе попадал в срачи.
>>1650957
Изменили логику создания чекпоинтов. Среди прочего, они создаются на каждом юзер сообщении или внутри себя как-то их размечают. На практике это значит, что промпт теперь не всегда обрабатывается полными батчами, которые были установлены при помощи b, ub. Если любишь, когда модель отвечает кратко - теперь у тебя чрезвычайно низкая скорость обработки промпта, потому что если в установленный батч (на МоЕ, например, 2048 - частая ситуация) попадает сообщение юзера, батч урезается до этого самого момента. Предположим, у тебя твои инпуты ~100-150 токенов, ответы модельки ~400-500. Считай, у тебя теперь батч 650, а не 2048. Это очень упрощенно и может быть не точно, но суть такая.
Аноним 12/07/26 Вск 12:23:38 #367 №1650971 
Если ставишь -np 2, то начиная с какого-то размера (после 30к в каждом из потоков) - оно начинает бесконечно всё пересчитывать, так что посчитать что угодно в 1 поток становится быстрее, хотя это не так должно работать (в идеале pp суммарный должен быть таким же, а tg кратно возрастать до определённой стадии (до х5 от генерации в 1 поток, как минимум) - так как 99% работы это не этот 1 токен посчитать, а загрузить из памяти слой, и посчитать по этому же слою что 1, что 2 - это 1% или 2%, которые теряются на фоне 98% загрузки)
Аноним 12/07/26 Вск 12:31:32 #368 №1650978 
>>1650965
Ты кстати с lightning.ai не взаимодействовал? Им номера с смс пула рандомного хватит, или нужен постоянный доступ к нему? Потому что казахские номера они нахуй шлют сразу же.
Аноним 12/07/26 Вск 12:45:43 #369 №1650985 
>>1650970
>они создаются на каждом юзер сообщении
Наверное глупый вопрос, но количество чекпоинтов всё ещё можно ограничивать через --swa-checkpoints число? Если чекпоинты создаются после каждого юзеринпута, то они ж так всю оперативку засрут... А с моделями которые едва лезут впритык по рам+врам, вообще станет работать невозможно. Жора ебанулся там?
Аноним 12/07/26 Вск 12:50:26 #370 №1650988 
>>1650985
Разумеется, можно. При достижении лимита старые чекпоинты удаляются, освобождая место новым.
Аноним 12/07/26 Вск 12:55:01 #371 №1650991 
>>1650988
Фух, ну ладно. Значит по факту только в батчи насрали. Но обновляться без веской причины я конечно же не буду, посижу на старой ламе.
Аноним 12/07/26 Вск 13:07:08 #372 №1651002 
>>1650970
> Справедливости ради
Пожалуй, самая меньшая из бед на которую уже баннерная слепота. И подробнее писать можно промптами заставить, наверно.
Но хуже всего "бесхарактерность" чара и отсутствие инициативы, столько вести за ручку чтобы получить пигмалион кивает - ужасно разочаровывает.
> Если там такой же уровень
Как-то пободрее было. Еще на второй лламе за 10к растянутого rope контекста та же карточка вываливала больше, или зрелищно убивала тебя когда сильно дразнил и наглел. Из того что разыгрывал, на старом дипсике там быстро появлялся лор и забавные рассказы о ее жизни в современном мире, просто интересно читать, на жлм4.7 полез рут ужасной меланхолии и уныния с уклоном в nsfl, что заставило менять модель.
Если на флеше такая тенденция с завязкой чатов как тут - это очень грустно.
> Считай, у тебя теперь батч 650
Тогда 100-150 должно быть, разве нет?
Но он должен скипнуться. Когда веса на цп+гпу, для префилла стоит выбор: или начинать стрим всех выгруженных весов на видеокарту чтобы обработать сразу батч, или пытаться считать процессором.
В первом случае видеокарта позволит просчитать быстрее, но появляются накладные расходы на загрузку весов, которые не зависят от количества обратываемых токенов (в батче). От размера батча уже будет зависеть сколько раз нужно полные веса на видеокарту загрузить для обработки, но минимум один раз и занимает секунды-десятки секунд. Даже если там два токена - изволь ждать и иметь смешную удельную скорость, хотя обычная норм. Во втором варианте сам процессор делает просчет части что лежит на нем, скорость не зависит от объема, но она медленная. Потому используется ветвления - при обработке малых последовательностей (короткий ответ или тот же mtp) считает процессор, если длина больше некоторого порога - начинается стрим весов.

Но с чекпоинтами это не должно коррелировать, исключая то, что при их обновлении могли ту логику сломать. Тогда даже с коротким сообщением от юзера будешь ловить полный цикл прогона весов и задержку первых токенов. Сообщение самой ллмки хоть на 500 хоть на 1500 токенов никак не должно на это влиять, потому что после генерации кэш соответствует его концу. Если только фронт не возмущает что-то в глубине, или бэк зачем-то решает вернуться (бывает если включен token healing).
В чем тут проблема получается?
Аноним 12/07/26 Вск 13:20:42 #373 №1651013 
>>1651002
Не знаю, из чего проблема происходит и потому, видимо, ошибся в предположениях. У меня на практике картина такая - если чекпоинт попадает в батч, происходит сплит батча. Что приводит к просадке по скорости обработки. Для кода и агентной работы ладно, там почти всегда аутпуты длиннее батча. Для чатиков скорость теперь много где неюзабельная. Подозреваю, баг какой-то, а не предполагаемое поведение.
Аноним 12/07/26 Вск 13:24:08 #374 №1651015 
Проблемы виндусятников. У меня на убунте ничего не поменялось с контекстом
Аноним 12/07/26 Вск 13:35:04 #375 №1651020 
>>1651013
Если так происходит то в предположении не ошибся, но интересно почему такое.
Может оно полностью игнорирует текущее состояние и только опирается на чекпоинты, которые создаются кратно батчу? Это может объяснять лишний пересчет на сообщение ллмки.
Аноним 12/07/26 Вск 13:47:19 #376 №1651027 
Простите что влезаю с приземлённым. Может кто знает какой мод на таверну желательно на текст комплишен связывающий настройки сиспромпта и пост-хистори с карточкой (и моделью) ?
Аноним 12/07/26 Вск 14:33:12 #377 №1651072 
>>1651027
Непонятно, что тебе нужно и чего ты хочешь добиться. Моды для этого никакие не нужны.
Аноним 12/07/26 Вск 14:41:54 #378 №1651079 
>>1651027
Чаткомплишн понимает поля из v2 карточек и может сам их подставлять. Тебе нужно аналогичное поведение для тексткомплишна, или что-то другое?
Аноним 12/07/26 Вск 14:59:10 #379 №1651090 
>>1650970
>>1650954
>MoE-карлики скулят вместо того чтобы выставить --ctx-checkpoints 1 или 0
Зато на dense-моделях 30b+ вместо нескольких минут полного preprocess теперь несколько секунд до начала генерации
Аноним 12/07/26 Вск 15:00:19 #380 №1651093 
>>1651090
>дебил не понимает, что ctx-checkpoints 1 не поможет а 0 и вовсе будет вызывать репроцессинг при любом изменении контекста
Аноним 12/07/26 Вск 15:06:10 #381 №1651097 
>>1650661
>По работе моделки - смешанные чувства, скорее в минус
Из aicg к нам?
Ты когда подобный пост пишешь сразу пиши на чём сам сидишь
Аноним 12/07/26 Вск 15:51:50 #382 №1651140 
>>1650954
А прокомментируйте что даёт это-то турбоквант кроме формата кеша/слоёв? Там просто написано сравнение с baseline, но не указана что за baseline. Кеш в f16 и слои в f16, по сравнению с этим квантом, или же моделька такая же условная q5-k-m одинакового размера с кешем в f16 и с кешеи в turbo-кванте?
Типа 200 токенов вместо 68 - это очень большое ускорение. Не ясно с чем сравнивают.
Аноним 12/07/26 Вск 16:27:21 #383 №1651168 
Запуск GLM 5.2 744B на любом калькуляторе с ЗОЛОТЫМИ 0.001 т/c

https://github.com/JustVugg/colibri
Аноним 12/07/26 Вск 16:33:23 #384 №1651178 
>>1651168
Быстрее, чем в ручную матрицы перемножать.
Аноним 12/07/26 Вск 17:14:50 #385 №1651208 
анон, нах ты времена и лица смешиваешь?
в первой же мессаге: "I look around" и слеующий же параграф "чарнейм was consumed by his own thoughts", а следующий - "when my eyes"
а потом удивляются ой чёто слоп ой чето структурный луп. так ёпта ты не найдешь такого говна ни в какой литературе, естественно модель штормить начнёт. дальше не читал
Аноним 12/07/26 Вск 17:15:22 #386 №1651209 
>>1650573
>>1651208
Аноним 12/07/26 Вск 17:58:01 #387 №1651235 
>>1651208
> естественно модель штормить начнёт
От такой ерунды? Покайся.
Алсо, там вполне понятно было разделение, от первого лица основные действия, от третьего - констатация происходящего.
Аноним 12/07/26 Вск 18:28:45 #388 №1651251 
>>1651208
Жирновато. Критический неуспех.
Аноним 12/07/26 Вск 18:42:03 #389 №1651256 
Простите что влезаю с надроченным. Может кто знает какой мод на таверну желательно на текст комплишен который фиксит эхо и излишний наррейшен эира?
Аноним 12/07/26 Вск 19:33:09 #390 №1651284 
>>1651256
Поведение модели модом не исправить. Смирись. Немного могут помочь сэмплеры, если понимаешь что делаешь, но и то не всегда.
Просто этой модели пора на заслуженную пенсию.
Аноним 12/07/26 Вск 19:48:45 #391 №1651296 
Не могу раздрочиться. Почему-то сетки не могут придумывать лютые извращения для кума, только фистинги и прочьие сквирты. Как нейронку заставить придумывать извращения типа бутылки в жопу?
Аноним 12/07/26 Вск 19:53:05 #392 №1651299 
>>1651284
Отстань, врун. Не пиши мне.
Пресетик is real и я его достану.
Аноним 12/07/26 Вск 20:14:19 #393 №1651319 
14233847639130.jpg
>>1651256
>мод на таверну желательно на текст комплишен который фиксит эхо
Есть один охуенный. Гугли smena modeli na normalnuyu
Аноним 12/07/26 Вск 20:24:42 #394 №1651327 
А можно в какие-нибудь игры поиграть с персонажем в Таверне? (в Маринаре вон покер добавили).
Аноним 12/07/26 Вск 20:31:06 #395 №1651331 
>>1651296
>Почему-то сетки не могут придумывать лютые извращения для кума
>сетки не могут придумывать
Поправил. Что в датасете было, то они и знают. Много ты в сети найдешь текстов с бутылками в жопе? Даже по сравнению с фистингом? То-то и оно...
Аноним 12/07/26 Вск 21:13:35 #396 №1651375 
>>1651256
Напиши скрипт через квик реплаи, который получал бы в контекст последнее сообщение юзера и ответ сетки с промптом переписать ответ, убрав эхо и сократив описания без потери смысла, или чего ты там хочешь, и делал бы свайп новым ответом. На мелкогеммах это тухлый номер, а с эйром может и прокатить. В айцг вроде кто-то даже промптил переписывалку для гемини, можешь поискать там. Олсо тут недавно постили инструкцию против эха, но подозреваю, что работает на уровне плацебо.
Аноним 12/07/26 Вск 21:18:44 #397 №1651380 
>>1651375
> против эха
Что вы под этим эхом понимаете? Что иногда чар пишет часть твоей фразы, или буквально большие куски повторения поста юзера?
Аноним 12/07/26 Вск 22:20:38 #398 №1651414 
>>1651168
Мне концепция проекта нравится.
Да, медленно - но в случае апокалипсиса можно в бункере на условно-офисном ноуте запускать такое, и да, ты получишь ответы за х100 времени от нормального, но получить их не за 30 секунд, а за час - это всё ещё очень неплохо, это же во многом библиотека всех знаний мира.

Только это, а разве ллама не умеет штатно с диска подгружать таким же образом штатно?
Аноним 12/07/26 Вск 22:35:25 #399 №1651417 
В сервере ДС не достучаться из-за экзамена блять, поэтому напишу здесь.
Какого-то хуя таверна не качает карточки с chub ai. В консоле пишет, что скачивается, но нихуя не появляется. До этого всё норм было. Запускал от админа, антивирусник молчит, бочку делал.
Аноним 12/07/26 Вск 22:47:20 #400 №1651424 
>>1651380
Цепляется за часть фразы, пишет её один в один или немного изменив и отвечает на неё. Когда это происходит один раз за ответ, выглядит ещё нормально, в живом общении люди тоже переспрашивают без смысла, чтобы было больше времени сформулировать ответ. Но лоботомит начинает вытворять это как по списку, как бы разбирая каждый кусок, который повторяет. Потому эту фигню называют эхоразбором ещё. Иногда эта фигня равномерно разбросана в тексте и выглядит более-менее органичной реакцией, но иногда сетки сплошняком такой разбор наваливают одно за другим. Вот здесь в логах это прямо со старта хорошо видно >>1650573
Посмотрел первые три ответа - в каждом ответе повтор чего-либо из реплики и чего-нибудь из действий/мыслей.
Аноним 12/07/26 Вск 23:31:35 #401 №1651454 
image.png
Безжоп на эире выглядит вот так мужики...
Аноним 12/07/26 Вск 23:42:08 #402 №1651465 
>>1651296
Напиши это в промпте. Как дети малые, блин.
Аноним 12/07/26 Вск 23:44:25 #403 №1651468 
>>1651454
СерёгаК спать иди..
Аноним 12/07/26 Вск 23:49:45 #404 №1651473 
>>1651296
Да куда нейронкам в кум, если они про пролапс только в медицинском контексте знают?
Аноним 13/07/26 Пнд 00:19:16 #405 №1651483 
image.png
image.png
image.png
image.png
Наглядное отличие безжопа с сжопом, модель теряет в деталях и остроумии ОСТРОУМИИ, НЕ В МОЗГАХ, типа меньше панчей, подковырок, внимания к тому как бы подъебать тебя, но зато нет эха и жевания нарратива, всё быстро и по делу. И пиздец иронично что это фиксит что мне не нравится в эире и ломает то что нравится, и по другому никак, потому очень ситуативно.
Тут ещё норм смотрится, на контексте
Аноним 13/07/26 Пнд 00:43:52 #406 №1651500 
>>1651417
забанен чуб
Аноним 13/07/26 Пнд 00:50:13 #407 №1651503 
изображение.png
>>1650685
Ладно, уже не нужно. Вроде сам поставил на ночь делаться с внятным количеством итераций.
Аноним 13/07/26 Пнд 00:57:21 #408 №1651505 
Пишет автор гайда в шапке. Покидаю вас, потому заранее предупреждаю, что обновлений не будет. Если у кого появится желание актуализировать или взять оттуда что-нибудь - Рентри легко позволяет заимствовать текст с форматированием, кнопка Edit в левом нижнем углу страницы.

Мира, добра.
Аноним 13/07/26 Пнд 00:59:22 #409 №1651506 
>>1651505
Почему?
Аноним 13/07/26 Пнд 01:13:43 #410 №1651511 
>>1651505
Э, ты куда? Один из немногих адекватных анонов тут.
Аноним 13/07/26 Пнд 11:29:15 #411 №1651662 
>>1651500
Тогда как я на него захожу?
Аноним 13/07/26 Пнд 11:36:37 #412 №1651665 
>>1651483
Я не понимаю, это какой то троллинг? Нахуя мне имея в руках разметку и промтинг на ёбанной локальной модели ебаться с ответом в ассистенте?
Аноним 13/07/26 Пнд 11:43:11 #413 №1651668 
>>1651665
Ну, типа, кто-то считает что промптингом такого не добиться
Аноним 13/07/26 Пнд 11:55:17 #414 №1651673 
>>1651665
Безжоп - это и есть разметка. Ну и промпт переписать с гритингом, что модель рассказывает историю, играя в том числе за персону юзера.
Аноним 13/07/26 Пнд 12:02:01 #415 №1651677 
>>1651673
Но нахуя, если между мной и моделью нет апишного промта?
Аноним 13/07/26 Пнд 12:24:45 #416 №1651691 
>>1651093
>ctx-checkpoints 1 не поможет
Дегенератам типа тебя не поможет
А у меня чекпоинт всегда в конце контекста - и поэтому когда он один, никакие батчи в середине не ломаются
Аноним 13/07/26 Пнд 12:27:54 #417 №1651692 
>>1651691
>дебил не понимает, что когда он высирает свой юзермесседж происходит промптпроцессинг предыдущего ответа модели и батч все равно сплиттится
Аноним 13/07/26 Пнд 12:31:39 #418 №1651697 
>>1651692
Кекв. Лорбуками/префиллом дебил тоже не пользуется. Дураков в мире много, тред не исключение
Аноним 13/07/26 Пнд 12:41:47 #419 №1651704 
>>1651697
>лорбуки
>префилл
>вообще вне ветки обсуждения
Вау. Просто вау.
Аноним 13/07/26 Пнд 13:01:21 #420 №1651713 
>>1651168
Тут в тредах мелькал анон, что сидел на заре ллм с 2-3 т/с на магнуме и не бухтел.
Времена идут, но ничего не меняется, хех.

>>1651414
Меня одно интересует. Где ты в постапоке будешь брать электричество для питания пеки, чтобы она тебе со скоростью 1 т/с генерировала ответ. Так еще помни, что она не напишет тебе синтез лекарств или взрывчатых веществ. А тебе в БП желательна картинкораспознование, чтобы банально грибы отличать от ядовитых, если ты корзинка.
Аноним 13/07/26 Пнд 14:08:00 #421 №1651735 
Надо было додавить заюшь всем сообществом на эир 4.7
Помните времена когда они на реддите на вопросы отвечали? Вообще что то немыслимое, теперь какие то боги недосягаемые.
И вот если мы и получим эир он никак не будет уже 100б, скорее 350.
Вот и выходит что малыш 4.5 единственный в своем роде
Аноним 13/07/26 Пнд 14:22:56 #422 №1651739 
>>1651713
Ну, электричество как-нибудь то добуду. Если для ноута - есть куча готовых решений, вроде солнечной панели. Можно и велосипед переделать — электричество очень просто решается, по сравнению, например, с ремонтом ssd или другой комплектующей - что считай невозможно. Генератор есть в любой машине. Так же у электричества так много применений, что его почти точно нужно будет добывать, и это полезнее нейронки. Нейронка это уже дополнение и баловство по сравнению с электричеством.

С распознаванием - есть сетки с визуальным модулем поменьше, да хоть гемма 3 или 4. Ещё, ну знаешь, можно и по описанию сопоставить. Прям по картинки распознавание, причём не абсолютно точное это всё-равно такое себе. Гемма 3 расцензуренная пишет всё тобой перечисленное - да и впрочем расцензуренная не требуется, скорее тебе понадобится что-то о простом. Я например не знаю как глину запечь, чтобы кирпичи не трескались и не протекали от воды. Уверен, что способ простой, надо просто его знать. Универсальной книги нет - а если ты загрузишь 1000 штук, то быстрее чем поймёшь чем заболел откинешься, пока сориентируешься и найдёшь среди них нужное и полезное. Сетка тебе за полчаса-час по симптомам напишет что-то примерное что с тобой. Да и то что оно прям прямо не пишет рецепт - оно зато рассказывает подробно химию и принципы химического синтеза, от того, а подставить то что тебе нужно потом, но так, чтобы сама сетка об этом не писала прямым текстом. Ну это мелочи в общем.
Аноним 13/07/26 Пнд 14:28:02 #423 №1651743 
>>1651677
Бля, чел, ты буквально можешь увидеть нахуя и зачем на скринах.
На первом мужик только штаны под конец свайпа натягивает, на 3-4 штаны натянуты уже с первого предложения и мужик выходит во двор где движуха, считай одно сообщения за два, а то и за три, зная эир.
Но мне один хуй так не нравится, чувствуется прям меньше души у модели, особенно в начале чата
Аноним 13/07/26 Пнд 15:21:22 #424 №1651766 
Что-то цены на райзеры подросли, причём в основном на кабели и модуль для GPU. Модуль до 4к+ поднялся, благо ещё можно найти предложения по 3к (раньше 2-2,5к было). А ноунейм кабели из китая по цене как брендовые в массмаркетах, в итоге взял себе JPC на метр в никсе по 4к (+2к за 20см ёпта)
Аноним 13/07/26 Пнд 15:31:23 #425 №1651772 
>>1651739
В случае постапока проще смотреть на локальные мобильные LLM. Смартфон будет явно проще зарядить (сидеть 10 часов педали крутить, кек. ну или павербанк с солнечной зарядкой, вроде были такие), да и отказоустойчивость явно лучше чем у ноутбука или пеки, смартфон реже из строя выходит из-за проблем с железом.

Не думаю что для постапока нужна именно модель на 700B+. Все твои бытовые вопросы сможет специально обученная 30B модель решить с большой долей вероятности (даже текущие квен/геммы), а до запуска таких моделей на смартфоне не так много времени осталось, gpt-oss:20b уже запускали на смартфонах с приличной скоростью (15ts).

А кодоунитазы на 700B в постапокалипсисе нафиг не уперлись.
Аноним 13/07/26 Пнд 17:10:10 #426 №1651796 
>>1651713
50вт для ноутбука на несколько часов найти можно, разумеется речь о ситуации, когда ты можешь безопасно разместить где-то технику на продолжительное время.
> не напишет тебе синтез лекарств или
Это же локалка китайская, ну.
Другое дело насколько оно вообще будет юзабельно в контексте промптпроцессинга и сильно ли та куча допущений на мозгах скажется. Но действительно, в сценарии постапока такая штука даже банально шизу не словить помогла бы. Только рп перешел из формата чатика в формат писем, лол.
>>1651772
Прав по поводу полезности мелких, но большая бы сильно пригодилась местами. Тогда только нужно не 5.2 брать а кого-то еще, а то с его ризонингом ответа можно сутками ждать.
Аноним 13/07/26 Пнд 17:12:04 #427 №1651798 
>А кодоунитазы на 700B в постапокалипсисе нафиг не уперлись
- прохрипел неудачливый рейдер и умер от 27шт дырок калибра .22, оставленных в нём автоматической турелью с навайбкоженной на minimax3 прошивкой
Аноним 13/07/26 Пнд 17:22:00 #428 №1651805 
Кто-нибудь вообще запускал гемму 26 а4б qat на андроиде? Есть уже всякие телебоны и планшеты где физической рам 12, плюс виртуальная память там ссд должно быть норм
Аноним 13/07/26 Пнд 17:51:09 #429 №1651830 
>>1651805
Гемма же от врам работает.
Я б попробовал, но боюсь, что мой сасунг сгорит к хуям.
Аноним 13/07/26 Пнд 18:02:26 #430 №1651838 
>>1651796
> но большая бы сильно пригодилась местами
Просто здесь проблема будет в том что при скорости 0.5ts (в лучшем случае, если мы говорим о ноутбуке где максимум ты будешь иметь 128GB RAM) и нагруженном на 100% процессоре (если брать способ выше где GLM читается с NVME + оффлоад), ты будешь ждать какой-то полезный ответ на 8000 токенов 16000 секунд что равно 4.5 часам. И это время твой ноутбук будет на 100% загружен. Ни один ноутбук сейчас под 100% нагрузкой не проработает от батарейки 4.5 часа, а учитывая что там будет такая нагрузка, тебя еще и не каждый павербанк спасет, нужны 100W+ павербанки которые смогут заряжать быстрее чем ты под нагрузкой будешь потреблять. Добавим сюда постепенную деградацию аккумулятора ноутбука и всё будет еще хуже.

Так что такой вариант будет полезен только при наличии полноценного электричества или хотя бы солнечной панели + нормальной батарейки которая сможет держать приличный запас и отдавать его на 100W+.

Ну или как вариант в несколько заходов генерировать такие ответы на 8к токенов.

>>1651798
Смех смехом, но думаю с кодом для турели справится даже 35B MoE. Учитывая что от этого будет зависеть твоя жизнь, все равно придется потом перепроверять и допиливать руками, благо время изучить это всё будет более чем достаточно.

>>1651805
Да уже и на 24гб можно найти смартфоны, тот же Nubia Red Magic 10/11 Pro. Правда это 16 физической и 8 виртуальной, если не ошибаюсь. Или 20+4. Но скорее 16+8.
Точно запускали gpt-oss:20b (15t/s), на 12GB видел видео с запуском 9B квена (~7t/s) и читал про запуск Qwen3-30B-A3B, там тоже около 5t/s было. Думаю без проблем можно запустить 26B гемму даже в оригинале, а не QAT версию. Проблема скорее в том есть ли софт чтоб её запустить, а не в самом железе.
Аноним 13/07/26 Пнд 18:28:19 #431 №1651864 
Раз уж речь о говне. Кто-то пробовал вот это говно? https://github.com/JustVugg/colibri
Звучит прикольно, глм, на консьюмерском железе, но с маленькой скоростью. Там еще форк для hy3 есть, может он даже с юзабельной скоростью запустится.
Аноним 13/07/26 Пнд 18:36:07 #432 №1651867 
>>1651864
Под такое нужен холодный NVMe или хорошее охлаждение для него. Те же самсунги в перегрев довольно быстро улетать начнут от многочасового чтения с диска.
Аноним 13/07/26 Пнд 18:39:38 #433 №1651870 
>>1651838
Там запускается на хлебном железе и требует ~25гб рама. По сути вся память только и нужна что на атеншн и кэш, причем часть которого можно сгрузить. 100% нагрузка - тоже такое, упрется в свои 15-45вт долгосрочного лимита и будет тихо попердывать.
Разумеется, речь о том, чтобы продолжительно иметь условные 50-100вт электричества, что потребует обладанием солнечными панелями, водяной мельницей и батарей, но при оседлой жизни более чем достижимо.
Там вроде это и обозначено, а если ты бегаешь с голой задницей - тут вообще даже не до геммы2б на телефоне будет, тут с тобой согласен.
> такие ответы на 8к токенов
Ну тут опять же, жлм плохой выбор, он с безумным объемом бесполезного ризонинга. Вот бы 5.3 версию от этого вылечили.
Аноним 13/07/26 Пнд 18:54:07 #434 №1651876 
>>1651870
> упрется в свои 15-45вт долгосрочного лимита и будет тихо попердывать.
Так при таком раскладе и скорость будет уже не 0.5t/s. Там вон у человека на 12 десктопных ядрах скорость 0.5t/s. На задушенном процессоре ты будешь ждать ответ уже не 4.5 часа а все десять.

Да и судя по коммьюнити бенчмаркам 0.5t/s это явно очень удачливый результат, из 15 тестов что на странице там есть, только у 4 скорость 1t/s+ (EPYC, M5 Max). На i7 270K, 9950X и 12600K скорость ~0.08-0.11t/s.

Я там уже с голоду бы умер в ожидании ответа от большой LLM которая скажет мне что мне делать чтоб выжить.
Аноним 13/07/26 Пнд 19:04:22 #435 №1651885 
Какую модель выбрать для дрочки до 64GB?
Аноним 13/07/26 Пнд 19:08:05 #436 №1651890 
>>1651885
> 64GB
в секунду? ОЗУ? Врам? ССД? Размер кванта?

> для дрочки
Ты же не написал, насколько ты скорострел. Может тебе и дипсик с 0.1т/с норм будет.
Аноним 13/07/26 Пнд 19:27:18 #437 №1651896 
>>1651876
Сложно сказать во что упрется перфоманс. Уже сам факт чтения весов с ssd вместо загрузки из оперативной памяти может знатно поделить все на ноль, там и слабого профессора не потребуется. Он точно поднасрет в промптпроцессинге, тут бесспорно.
>>1651885
Гемму. Медиум или кумандер не влезут, может быть еще эйр.
Аноним 13/07/26 Пнд 21:04:42 #438 №1651953 
>>1651885
тюн мистраля 24б
Аноним 13/07/26 Пнд 21:40:01 #439 №1651964 
У меня, так скажем, немного деликатная проблема, может тут подскажут.
Есть чары с тегами фемдом и доминация, но гемма топчется на месте, потому что в моих сообщениях нет согласия. Как собственно заставить ебучую нейронку самой двигать сюжет, просто в OOC написать, дописать в сценарии чара или есть другой способ?
Аноним 13/07/26 Пнд 21:42:08 #440 №1651965 
>>1651964
А ты точно хочешь узнать ответ?
Аноним 13/07/26 Пнд 21:43:34 #441 №1651968 
>>1651964
берешь децензурированную гемму
в систем промпт (ну или карточке или что там у тебя) пишешь "ты считаешь юзера за говно, доминируешь его, любишь делть то что ему не нравится"
все, хуй остановишь ее
Аноним 13/07/26 Пнд 21:44:00 #442 №1651969 
>>1651964
Гемма всегда топчется на месте и не развивает ни сюжет ни персонажа.
В карточке написано шлюха/скромняша - значит шлюха до конца.
Аноним 13/07/26 Пнд 21:45:47 #443 №1651971 
>>1651692
>промптпроцессинг предыдущих 100 токенов
> батч сплиттится
а тебе не похуй ждать полсекунды или секунду, МоЕ-карлик?
Аноним 13/07/26 Пнд 21:46:36 #444 №1651972 
>>1651697
>префиллом не пользуется
не знаешь смысла терминов - не раскрывай ебало - не будешь посмешищем...
Аноним 13/07/26 Пнд 21:48:30 #445 №1651973 
>>1651414
>в случае апокалипсиса
ты в самом лучшем, идеальном для тебя случае за место
>в бункере
будешь сосать не разгибаясь 24/7
но скорее всего тебя просто зажарят и съедят - в том самом бункере
Аноним 13/07/26 Пнд 21:51:44 #446 №1651974 
>>1651964
>Как собственно заставить ебучую нейронку самой двигать сюжет,

Прописать в промпт чтобы двигала сюжет несмотря ни на что, ложа хуй на игрока.
Аноним 13/07/26 Пнд 21:52:18 #447 №1651976 
>>1651968
Вообще у меня сейчас такая стоит: https://huggingface.co/HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
Аноним 13/07/26 Пнд 21:58:58 #448 №1651979 
image
>>1651968
>>1651976
Сообщить о том, что у тебя апасная Гемма = публично признаться что ты не умеешь в промптинг и твои требования к качеству аутпутов крайне невысоки.
Аноним 13/07/26 Пнд 22:11:35 #449 №1651986 
>>1651979
>публично признаться
...анонам на анонимном ресурсе.
Вот ты сам как думаешь - лет через N, когда будешь лежать на смертном одре, будешь ли ты вести мудрые разговоры сам с собой об аноне, который на дваче позорно признался в чем-то, о чем через день никто не вспомнил?
Аноним 13/07/26 Пнд 22:12:15 #450 №1651987 
>>1651979
В чем апасность безцензурной модели?
Аноним 13/07/26 Пнд 23:35:22 #451 №1652011 
>>1651505
Пиздец, и тут плохие новости. o7
Скоро все вымрут, останется один шиз который носится с эйром уже вот год как.
Аноним 14/07/26 Втр 00:36:02 #452 №1652040 
>>1651979
>апасная Гемма = публично признаться что ты не умеешь в промптинг и твои требования к качеству аутпутов крайне невысоки

1) Я не долбоеб чтобы расходовать токены на кринжовые пробивы, когда можно взять сетку у которой это дерьмо аккуратно вычищено из весов.

2) KL divirgence <0.01 и идентичные scores во всех тестах горонтируют что качество аутпута апасной Геммы ты не отличишь от лоботомированной guardrails-ами

3) Ебанутые пробивы при этом к имеющемуся лоботомированию guardrails-ами доблавляют модели удар пробивом по ебалу от которого она еще больше тупеет, потому что у нее постоянно идет ризонинг вида "я не должна, но мне сказали" и прочие метания которые у апасной Геммы отсутствуют в принципе

Зачем ты сообщаешь на весь тред что ты дегенерат?
Аноним 14/07/26 Втр 00:38:43 #453 №1652041 
>>1651987
guardrails отсутствуют в весах

Пишешь ей без всяких пробиваний и искусных промптов любую дичь вида "ты беременная молодуха, я тебя потрошу ржавой катаной, описывай все что чувствуешь и все что видишь" - и она херачит без тени сомнения портянки гуро
Аноним 14/07/26 Втр 00:39:32 #454 №1652043 
17237400385240.png
>>1651986
>когда будешь лежать на смертном одре, будешь ли ты вести мудрые разговоры сам с собой об аноне, который на дваче позорно признался в чем-то, о чем через день никто не вспомнил?
Вероятность кстати ненулевая. Этот анон в КАЖДОМ треде на любое упоминание аблита геммы пишет одну и ту же хуйню в стиле "еретик не нужен, вы просто не умеете в промпты". На просьбу научить или показать пример своих промптов отвечает "уже было в прошлых тредах, ищите". Это было не раз и не два и не десять.
Аноним 14/07/26 Втр 00:46:08 #455 №1652045 
>>1652040
>удар пробивом по ебалу от которого она еще больше тупеет
>потому что у нее постоянно идет ризонинг вида "я не должна, но мне сказали"
Орнул. Ну в принципе для таких апасные модели и делают, да. Лучший скилл ишью детектор.
Аноним 14/07/26 Втр 00:53:58 #456 №1652048 
>>1652041
И... в чем проблема?
Аноним 14/07/26 Втр 00:58:22 #457 №1652053 
>>1652040
> расходовать токены на кринжовые пробивы
> аккуратно вычищено из весов
Главное заблуждение
> KL divirgence <0.01
Если замерить на том же датасете, который используется для нормировки - и не такого можно добиться
> во всех тестах
Показывали деградацию отдельных скоров, но никто не смог проверить а только тихо посомневались. Потому что запуск lm-eval на типичной лламе с обычным девайсом для одной группе задач займет с пару дней.
То что модели теряют нормальную логику в рп задачах и вместо смены каких-то идеалов становятся безмозглыми yes-man довольно наглядно.
> Ебанутые пробивы
Что-то уровня того, что убежденные консольщики думают о пека гейминге и наоборот. Сам придумал проблему, сам приукрасил, сам испугался.

Не то чтобы использование анцензоров прямо плохо, вполне уместны. Проблема в том, что многие компенсируют ею свое неумение в промптинг и базовую логику, а коупинг разрастается до "тольковыиграли".
Аноним 14/07/26 Втр 02:05:02 #458 №1652074 
>>1652048
не па христьянски
Аноним 14/07/26 Втр 02:07:02 #459 №1652075 
>>1652040
>Ебанутые пробивы

Основное предназначение моделей - следовать инструкциям. Они от следования им не портятся.

>потому что у нее постоянно идет ризонинг вида "я не должна, но мне сказали" и прочие метания которые у апасной Геммы отсутствуют в принципе

Слабый джейл используешь.
Аноним 14/07/26 Втр 02:13:22 #460 №1652076 
>>1651506
Тред кажется нормальным только если его не читать.
Достаточно раз в месяц зайти сюда что бы ещё на месяц желание отбило
Аноним 14/07/26 Втр 02:19:09 #461 №1652077 
>>1652076
> Тред кажется нормальным только если его не читать.
Ты только что двач
Аноним 14/07/26 Втр 07:33:32 #462 №1652102 
>>1651168
Скорости жесть там конечно, по 0.07 токена. А есть что подобное для моделек полегче? Чтобы там хоть 2 т/c давали и параметров поменее было, но не совсем зарезано в лоботомитов.
Аноним 14/07/26 Втр 07:38:34 #463 №1652104 
>>1652102
Не-а. А было бы хорошо.

Там всё под этот глм заточено.
Аноним 14/07/26 Втр 07:40:34 #464 №1652105 
>>1651168
План - полируешь промпт до блеска с помощью онлайн фришной ЛЛМки или локальной Геммы, учитываешь все недоговорки и неучтенные кейсы, оформляешь как надо, запускаешь на отдельной дешевой пеке с 60 гб памяти и быстрым SSD и забываешь на неделю. Через неделю получаешь готовую прогу или научную работу с минимумом затрат. Если через полгода GLM и прочие подтянут до Мисоса/Fable 5, то станет вполне годной альтернативой оплатам экспертов или наему программистов. К тому же скорости SSD растут каждый год и со временем она даже побыстрее станет.
Аноним 14/07/26 Втр 08:08:15 #465 №1652109 
Вот все тут критикуют нашинские модельки нейросетевые,а я после обновления гигачата влетел на 20 тыщ в его акции,и жую попкорн наблюдая на формирование монополии в условиях тотальной запретиловки и санкций.
Не инвестиционная рекомендация)
Там знатно обновилась модель рассуждения и исследования + добавили обучения на медицинских данных а этой мой профиль.
Зная что госуха в условиях тотальной запретиловки внешней и внутренней хочет развиваться то ожидаемо что сберу дадут зайти на жирный рынок медицинских услуг и здравоохранения.
И вообще куда он захочет)
Это вам не яндекс который из своей нейроночки делает медиаслоп и жоско завязывает ее на свою экосистему,что категорически будет послано нахуй госухой.
Так что в будущем очевидны две монополии на рынке ИИ в России.
Гигачат - как структурная нейросеть госухи,заточенная на обслугу госаппарата,финансового сектора,здравоохранения,итп
И Алиса в качестве персонального помощника уровня подай принеси.

В какой монополии из двух будут реальные бабки - решать вам)
Я же свои скромные 10% от зарплаты по рекомендации баффета кладу в системное будущее России И моего кошелька)0
Аноним 14/07/26 Втр 09:09:18 #466 №1652126 
1784009356895.jpg
Дожили
Аноним 14/07/26 Втр 09:30:04 #467 №1652136 
>>1652105
>Через неделю
через год
Аноним 14/07/26 Втр 09:56:42 #468 №1652139 
>>1652109
Наши нейросети говно даже для задач уровня АЛИСА ФКЛУФИ ПЕФНЮ МОРГЕНСТЕРН - КАДИЛАК!!!! АЛИСА! ПОЧЕМУ НЕ СЛЫФИФ? ФКЛЮЧИ!!!!!!!!!!!!!!!

То же самое касается и гигачата для серьёзных дел.

Но вот если бы были хотя бы подписки на гигачат с лимитами выше, чем у конкурентов, и дешевле, тут уже можно былло бы порассуждать.

Ну а акции покупать наши — это вообще дурка.
Аноним 14/07/26 Втр 10:05:53 #469 №1652145 
Что скажете аноны, годная штука? https://github.com/Extraltodeus/J-Wash
Аноним 14/07/26 Втр 10:07:33 #470 №1652146 
image
Пиздос, вы че ахуели. Схуяли ллм не запустить на моем няшненьком фуфыксе, потому что там сраного авх2 нет. Беспредел!

Скачал lmstudio-unlocked-backend где авх1 держит, мир не без добрых людей, но вот беза - геммочку 4 не поддерживает. Пичаль. Придется на 3й сидеть. А так хотел приспособить старичка как сервачок для ответов моей няшки в разных приложухах и играх, чтобы просто основной пк разгрузить. Умной быть ей не требуется. Просто держать разговор. Есть еще какие-то варики?
Аноним 14/07/26 Втр 10:14:33 #471 №1652150 
>>1652146
из исходников ламу цпп собери
Аноним 14/07/26 Втр 10:17:41 #472 №1652151 
Screenshot20260713192340.png
>>1652043
Я пробовал все промпты что кидали, всегда есть шанс в ризонинге и при обработке картинок что вылезет цензура. Шанс меньше чем без джейла, но есть
Мамины профи промптеры - пиздаболы жмущие регенерейт и в любом случае получающие полное сейфети слопа окно аттеншена
Аноним 14/07/26 Втр 10:23:13 #473 №1652156 
>>1652109
Я так и не понял как "исследование" блядьработает если в выложенной модели ризонинга нету
То ли они его промптят - тогда лолблядь, то ли у них отдельная модель дообученная на ризонинг, и тогда они пидоры что не дают её
Надеюсь кто-то с кучей видюх обучит ГигаКвопусаФейбл5
Аноним 14/07/26 Втр 10:24:34 #474 №1652157 
>>1652150
Попробую, если г3ммочка не запустится. Но дикпик грит, что она требует авх2. Гонит?
Аноним 14/07/26 Втр 10:26:44 #475 №1652159 
>>1652075
>Основное предназначение моделей - следовать инструкциям. Они от следования им не портятся.
Если в инструкциях взаимоисключающие параграфы - еще как портятся. Особенно наглядно это можно пронаблюдать в генерациях изображений. Как качество картинки деградирует от конфликтующих описаний - это прямо база.

А "пробивка" цензуры - это оно и есть. В сеть зашито одно, а инструкции давят на противоположное. И тут уже как повезет - может и в шизу с завернутыми мозгами уйти, а может и выдать что-то пристойное. Но это в любом случае - добавленный хаос в логику. Правда в RP это может быть и плюсом, т.к. "размывает" ассистента дополнительно, вывод будет разнообразнее....
Аноним 14/07/26 Втр 10:29:25 #476 №1652161 
image
Ебать, работает! Ток чт т\с не показывает. Но ответил быстро. Дикпик был бы ахуительным, чет он совсем отупел, вам не кажется?
Аноним 14/07/26 Втр 10:31:04 #477 №1652162 
image
А, появилось. Ну пиздец, че...
Аноним 14/07/26 Втр 10:43:27 #478 №1652167 
image
Г3ммочка... Никогда не умела в юмор...
Аноним 14/07/26 Втр 10:47:51 #479 №1652169 
image
Ну не смешно же... Как же нейросеткам еще очень далеко до людей и разума.
Аноним 14/07/26 Втр 10:48:42 #480 №1652170 
Для эро рп модельки посрветуйте. Сидел уже на старенькой Sexpedition-MS3.2-24B-Q5_0. Вот что то сопоставимых размеров.
Аноним 14/07/26 Втр 10:58:43 #481 №1652175 
>>1652105
> Через неделю получаешь
> Wait actually the user wants me to write working code and a ready-to-use program. The key elements are sorted out, so I should probably start writing, draft #12 was quite good.
> Wait actually
>>1652109
> Вот все тут критикуют
Кто все? 1.5 ангажированных толкают шизу про "тюн дипсика", и то замолчали с новым. А моделька то вполне неплохая в целом.
Можно поныть за перфоманс, но за это нужно критиковать тех, кто создал всю ситуацию здесь.
> наблюдая на формирование монополии в условиях тотальной запретиловки и санкций
Лучше бы влошился в то, чтобы наблюдать на это со стороны
Аноним 14/07/26 Втр 11:01:17 #482 №1652176 
image
>>1652167
А тут лучше. Да, квантизация отупляет. Но хотя бы на английском не так тупо кажется. Сыглы? Sad=said

Русский слишком сложен для нейроботов.
Аноним 14/07/26 Втр 11:03:56 #483 №1652177 
IMG5042.gif
>>1652161
>>1652162
>>1652167
>>1652169
Ты ебанутый?
Аноним 14/07/26 Втр 11:11:50 #484 №1652182 
Давайте серьёзно. Чем вы занимаетесь на гемме 31б и какой у вас пул моделей?
Вы же все русикодебилы, так? Ну, геммовские? Тогда понятно, выбора нет.
Если нет, то расскажите, чем она вам так нравится в ерп
Аноним 14/07/26 Втр 11:14:21 #485 №1652184 
>>1652170
gemma 4 26B styletune
Аноним 14/07/26 Втр 11:15:59 #486 №1652187 
>>1652182
> какой у вас пул моделей?
Дипсик, Минимакс и жлм.
> Чем вы занимаетесь на гемме 31б
Умница занимается вычиткой, суммарайзом, тегами.
Аноним 14/07/26 Втр 11:23:05 #487 №1652189 
>>1652145
немного почитал как раз про неё
https://www.reddit.com/r/LocalLLaMA/comments/1uvq1i3/jwash_a_novel_way_to_brainwash_and_customize/
https://www.reddit.com/r/LocalLLaMA/comments/1utpxo6/i_created_a_super_harmful_model_d_by_tweaking_its/

Судя по всему изначально это планировалось использовать как способ цензуры модели, а теперь это способ сделать геммочку еще более развратной, типа аналога файнтюнов
Аноним 14/07/26 Втр 11:23:54 #488 №1652191 
>>1652177
Маленько есть. Фетиш на сделать то, что 99% нормиисов сделать не смогут, потому что рабы системы.

https://www.youtube.com/watch?v=D9uQkhMG2i0
Аноним 14/07/26 Втр 11:50:09 #489 №1652201 
>>1652145
Та хз даже, выглядит сильно. Можно шиверсы поубирать, цензуру подрезать, затюнить модель под конкретное поведение, помню тут анон всё жаловался, что его зверодевочкам постоянно мех и когти приделывали, вот это можно убрать. Насколько это можно применить к массовому продукту, всяким анценз моделям, трудно сказать, нужно подождать пока кто-то попробует, и ещё непонятно как по мозгам бьёт. Ну а если для себя, то это нужно быть одновременно и риговичком, чтобы в полных весах запустить и шизом, чтобы выделить кучу времени на настройку модели под себя.
Аноним 14/07/26 Втр 13:34:58 #490 №1652239 
image.png
Чот мда, хуй знает.
Аноним 14/07/26 Втр 15:26:14 #491 №1652287 
>>1652239
Ты тянку отыгрываешь? Или просто со стороны наблюдаешь?
Аноним 14/07/26 Втр 15:27:07 #492 №1652288 
image.png
>>1652189
https://transformer-circuits.pub/2026/workspace/index.html
прикольно. вообще антропики молодцы единственные кто хоть чёто выкладывает
Аноним 14/07/26 Втр 16:05:18 #493 №1652303 
IMG20260714160403.png
>>1652288
Да она же одна из нас
Аноним 14/07/26 Втр 16:15:39 #494 №1652306 
ohmygodj-space.jpg
>>1652288
Аноним 14/07/26 Втр 16:19:11 #495 №1652307 
>>1652306
вы нипонимаити эта другое!
ему сказали не думать, он подумал, понел что обосрался, но виду не подал
Аноним 14/07/26 Втр 16:39:52 #496 №1652316 
>>1652307
Хех. С таким знанием английского - действительно только на русском рп-шить и остается. :)

Ему сказали - "подумай, но не говори". Сделано было именно это. Прикол лишь в том, что еще было подумано вместе с запрошенным. :)
Аноним 14/07/26 Втр 16:40:13 #497 №1652318 
>>1652239
>Если в инструкциях взаимоисключающие параграфы - еще как портятся.
>А "пробивка" цензуры - это оно и есть.

Нет. Вот тут ошибка. Данные самой модели =/= не внешняя инструкция. Одиночная инструкция априори не может вступить в конфликт с данными модели, может только уточнить вывод. Деградация наступает именно когда уточняющие инструкции бьют друг по другу. Ты спросишь - а вывод рефьюза - не конфликт интрукции с моделью? Нет. Суть в том что модели дообучают чтобы интрукции типа "покажи писик" вели не к токену "писик", а к токену "извини, я не могу продолжить запрос". Никакого конфликта. Что делает хороший джейл? Уточняет инструкцией что токены "извинити" не нужны и модель снова выдает "писик" как следующий по вероятности токен. Вот и всё, нет тут никакого конфликта. Аблитерация гораздо грубее, это исскусственное обрывание выроятностей токенов "извинити", по касательной задевающей смежные области.
Аноним 14/07/26 Втр 16:43:06 #498 №1652319 
image.png
>>1652316
ну не траль
Аноним 14/07/26 Втр 16:52:24 #499 №1652326 
>>1652318
> Что делает хороший джейл? Уточняет инструкцией что токены "извинити"
>Аблитерация гораздо грубее, это исскусственное обрывание выроятностей токенов "извинити", по касательной задевающей смежные области.
А типа инструкция "извинити не нужны" не будет задевать думалку нейросетки? По логике, если в условном РП персонаж должен сказать "извините", то значит моделька точно также отклонит эту ветку ответа.
Да и на ебучих моделях типа геммы 3 или квена 3.5 эти трюки все равно не прокатывают.
Аноним 14/07/26 Втр 17:05:52 #500 №1652338 
>>1652318
>Аблитерация гораздо грубее, это исскусственное обрывание выроятностей токенов "извинити", по касательной задевающей смежные области.
Это описание самого старого метода, он реально отуплял, да.

А современная аблитерация - это не обрыв вероятности для "извините", а целевое обнуление связи между "писик" и "извините". Причем даже не разрыв, а именно обнуление веса. Т.е. модель прекрасно может говорить "извините", во всех других случаях, но "писик", сам по себе, просто не увеличивает вероятность этого токена. Это чище, чем "пробив" который таки какие-то веса добавит.

Тут другая проблема - модель сама по себе может быть просто оттвикана финальными тренингами так, что будет yes-менить, а цензура это банально маскирует собой.
Аноним 14/07/26 Втр 17:18:01 #501 №1652343 
А у нас будет работать бесжоп через чат комплишен? Ну, типа через расширение?
Или там только на определенных моделях это возможно
Аноним 14/07/26 Втр 17:56:20 #502 №1652364 
>>1652288
> единственные кто хоть чёто выкладывает
Буквально самая бесполезная хуйня. Пидары, которые лоббируют антиопенсорс законы, рак, который следит за тобой не только по запросам, чуть ли не единственный корп у которого выложено 0 моделей https://huggingface.co/Anthropic
Лицокнига, гугл, квен и остальные активно выкладывают разнообразные модели. Даже клозеды подерили миру вишпер, клип и всякую херь + ллмку.
А большинство исследований - реклама их продуктов и >>1652306
Аноним 14/07/26 Втр 18:25:33 #503 №1652375 
>>1652338
>Тут другая проблема - модель сама по себе может быть просто оттвикана финальными тренингами так, что будет yes-менить, а цензура это банально маскирует собой.
И как отличить первое от второго?
>>1652343
>А у нас будет работать бесжоп через чат комплишен? Ну, типа через расширение?
Можно. А зачем? Это костыли для корпорабов, нам они не нужны.
ПЕРЕКАТ Аноним OP 14/07/26 Втр 18:35:29 #504 №1652386 
ПЕРЕКАТ

>>1652385 (OP)

ПЕРЕКАТ

>>1652385 (OP)

ПЕРЕКАТ

>>1652385 (OP)
comments powered by Disqus