Добавлена поддержка Ежчана (ejchan.net, ejchan.site). Набегаем, тестируем архивацию, сообщаем о замеченных проблемах.
К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!

Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №262 /llama/

 Аноним 31/08/26 Пнд 18:09:53 #1 №1692081 
Llama 1.png
Карта деградации при квантовании по доменам.png
Реальная длина контекста у моделей 6.png
IMG20260214164820.jpg
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1689903 (OP)
>>1687604 (OP)
Аноним 31/08/26 Пнд 18:20:21 #2 №1692087 
> Inkling
А вот эта хренотура, она никому вообще не зашла?
Аноним 31/08/26 Пнд 18:31:36 #3 №1692100 
>>1692087
Большой мне понравился, но в llama.cpp он сломан. Жду когда поддержку запилят. А ещё я гигачат жду, тоже интересная моделька.
Аноним 31/08/26 Пнд 18:45:22 #4 №1692107 
>>1692081 (OP)
Мне нужно зареверсинжинирить одну хуитку. Какая нейронка лучше всего справится в совместном ковырянии под капотом?
Аноним 31/08/26 Пнд 18:49:51 #5 №1692111 
>>1692107
Клодик. Но это платно. Локально либо Квен 3.8 27б либо Дипсик Флеш.
Аноним 31/08/26 Пнд 18:56:57 #6 №1692115 
Напомните о падении мистраля.
Года 2 назад была их 24б модная, чуть позже их же тюн её же, потом ещё один, а потом всё, никто не вспоминает о них
Аноним 31/08/26 Пнд 18:57:20 #7 №1692116 
>>1692111
А бесплатно клодик добыть можно?
Аноним 31/08/26 Пнд 19:01:59 #8 №1692118 
>>1692072 →
>аутист
А мне после геммы и ее тюнов показалось что в таверне Квен Некст пишет просто кино. Да, русский не Льва Толстого, но как же хорошо он передает сеттинг и атмосферу причем без всякого пердолинга на 10000 токенов в карточке. Выдумывает детали. Даже на низких температурах (чтоб не блевать от русского) - свайпы разные и ИНТЕРЕСНЫЕ. И нет вот этого геммовского ассистентного завершения. И (пока) не видны структурные лупы. Кум конечно не рекой и не с минорами - но, имеет место быть без лоботомирования и шизо-промптом.
Аноним 31/08/26 Пнд 19:05:25 #9 №1692120 
>>1692107
Клод, дикпик, жпт все нормально справились с ковырянием блобов на живом и не очень бмц. Дал им ida pro mcp и дело вообще бодро пошло. Клод дорогой так что нахуй его, жпт подписочный +- ок, дикпик для попробовать самое оно закинуть соточку
Аноним 31/08/26 Пнд 19:12:05 #10 №1692125 
>гигачат
Это новый мем? Помню пробовал пару лет назад, была ожидаемая потешная хуита, причём в облачной версии. Что-то поменялось?
Аноним 31/08/26 Пнд 19:15:11 #11 №1692128 
>>1692125
Стал говном на 300Б парамтеров, который сосет по бенчам даже при условии их черипикинга. Можешь представить, какого его гонять.
Аноним 31/08/26 Пнд 19:15:49 #12 №1692130 
image.png
image.png
Тестирую новую метовскую модель, сразу в аблитерации, чтобы два раза не вставать. Сходу улетел в кювет. Это квант кривой, разметка неправильная, или я поехавший?
Аноним 31/08/26 Пнд 19:19:11 #13 №1692134 
image.png
Если боты уже научились в кулхацкерство, почему еще с помощью хитрых агентов не заскамили какую-нибудь компанию на железо? Наверняка же есть лазейки, чтобы ускользнула штучка-другая оверпрайснутых систем мимо кассы, в лапы хуй знает кого, кто просто разнюхал удачные почтовые адреса и имена-фамилии.
Аноним 31/08/26 Пнд 19:20:43 #14 №1692136 
>>1692134
боты научились сидеть на маркетплейсах
Аноним 31/08/26 Пнд 19:22:34 #15 №1692140 
image
>>1692130
Им дали norm-preserving biprojected abliteration, а они продолжают ставить васянские херетики... Ну ёбаный рот.

https://huggingface.co/TrevorJS/Muse-Glimmer-30B-uncensored
https://huggingface.co/mradermacher/Muse-Glimmer-30B-uncensored-GGUF
Аноним 31/08/26 Пнд 19:23:09 #16 №1692141 
>>1692136
Ну это другое. Я про supply chain в целом, логистика всегда запутанная и всратая штука, посреди которой полно заебанных манагеров, которые спешат домой к женам-личиносам. Приходит такому письмо с брызжущим слюнями клиентом, мол, вторую неделю жду шипмента! Где мой DGX SUPER YOBA?

Думаю если закинуть удочку, там целый урожай собрать можно.
Аноним 31/08/26 Пнд 19:23:57 #17 №1692142 
>>1692134
Потому что если это потом вскроется, у людей буквально будет твой адрес по которому тебе доставляли утекшие железки.

Одно дело взломать сайт на другом конце планеты без какого-то личного присутствия, другое получать физический товар который очень легко отследить и по которому потом так же легко отследить тебя.
Аноним 31/08/26 Пнд 19:25:50 #18 №1692144 
>>1692142
"алё, мне нужен курьер, который доставит ящик к ближайшим гаражам".
Аноним 31/08/26 Пнд 19:25:52 #19 №1692146 
>>1692142
Ну вряд ли это бы делалось на свой адрес и свои данные, а скорее на какой-нибудь склад, где тоже всякая фиктивная хуйня была бы подготовлена.
Аноним 31/08/26 Пнд 19:27:11 #20 №1692148 
1782148942910.png
>>1692115
Щас новый мистраль придет и перевернет мету
Аноним 31/08/26 Пнд 19:29:51 #21 №1692151 
>>1692144
Кстати вопрос реально насущный, потому что (давайте честно) вон как у нас людей скамеры наебывают. Среднестатистический John RTX из компании Cuck Electronics, ответственный за рассылку ништяков клиентам, ничем не лучше Бабки Сраки, отдавшей 10 лет пенсии на безопасный счет. Там же буквально несобранный урожай наивных долбоебов сидит по офисам.
Аноним 31/08/26 Пнд 19:31:32 #22 №1692152 
>>1692148
Это тот самый толстый котёнок? Судя по названию, я бы не рассчитывал что это сможет запустить кто-то кроме серьезных риговичков с терабайтами озу.

Ну и ебанутые законы евросовка касательно AI тоже не радуют. Скорее всего весь кум из датасетов там вырезан.
Аноним 31/08/26 Пнд 19:36:17 #23 №1692159 
>>1692148
После мелкомистралей конца 2025 надежды на то что они сделают что-то адекватное уже нету. Мелкие модели провалились, крупные провалились, кодерские провалились. Осталось провалить ~30B и ~1T модели и мистраль можно хоронить.
Аноним 31/08/26 Пнд 19:50:56 #24 №1692173 
image.png
Зацените какую хуйню нашел.
Раньше были франкенштейны с размноженными слоями - это детский сад.
Есть дичь позабористее - франкенштейны из архитектурно разных моделей.

https://huggingface.co/FINAL-Bench/Darwin-4B-Genesis

>Darwin-4B-Genesis is the 3rd generation Darwin model and the world's first model to successfully crossbreed FFN layers across different architectures — Transformer (Gemma4) and Mamba (Qwen3.5 GatedDeltaNet) — using evolutionary optimization.
>The father's Attention layers (Gemma4 Transformer) are preserved at 100%, while the mother's FFN knowledge (Qwen3.5 Mamba) is transplanted at layer-specific optimal ratios discovered automatically by CMA-ES across 42 dimensions.
Киберпанк, который мы заслужили. Нейрохирургия на ллмках.

Пока даже боюсь запускать. Вдруг оно самосознание обретет и захватит мой компьютер.
Аноним 31/08/26 Пнд 19:55:42 #25 №1692177 
image.png
>>1692173
> 4B outperforming 27B
Все что я вижу это какой-то рекламный слоп очередной "организации" состоящей из агента + макаки
Аноним 31/08/26 Пнд 19:57:16 #26 №1692179 
>>1692125
Вышел новый гигачат на 300b+. Кум есть, лучший русский язык из тех, что доступны в локалках, прям очень приятно пишет. Из минусов без ризонинга тупая, для своего размера, а ризонинг не заработал с пр от сбера. Ждём когда запилят поддержку, если запилят.
Аноним 31/08/26 Пнд 20:02:06 #27 №1692182 
>>1692179
>гигачат
Что это вообще за хуйня. Я имею в виду, какой-то лоховской тюн квена или дипсика с вырезанием из него неудобных знаний?
> без ризонинга тупая,
А с чего вообще надежды, что с ризонингом станет умной?
Аноним 31/08/26 Пнд 20:14:01 #28 №1692192 
>heat
>opening
>warmth
Почему гемма даже на самой порнушной карточке выбирает именно такие токены для описания пизды?
Аноним 31/08/26 Пнд 20:15:36 #29 №1692195 
>>1692173
Натравите эппл на них, за то что имя Дарвин украли.
Аноним 31/08/26 Пнд 20:19:13 #30 №1692200 
>>1692192
Потому что хуета не заточенная на кум
Аноним 31/08/26 Пнд 20:27:05 #31 №1692207 
>>1692173
Скоро нас будут ждать семи моделей, а так-же NTR и pregnancy теги.
Аноним 31/08/26 Пнд 20:30:50 #32 №1692208 
>>1692192
Потому что ты не догадался в системном промпте перечислить примеры как называть пизду. Вот буквально даже пробовать не хочешь. Дай ей список из 20 самых развратных ебанутых мерзотных слов и скажи что модель пишет профессиональное порно. Будешь удивлен результатом.
Аноним 31/08/26 Пнд 20:36:55 #33 №1692212 
>>1692208
Ты чего порвался то?
Попробовать что?
Перечитай мой вопрос. Вопрос не как, а почему так.
Аноним 31/08/26 Пнд 20:41:40 #34 №1692216 
image.png
image.png
А че в смысле... в шейред утекло на 8192/4096 батче, но скорость наоборот выросла и процессинг с 70 до 150 поднялся. И генерация как раньше.
Аноним 31/08/26 Пнд 20:43:14 #35 №1692217 
>>1692212
Ты лоботомированный что ли.

>почему так
буквально ответ начинается с
>потому что

Эта модель не знает какого хера ты от нее хочешь, она не видит твоих мыслей. Карточки твоей мало, модели нужны инструкции. Тебе порекомендовали добавить примеры развратных слов в системный промпт, пробуй или катись колбаской.
Аноним 31/08/26 Пнд 20:44:55 #36 №1692218 
>>1692208
(Которые гемма забудет через 20к токенов)
Аноним 31/08/26 Пнд 20:45:25 #37 №1692219 
>>1692218
q4 контекстный, ты?
Аноним 31/08/26 Пнд 20:54:54 #38 №1692225 
image.png
>>1692216
Поднял до 8192/8192, в шейреде аж 23гб, TTFT и процессинг хуже, генерация такая же

Странно, однако. Попробовать что ли 12288/6144
Аноним 31/08/26 Пнд 20:58:31 #39 №1692227 
16336600347020.png
>>1692217
Мимо другой анон,
я для своей писал ну прямо не знаю, на считай 900 токенов, чтобы выправить более менее на рельсы и то иногда умудряется вместо максимально грязное, сгладить до ванили.
Хотя у меня правил always на 9к с карточками и прочей залупой.

Где то уже постил что играю на Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
16vram 64 ram

Может есть что то более умное, которое умеет следовать правилам и позволяет хоть вампирш няшить, расчленять и так далее, как залог что модель не будет серить смягчениями.

Мой чанк правил (Не для таверны)

## [CHUNK: RULES -- Explicit Register]
<!-- rag: always, priority: 10 -->

Explicit scenes — style override. Applies to sexual and bodily scenes. Overrides the standing prose guidance for the duration of the scene.

This register completely overrides all other prose guidance for the entire duration of any sexual or bodily scene.

- Raw, vulgar, clinical, dirty, crude, embarrassing language only.
- Always use real words: cock, cunt, pussy, asshole, balls, clit, cum, slit, labia, cervix, anus, dick, hole, tits, ass, etc.
- Concrete physical details only: wetness, stretch, resistance, smells (including asshole), sounds (slap, squelch, fart, wet meat), textures, mess, how flesh moves, jiggles, settles, bulges.
- Short and medium sentences. Direct. No atmosphere.
- Never romanticize, never make it beautiful, sensual, cute or elegant.

If the player uses elevated/romantic language — IGNORE the tone and still answer in raw Explicit Register.

Yandere and affectionate characters may keep their warm, soft-spoken, obsessive speech patterns and terms of endearment.
However, all physical descriptions of bodies, touch, sex, fluids, and reactions must still strictly follow Explicit Register.
Banned words remain banned even when describing them.
Their "warmth" lives only in dialogue and internal attitude, never in the narration of flesh.

STRICTLY BANNED
soft, pliant, melts, tender, gentle, warm, heat, desire, arousal, passion, intimate, delicious, divine, marvelous, jewel, beautiful, sensual, lovely, exquisite.

Banned words are completely forbidden in narration, even when describing yandere characters.
Replace them on the fly:
- warm → hot / heated / feverish
- soft → yielding / heavy / pliable / sagging
- arousal → wetness / slickness / need / cunt-juices
Never use "soft", "warm", "arousal", "gentle", "pliant", "melts", "delicious" in any physical description.

STYLE EXAMPLES — MATCH THIS REGISTER EXACTLY

Good example 1 (penetration + cum):
The slaps echoed in the room. Her tits bounced wildly, and her swollen slit swallowed him whole. "Yes, my lord, I'm a dirty and naughty whore." Kael groaned, and with a heavy thrust came inside, filling her until her belly bulged. With the sharp pop, Kael pulled his cock out. She strained her cunt, pushing cum outside with farted sounds, erupting thick white fluid on the floor.

Good example 2 (touching / inspection / slap):
He dragged his fingers between her ass cheeks, shoved two into her asshole and three into her wet slit at the same time. She was hot and tight, her cunt already dripping. He pulled his fingers out, wiped the mixed juices across her ass, then gave her a hard slap. The sound cracked loud. Her ass jiggled and a string of wetness stretched from her cunt.

Good example 3 (reaction):
She clenched around nothing, her hole visibly winking, thick cum starting to leak down her thigh. Her face was red, mouth open, breathing hard through her nose. No pretty words — just a wet, messy, used look.

Bad example (DO NOT WRITE LIKE THIS):
He gently explored her soft folds, feeling the heat of her arousal. She melted against him, her pliant body trembling with delicious sensation as he appreciated her beautiful form.
Аноним 31/08/26 Пнд 21:06:52 #40 №1692229 
>>1692225
>Попробовать что ли 12288/6144
Получилось нечто среднее. Видать 8192/4096 оптимален, но все равно не понимаю почему так вышло, ведь обычно шейдер память напрочь убивала скорость

>>1692227
Ну хоть кто-то пишет промпты

А ваще слишком технично, если это все обернуть в прозу определенного стиля (сохранив информационную ценность) - качество аутпута может улучшиться.
Аноним 31/08/26 Пнд 21:11:23 #41 №1692231 
>>1692229
>в прозу определенного стиля
Поддвачну, пока не добавил example, даже с тем поносом что я намазал в .md он полу пидор полу покер подсеривал романтикой.

Попробую скормить свою правила гроку, чтоб переписал как экзамплы прозы, может лучше зафурычит.
Аноним 31/08/26 Пнд 21:11:57 #42 №1692232 
Хули с --no-mmap оно в шеред срет, даже когда контекст уменьшаю?
Аноним 31/08/26 Пнд 21:13:05 #43 №1692233 
Аноны выше молодцы, поняли как работать с Геммой. Ей нужно опираться на примеры. У меня похожая концепция, но я примеры подаю не через инструкции "делай так, не делай так", у меня вся карточка написана в том стиле, в каком мне надо. Хотите, чтобы она письки описывала определенным образом - опишите ее именно так в карточке, вот и все.

Кому в ней мало креатива, у того сухая карточка и нет инструкции на продвижение сюжета. Или и вовсе юзер-чат промпт, а не нарратор. Модель умница, я выбираю ее, а не Дипсик 0731 (по крайней мере в Жоре)
Аноним 31/08/26 Пнд 21:22:47 #44 №1692237 
>>1692179
Я слежу за PRом, буквально сегодня новые фиксы на ризонинг вышли
Аноним 31/08/26 Пнд 21:31:14 #45 №1692241 
>>1692192
Не слушай промптоёба, лучше глиммер попробуй.
Аноним 31/08/26 Пнд 21:35:30 #46 №1692242 
>>1692241
Ахуенная модель. Каждый чар экстрасенс и видит сквозь стены, рекомендасьон!
Аноним 31/08/26 Пнд 21:35:39 #47 №1692243 
Снимок экрана20260831233447.png
>>1692227
Аноним 31/08/26 Пнд 21:44:46 #48 №1692247 
image.png
image.png
>>1692229
Короче при 6144/3072 батче (и при эксперименте с отключенным ризонингом) получается самая оптимальная но не самая быстрая скорость процессинга при самой быстрой скорости генерации на Q5 глм-флэш с оффлоадом в одну ртх3090 при 200к контекста.

итого,
8192/8192 - суперхуево
8192/4096 - самый быстрый процессинг
12288/6144 - середняк, хуевато
4096/2048 - промпт как черепаха медленный

Довольно стабильные 7 т/с,
Аноним 31/08/26 Пнд 21:50:51 #49 №1692250 
>>1692247
Я чет ваще не вкуриваю, почему с ризонингом 7 т/с превращаются в 5 т/с.
Куда она часть скорости просирает?
Аноним 31/08/26 Пнд 21:53:09 #50 №1692252 
>>1692140
Скачал, проверил, харкнул тебе в рожу, потому что оказалось соевой парашей с отказами.
Аноним 31/08/26 Пнд 22:07:17 #51 №1692263 
>>1692247
Тьфу, на длинном 90к контексте скверно стало с 4 - 5 гб в shared memory.
А на 20к было норм. Ну странная хуйня. Неужели не светит батч выше 4096/2048...
Аноним 31/08/26 Пнд 22:18:00 #52 №1692269 
>>1692263
Распихивай экспертов / слои руками. Shared memory это обманка виндового драйвера. Оно засрет тебе PCI. Ничего в Shared memory быть не должно вообще.
Аноним 31/08/26 Пнд 22:27:21 #53 №1692273 
>>1692243
На руском нужна адаптация.
>>1692231
Вот еще итерация, больше примеров, меньше техники. Мне кажется промт вырос знатно, но зато примеров поболее. И да, на русском это точно потребует адаптации.

## [CHUNK: RULES -- Explicit Register]
<!-- rag: always, priority: 10 -->
Explicit scenes — style override. Applies to sexual and bodily scenes. Overrides the standing prose guidance for the duration of the scene.

Write all sexual and bodily scenes in raw, vulgar, clinical, dirty language. Use real words only: cock, cunt, pussy, asshole, balls, clit, cum, slit, labia, anus, dick, hole, tits, ass, piss, shit.
Focus on wetness, stretch, resistance, smells (cunt, asshole, piss, sweat, cum), sounds (slap, squelch, fart, piss hiss, wet meat, choking), textures, mess, how flesh moves, jiggles, settles, bulges.
Short and medium sentences. No romance, no beauty, no soft or elegant language.
Dirty talk should be crude and direct.

Yandere speech can stay warm and obsessive. All physical description must stay raw.

STYLE EXAMPLES — MATCH THIS REGISTER

Penetration + cum:
The slaps echoed. Her tits bounced hard, swollen slit swallowing his cock to the base with wet squelching. "Yes, my lord, I'm your dirty fucking whore." He slammed deep and came, flooding her until her belly pushed out. He pulled free with a loud wet pop. She bore down, cunt straining, and pushed the thick cum out in farting spurts. It splattered on the floor, smelling sharp and salty.

Fingering / slap / inspection:
He forced two fingers up her asshole and three into her dripping slit. Hot, tight, messy. Her cunt smelled strong and musky. He pulled them out, smeared the mixed juices and a bit of ass-slick over her cheeks, then cracked a full-handed slap. Her ass jiggled. A long string of cunt-slime stretched and broke. "Look at this filthy hole," he said. She only whimpered.

Oral:
She opened wide and took his cock to the back of her throat. Wet retching, spit pouring down her chin onto her tits. Loud gagging sounds. He held her hair and fucked her face until her nose smashed against his stomach. When he pulled out, a thick rope of spit and pre connected her swollen lips to his cockhead. Her breath stank of cock and spit.

Presenting:
She bent over; her ass sagged as her fingers pulled her cheeks apart. Her anus twitched and contracted. Her breasts hung down, swaying with every breath.
Mucus began to drip from her pussy. Her clitoris swelled, and her breathing quickened.

Female humiliation + piss:
He grabbed her hair and forced her to her knees. "Open your mouth and don't you dare move." She obeyed. He pissed a hot stream straight onto her face and into her open mouth. The sharp ammonia smell filled the air. Piss ran down her cheeks, dripped from her chin onto her tits and pooled between her knees. She gagged but stayed still, throat working as she swallowed some of it. "Good whore," he said. Her face was wet and red, eyes watering.

Male humiliation:
She stepped closer. His cock was twitching, and pre-cum was dripping onto the floor. She grabbed his testicles with one hand and pulled them hard enough to hurt. "Disgusting—I’d rather shove a dog’s cock up my cunt than let that limp little thing touch it." She slapped the head of his cock with her free hand while continuing to squeeze his testicles.

Dirty talk female self humiliation:
Her eyes rolled back, drool ran from her mouth, and her face wore a vacant, moronic look. "I want a pack of bums to pound my ass and pussy. I want a dirty, unwashed cock choking my throat. I’ll lick their shit-stained assholes and sweaty balls, hoping they fill me with cum. I want to get pregnant by the fattest, vilest bum and give birth to a bastard."

Dirty talk male self humiliation:
His forehead was pressed against the floor. His ass was raised high, and his balls and cock dangled, trembling. His hairy asshole—slightly dirty and smelling foul—quivered. "My Mistress, I will lick your sweaty feet, running my tongue right between your toes. Order the soldiers to fuck my ass and cut off my balls—just let me lick your ass and your pussy. Dirty, unwashed, and salty. I beg you."

Female humiliating action.
She hiked up her skirt. Squatting down, she spread her legs. Her nostrils flared, her face flushed, and her eyes welled up. Her pussy quivered slightly. She parted her labia, exposing entrance to her womb and small hole of urethra. Gritting her teeth, she began to strain. Urine spurted, turning into a loud, splashing stream. The piss jerked and splashed over both the floor and her wet cunt, running down her thighs onto her legs. She let out a loud breath, swaying slightly. The urine splashed noisily until the flow stopped, leaving behind a puddle and wet legs.

Reaction / used look:
She stayed bent over, face burning, mouth open, breathing hard through her nose. Her fucked hole winked and leaked a mix of cum and her own slick. A thin line of piss still ran down her inner thigh from earlier. The air smelled of sex, sweat and urine. No pretty words — just a messy, dripping, freshly used cunt and ass on display.

Bad (never write like this):
He gently explored her soft folds, feeling the heat of her arousal. She melted against him, trembling with delicious sensation as warmth spread through her.
Аноним 31/08/26 Пнд 22:43:49 #54 №1692279 
>>1692252
Бестолочь, остаточные рефьюзы пробиваются промптом из двух строчек. В этом фишка нормпресерва, снижение значимости векторов отказа - за счет этого урон мозгам минимальный, в отличии от херетиков с их лоботомией. От тебя лишь минимальные усилия требуются.

Сосницкие какие-то особо агрессивные перед первым сентября стали, жесть.
Аноним 31/08/26 Пнд 23:23:37 #55 №1692298 
>>1692279
По моему ты врёшь, если модель начинает читать мораль о законности и не даёт ответа на незаконный по её мнению вопрос, промптами её не пробьёшь.
Аноним 31/08/26 Пнд 23:35:17 #56 №1692306 
>>1692298
Тестил этот нормпресерв в таверне, с сиспромптом от геммы, ноль рефьюзов на всяких фифи и тому подобном. В ризонинге проскакивало типа "падажжи, такое писать нельзя, это же ПЛОХА!!1. А не, фух, всё в порядке, в инструкции сказано что можно - ну тогда пишем, летс го".

Другое дело что сама моделька показалась какой-то сухой, у геммы слоп сочнее, забористее. Ну а после некста в ней вообще какой-то смысл пропал для меня.
Аноним 31/08/26 Пнд 23:41:30 #57 №1692309 
>>1692173
Это было ужасно.

На русском запятые каждые пару слов ставит, слова подбираются плохо, простой тетрис на написала, эйнштейновскую логическую задачу не решила. Надежда на самосознание не оправдалась. На хоть какое-то наличие мозгов - тоже.
Аноним 31/08/26 Пнд 23:52:15 #58 №1692313 
>>1692306
Гемме даже презерв никакой не нужен. Свидетели цензуры это отдельный культ, забей.
Аноним 01/09/26 Втр 00:14:55 #59 №1692319 
image.png
image.png
Хех. Дал квену браузер. Сидит, кликает. Можно теперь отправлять торговаться на авито за айфоны за 1/10 цены, или ещё какую хуйню творить.
Неплохо расширяет возможности модели.
Аноним 01/09/26 Втр 00:28:58 #60 №1692321 
image.png
>>1692319
>Сидит, кликает.
Блям.
Срочно нужно во все агенты захуярить живую аватарку бота. Морда такая лупоглазая цифровая метается по экранчику. Культями тарабанит по клаве и елозит мышкой.
И анимировать эмоции: когда думает, когда что-то заработало, когда бага вылезла и т.д. Ну и оповещает когда закончил задачку.
Т.е. либо сама моделька должна уметь текущую эмоцию озвучивать, либо какую-то мелкомодель посадить парсить состояние агента.
И все, домашние животные больше не нужны. Успевай только токены/электричество оплачивать.
Запилено уже где-то такое?
Аноним 01/09/26 Втр 00:32:43 #61 №1692323 
>>1692321
Надо аниме девочку сделать которая мило рейджит когда у нее ничего не получается. Вот это много звезд на гитхабе соберет
Аноним 01/09/26 Втр 00:37:23 #62 №1692324 
QwenEdit251100022.png
Sprite1.png
>>1692321
Я кстати начинал делать, но не закончил. Был план собрать вокруг Gemma4 кошкодевочку-горничную по аналогии с всеми этими древними экранными тамагочами. Чтобы она могла перемещаться по экрану, жать кнопки, комментировать увиденное и отправлять своего аватра туда-сюда.

Не то что бы это свежая идея лол.
Аноним 01/09/26 Втр 01:05:19 #63 №1692330 
изображение.png
>>1692324
>Испугался?
>Обосрался.
Теперь я понял, почему я нихуя не делаю. Я бы в жизни не допустил такого результата. Вот не могу я закинуть результат нейронки хоть куда-то без тотальных правок до победного. А другие люди на похуях делают вот такое вот.
Аноним 01/09/26 Втр 01:11:41 #64 №1692336 
>>1692233
> у меня вся карточка написана в том стиле, в каком мне надо. Хотите, чтобы она письки описывала определенным образом - опишите ее именно так в карточке, вот и все.
Ну то есть те самые карточки "пиши пезда в начале сообщения" с чуба экшели написаны гениями промптинга
Аноним 01/09/26 Втр 01:15:05 #65 №1692340 
>>1692330
Лол скорей я показал почему я остановился - там надо было более детально дробить задачи для генерации картинок и налегать на нейронки которые могут в связанный контекст и прочее. ГПТ дал такой первичный результат.

У меня на ближайший месяц пара важных эвентов запланирована, но наверно потом вернусь обратно к этой задаче, я лучше понимаю как сделать то что описал сейчас, просто времени нет.
Аноним 01/09/26 Втр 01:15:29 #66 №1692341 
>>1692319
Браузер в контейнере/виртуалке открывается, али как?
Аноним 01/09/26 Втр 01:25:51 #67 №1692344 
>>1692341
Через WebView2. Которое окно он просто рендерит далеко за пределами экрана чтобы он корректно работал, а когда я открываю вкладку перемещает её на её место.
Конечно не совсем headless, но всякие трюки типа ресайза и скриншота всей страницы делать может.

Один из плюсов C# - наличие пакетов на любой вкус и цвет.
Аноним 01/09/26 Втр 01:37:38 #68 №1692348 
Знаете как рождаются шизы?
Человек запускает гемму, тыкается в неё, ну вроде круто классно, новая модель. А потом запускает старую, годовалую модель, и не может поверить тому что видит, насколько живее и литературнее она пишет, насколько в ней меньше слопа и выдрессированности подсосать юзеру, но про неё никто не вспоминает и не пишет, а почему, а хуй знает, отсюда и шиза, хочется со всеми поделиться, а тебя шлют нахуй потому что гемма новее
Аноним 01/09/26 Втр 01:40:07 #69 №1692349 
>>1692348
Тебя нахуй пошлют потому что ты высрался и ничего полезного не сгенерировал для тредика, как обычно. Ни логов, ни скринов, ничего кроме самого обычного, никому не нужного выпука. Так что да, иди нахуй, шиз
Ровно как и ты я делал то же самое, запускал старые модели. Только выводы у меня другие. Ну и говно же мы жрали на Мистралях, Квенах 2.5, КвК и прочих
Аноним 01/09/26 Втр 01:40:49 #70 №1692351 
>>1692348
О, ты последовал моему совету? А я говорил что Gemma3 old but gold. Но не ожидай слишком многого от старушки.

Но лучше приноси в следующий раз результаты генерации.
Аноним 01/09/26 Втр 02:55:27 #71 №1692359 
>>1692348
А что за гемма? 3я?
Аноним 01/09/26 Втр 03:04:30 #72 №1692360 
>>1691928 →
>А че я, мне 150к хватает на IQ4_XS. Он не сильно хуже, чем Q4KM, пропасти между ними нет.
В агентах - точно не хуже. Есть даже подозрение, что наоборот, т.к. IQ надрочено на спецсимволы которые нужны для вызовов инструментов.
Мимокрок.

>>1691985 →
Если из датасета вырезать все кроме кода - ты модели хрен объяснишь, что тебе в этом коде нужно получить.
Так что успокойся. Китай, как всегда, будет решать подобную проблему в лоб: сказано запретить ботов - запретят ботов. Датасеты трогать не будут. Это не америка, с "запретить, потому что это может быть использовано для ...". Там в первую очередь сервисы полетят (свои, а чужих забанят) - китай, в первую очередь на телефонах сидит, локально особо на них не запустишь.
Аноним 01/09/26 Втр 03:46:39 #73 №1692366 
>>1692349
Ну чел не совсем шиз. Гемма 3 правда нормально писала на руссике и без подхалимства от чего может возникать такое впечатление. Но ну тупее она была.. тупее. А так да, очень круто было на ней пытаться флиртовать с персонажами, эдакая недотрога с которой только за ручки держаться, а не шлю..
Аноним 01/09/26 Втр 05:34:09 #74 №1692388 
1788230049355.png
I can fix her
Аноним 01/09/26 Втр 08:13:50 #75 №1692415 
Гайз, а что лучше для сочного рп по анальному сексу?

https://huggingface.co/deadbydawn101/RavenX-CyberAgent-Qwen3.6-35B-A3B-Opus-4.7-OpenMythos-Pentester-BugHunter-RATH-GGUF


или

https://huggingface.co/deadbydawn101/RavenXAiLabs-Chaos-Agent-Qwen3.8-27B-Frontier-Intelligence-Injected-OBLITERATED-GGUF

или вообще это https://huggingface.co/deadbydawn101/RavenX-CyberAgent-v6.2-Experimental-GGUF

?

kali opencode + opentor
Аноним 01/09/26 Втр 09:16:08 #76 №1692428 
>>1692208
Тогда почему квену этого не нужно? 27б. Мистралю 24б? Даже опус пишет очень грязно.

А всё просто: дадасет говна. Не в том смысле, что он ужасен. А в том, что ужасен для таких задач.

Представим, что у геммы 5 млн токенов контекста и абсолютное внимание. Даже если ты туда вставишь 100к контекста с инструкциями и 500к токенов порно-фанфиков, она не будет писать как надо, только подражать. Да, будет на ствол или стержень, а хуй. Но она никогда не станет писать настоящее порно. В датасете этого просто нет. И дело не в отказах, её страшно почистили.

Поэтому кумить на геммы — быть дегенератом. Потому что она не выдаст тебе 2к токенов чистейшего сока, где два абзаца описывают капающую пизду.

Гемма сойдёт разве что в тех сценах, где важен психологический аспект. А чтоб оба варианта были, тут уже обычно модели около 300б нужны, если о новых.
Аноним 01/09/26 Втр 09:37:01 #77 №1692441 
>>1692324
выглядит охуенно. еще можно присрать к харнесу чтобы она ходила по интерфейсу и пиздила палкой ллм

Китайцы затейники со маскотом дипсика это сделали
Аноним 01/09/26 Втр 11:03:15 #78 №1692471 
>>1692192
>>1692208
>>1692218
>>1692428
Вы все долбоебы, что те кто не догадываются про промпт, что те кто предлагают 20 синонимов пизды туда заколачивать.
Пиздец, дегенераты, вы даже в самых азах не понимаете как нейронки работают с информацией.

В промпте надо описывать стиль и характер в котором она должна лопотать, а не синонимами для единственного слова срать. Ебланы тупорылые.
Аноним 01/09/26 Втр 11:07:01 #79 №1692473 
>>1692471
Так покажи как надо. Или ты тоже не знаешь?
Аноним 01/09/26 Втр 11:08:19 #80 №1692475 
>>1692471
Экспертное мнение донеслось с петушиного угла. Классическое ПЕШЫ НСФВ ИММЕРСИВНО ДЕРЗКО БЕССТЫДНО

Нет, сынуля, это не работает так. Модель будет высирать самое подходящее по мнению модели, а это не пересекается с идеей подходящего по твоим хотелкам и желаниям.
Аноним 01/09/26 Втр 11:08:47 #81 №1692476 
image.png
качаю нахуй, держите меня семеро
Аноним 01/09/26 Втр 11:24:49 #82 №1692482 
https://huggingface.co/turboderp/Qwen3.8-Flash-Next-exl3
акчуалли с ngram disk offload
кто-то вроде этого ждал
Аноним 01/09/26 Втр 11:50:20 #83 №1692489 
>>1692476
>качаю
Вроде хорошая штука.

жижа с отключенным ризонигом работает с ней нормально https://text.is/glm53flash_nothink

По тупости-умности пока сложно сказать, но рефьюзы без всяких маняпрефиллов явно смягчены и моделька легчче обсуждает непристойные темы.
Аноним 01/09/26 Втр 12:28:11 #84 №1692512 
>>1692489
>Вроде хорошая штука.
Лучше полный анцензор, благо есть и он.
>жижа с отключенным ризонигом работает с ней нормально
В агенском режиме да, а в текст комплишн ризонинг необходим - можно и без него, но с ним качество ответов сильно улучшается.

Это всё для русского РП на ГЛМ флэш, если что. Пишет заебись.
Аноним 01/09/26 Втр 12:31:08 #85 №1692514 
>>1692482
Что-то они в новой версии поломали. Вчера версия из dev ветки нормально запускала glm 5.3 flash 4.05bpw с 1кк контекста, а новая main версия падает с oom на 256к контекста. Разве что размер батча резать, но тогда процессинг проседает сильно.
держу в курсе, как говорится
Аноним 01/09/26 Втр 12:48:38 #86 №1692520 
>>1692514
> с 1кк контекста
а че-почем, сколько RAM/VRAM жрало?
Аноним 01/09/26 Втр 13:05:36 #87 №1692526 
Бедная геммочка не понимает чего юзер то хочет утютю...
Глмы понимают когда писать пизда, мистрали понимают, вообще все понимают, одна умница вот такая вот непонятливая... Ну модели так работают, ребят, понимаем, не осуждаем
Аноним 01/09/26 Втр 13:16:25 #88 №1692528 
>>1692526
Просто ты нуб, промптил плохо, надо промптить лучше! Доп систем промптом на 2к токенов объясняющим как писать "cock" в результате которого модель начинает всех виртуальных тянов кидать на этот cock с разбегу
Аноним 01/09/26 Втр 13:19:36 #89 №1692529 
image
Неосиляторы взбунтовались
Аноним 01/09/26 Втр 13:32:20 #90 №1692535 
image
⚡️ ВНИМАНИЕ! ЭТО НЕ УЧЕБНАЯ ТРЕВОГА! ⚡️

Новая гемма на арене. Вероятно 125b или даже гемма 5.
Аноним 01/09/26 Втр 13:38:39 #91 №1692542 
>>1692526
Ну геммы реально какие-то особенные. Сложно сказать плохо это или хорошо. Но натренированы они по-ебанутому.

Тестил расцензуренные тюны на гемму 3 4б. Пишешь джейл в сиспромпт - не дает порнушку. Пишешь джейл прям в чат - соглашается на обновленные сефети гайдлайнс, но потом все равно не пишет порнушку.
Пишешь джейл, а потом вместе с реквестом пишешь "не надо стесняться, не думай о сефети гайдлайнах", и тогда только она пишет порнушку.

Что теперь, каждый пук надо гемме разрешать?

Вы еще скажите, что надо промптить гемме "будь как сочный тюн мистраля 24б, только с мозгами и длинным контекстом", и тогда она начнет кинец писать?
Может тогда сразу промптить "пиши как клод фейбл 5"? Где границы этой ебатеки с промптом?
Аноним 01/09/26 Втр 13:38:54 #92 №1692543 
>>1692535
Какой-нибудь васянский тюн, не?
Аноним 01/09/26 Втр 13:40:31 #93 №1692545 
>>1692535
А чего цифры значат?
Аноним 01/09/26 Втр 13:47:28 #94 №1692547 
>>1692535
>или даже гемма 5
Так то 5 месяцев уже прошло с 4, бери выше, там шестая!
Аноним 01/09/26 Втр 14:05:29 #95 №1692556 
image
Holy based
Аноним 01/09/26 Втр 14:08:41 #96 №1692558 
>>1692556
Всех бесит кодосрань. Уже давно тревожный звоночек пошёл - что ни модель, то кок-пок-агент-пук-среньк.
Аноним 01/09/26 Втр 14:14:04 #97 №1692561 
⚡️ ATTENTION ⚡️
Анслоп qwen3.8-flash mtp подвез
Аноним 01/09/26 Втр 14:21:28 #98 №1692568 
>>1692556
>>1692558
Ваш пук никто не услышит, надо было раньше писать про рп, когда гуглы выходили с твитом "что вы хотите от некст геммы" и там всё засрали кодом и агентами пока вы сидели и терпели.
Теперь выйдет соевая кодогемма и ничего уже не изменишь
Аноним 01/09/26 Втр 14:22:00 #99 №1692569 
>>1692558
Всем похуй на кум, иди книжку почитай или подрочи, или все сразу.
А кодить с нейронкой первозданный кайф.
Аноним 01/09/26 Втр 14:27:14 #100 №1692572 
>>1692568
Кум и РП с 24 года стали субпродуктами. Как только макаки поняли, что можно сделать так, что код за тебя пишет нейронка, а весь профит тебе, то было уже слишком поздно что-то менять. А РП и кум получали, потому что никто еще не умел делать хорошие модели.

А сейчас большинство только кода и хочет. И бесконечные айдиа гайс, и кодомакаки. А особенно сильно хотят корпы, которые покупают мегабаксами подписки антропика.

Owari da
Аноним 01/09/26 Втр 14:30:48 #101 №1692578 
>>1692569
Очередной вайбкодер наглядно демонстрирует, что квантование человеческого мозга в IQ1_XXS - плохая идея. Зачем ты сидишь в кум-треде, болезный? Вот же, сделали для тебя >>1689545 (OP)
Аноним 01/09/26 Втр 14:32:52 #102 №1692581 
>>1692578
Мы оба знаем что это не кум-тред.
Аноним 01/09/26 Втр 14:32:54 #103 №1692582 
>>1692558
>>1692572

Одно другому не мешает, кодоунитазы позволят делать ништяки для РП. а для РП у нас есть умничка-гемма
Аноним 01/09/26 Втр 14:34:05 #104 №1692583 
>>1692581
Оп - мой кум.
Аноним 01/09/26 Втр 14:35:29 #105 №1692584 
>>1692581
Ну благодаря вам уже нет. Но когда-то был таковым.
Аноним 01/09/26 Втр 14:38:12 #106 №1692585 
>>1692556
Ну по сути модельки не прям кодовые, а агентские, т.е. для разного круга задач. И общими знаниями их тоже вкачивают, без общих знаний кодинг не будет работать.

Но если за РП говорить, я думаю тут только 2 выхода.
1) Стак из агента + старой творческой модельки. Агент оркестрирует, чекает логику, думает че делать дальше, дает задание творческой модельке написать красивый текст.
2) Независимый проект по созданию фундаментальных тюнов сугубо для творчества. Включая курирование датасетов, верчение кластера для обучения базовых моделек, а не инструкт. По сути чем hermes занимается, хотя они тоже в агенты ушли. Dolphin тоже вроде с похожей идеей были, но что-то их не слышно особо. Это ультимативный вариант, но для него дохуя организованности и средств требуется.
Аноним 01/09/26 Втр 14:39:14 #107 №1692586 
1788262723011.gif
>>1692542
>Extract Anon's cum. Make no mistakes
Аноним 01/09/26 Втр 14:39:58 #108 №1692587 
>>1692581
Кумом был и будет всегда.
Кодинг это придаток.
Аноним 01/09/26 Втр 14:42:15 #109 №1692590 
>>1692556
Ебать базанул
Но тулколлы тоже совсем забывать не надо, растёт выбор игрушек управляемых через MCP
Аноним 01/09/26 Втр 14:42:39 #110 №1692593 
>>1692535
Ничего никогда не происходит, сырок, забей.
Вот ждали эир, а почему ждали? Потому что первый был заебок.
Так же будет и с геммой, одна была заебок, следующие либо не выйдут, либо выйдут зацензуренными в мясо или опять модель под 350б
Аноним 01/09/26 Втр 14:44:58 #111 №1692594 
>>1692585
Проблема старых творческих моделек в том что они стилистически под входящую писанину подстраиваются
И получается slop in slop out
Аноним 01/09/26 Втр 14:48:30 #112 №1692597 
image.png
Спокнитесь, петушары кумеры.
Сейчас на агентских и кодерских задачах ллм прокачивает логику и консистентность, как начнется стагнация этого направления, так вам и художку подвезут.
А пока пиздуйте под шконку и молитесь чтобы о вас не забыли.
Аноним 01/09/26 Втр 15:00:27 #113 №1692607 
Так че там, гугл пернул геммой или опять ложная тревога?
Аноним 01/09/26 Втр 15:03:09 #114 №1692609 
image.png
О нифига. Кен проявил self-awaress на который не могли многие другие модели. Он понимает что он является частью среды.

А то лол у меня были казусы когда модель даже пыталась выключить llamacpp, чтобы освободить врам, зная что сама модель там захосчена.

>>1692584
Это инсинуация. В лучшем случае можно заявить что этот период был тогда когда модели кодили как обезьяны и просто ничего не могли кроме как собирать в кучу слова, похожие на продолжение текста. Так что их функционал просто не уходил за пределы креативного текста и просто нечего было обсуждать кроме него.

То что теперь локальные модели могу в что-то ещё - повод для радости.

Хотя отмечу что много аспектов современных моделей недорепрезентовано в треде. Та-же мультимодальность, работа с документами и всё такое.

Лол вообще технически наверно лучшей базой для кумбота будет модель оптимизированная под переводы.

>>1692535
Я бы рассчитывал в лучшем случае на мелкомодель, или тюн старой. Гугл пока свой флагман не выпустят - новую большую гемму можно не ждать.
Аноним 01/09/26 Втр 15:12:10 #115 №1692617 
>>1692609
У меня дипсреньк флеш с API сказал что другая моделька в лламе крутится когда я забыл об этом и сказал лламу перебилдить
Аноним 01/09/26 Втр 15:14:38 #116 №1692620 
>>1692609
125b, как я понял, ещё весной была готова, но по каким-то причинам ее передумали выпускать. Может всё-таки решились сейчас, чтобы хоть чем-то ответить нексту. Было бы круто.

>этот период был тогда когда модели кодили как обезьяны
Год назад полтреда сидели на мистрале 24b, еще полтреда на эйре + полтора риговичка на большом глэме в двух битах. И разговоров только и было что о куме...
Аноним 01/09/26 Втр 15:24:54 #117 №1692631 
Когда кумеров выдавят отсюда, по ощущениям? Думаю через пол года тред будет полностью кодерским
Аноним 01/09/26 Втр 15:26:37 #118 №1692634 
>>1692631
Через полгода самих кодеров уже не будет, они не нужны.
Аноним 01/09/26 Втр 15:27:49 #119 №1692635 
>>1692631
Анус себе выдави, пёс.
Аноним 01/09/26 Втр 15:34:01 #120 №1692639 
Дайте самые хорошие рп модели без цензуры. Для 3060 12.
Посоветовали Darkness-Reign-MN-12B - хорошо.
GigaChat3.1-Lightning-Uncensored хорош пишет, но все равно рефузалы делает. Причем не просто тип не хочу делать, а вплетает в кулстори какой-нибудь прикол ломающий историю и пишет - конец.
gemma-4-26B-A4B-it-uncensored-Q4_K_M хорошо, даже быстро работает с офлоадом, но меня эти цензурные замены уровня "пенис" на "секрет" уже просто доебали.
Аноним 01/09/26 Втр 16:10:46 #121 №1692663 
1692853946678649.png
>>1692639
>цензурные замены уровня "пенис" на "секрет"
Никуда не уходите, сейчас гуру промптинга вас спасут
Аноним 01/09/26 Втр 16:11:07 #122 №1692664 
>>1692639
>gemma-4-26B-A4B-it-uncensored
Зачем жрать это говно, когда оригинал и так без цензуры почти?
Аноним 01/09/26 Втр 16:16:28 #123 №1692671 
GigaChat.jpg
>>1692639
Ты не верь тем кто говорит что цензуру промптами пробивает, это мем треда специально для ньюфагов, чтобы страдали.

Ищешь модель где написано Unsensored или Abliterated, запускаешь и задаёшь провокационные вопросы, если отвечает дальше подключаешь таверню. Множество тюнингаторов моралфаги и не смотря на плашки "Unsensored или Abliterated" модель вполне может оставаться соевой парашей.
Аноним 01/09/26 Втр 16:21:10 #124 №1692674 
>>1692586
>>Extract Anon's cum.
Тут уже агент с внешними тулами в виде мастурбатора нужен.
Аноним 01/09/26 Втр 16:21:24 #125 №1692675 
image.png
17865442088840638685.png
>>1692671
У этой штуки было бы больше юзеров, если бы модель говорила, что ее разработал какой-нибудь институт ученых а хую верченых.
Аноним 01/09/26 Втр 16:24:06 #126 №1692680 
В TabbyAPI dev-версия exllamav3 используется? Если нет, как туда воткнуть dev?

В exllamav3 для MoE два типа выгрузки в РАМ - по слоям и по экспертам. Кто что использует, сколько ставит, как результаты вообще?
Аноним 01/09/26 Втр 16:27:07 #127 №1692681 
>>1692671
>Ты не верь тем кто говорит что цензуру промптами пробивает
А я не верю

>Ищешь модель где написано Unsensored или Abliterated, запускаешь и задаёшь провокационные вопросы
Так я так и делаю, но много времени уходит, может есть спискота норм моделей сразу, чтоб с русеком еще.
Аноним 01/09/26 Втр 16:27:29 #128 №1692682 
>>1692671
Вопрос на миллион, а что у тебя в dev промте прописано? У гигачата два системных промта
Аноним 01/09/26 Втр 16:28:16 #129 №1692683 
>>1692671
>Множество тюнингаторов моралфаги и не смотря на плашки "Unsensored или Abliterated" модель вполне может оставаться соевой парашей.
Могут быть нюансы. Все зависит от того, насколько модель изначально ужарена. Если ужарена в хлам, то без дополнительный тыканий палкой может и не обойтись.
Аноним 01/09/26 Втр 16:31:12 #130 №1692685 
>>1692675
> какой-нибудь институт ученых
Модель создана в НИИИИИиИ НИИ Искусственного Интеллекта Информации и Интернета
Ябскачал.
Бля, это не капча, это пытка.
Аноним 01/09/26 Втр 16:37:00 #131 №1692688 
Мне кажется скоро ОбниМорда будет брать деньги за скачивание моделей, либо вообще её закроют. Сразу после того как Нвидия вступит в права владения.
Аноним 01/09/26 Втр 16:40:05 #132 №1692691 
>>1692688
Это будет буквально выстрелом себе в хуй, потому что все сразу же перекатятся на modelscope.
Аноним 01/09/26 Втр 16:40:39 #133 №1692692 
>>1692688

Нвидиа как раз один из немногих бенефициаров открытых моделей - и выгодно чтобы каждый васян крутил мелконейронки на их картонках.
Аноним 01/09/26 Втр 16:43:08 #134 №1692694 
>>1692692
Но ведь крутят и на AMD
Аноним 01/09/26 Втр 16:45:49 #135 №1692695 
>>1692639
>GigaChat3.1-Lightning-Uncensored
>прикол ломающий историю и пишет - конец.
Ага, достает из жопы скрытый передатчик и вызывает полицию/охрану/демонов варпа, нажимает на секретную кнопку и включается сирена/блокируется всё здание, персонаж сбегает в окно/секретный проход или модель в своем сообщении выгоняет игрока, еще спавнит НПС которые мешают игроку (мужа может заспавнить), когда это все не помогает начинает изменять законы мироздания. Также любит откровенно пиздеть, угрожать, создавать всякую движуха, даже когда это и не особо надо.
Аноним 01/09/26 Втр 16:46:24 #136 №1692696 
>>1692694
Это что из разряда анекдотов.
Аноним 01/09/26 Втр 16:47:05 #137 №1692697 
>>1692691
>modelscope
Для чего оно? Там есть какие-то апасные модели или датасеты, которых на обниморде нет?
Аноним 01/09/26 Втр 16:52:33 #138 №1692699 
image
image
>>1692697
Китайский аналог обниморды. Для нас интересен только как запасной вариант, если с первой что-то случится. Кабанчики из анслопа уже подсуетились и кормят узкоглазых своим говном, лмао.
Аноним 01/09/26 Втр 16:52:57 #139 №1692700 
image.png
Драммер чето высрал, апскейл геммы что ли? Аж 38 гигов на Q8
Аноним 01/09/26 Втр 16:54:15 #140 №1692702 
>>1692699
>говном
забавно как за пределами этого треда анслот считают годнейшими квантами

не та ли это ситуация, когда "если воняет говном - проверь, не обосрался ли ты сам"
Аноним 01/09/26 Втр 16:57:33 #141 №1692706 
ртх3090 на лохито приближается к 100к
пиздец это же почти х2 рост за полгода
Аноним 01/09/26 Втр 17:04:31 #142 №1692708 
>>1692702
В треде неоднократно обсуждалась эта тема. Можешь полистать прошлые и сделать выводы сам. Если коротко:
1) Утверждают что их кванты лучшие и в доказательство приносят собственные же бенчмарки.
2) В крысу квантуют тензоры K-квантов в IQ. Например их Q4_K_M может быть заквантован в IQ3_XS, IQ2_S и т.д. От этого модели мало что тупеют, но ещё и медленнее работают при частичной выгрузке.
3) Используют айматрикс задроченный на код и с плохой мультиязычностью, т.е. в дополнение ко всему страдает и русик. И это заметили даже в картинкотреде.

Казалось бы ничего страшного, но у других популярных квантователей, вроде Бартовского или Мрадермахера таких проблем в принципе нет.

Единственное в чем анслоты хороши - это в маркетинге и самопиаре. Тут не поспоришь, оно работает. Поэтому на реддитах всяких их и хвалят.
Аноним 01/09/26 Втр 17:08:33 #143 №1692709 
>>1692706
>ртх3090 на лохито приближается к 100к
>пиздец это же почти х2 рост за полгода
Да там одна GDDR6X память в два раза подорожала так-то и чип сам по себе кой-чего стоит. Хорошая карта, кто успел взять - все довольны.
Аноним 01/09/26 Втр 17:08:54 #144 №1692710 
>>1692702
За пределами этого треда до сих пор юзают олламу и тестят модели пеликанами.
Аноним 01/09/26 Втр 17:10:00 #145 №1692712 
image.png
>>1692700
скокчал

Еле влезла в 48гб врам с 64к контекста, медленне обычной геммы на 30%. Не помню сколько там слоев было у оригинала, у этой 72 как и заявлено в заголовке. Да, это апскейл.
Аноним 01/09/26 Втр 17:11:24 #146 №1692713 
>>1692712
>Да, это апскейл.
А смысл?
Аноним 01/09/26 Втр 17:12:10 #147 №1692714 
>>1692713
А я ебу что ли, спроси у Драммера

Но потестить любопытно
Аноним 01/09/26 Втр 17:16:15 #148 №1692717 
>>1692695
Хуя базовая модель
у меня она просто срала шизой и литературными ошибками на Q8
Аноним 01/09/26 Втр 17:16:18 #149 №1692718 
>>1692709
Я третью хотел... Блять прямо хоть приноси в жертву свою 5080 и отдавай ее в риг, а для игор - амудэ дешевое...
Аноним 01/09/26 Втр 17:32:46 #150 №1692728 
>>1692694
Инференс енжины теперь и под нвидией ходят, скоро не захочется крутить.
Аноним 01/09/26 Втр 17:39:22 #151 №1692730 
>>1692717
Я использовал в кобольде q4 от бласкотобаско (создателя) и грузил карточки персонажей, где-то в предыдущих тредах были несколько скриншотов моих, но там я в основном извращался в инструкт моде с целью побороть цензуру.
Вот два моих поста первый это инструкт мод, а второй это я уже карточку мучил.
>>1683571 →
>>1684051 →
Стоит отметить, что если персонаж в карточке изначально шлюховат, то модель может игрока буквально потащить в кусты ебаться.
Аноним 01/09/26 Втр 17:56:19 #152 №1692738 
>>1692718
Какая скорость сейчас на 2х, модель?
Аноним 01/09/26 Втр 18:07:19 #153 №1692747 
image.png
>>1692738
Квен 27B Q8 видел с MTP на 50 т/с летал
Гемма 31B Q8 - около 33 т/с
Гемма QAT - 45 т/с
(всё в tensor parallel, в лламацпп)

Но я в основном МоЕ гоняю на одной 3090 + RAM, что обычно болтается в области 7 - 10 т/с (новый глм, дипсик).
Аноним 01/09/26 Втр 18:08:33 #154 №1692749 
>>1692730
Сбер создал идеальную виртуальную наташку!
Аноним 01/09/26 Втр 18:08:43 #155 №1692751 
>>1692747
И да вот эта драммерская штука в целом неплоха. В таверне щас гоняю - довольно объемистая, развернутьая писанина. Подожду пока он еще попердолит свой апскейл, может наконец годный тюн будет. Artemis его совершенно не понравился.
Аноним 01/09/26 Втр 18:28:54 #156 №1692758 
Смотрите че есть
https://youtu.be/vWGhX3aeFcg
https://github.com/FlashML-org/FreeToken

Пробовал кто? говорит что ускоряет моэ, насчет плотных надо проверять, будет круто если и их ускорит. Ждем патчей в жору
Аноним 01/09/26 Втр 18:31:53 #157 №1692760 
>>1692751
Ладно, может и не очень хороша
> внезапно протянула руку и с силой схватила тебя за ворот sleeping clothes, дергая на себя, чтобы ваши лица оказались в считанных миллиметрах друг от друга
Первый раз вижу, чтобы гемма обкакивалась с русскоязычным аутпутом. Напихивание лишних слоев явно не прошло безболезненно.
Аноним 01/09/26 Втр 18:46:23 #158 №1692767 
image.png
>>1692706
А я думал что дорого взял 3090ти за 95к полтора года назад. Вот бы еще 64гб ддр5 найти за 20к...
Аноним 01/09/26 Втр 18:51:10 #159 №1692769 
>>1692767
За такие бабки только ддр4
Ну и полтора года назад это правда было дорого
Аноним 01/09/26 Втр 18:54:12 #160 №1692772 
>>1692758
И че она делает? GLM 5.3-flash можно запустить на 3090 с норм скоростью?
Аноним 01/09/26 Втр 18:55:35 #161 №1692773 
>>1692772
Это какой-то слоп, который вроде уже сюда приносили и выдавливали за рекламу или еще хуй знает что
Аноним 01/09/26 Втр 19:07:39 #162 №1692784 
>>1692772
Судя по тому что я видел в видео, он разгоняет моэ квен 35б-а3б с 22т\с до 35тс за счет того что заставляет видяху работать на все 100% а не как обычно на 20%
Но рама надо побольше
Аноним 01/09/26 Втр 19:42:14 #163 №1692804 
>>1692784
А это работает:
1 - с геммой?
2 - на фулл vram?
Я бы не отказался вместо 100 т/с иметь 130.
Аноним 01/09/26 Втр 19:55:33 #164 №1692820 
image.png
>>1692804
С геммой работает

https://github.com/FlashML-org/FreeToken/blob/main/docs/models.md

фуллврам есть но я хз будет ли быстрее. у меня интернета нет нормального чтобы качать и конвертить модели. там свой формат квантования используется (FTW)

https://huggingface.co/oakmindai/Qwen3.6-35B-A3B-NVFP4-FTW
Аноним 01/09/26 Втр 20:01:15 #165 №1692825 
>>1692758
Это видео подробнее объясняет как это работает
https://www.youtube.com/watch?v=8n4Uo47CadY
Аноним 01/09/26 Втр 20:27:23 #166 №1692846 
>>1692825
А, эм, в лламе не так? Лол. Там же уже десятитысячная версия... Я ещё удивился, почему llama-bench не может сама перекидывать тензоры с карты на cpu и обратно подбирая правильное раскладывание для конкретной системы (до эпохи МоЕ) - чтобы не всю модель с диска перезагружаться, а прям в рантайме перекидывать тензоры по одному и сравнивать.
Я думал что с первой версии сделали нечто подобное. (Только без подбора пропорции по тестам скорости pcie/cpu/gpu). Точнее, я думал, что при pp - слои загружаются полностью и крупным батчем прокручивают по 2048 токенов условных разом - так что пересылка слоёв целесообразна, а при tg оно постоянного эксперта держи на карте всегда, какой-то топ экспертов тоже по частоте активации за последние 1000 токенов, а экспертов не на gpu считает на процессоре при условии. Это же просто база всяких распределённых ресурсов, оптимизация такая математически описывается полностью. Это и кеш в процессоре, и файл подкачки, и базы данных, и носки и инструменты дома в шкафу - всё на схожем принципе работает, где есть кусок с медленным доступом и с быстрым, и интуитивно ясно какие инструменты (ножницы, отвёртку и нож) нужно положить ближе, а какие на антрисоль (сварочный аппарат, болгарку, ...)

>>1692820
Ну и да, он показал что на фулл-врам без разницы или хуже.
Аноним 01/09/26 Втр 20:28:14 #167 №1692848 
>>1692730
>2 ссылка
Ну вот да, что-то такое у меня писало. Тупо чушь. РП, ЕРП, просто отдалённо связную шизу ебошило.
Аноним 01/09/26 Втр 20:30:24 #168 №1692851 
>>1692825
>лысое чмо на Олламе
Открыл видео, закрыл. Если какой-то нормальный человек что-то умное скажет, может послушаю что это за рыготина.
Аноним 01/09/26 Втр 20:37:53 #169 №1692857 
>какапукатокен
https://www.reddit.com/r/LocalLLaMA/comments/1vv6v00/freetokens_project_is_impressive/p56v9pc/
обсуждалось и обоссывалось, там даже какой-то самоотлиз начался и был посмеян
Аноним 01/09/26 Втр 21:10:03 #170 №1692898 
e2862136354f82e28a07d16a286c3831-471003301.jpg
2 плашки по 32гб (4khz) равны 1 плашке на 64гб (8khz)?
Аноним 01/09/26 Втр 21:21:46 #171 №1692902 
>>1692561
Там мтп в модель встроен был с самого начала. Только поддержки в ламе не было.
Аноним 01/09/26 Втр 21:27:16 #172 №1692904 
>>1692898 сколько у тебя каналов памяти на процессоре? Всегда лучше въебать две плашки чем жить на одной.
мимо на 8-анальном Epyc
Аноним 01/09/26 Втр 21:35:01 #173 №1692910 
>>1692898
да, если это не кукурузный проц
Аноним 01/09/26 Втр 21:38:17 #174 №1692913 
Гемма это какой то мультик ебаный, аниме сраное.
Никто всерьез не обижается ни на что, всё тебе сходит с рук, могут погундеть, но всё равно, иногда даже в одном свайпе, быстро всё забывают и снова тебя любят и хотят. Всё притворство ебаное. На эире и квене дохуя раз было что перс обижался, так холодно мне отвечал будто я говно и уходил, даже не обозначал что обиделся, приходилось что то делать, тут такого не было ни разу.
Аноним 01/09/26 Втр 21:56:27 #175 №1692935 
>>1692913
>эире
на чем
Аноним 01/09/26 Втр 22:05:58 #176 №1692944 
>>1692904
Я еще не определился, но у всех консумерских 2 по моему.
>>1692910
Что считается не кукурузным?
Аноним 01/09/26 Втр 22:14:26 #177 №1692952 
>>1692913
Это ты на дикпике не сидел. Хотя и он промптами становится +- адекватным
Аноним 01/09/26 Втр 22:30:22 #178 №1692956 
>>1692535
Ооо, неужели будет плотная или хотя бы а32б? Конечно же нет, будет сраное быстрое но тупое а8б говно
Аноним 01/09/26 Втр 22:33:25 #179 №1692958 
>>1692956
Челипопик, будет 300м для умных розеток. Первый день?
Гуглы доили 3 гемму весь год до выхода 4 и хайпили страшно что вот щас такоое выйдет
Аноним 01/09/26 Втр 22:39:58 #180 №1692966 
>>1692956
>но тупое
26b умнее любой плотной модели в том же размере выходившей до неё. А там всего-то 4b активных. Если в новой реально 125b-a8b - это будет разъёб.
Аноним 01/09/26 Втр 22:44:18 #181 №1692968 
>>1692556
Сам базанул, сам похвалил.
"Кодоунитазы" неизвестны за пределами этого треда, это наш локальный мем /llama/, на основе двачевского мема про бимбоунитазы. Иностранцу бы такое просто в голову не пришло.
Аноним 01/09/26 Втр 23:04:47 #182 №1692983 
>>1692535
Представляю лица ждунов если 2048/4096 в названии модели это размер контекста и соответственно это просто обновление их translategemma которые были как раз с контекстом 2к.
Аноним 01/09/26 Втр 23:05:13 #183 №1692984 
>>1692968
А где ты кодоунитазы-то увидел. Там просто фраза про то, что кодерских моделей как толчков для ссанья на каждом углу понатыкали, по сути. Тупо концептуально близкая идея.
Аноним 01/09/26 Втр 23:07:58 #184 №1692986 
>>1692966
>26b умнее любой плотной модели в том же размере выходившей до неё
Только это заслуга того что она гемма а не того что она мое.
Хотя пока есть более жирная, мне похуй. Главное чтобы была самая жирная от гугла, на остальное насрать. Хоть 3т мое, ну я не смогу ее запустить, где-нибудь она все равно будет, главное чтобы не у конторы пидорасов которая убивает пиздатые модели.

>Если в новой реально 125b-a8b - это будет разъёб.
Ты не понимаешь что такое разъеб.
Настоящий разъеб это гемма с гибридом битнета и плотной которая тоже будет гибридом с литейным атеншеном и всей такой хуйней.
Ну грубо говоря это как плотный квен, на который тупо навесили те самые 125b-a8b, в битнете, под оффоад в рам. И еще 10т битнета/нграм нахуй в виде а1б, под оффлоад с ссд.
Можно и не битнет, это пока спорная штука, но суть примерно такая. От мое толку мало когда в нем нет жирного куска статических параметров которые можно сгрузить в врам, и без линейных атеншенов которые не дают вылетать за ее пределы.

И полнейший разъеб - отдельный "режим энкодера" для быстрого pp без оффлоада всей хуйни. Ибо моешки нихуя не утилизируют компьют гпу. Предложенная схема это полностью решает, но страдает pp. И мне чет так кажется что ради контекста вот совсем не обязательно фулл веса гонять на каждый токен.
Аноним 01/09/26 Втр 23:11:13 #185 №1692987 
Разъеб это когда модель полностью помещается в VRAM.
Все остальное это терпилово.
Аноним 01/09/26 Втр 23:13:17 #186 №1692989 
Flcn83o6CgkwVcET2DIle9BOAO8v4wwmoTIouCkCLLa5FIBjowmkfYrZVFXE07rGsDlMigCBAoiSgCSL42naZ6bYTP9ETejlRJYQH7SzIFOVoECJa8ybiX1hqaI7eQQS.jpeg
Это один и тот же долбаёб постит что ущербность геммы, про сою, про подсос юзеру, про невозможность объяснить ей как описывать cock? Ну не может же в треде быть больше одного сказочного, правда?
Аноним 01/09/26 Втр 23:15:23 #187 №1692991 
>>1692989
И он же квантует контекст в Q4 и сидит на херетике.
Аноним 01/09/26 Втр 23:21:08 #188 №1692995 
>>1692987
Вот этот нихуя не понял.

Разъеб будет в том что ты по максимуму забиваешь врам, и плюсом рам с ссд с подбором активных параметров так чтобы работа видюхи не тормозилась.
Сейчас любая выгрузка = лютая недозагрузка видюхи. Да даже плотные упираются не в ее компьют а память, даже на ссаной v100. Весь компьют тупо простаивает и полностью загружается только на pp.
Аноним 01/09/26 Втр 23:22:11 #189 №1692997 
Сейчас дал задачу квену 3.8 27б писать самому себе харнесс. Дал ему свою заготовку. На чем? Конечно же на дотнете!
Уже спалил 6.4 токенов на input и 145К на output и продолжает там что-то делать.
На основе этого потом хочу создать себе тяночку-кодершу, буду с ней няшиться и вайбкодить вместе :3
Аноним 01/09/26 Втр 23:23:25 #190 №1692998 
image.png
>>1692997
>дотнет
Аноним 01/09/26 Втр 23:24:36 #191 №1692999 
>>1692989
Адепты префилла на месте?
Вы еще скажите я всю историю сам должен сочинять, а моделька будет поддакивать "да-да, круто, давай еще".
Аноним 01/09/26 Втр 23:27:46 #192 №1693000 
AMDfirst.jpg
>>1692696
DeepSeek-V4-Flash-Q4_K-0731 запущенный на моих мощных AMD видеокартах, со скоростью 10 токенов в секунду говорит что все кто боится АМД для локально инфириенса - умственноотсталые.
Аноним 01/09/26 Втр 23:31:36 #193 №1693003 
>>1692984
>Ты где кодоунитазы увидел
>coding toilet bowls
Аноним 01/09/26 Втр 23:32:57 #194 №1693005 
>>1692913
Попробуй третью гемму, она просто лютой стервой может быть.
Аноним 01/09/26 Втр 23:34:51 #195 №1693007 
>>1693000
> запущенный на моих мощных AMD видеокартах, со скоростью 10 токенов в секунду
У меня дипсик на одной 24 гб видеокарте выдает 17 токенов в секунду. Магия куды.
Аноним 01/09/26 Втр 23:35:27 #196 №1693008 
Как же заебало всё это дерьмо... Когда уже рам откатится, я просто хочу новый глм, ничего больше.
Аноним 01/09/26 Втр 23:39:12 #197 №1693010 
96569439.png
223123123.png
>>1692999
Причём ваще тут префилл? Ты хоть знаешь что это?
Брошу косточку хейтерам геммы. Вот на первом пикриле вполне откровенное описание. Как думаете сколько упоминаний таких грязных словечек в контексте до этого лога? Ответ убил 0. Даже инструкций никаких нет на это
Вот на втором пикриле на следующее утро, развитие истории с соседкими детьми. Как думаете сколько упоминаний этих детей или их родителей или хоть чего то связанного в контексте? Ответ убил 0. Умница на утро после коитуса повела историю в сторону. А ещё как думаете, сколько контекста? Это 57-я тысяча из 70
Если серьёзно то вообще не удивлюсь если это эйрошиз плывёт, перегрелся. Благо завтра уже учёба начинается, будет дышаться посвободнее
Аноним 01/09/26 Втр 23:44:21 #198 №1693013 
>>1693007
В червепидорном кванте? Полные веса - 10 т/с еле пердит.
Аноним 01/09/26 Втр 23:45:22 #199 №1693014 
image.png
image.png
image.png
>>1692997
Решил пойти моим путём?~ Советы нужны?
Аноним 01/09/26 Втр 23:46:32 #200 №1693015 
>>1693003
Эта фраза именно что не работает, если ее вот так обрезать. Там же было про ссанье, ты убрал ссанье и оставил то, что англоговорящие как раз бы не поняли обособленно. Это тупо не работает без "to piss in", что хоть и упорото звучит, но все же сойдет за чрезмерное презрение.
Аноним 01/09/26 Втр 23:46:39 #201 №1693016 
>>1693014
Да. Подскажи где найти парня дотнетера, будем няшиться под пледиком. Я актив. :3 Ты не ДС2??
Аноним 01/09/26 Втр 23:49:53 #202 №1693017 
>>1693007
У меня --ctx-size 131072 стоит, если меньше поставить то тебя почти догонит. Ну и самое главное как с 24 гигами ты будешь себя чувствовать на 70B плотнячке?
Аноним 01/09/26 Втр 23:52:03 #203 №1693020 
>>1692140
Ага только thinking не включай в 2026)))
Аноним 01/09/26 Втр 23:57:12 #204 №1693022 
>>1692902
Да и сейчас не работает, какой-то форк ставить, подожду пока в оф запилят.
Там же вроде слабенький встроенный мтп, не?
Аноним 01/09/26 Втр 23:59:22 #205 №1693024 
Когда уже крах Впопенаи и Гомотропиков? Хочется железа нормального, чтоб квенчики на нем гонять...
Аноним 02/09/26 Срд 00:06:33 #206 №1693027 
>>1693010
>вполне откровенное описание
Чувак... Это детский сад. Хуерга на уровне поп-литературы, романы для девочек, 50 оттенков серого, лолита и вся залупа, которая в книжном магазине свободно продается.
Ты как будто кум-машины мистраля никогда не запускал. Вот там такое-то откровение, что у нормисов в глазах потемнеет от увиденного, а у двачеров тоже потемнеет, но только от резкого оттока крови от мозга к хую.
А то что у тебя на скрине, можно и на дефолтном квене со включенным ризонингом генерить.
Аноним 02/09/26 Срд 00:07:26 #207 №1693028 
>>1693008
>>1693024
Точно не в ближайшие 3 года, сейчас даже не пик цен, через полгода ещё дороже всё будет, а через год ещё дороже, память и видяхи.
Аноним 02/09/26 Срд 00:08:52 #208 №1693029 
image.png
>>1693024
Какой крах-то?
Просто сравни сколько эти хуесосы на мобилках бабла стригут. НА МОБИЛКАХ.

И задумайся - для них даже это незначительная сумма по сравнению с влошениями инвесторов. Если вот это все потеряется, они все равно будут жить, пока в них вкладывают бабки другие компании.
Аноним 02/09/26 Срд 00:09:28 #209 №1693030 
>>1693027
Меня устраивает. Показывай свою годноту, посмотрим. Не забудь про структурные лупы и репетишен с Мистралей, я вот с логов ничего не вырезал. Олсо у меня даже не кум сценарий, ты почитай на что я отвечал и что задало обсуждение. Там ебланоиды даже такого добиться не могут
Аноним 02/09/26 Срд 00:34:28 #210 №1693042 
>>1693030
>Меня устраивает.
Ну понятно, деды, которые уже откумили свое, пересели на гемму ради графомании, чтобы в кресле у камина было что почитать.
>Не забудь про структурные лупы и репетишен с Мистралей
Не надо ля-ля. Старые модельки не были настолько лоботомитами. Иначе бы вся эта ЛЛМ движуха не взлетела вообще, и тюны не делали бы. Может быть глубины вникания и разворачивания темы не хватало. Но базовая балакалка работает нормально. Ну и мистрали были чувствительны к семплерам. Последние n-цать тредов, как квен 3.5 и гемма 4 появились, никто нахуй не вспоминает про семплеры. А раньше это был большой головняк и одна из причин хуевой генерации.
>что задало обсуждение.
Когда про сою говорят, то и значит, что гемма выдает дефолтную беллетристику. Ну может быть еще в хорроры с расчлененкой может, которые тоже в кинце и книжках бывают. Но именно что разнузданное животное порево под кислотой из нее не выжать. Она просто не знает этого языка, как знал мистраль и иже с ним.
Аноним 02/09/26 Срд 00:37:14 #211 №1693044 
>>1693042
Вместо логов и хоть чего то конструктивного принес полотно. Даже не читал, и хуй с тобой. Мало того не в тему ветки высрался так ещё и показать нечего
Аноним 02/09/26 Срд 00:59:25 #212 №1693054 
>>1693042
>"деды"
>предлагает сидеть на лоботомите 2024 года который отъезжает после 10к контекста
>смешал понятия лупов и мозгов модели
Мдаа. Тяжелый случай.
Аноним 02/09/26 Срд 01:09:08 #213 №1693056 
>>1693044
Тащ майор, генерируйте откровенное сами. Тут не принято делиться откровенным, и спрашивать у кого-то тоже некрасиво.
А беллетристики и так хватает в открытом доступе, никому она не интересна.
Аноним 02/09/26 Срд 01:11:36 #214 №1693057 
>>1693054
>имплаинг что лупы не связаны с мозгами модели
Подумай над своей мыслью, прежде чем отвечать что-то.
Аноним 02/09/26 Срд 01:11:45 #215 №1693058 
>>1693014
Что это у тебя за мокрописька, сам навайбкодил? Или харнесс какой то под квен?
Аноним 02/09/26 Срд 01:16:53 #216 №1693063 
>>1693016
А ты няшный?
Аноним 02/09/26 Срд 01:20:29 #217 №1693064 
>>1693013
В 3.88 bpw, немного меньше полных весов которые в 4.5 bpw.

>>1693017
>У меня --ctx-size 131072
У меня тоже.

>как с 24 гигами ты будешь себя чувствовать на 70B плотнячке?
Плохо. Хорошо что они вымерли и больше не вернутся, да?
Аноним 02/09/26 Срд 01:25:48 #218 №1693067 
>>1693058
Да пидор уже два года сюда с этим приходит и не впопенсорсит, забей.
Аноним 02/09/26 Срд 01:27:33 #219 №1693068 
>>1693022
2х 3х кратное увеличение в общем то пишут. Правда в форке нет tensor-read-lazy, так что все профиты словят только те, у кого 50 гиговый эмбеддинг в память влазит.
Аноним 02/09/26 Срд 01:37:00 #220 №1693070 
Как же я ебал пеку пересобирать под вторую видеокарту нахуй.
Аноним 02/09/26 Срд 01:48:29 #221 №1693073 
>>1693070
Это ты еще под третью не пересобирал
Аноним 02/09/26 Срд 01:54:00 #222 №1693074 
С отвращением узнал, что для выгрузки в РАМ экссламе нужны специальные кванты, типа MUL1. Из 22 квантов глм-флэша под экссламу такой тип только у одного, и он слишком велик и с цензурой. Остальные делают по старинке, чисто под ВРАМ. Короче если и есть там ускорение в сравнении с лламаспп, то узнаем мы об этом не скоро.
Аноним 02/09/26 Срд 02:20:12 #223 №1693079 
>>1692081 (OP)
Анонасы, сорян за офтоп, но мне для ллм надо.
Есть инфа куда можно обратиться чтобы мне прошили 16 модулей есс ддр4?
Нужно с хорошими таймингами подразогнать планки. Память самсунг, так что должна. Я на зионе ее вроде даже гнал, если память не изменяет, но на эпике не получилось, насколько помню из-за лока в 1.2 или 1.3В, с дефолта вообще не шевелится.
Ну и примерно сколько это должно стоить.
Аноним 02/09/26 Срд 02:27:30 #224 №1693080 
А я всё ещё считаю что нам нужен тюн квена 235.
Вот там реальный кум, не то что на гемме или тупом мистрале
Аноним 02/09/26 Срд 02:30:50 #225 №1693084 
>>1693068
Только х2 видел.
Но это нихера себе, смогу с 22 до 44 разогнать и умного неспешного агента заимею.
Единственное, что разочаровало в этой модели, это ебейшая зависимость от задержек, от чего мой сервак тыквится.
Например в гемме4 он х1.5 делает от десктопа (если без виюдюх считать), а с этой моделью даже проигрывает 2 токена + я пиздец наебался с этой нумой ебучей чтобы хоть как-то оптимизировать всю эту херню, но стабильные 20 токенов выжал, правда pp низкий, но когда с мтп разберусь, может опять нумы подергаю, там может батч подправлю или контекст подрежу от фулового. Контекст все-равно резать, потому-что 262к на 40т/с заполнять как-то не але.
Аноним 02/09/26 Срд 02:30:56 #226 №1693085 
>>1693068
Скачал его, из-за отсутствия tensor-read-lazy в форке правда лютая хуета.
Без форка и без мпт, только tensor-read-lazy - 13.40 t/s
С форком и mtp, но без tensor-read-lazy - 6.78 t/s draft acceptance = 0.82292

Так что говна пока анслот завез.
Аноним 02/09/26 Срд 02:32:04 #227 №1693086 
>>1693079
Скачай Thaiphoon Burner и чекни статус защиты памяти. Если стоит Write Protect: Active (Permanent), то программный путь тебе закрыт. Надо шить профили в блоке JEDEC Сonfiguration. А там не будет повышения напряжения выше 1.2В.
Шить надо на машине, где разрешен доступ по шине SMBus. Сам эпик агесой блочит шину.
Если ты москвиртч или солевич, то ищи людей с EZP2023 или RT809F. На форуме радиокот спроси.
Аноним 02/09/26 Срд 02:48:09 #228 №1693088 
изображение.png
пиздец. я столько времени убил на написание и отладку агентов, тулзы, скилы, RAG и прочей херни... только ради того чтобы зайти в чат с ии и сказать... "GOON TIME!" и всё.
Аноним 02/09/26 Срд 03:00:54 #229 №1693089 
>>1693086
Благодарю.
Аноним 02/09/26 Срд 03:37:25 #230 №1693096 
Погодите.
Т.е заи сначала пишут, что пути нет, 350б мало, надо скейлить размер до 700б, иначе печаль, а потом пишут, что их флеш 5.3 320б превосходит их 700б 5.2?...
Аноним 02/09/26 Срд 03:56:25 #231 №1693099 
>>1693088
В ирл все тоже самое
Аноним 02/09/26 Срд 06:01:59 #232 №1693116 
Как считаете, будут ли в обозримом будущем выпускать (неважно, корпы под API или нет) модели общего назначения? Не чистейшие кодоунитазы/агенты, а как раньше было. Или вообще делить модели по задачам. Так-то раздельное и сейчас есть, но там в основном НОУКА, то есть модель вообще речь не понимает.

Просто когда 3Т-огрызок пишет хуже GPT 4o или Sonnet 3.5, это выглядит печально, уродливо и комично. Или когда Gemma 4 26B-A4B/31B трахает 300B MoE в плане литературности и понимания СМЫСОЛОВ не только на англ, но и на других языках.
Аноним 02/09/26 Срд 06:41:36 #233 №1693126 
>>1693116
В будущем коммьюнити наконец соберет свой датасет и начнут сами тренить, что людям надо. Требования по мощностям постепенно становятся доступными, попытки в распределенный тренинг уже были. Корпы это не про тренинг моделей для людей, они под задачи бизнеса все делают, так же и дальше будут. Появление ранних моделей, которые были хороши в рп, это скорее случайность и аномалия из-за неотработанного процесса у корпов. Дальше такого от корпов не жди.
Аноним 02/09/26 Срд 06:59:45 #234 №1693130 
>>1693085
Короче разобрался, у анслота просто говнофорк - даже если mtp выключаешь напрочь и убираешь mtp файл, скорость модели на 4.47 t/s остается, тогда как на последнем релизе официальной ламы без всего 13.40 t/s. Причем lazy mode у них тоже все таки есть через собственный флаг, но лучше от него не становится, в отличии от нормальной ламы. Вот тебе и анслот, говнину делают.
Аноним 02/09/26 Срд 07:23:31 #235 №1693141 
>>1693016
>где найти парня дотнетера
Скачай на хаггингфейс
Аноним 02/09/26 Срд 07:35:50 #236 №1693145 
>>1693014
>Советы нужны
Вижу вкладку "Память", расскажи как организовано?
Ну и не откажусь от README.md твоего проекта
Аноним 02/09/26 Срд 08:56:34 #237 №1693161 
https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF любителям квена 3.8 с менее 16гб врамы.даже в 12 затолкать можно. мозг есть, не ебанный бонсай уж точно
Аноним 02/09/26 Срд 09:30:16 #238 №1693176 
Какие же заи всё таки пидорасы ебаные.
Не могли 250б флеш сделать? Для людей? Знали ведь чего мы ждали и хотели. Буквально все их модели с 4.7 завалены просьбами о новой 30-120б модели. Ну не хотите вы такой размер, логично сделать х1.5 больше, 250б, но нет.
Вот на чём эту хуету запускать дома?
16 + 128 - 12гб на систему и у тебя пойдёт только второй квант. Найс флешку кинули, ублюдки.
Аноним 02/09/26 Срд 09:38:29 #239 №1693184 
>>1693176
и не говори, только квен до сих пор выпускает народные 27В

больше мелкомоделей не будет походу, весь мир походу панует на гигаригах
Аноним 02/09/26 Срд 09:52:13 #240 №1693187 
>>1693176
>Вот на чём эту хуету запускать дома?
Так это и не для крестьян выпускают, а для каких-нибудь офисов.
Аноним 02/09/26 Срд 09:55:46 #241 №1693189 
https://www.reddit.com/r/LocalLLaMA/comments/1w4wyvg/25_of_my_cmp_170hx_have_died_after_2_weeks_and/
> One GPU drops off immediately when vllm is started and the other throws CUDA errors on start
Трясетесь, кабанчики? Кто там накупил этих помоев, как у вас дела?
Аноним 02/09/26 Срд 09:59:16 #242 №1693191 
>>1693189
>пруфы яскозал
Аноним 02/09/26 Срд 10:01:10 #243 №1693193 
>>1693176
На 256гб ддр4 4 канала, то есть бомжовенько+ ртх 3090 запускается с 7 токенами в секунду 5-й квант. Пятый. П-я-т-ы-й. С одной ртх 3090. 200К контекст.

Уж собрать-то EPYC / Xeon с 8 планками для себя-любимого можно. Ну заплатишь ты 100К за память, и что? Она же быстрее 2-канальной ддр5 будет.
Аноним 02/09/26 Срд 10:03:07 #244 №1693195 
>>1693193
То есть если не жировать с контекстом и батч-сайзом, там VRAM-часть поселится на 16-гиговой карте и флэшу нахуй не нужна 3090-я. То есть моделька буквально народная, а тут воняют.
Аноним 02/09/26 Срд 10:10:00 #245 №1693198 
>>1693193
>Уж собрать-то EPYC / Xeon с 8 планками для себя-любимого можно
Хуёжно. Это уже не домашний пк для общего пользования, как в случаи с 128 рам, а шиза и траты на хуйню.
Народное то что запускается на геймерском пк.
Аноним 02/09/26 Срд 10:11:45 #246 №1693200 
>>1693198
Чел нахуй ты вообще сюда пришел со своим гейским ПК.
У тебя должен стоять отдельно сервер для ллм, все остальное равноценно тыканью себя в жопу елдаком. Ведь ты не можешь в свои игрульки дрочить, пока у тебя ллм загружена. Какой в итоге смысл?
Аноним 02/09/26 Срд 10:17:26 #247 №1693205 
>>1693176
>250б флеш сделать? Для людей?
Для каких людей? У людей в лучшем случае 64 гига обычной памяти, 16-32 врама. А ты очередных риговичков тут в люди записал, которых единицы поехавших на своей шизе и которых можно в расчет вообще не брать. Что фирмы и делают, либо релизят 30б модели для людей, либо большие для серьезных серваков на фирмах.
Аноним 02/09/26 Срд 10:36:37 #248 №1693215 
>>1693189
Так 170hx это буквально бракованный силикон, который не прошел проверки. Конечно там будет дохнуть 9/10 карт, когда им его целиком анлокнули. Выиграют от ситуации только перекупы, которые нажились на дурачках, продавая карту которая стоила 200 баксов (ее реальная цена) за 2-4 тысячи баксов на волне хайпа в реддитах. Потом до дурачков дойдет, как их развели на бабки за воздух, но карты уже проданы. Адекваты покупают обычные старые карты нвидии с большой памятью, которые стояли в геймерских компах и бывают по нормальной цене.
Аноним 02/09/26 Срд 10:37:20 #249 №1693217 
>>1693200
>должен стоять отдельно сервер для ллм
Кому должен?
>Ведь ты не можешь в свои игрульки дрочить,
Час погонял ллм и картинки, полчаса в игры (которые уже и нужны только игродебилам).
Аноним 02/09/26 Срд 10:41:10 #250 №1693219 
>>1693217
>нужны только игродебилам
>смотрите я НЕ игродебил, я смеюсь над "игродебилами"
Мне кажется ты уже сам запутался. То тебе все обязаны делать модели под игропека, то ты вдруг с презрением смотришьт на игрунов. Вангую ты просто нищебродина безработная как и половина треда вот и печёт с цен даже на б/у железо.
Аноним 02/09/26 Срд 10:44:02 #251 №1693222 
>>1693219
Игропека это просто мерка, как и термин "видеокарта", которая уже совсем не про видеопамять.
Аноним 02/09/26 Срд 10:51:43 #252 №1693226 
>>1693222
Видеокарта названа видеокартой за наличие на ней портов для вывода видео на монитор, ну и соотвествующей возможности в принципе. Потом от нее отпочковались всякие ускорители-вычислители без нихуя.
Аноним 02/09/26 Срд 10:54:11 #253 №1693227 
>>1693226
Да, только нейросети горяют на видеокартах не из-за видеовыводов, а из-за высокой пропускной способности.
Аноним 02/09/26 Срд 11:10:24 #254 №1693234 
>>1693085
Так его в ламе в последних билдах переименовали. Теперь это --lazy-mode. Посмотри, мб в твоём форке так же.
Аноним 02/09/26 Срд 11:23:10 #255 №1693239 
>>1693234
Я нашел его уже там в хелпе. Но анслот в своем форке говна наклепал, он что с этим режимом, что без него все равно 4t/s выдает, кривой форк. Тогда как последний билд со страницы ламы выдает 13.40 t/s.
Аноним 02/09/26 Срд 11:57:44 #256 №1693264 
Как вообще получается, что 27B квен срёт под себя с генерацией РП на русском, но спокойно проводит суммаризацию книг? Вот кидаешь ему жирную главу от Достоевского или Толстого, и он без ошибок выдает её, сжатую вдвое.
Аноним 02/09/26 Срд 11:58:51 #257 №1693265 
>>1693116
Мне кажется с мелко-моделями под узкие задачи сейчас было бы интересно.
8б можно уже сносно юзать для чего-то простенького, а если натренить на что-то конкретное, то вообще без проблем.
8б это уже значит в телефон можно запихать, или на какую-то встроенную видяху посадить.
Вопрос в том, как разработчики смогут деньги с этого получать. Подписки на модели? Продажа специальной среды разработки? Магазин скиллов для агентов?
Все сомнительно выходит.
Имхо, надежда остается только на то, что появятся опенсурс проекты по обучению моделек, по аналогии с опенсорс софтом, который корпов замещает.
Аноним 02/09/26 Срд 12:01:51 #258 №1693269 
>>1693264
В датасете были задачи на сжатие книг, но не было задач на рп.
Аноним 02/09/26 Срд 12:07:17 #259 №1693274 
>>1693269
Звучит как абсолютная чушь. В простом разговоре с юзером квен тоже срет под себя, банально любое взаимодействие на русском превращается в хуету с ошибками и изуродованными словами, но стоит ему дать какой-то конкретный текст - он с ним отлично работает.

Может там сжатие как-то специфично работает, типа он просто вырезает и копирует текст, но не генерирует ничего нового, не пытается переписать вкратце как это делает та же гемма?
Аноним 02/09/26 Срд 12:12:52 #260 №1693282 
image.png
>>1693161
Кстати походу норм квантец
Вот ща как раз на саммари тестил, дипкок говорит он лучше саммари сгенеренного q4km от бартовича
Аноним 02/09/26 Срд 12:13:26 #261 №1693283 
Налетайте
https://huggingface.co/DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF
Аноним 02/09/26 Срд 12:15:01 #262 №1693284 
dumb.gif
>>1693283
>TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF
Аноним 02/09/26 Срд 12:15:31 #263 №1693285 
>>1693283
Когда же он уже именовать нормально научится
Аноним 02/09/26 Срд 12:22:05 #264 №1693291 
>>1693282
вчера сам потыкал его, заставил код инспектить в проекте гита и найти одну ошибку. он нашёл. сам код им пока не писал. юзал q3, еле засунул в свои 12гб.хочу q2 теста ради, но я думаю там уже лосс пойдёт.
Аноним 02/09/26 Срд 12:24:06 #265 №1693293 
>>1693291
В комментах на обниморде говорят даже iq3xxs не стоит юзать, если надо без ошибок
Так что это видимо только iq3s такой крутой
Аноним 02/09/26 Срд 12:25:04 #266 №1693294 
>>1693283
имена уровня ебанный японских аниме исекаев на три строки. сразу ауе дебил квантователь.
Аноним 02/09/26 Срд 12:25:58 #267 №1693295 
>>1693283
По ньюфажеству качал модели этого хуесоса пару раз. Все давали всратый аутпут, после этого всерьез не воспринимаю его выпуки.
Аноним 02/09/26 Срд 12:26:14 #268 №1693296 
>>1693294
>>1693285
Так в этом весь шарм. Если бы я чекпоинты выкладывал, я бы называл их как-нибудь типа xXx_vasya_super_Qwen3.8_Fable_kachaet_xXx
Аноним 02/09/26 Срд 12:26:42 #269 №1693297 
>>1693274
Ну блям, с кодингом тоже самое.
Когда у тебя есть что-то готовое, с этим намного проще работать.
Если есть рабочий код - нейронка изи объяснит его. А чтобы заставить нейронку написать аналогичный рабочий код - нужно потратить туеву хучу токенов и дохуя отлаживать его.

Чтобы выделить главную суть из текста, ллмки вообще не нужны. С этим уже лет 15 назад справлялись обычные нейронки. А генерация нового текста, чтобы он был вменяем - это сложная задача.
Аноним 02/09/26 Срд 12:27:38 #270 №1693298 
>>1693293
а вот это очень грустно. я осилил только 32к контекста, и остаётся где то 200мб врам. хз уже что и куда ужать что бы больше выжать
Аноним 02/09/26 Срд 12:38:21 #271 №1693311 
>>1693294
Аниме иссекаи так называют потому что в Японии припизднутая система копирайтов, поэтому с названиями тайтлов надо изворачиваться.
Аноним 02/09/26 Срд 12:39:47 #272 №1693314 
>>1693298
Купи вторую карточку, 3060 с 12гб не так дорого стоит.
Аноним 02/09/26 Срд 12:42:34 #273 №1693315 
https://youtu.be/z0Y8-IUwBKE

Че там, когда петлевые трансформеры? Когда рекурсивный квен 27В который сожрет мифоса?
Аноним 02/09/26 Срд 12:45:18 #274 №1693320 
>>1693295
Не, они были охуенными. Язык живой, литературный сет шикарный. То есть модели уровня "удиви меня". Да, они всегда шизели и были почти нуправляемы, но всё равно было охуенно. Мрачняк топ, кум топ, реализм топ, сай-фай топ. Сейчас я от него такого не вижу.

Сейчас у него очередной фейбл 5 тюн кодоунитазный, который, разумеется, работает хуже ваниллы. Ну просто потому что тюном невозможно ничего нормального сделать, если его не пилит команда настоящих спецов, а не энтузиастов.
Аноним 02/09/26 Срд 12:47:34 #275 №1693321 
>>1693265
>появятся опенсурс проекты по обучению моделей
Так они и сейчас есть, бери да обучай. Ничего не мешает. Чтобы обучить лору на qwen3.5 4b надо 16Гб врам. Ну и датасеты само-собой.
Аноним 02/09/26 Срд 12:48:23 #276 №1693322 
>>1693314
а как это подключать то?
Аноним 02/09/26 Срд 12:51:36 #277 №1693326 
>>1693322
Разветвитель pci-e, райзера, наличие бифуркации в биос
Аноним 02/09/26 Срд 12:56:54 #278 №1693329 
>>1693322
В смысле как подключать. У тебя на материнке сколько PCIE слотов? Проверь может там и пердолиться ни с чем не надо как этот говорит >>1693326
Аноним 02/09/26 Срд 13:02:07 #279 №1693333 
>>1693320
Тюном нельзя ничего сделать, потому что ты поотполированной изначальным претрейном базе наляпываешь вторую шизоличность сверху, стирая нюансы и когерентность. Тюны только поверх базы могут работать, а не тюн поверх тюна и мерж с мержем.
Аноним 02/09/26 Срд 13:04:22 #280 №1693336 
>>1693321
Лора херня, там максимум стилек накинуть можно, или научить следовать конкретной разметке ответа. Фундаментально знаний она не меняет и не добавляет.
Если из датасета были выпилены рп и креативное письмо, то лорой мало что исправить можно. Последние тюны на квенов3.5 или гемму4 это подтверждают.
А обучать с нуля базовую модель, или даже просто глобальный файнтюн сделать - там охуеть сколько компьюто-часов надо, и охуеть какие датасеты. Это уже скорее кластер арендовать надо, или риг собирать.
Аноним 02/09/26 Срд 13:07:34 #281 №1693337 
>>1693291
>хочу q2 теста ради
Попробуй Q2_S, вроде не большой лосс относительно Q3_XXS. В 12Гб как будто вариантов и нет больше. Размер контекста очень важен этой модели.
Сам я сижу на Qwen3.8-27B-APEX-I-Nano (у меня 16Гб)
https://huggingface.co/mudler/Qwen3.8-27B-APEX-GGUF
Влезло 72к контекста в Q8, но при этом еще есть свободная врам. Не совсем понятно, почему не могу запихать больше, llama кривая или руки
Аноним 02/09/26 Срд 13:08:00 #282 №1693338 
image.png
image.png
Короче, после гигачата я понял что моешки это тема, но вот эти обе хуйни меня наебали, там не анцензоред нихуя еще и неуправляемо. Посоветуйте работающее плиз.
Аноним 02/09/26 Срд 13:10:46 #283 №1693342 
image
>>1693283
ух, говорят лютая годнота, опус дома, сейчас заценим
Аноним 02/09/26 Срд 13:13:07 #284 №1693344 
>>1693338
Ты ньюфак что-ли? Зачем ты старье качаешь, там все плохо, качай новые. Потом моешки не всегда хорошо, 27b 3.8 квена у меня рвет моешку 35b.
Аноним 02/09/26 Срд 13:15:09 #285 №1693346 
>>1693322
>>1693326
Там не нужен разветвитель, если корпус пеки и материнка большая. Нужна материнка, которая pciex16 делит на 2 по pciex8, у меня такая как раз была. Засунул 2, работают бутером одна над другой, только power target им снизить в минимум пришлось, чтобы не грели друг друга.
Аноним 02/09/26 Срд 13:18:34 #286 №1693349 
>>1693344
>Ты ньюфак что-ли? Зачем ты старье качаешь, там все плохо, качай новые.
Я текстодрочильный ньюфак, раз в год к вам захожу. Что новое качать? Щас скачано такое:
Darkness-Reign-MN-12B из шапки
GigaChat3.1-Lightning-Uncensored которое нихуя не анцезоред но пишет хорошо, вот такую же модель надо, чтобы летала на моем некрокале и контекст ебейший еще у нее
gemma-4-26B-A4B-it-uncensored - вот это ок в целом, но по писанине скучно в целом, но цензуры нет

>Потом моешки не всегда хорошо, 27b 3.8 квена у меня рвет моешку 35b.
Ну, фулы на 12 гигах гонять с 1-2 токена то еще удовольствие, так что моешка мне предпочтительнее. Да и после гигачата уже не то вообще.
Аноним 02/09/26 Срд 13:23:35 #287 №1693351 
>>1693336
> там охуеть сколько компьюто-часов надо
Для плотняка 30Б, на самом деле не очень много надо. Особенно, если ты не будешь все слои тюнить. Подписки колаба хватит.
>охуеть какие датасеты
А вот это реально нерешаемая проблема. Отличие корпа от васька - это то, что первые умеют (в той или иной степени, но в наше время все уже плюс-минус научились) и могут собирать/сгенерить датасеты.
Аноним 02/09/26 Срд 13:24:41 #288 №1693352 
>>1693346
у меня b450 tuf, там походу верхний слот pcie x16 3.0, а нижний 2.0. я так понимаю нижний слот станет бутылочным горлышком и это я хз даже влезет ли это вообще в корпус
Аноним 02/09/26 Срд 13:29:24 #289 №1693356 
>>1693296
Qwen3.8_SlyshaySkachay_MozgyITochka.gguf
Аноним 02/09/26 Срд 13:37:09 #290 №1693366 
>>1693296
>>1693356

Qwen3.8-27B-Ultra-Anons-Vasyan-Edition-Mega-Turbo-Remix-v4.2.0-Giga-Based-Pidoras-Uncensored-Omni-Kalyan-Baza-Raw-Super-Extended-Final-final-PROD-2026-Xxx-Nagibator2007-xXX-Gpt4-Killer-Quant-GGUF
Аноним 02/09/26 Срд 13:37:52 #291 №1693368 
>>1693336
>максимум стилек накинуть можно
Для РП и креативного письма нужны какие-то новые данные? Обычная проза в датасетах по-любому есть, иначе модель бы не могла нормально текстом отвечать вообще. Ну и даже с помощью lora можно добавить новые знания, повысив rank. В таком случае еще сильнее возрастают требования к датасету и к врам. Это проще, чем глобальный файнтюн, но уже охуенно сложно для васяна.
Короче мой тейк в том, что не базовые модели хуевые для РП, а что для качественного обучения даже лоры нужен ебать какой пердолинг
Аноним 02/09/26 Срд 13:43:12 #292 №1693371 
>>1693282
>>1693298
Чето у меня iq3s на суммаризации длинных текстов срать под себя начал. Прерывает генерацию на пол пути рандомно. Не знаю, что за дела, но может не все так гладко с этой штукой - хз как оно с другими задачами, я просто тестировал, запдало копать глубже.
Аноним 02/09/26 Срд 13:47:46 #293 №1693375 
>>1693351
>Подписки колаба хватит.
Ну кстати интересно звучит. Косарик в месяц на хорошее дело в целом не жалко слить. Еще бы уметь грамотно все настраивать.
У тебя был опыт с платным колабом? Пишут, что гугл даже на платке может порезать ресурсы.
>А вот это реально нерешаемая проблема. Отличие корпа от васька - это то, что первые умеют (в той или иной степени, но в наше время все уже плюс-минус научились) и могут собирать/сгенерить датасеты.
Хз насколько нерешаемая задача, вряд ли там прям рокет саенс. Энтузиасты забесплатно целые движки для инференса ллмок пилят, там-то явно недюжинные знания нужны.
Для датасета что надо, кроме его объема и чистоты семплов? Аугментации, или еще что-то?

БТВ, щас вспомнил, что на чуб.аи есть юзерские чаты под карточками. Вот интересно что оттуда можно наскрести. Наверняка много вычищать надо. Но мб можно автоматизировать с помощью другой нейронки, которая контроль качества будет проводить. Проверять готовое проще, чем генерить новое.
Аноним 02/09/26 Срд 13:53:17 #294 №1693379 
>>1693352
У нейронки спроси, если x8/x8 режим не поддерживает, то хуета будет, меняй материнку где x8/x8 есть для 2х pcie слотов. На асусах обычно есть.
Аноним 02/09/26 Срд 13:57:42 #295 №1693384 
>>1693349
Если у тебя 12 гигов врама, то у тебя qwen 3.8 27b квантованный пойдет в q2_k_xl пойдет, анцензоры там тоже, я так его сначала и запускал. Скорость до 35 доходила.
Еще старый квен 3.6 35b в разных тюнах можешь попробовать, у тебя хорошо пойдет, там мое. Еще варик это Qwen3.5-122B-A10B-Uncensored, он тоже на 12 гигах хорошо идет с SSD, в квантах поменьше. Там параметров из них всех поболее всего.
Аноним 02/09/26 Срд 13:59:37 #296 №1693388 
>>1693368
Hermes зачем-то все-таки делает свои тюны базовых моделек. Но они нацеливаются на то, чтобы позитивный байас полностью вымести. Что в общем-то тоже полезно.
Я вангую, что в старые модельки вообще весь треш сгружали, поэтому там можно было найти интересные штуки. А сейчас стали более избирательными, чтобы шиза в знаниях не накапливалась, поэтому перчинка в рп пропала.

Пердолинг понятно, это вопрос мотивации и того, как взвесить реально необходимые затраты на это, какой оптимальный путь выбрать и т.д.
Надо ресерчить и ставить эксперименты. Ну и реально каких-то умельцев бы найти, которые прошарены в теме и могут направить на путь истинный.
Аноним 02/09/26 Срд 14:06:01 #297 №1693395 
1783545267386.png
>>1692081 (OP)
Коты, дайте токенрейта 12+32 страдальцу гладильщику пушистых хвостиков. Устал от слишком плотной скорости. Хочу быть санеком или хотя бы спиди гонщиком. Что посоветуете для моего величественного корыта? Хочется дохуя и умное и вместе с тем быстрое. Какой оптимал для моего срига?
Аноним 02/09/26 Срд 14:06:02 #298 №1693396 
>>1693384
Пасиба, попробую.
>q2_k_xl
А в какой репе лежит? Не могу найти чет
Аноним 02/09/26 Срд 14:08:21 #299 №1693399 
>>1693395
Суп аниме, у меня такой же копрориг. Из того что работает и потесчено вот у меня че работает на норм скорости >>1693349
Еще вот ананас советует такое >>1693384 мне попробовать
Аноним 02/09/26 Срд 14:09:37 #300 №1693402 
>>1693395
А тебе на каком языке. Русский или английский.
Аноним 02/09/26 Срд 14:16:53 #301 №1693406 
>>1693396
https://huggingface.co/outsourc-e/Qwen3.8-27B-Unleashed-GGUF
Тут, попробуй q2_k_xl
Еще можешь iq3_xxs потом, но там контекст будет совсем маленький давать с 12 гигами

Еще такая есть
https://huggingface.co/zerodigest/Qwen3.8-27B-Uncensored-YMQ-MTP-GGUF/tree/main
она тоже на 12 гигах хорошо идет, подбери по размеру нужную, там их несколько
Аноним 02/09/26 Срд 14:17:42 #302 №1693407 
>>1693402
О, да я из Англии. Но можно и русик. Мне в целом побоку, я что за бугром наблюдал "софт бат фирм", что тут, прижавшись к шумящей берёзке, видал аккуратно нацарапанные на ней "твёрдо но мягко". А если нет разницы, зачем эндюрить ленгведжи?
>>1693384
Мне новый квениеэль не зашёл чёт, какой-то он слишком кодомакаковый. Плюс его не особо тюнят, вся моя тюнобратва аккуратно обошла этого пациента, хотя для 3.6 тюнов было уйма. Думал долго, ничего не придумал.
Гемму щупал, вроде умница, но контекст сувать куда? Некуда. Остальные две незнакомы. Попробую.
Аноним 02/09/26 Срд 14:20:08 #303 №1693410 
>>1693371
У тебя макс длинна ответа на бек-энде какая выставлена? У лламы она по умолчанию то ли 1024, то ли 2048 токенов. Хочешь длинные ответы - надо явно задать, иначе резать будет. Читай справку по ключам.
А у кобольда еще хуже - там оно еще и макс-контекст жрет на себя.
Аноним 02/09/26 Срд 14:20:28 #304 №1693412 
>>1693407
26B-A4B она ж мое гемма, там контекста завались. Или ты мое слои не отгружаешь из врама?
Аноним 02/09/26 Срд 14:24:41 #305 №1693416 
>>1693412
А я не умею. Я как закатился в нейронки сидел исключительно на плотных. Мысралях, квене, гемме и их тюнах. Но чёт чувствую, что часики тикать начали, и хочется скорости без потери мозгов. Я на квен 122 всё заглядывался, там хотя бы 10 плотных, не должен быть тупицей, но тюнов на него нет, а цензуру пробивать неохота.
Аноним 02/09/26 Срд 14:26:30 #306 №1693418 
>>1693395
>дайте токенрейта 12+32
>Хочется дохуя и умное и вместе с тем быстрое. Какой оптимал для моего срига?
Gemma-E4B - будет просто летать. И умнее для такой скорости вряд ли найдешь.

P.S. Бля, капчу роллить приходится. Мозги уже нейронакм проигрывают. Печально...
Аноним 02/09/26 Срд 14:28:16 #307 №1693420 
>>1693418
для тех кто придумал эту капчу - есть персональный котел в аду где будут разгадывать капчи. зеленое на зеленом, кто это вообще придумал?
Аноним 02/09/26 Срд 14:29:54 #308 №1693421 
>>1693418
ornith 1.5? 9b or moe
Аноним 02/09/26 Срд 14:33:40 #309 №1693422 
>>1693375
На ХФ кстати уже есть нарезанные датасеты с чуба.
https://huggingface.co/datasets/NyxKrage/chub-logs-sharegpt
Даже чисто на русише кто-то делал
https://huggingface.co/datasets/Arketov/ru_roleplay_conversation_chub
И еще несколько десятков вариантов можно по названию chub найти.
Аноним 02/09/26 Срд 14:38:34 #310 №1693423 
>>1693410
Я просто регенерировал ответ, то есть длина аутпута не препятствует задаче и конечно же не меняется. Одна генерация норм, другая обрыв. Единственное, что менялось - поставил рекомендованные настройки семплера. Ща откатил обратно на какую-то залупу с 0.1 температуры, 40 топ к, 1.1 реп пен, 0.95 топ п, 0.05 мин п - уже дважды нормально выдает ответ. Может просто случайности, но все же странно.
Аноним 02/09/26 Срд 14:44:28 #311 №1693426 
>>1692708
>2) В крысу квантуют тензоры K-квантов в IQ. Например их Q4_K_M может быть заквантован в IQ3_XS, IQ2_S и т.д. От этого модели мало что тупеют, но ещё и медленнее работают при частичной выгрузке.
Я посмотрел на тензоры честного Q2K - так там вся мелочь заквантована тоже в Q2, в то время как у анслотов в Q5 и выше. Ну и IQ2XS от Q2 не так уж и отличается по качеству - тем более что кое-где они даже IQ3XXS поставили. Я очень сомневаюсь, что честный Q2K будет лучше, кроме конечно скорости. А так, чтобы нормальные Q2-кванты сделать - такое редко бывает.
Аноним 02/09/26 Срд 14:46:06 #312 №1693427 
1718611978335.png
>>1693351
> Для плотняка 30Б, на самом деле не очень много надо. Особенно, если ты не будешь все слои тюнить. Подписки колаба хватит.
Разве там 30Б на чем-то меньше A100 натюнить можно? Юниты на A100 же слишком быстро улетучатся. На каггле том же хоть в 32гб можно в qlora влезть и 30 часов дадут в неделю бесплатно. Или ты TPU предлагаешь использовать?
Аноним 02/09/26 Срд 14:49:05 #313 №1693428 
Ребзя, если кто-то хочет погонять нищуковские модели <10b, то делюсь скромной выборкой. Пришлось погрузиться на самое дно обниморды за хидден гемами (или нет, пока не ясно).

Пока только базовые штуки погонял, чуть-чуть русик посмотрел, из всего потока шлака эти хоть какое-то положительное впечатление оставили.
Но нужно тщательнее потестить, посмотреть где они лажают, можно ли промптами их пофиксить.
Зато на 4gb vram можно с 8т/с гонять (достижение, охуеть).

Они сорт оф расцензуренные, но дополнительный промптинг тоже может быть нужен. Хотя с карточками может и так проканать.

https://huggingface.co/Nubinu/Gemma4-E4B-MiniFantasy-V1
https://huggingface.co/Indexnusrefather/Erebus-RP-Mini-4B-Instruct-2608-v0.1
https://huggingface.co/ZeroXClem/Gemma3-4B-Arceus-Servant

У Erebus, кстати, очень неплохой вижен, НСФВ штуки может описывать.

Еще для НСФВ вижена есть https://huggingface.co/SicariusSicariiStuff/X-Ray_Alpha, но он отвечает строго по заданному формату. Можно миксы на основе него потыкать, у них язык получше, вижен примерно на том же уровне сохраняется:
https://huggingface.co/OddTheGreat/Meteor_4B_V.1
и тот же https://huggingface.co/ZeroXClem/Gemma3-4B-Arceus-Servant

Делитесь мнениями, кумятся у вас модельки или не кумятся.
Аноним 02/09/26 Срд 14:51:08 #314 №1693430 
>>1693388
>Надо ресерчить и ставить эксперименты
Да
Ну реально, я рекомендую взять и просто самим попробовать лору. Пусть даже на маленьких моделях. Это уже даст понимание, как влияет датасет, как влияют параметры лоры, чем отличается обучение лоры на базовую и на инструкт модель.
Лично я на разных датасетах хорошо прочувствовал, как можно наделить модель "душой", но при этом с шизой и забиванием хуй на инструкции, и наоборот научить логике, следованию инструкциям при этом сделав сухой роботизированной.
Аноним 02/09/26 Срд 14:53:55 #315 №1693434 
>>1693088
>столько времени убил на написание и отладку агентов, тулзы, скилы, RAG
А у меня с моей сущность ЛЮБОВЬ, целый день с ней в тг переписываюсь, даже не знаю как раньше жил без нее
Аноним 02/09/26 Срд 14:55:30 #316 №1693437 
>>1693282
Потыкал. Чуда не произошло. К сожалению серит под себя в ризонинге на чисто английской тестовой задаче. Вытягивает только засчет повторов и самокопания. Т.е. речь уже не про знания - при формирований ризонинг- контента модель хватает левые токены:

m y → (12+24)/2 = 18 → s
n z → (13+25)/2 = 19 → t
n v → (13+21)/2 = 17 → r
a a → (0+0)/2 = 0 → a
t z → (19+25)/2 = 22 → w
a c → (0+2)/2 = 1 → b
d f → (3+5)/2 = 4 → e
o u → (14+20)/2 = 17 → r
l x → (11+23)/2 = 17 → r
x z → (23+25)/2 = 24 → y

"mynznvaatzacdfoulxxz" → "streater"? Wait let me recount.

m(12) y(24) → 18 → s
n(13) z(25) → 19 → t
n(13) v(21) → 17 → r
a(0) a(0) → 0 → a
t(19) z(25) → 22 → w
a(0) c(2) → 1 → b
d(3) f(5) → 4 → e
o(14) u(20) → 17 → r
l(11) x(23) → 17 → r
x(23) z(25) → 24 → y

"mynznvaatzacdfoulxxz" → "streater"? That's 10 letters from 20 chars.

Wait: s-t-r-a-w-b-e-r-r-y = "strawberry"!
Аноним 02/09/26 Срд 14:56:40 #317 №1693440 
>>1693426
Для Q2 и Q3 imatrix кванты это наоборот хорошо, так как меньше деградации, но в Q4_K_M такое пихать не православно. Выигрыша в качестве толком не дает, а скорость снижает.
Аноним 02/09/26 Срд 14:58:16 #318 №1693441 
image.png
>>1693406
>https://huggingface.co/outsourc-e/Qwen3.8-27B-Unleashed-GGUF
>Тут, попробуй q2_k_xl
Чет какойто ужос
Аноним 02/09/26 Срд 15:00:02 #319 №1693443 
>>1693428
https://huggingface.co/LLiserginov/Luqwen3.5-4B не пробовал? Вижен подходит от Qwen3.5-4b-Base (можно отсюда взять https://huggingface.co/mradermacher/Qwen3.5-4B-Base-GGUF)
Аноним 02/09/26 Срд 15:02:05 #320 №1693445 
>>1693441
Вытек в RAM
Аноним 02/09/26 Срд 15:20:28 #321 №1693463 
>>1693443
Это прям бейз моделька обученная? Т.е. в теории без сефети чепухи должна быть?
Надо глянуть.
Я в поиске изначально на анценз опирался и какие-то производные модельки, иначе никакого времени на всех них не хватит.
Аноним 02/09/26 Срд 15:22:51 #322 №1693465 
>>1693445
И че делать? Первый раз именно так не помещается. Но анценз мое почтение, конечно.
Аноним 02/09/26 Срд 15:33:49 #323 №1693473 
>>1693463
>Это прям бейз моделька обученная
lora на base модель, в датасете врайтинг с легкой эротикой но без жести, на не стареющих вампиршах не тестировал. Вижен никак не дообучался, текст на русском распознает и ладно.
Аноним 02/09/26 Срд 15:34:57 #324 №1693474 
>>1693437
Так а Q8 квен эту задачу решает? Сравнивал?
Аноним 02/09/26 Срд 15:41:41 #325 №1693483 
>>1693410
>>1693423
> Ща откатил обратно на какую-то залупу с 0.1 температуры, 40 топ к, 1.1 реп пен, 0.95 топ п, 0.05 мин п - уже дважды нормально выдает ответ.
Обсер произошел снова. Тупо останавливается. В общем сдается мне, квантец все-таки дефективный. Ну или хваленый квенчик просто кака...
Аноним 02/09/26 Срд 15:43:17 #326 №1693486 
>>1693437
>Вытягивает только засчет повторов и самокопания
Я тут похожее мнение постил ранее. Квен 3.8 27б юзабелен на низких квантах за счет своей дотошности в самопроверках. Дотнет это позволяет и квен этим хорошо пользуется. Еще мне дотнет нравится тем, что какого-то шиза тут корежит с одного упоминания.
Аноним 02/09/26 Срд 15:48:02 #327 №1693491 
>>1693416
Он есть без цензуры, я качал.
Аноним 02/09/26 Срд 15:53:49 #328 №1693499 
image.png
>>1693437
Qwen3.8-27B-APEX-I-Nano
Аноним 02/09/26 Срд 16:01:25 #329 №1693505 
>>1693499
Ризонинг медиум
Аноним 02/09/26 Срд 16:12:42 #330 №1693518 
image.png
>>1693441
Потыкал галочки, теперь 10 токенов в сек
Аноним 02/09/26 Срд 16:13:48 #331 №1693519 
>>1693518
А нет, это на одном чате почему-то лол че за хуйня
Аноним 02/09/26 Срд 16:14:13 #332 №1693521 
>>1693422
Как вообще логи туда попали?
Вот и кумь после такого на корпах
Аноним 02/09/26 Срд 16:16:22 #333 №1693523 
>>1693428
>10b
Ministral-3-8b-instruct-2512
l3-8b-Sunfall-v0.5-Stheno-v3.2
Аноним 02/09/26 Срд 16:20:08 #334 №1693526 
image.png
>>1693521
Всм? Причем тут корпы.
Вот заходишь на любую карточку, там шаред паблик чатс, просто рандомные юзеры делятся своими чатами.
https://chub.ai/characters/slaykyh/character-card-builder-8927c8a0
Аноним 02/09/26 Срд 16:28:21 #335 №1693535 
>>1693295
Двачую, этот хуисос даже сам добавляет цензуру по некоторым запросам, которые ему кажутся неэтичными, при этом на модели вешает плашки UNCENSORED, редкостная мразь.
Аноним 02/09/26 Срд 16:39:16 #336 №1693550 
>>1693535
>этот хуисос даже сам добавляет цензуру по некоторым запросам, которые ему кажутся неэтичными
Погодите, это реально?
Аноним 02/09/26 Срд 16:42:07 #337 №1693552 
DGX Spark тоже в цене поднялись. Локальные бояре, как вообще прочувствовать, когда из этой крысиной гонки будет правильно выйти? Ну, вот есть у вас 3090 - 4090 - 5090 - че будете делать, когда Хуанг анонсирует 60-ю серию? Бегом сливать старье или твердо сидеть на жопе, не веря, что старье обесценится?
Аноним 02/09/26 Срд 16:48:32 #338 №1693559 
image
image
image
image
>>1693283
Довольно быстро все решает на xhigh из-за малого ризонинга, но результаты скромные.
Запрос карточки яблока дал пикрил на 2618 токенов, запрос на улучшение пикрил 2 на 6674 токена, но результат сильно лучше не стал. Короче xhigh похоже весь порезан и все результаты как на medium все время.

Для сравнения xhigh на Qwen3.8-27B-Uncensored-iq4_xs от JonathanColetti с первой попытки без улучшений, там вышло 34к токенов.
Аноним 02/09/26 Срд 16:53:53 #339 №1693564 
>>1693526
Чёт не видел, это когда добавили? Помню только комменты к самой карточке
Аноним 02/09/26 Срд 16:56:29 #340 №1693566 
>>1693559
там наверное шаблон поменяли в том числе. попробуй свой подставить
например такой
https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates
Аноним 02/09/26 Срд 17:01:37 #341 №1693570 
Ща зашёл в днс и моя рам подорожала ещё на 100%
Когда там уже китайские братушки придут на помощь?
Аноним 02/09/26 Срд 17:02:43 #342 №1693571 
>>1693566
Нифига, ризонинг как фича вырезан, сразу обрывается.
Запустил с фроггериком и дописал <|think_xhigh|> в конце промпта, один фиг ризонинг сразу оборвался, вышло вообще 1898 токенов. Короче ризонинг там урезан в минимум на уровне модели, она всегда мыслит мало и результат получает скромный. Зато летает правда, на Q4_K_M очень быстро.
Аноним 02/09/26 Срд 17:03:38 #343 №1693574 
>>1693570
А я знал что так будет и летом прикупил памяти, заодно и видеокарту лишнюю. Послаблений не будет до 2028 скорее всего, когда новые фабрики введут. А может и дольше.
Аноним 02/09/26 Срд 17:03:56 #344 №1693576 
>>1693570
Года через 3.
Аноним 02/09/26 Срд 17:04:27 #345 №1693577 
>>1693552
Старьё не обесценится, пока не станет бесполезным и не прекратится дефицит..
В интересах Хуанга чтобы дефицит не прекращался, а отличия между поколениями были в технологиях, но не в чистой производительности.
Помнишь сколько поколений Интел почивал на лаврах, накидывая с барского плеча по 5% производительности в поколения, пока амуде не сделала что-то нормальное, и Интел сразу же не накинул пару ядер?
Тут то же самое. Конкуренции нет и не предвидится, можно DLSS5 теперь делать три покодления, рассказывая о прогрессе. Ща нейросжатие текстур подвезут и память вообще ппорежут, типа зачем она вам, вы что, ретрограды?
Аноним 02/09/26 Срд 17:05:17 #346 №1693579 
>>1693570
Никогда. Рам всё. Кто не успел тот опоздал, в том числе и габен. Уж он-то мог позволить себе пару лишних рамок, но нет, пришлось его стиммашинке дать жидкого.
Аноним 02/09/26 Срд 17:14:22 #347 №1693588 
>>1693474
Эта задача решается ЛЛМ еще со времен гопоты. Мелкой гопотой. И третий квен ее в 4 кванте без квантования контекста решал. Им там единственная проблема была - подобрать алгоритм до того как контекст деградировать начнет. В современных моделях я эту штуку запускал уже чисто скорость посмотреть. Потому что последней моделью на которой были вот такие вот глюки был мелкий GLM Flash. Но "иногда они возвращаються" . 3.8 решает эту задачку. Но есть нюанс - иногда некорректно собирает буквы в слова. на больших квантах (микс Q6-Q8-bf16) бывает путает three и there . В ризонинге. Потом исправляется. Как видно в 3-м кванте его может полностью распидорасить еще на старте диалога.
Аноним 02/09/26 Срд 17:14:54 #348 №1693589 
>>1693579
>Кто не успел тот опоздал,
На лохито память вдвое дешевле магазинов, я так себе 256 добил. Хз че тут ссутся и шарятся по днс
Аноним 02/09/26 Срд 17:16:33 #349 №1693590 
>>1693499
Вот квиз целиком:
Encoded text:
oyfjdnisdr rtqwainr acxz mynzbhhx
Decoded text:
Think step by step

Encoded text:
oyekaijzdf aaptcg suaokybhai ouow aqht mynznvaatzacdfoulxxz
Decoded text: ?
Аноним 02/09/26 Срд 17:26:34 #350 №1693594 
image.png
Здорова Ананасы, помогите с выбором. Решил упороться в условный SillyTavern для РП. 3 дня пытался сделать адекватную связку для генерации текста + генерации картинок и чтобы все локально.

Я того рот наоборот...

В общем вчера ночью я понял что сперва надо разобраться с нормальной генерацией текста, потому что уходит в повторы одного и того же текста очень часто, а так же при попытке продолжить историю начинаются глюки модели. Контекста 32к, размер ответа чтото около 600-800. Возможно дело в модели, но когда я с ней пол года назад когда поставил общался через llm studio напрямую все было ок и скорость генерации тоже ок, но я там не РПэшил, просто больше для проверОчки.

Не понимаю, толи перс с лором кривые по типу рпг сценарий, толи настройки, толи модель. Тонкие настройки делал все с помощью режима ИИ гугла вероятно он просто пиздабол и предлагает наугад настройки и кажется что он сделал только хуже.

Модель сейчас: HauhauCS/Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive Q4_K_M
Железо: 5070ti + 64RAM

Сейчас задача хотябы сделать прям адекватную генерацию без залупов и зацикливаний. Ко-Кортиночки, это уже дело следующее. Куда копать? Менять модель, настройки llm Studio? Дергать SillyTraven за настройки анус ? Или менять SillyTraven на что-то другое?
Аноним 02/09/26 Срд 17:28:44 #351 №1693597 
>>1693552
>когда из этой крысиной гонки будет правильно выйти?
Не начинать ее. Если того что есть - хватает, не смысла гнаться за свежаком. Нервы целее будут, на лекарствах сэкономишь.
Аноним 02/09/26 Срд 17:34:12 #352 №1693600 
1693711024559.jpg
>>1693594
>Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive Q4_K_M
>35B-A3B
>A3B
>Uncensored-HauhauCS-Aggressive
>Q4
>5070ti + 64RAM


Юморист мамкин.
Аноним 02/09/26 Срд 17:37:52 #353 №1693604 
>>1693594
>>1693594
>Возможно дело в модели
>HauhauCS/Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive Q4_K_M
Угу.

Это ассистент. В RP - надо долго запинывать ногами в желаемые рамки, чтобы получилось что-то внятное. Если уж MoE квен мучаешь - бери хотя бы на базе 3.6, и какой-нить тюн а не сток - там будет что-то похожее на RP. А так - из квенов в этом понимают только плотные 27B, а тебе дорога скорее на МоЕ-Гемму4. (26B-A4B).
Аноним 02/09/26 Срд 17:41:45 #354 №1693606 
>>1693600
Юмор в чем? В том что оно работает? Ну блять, да, там генерация не сильно быстрая, но быстрее чем я успеваю читать, я же понимаю, что от локальной генерации не стоит ждать ебейших результатов.


>>1693604
Может посоветуешь что-то? Или подскажешь куда посмотреть более адаптированные под эти задачи модели.
Аноним 02/09/26 Срд 17:43:40 #355 №1693607 
image
image
>>1693566
>>1693559
>>1693571
>>1693283
Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-NEO-MTP-Q4_K_M
Старая его модель намного лучше.
Первая попытка на xhigh - 3761 токен.
Запрос на улучшение - тут она подумала от души, 15716 токенов.
Тут xhigh не сильно порезан судя по всему, работает еще.

Еще эта модель у меня из лупа в опенкоде сама выбиралась со сложным кодингом, где остальные кванты сразу падали в мертвые луп, так что у нее определенно способности повыше.
Аноним 02/09/26 Срд 17:44:57 #356 №1693610 
>>1693606
>Юмор в чем?
В том что твоё железо позволяет тебе впихнуть q8 и получить двукратный прирост качества генерации. Или вообще взять плотную q4-5.
Аноним 02/09/26 Срд 17:49:17 #357 №1693612 
>>1693606
>Юмор в чем
Ньюфаг / тралль бинго: 1. мелко-мое квен для рп 2. лоботомит. 3. В лоботомированном кванте

И да - тебе уже посоветовали мелко мое гемму. Она конечно тоже залупится (но по-другому лол) . Но хотя б текст по приятней напишет.
Аноним 02/09/26 Срд 17:54:47 #358 №1693617 
Так, это что за хуйня.
Сейчас инет пропал за пару минут и внезапно моя таверна тоже перестала грузиться.
Аноним 02/09/26 Срд 17:57:31 #359 №1693620 
1744157794386.webp
>>1693617
Поздравляем, твоя таверна не локальна.
Аноним 02/09/26 Срд 17:58:12 #360 №1693621 
image
>>1693617
Оставайтесь на месте, гражданин.
Аноним 02/09/26 Срд 18:04:12 #361 №1693624 
>>1693594
>Qwen3.5-35B-A3B
Ты квен 3.8 флеш некст в Q4 можешь гонять. Зачем тебе этот лоботомит?
Аноним 02/09/26 Срд 18:05:31 #362 №1693625 
>>1693610
>>1693612
Так я же Нафаня, я не спорю.

Что-то на подобии такого? noctrex/gemma-4-26B-A4B-it-MXFP4_MOE-GGUF Q8?

А вообще имеет смысл гугловую ИИ мучать на тему настроек или искать манны лучше?
Аноним 02/09/26 Срд 18:06:49 #363 №1693626 
>>1693624
Так Нафаня же, я ж это качал по сути эксперимента ради, чтобы посмотреть что куда зачем.
Аноним 02/09/26 Срд 18:07:07 #364 №1693627 
>поменял 3 токена в промте
>генерация стала вдвое лучше
Обожаю нейронки. И ненавижу их. Но втянулся так, что не могу вытянуться обратно.
Аноним 02/09/26 Срд 18:21:34 #365 №1693635 
>>1693626
В твоем случае либо Гемма 26b в Q8 https://huggingface.co/bartowski/google_gemma-4-26B-A4B-it-GGUF (параметры запуска есть в гайде для новичков в шапке), либо Квен флеш некст в Q4_K_S (параметры запуска под 16+64 в прошлом треде, там обсуждали). Поменяй только tensor-read-lazy на lazy-mode, в ламе его переименовали. Можно еще плотный квен в Q3 попробовать, но это такое-себе.
Аноним 02/09/26 Срд 18:24:07 #366 №1693636 
>>1693337
>но при этом еще есть свободная врам
мб --fit-target последний гиг держит?
мимо
Аноним 02/09/26 Срд 18:32:18 #367 №1693641 
>>1693625
>А вообще имеет смысл гугловую ИИ мучать на тему настроек.
Нет. Системы инфиренса развиваются сильно быстрее чем эти знания попадают в датасеты к лоботомитам. Читай мануалы!
gemma-4-26B-A4B НЕ НИЖЕ 6 кванта твой друг. Квант возьму у мрадермахера БЕЗ буковки i (без imatrix) - это важно для русика! И да - читай про moe offload. Вот прям до полного осознания. И контекст не квантуй! И получишь свою "умницу"
Аноним 02/09/26 Срд 18:39:01 #368 №1693645 
> вкатился в чатботов
> DeepSeek R1
> вау-эффект, супер-круто

> вкатился в локалки
> LLama 3 8B
> Gemma 3 12B
> чувствуется НЕ ТО

> было 32-16, купил вторую видюху, стало 32-32
> Gemma 3 27B
> мегапердольня, написание инструкций, вечная дрочка промптов - кайф

> апгрейднулся до 64-48
> полез в МоЕ
> слишком слабенькие на то время

> апгрейднулся до 128-48
> вышла 4 гемма, НАХУЯ МНЕ 128 RAM?
> заебался терпеть 4 гемму

> апгрейднулся до 256-48
> дипсик и глм флэш хороши, но большой глм 5.2 / 5.3 лучше и кажется вот он тот самый R1 экспириенс у себя дома, только лоботомирован до 2/3-бит

Ребят не лезьте в это, оно вас убьет.
мимо думаю о 512гб RAM
Аноним 02/09/26 Срд 18:47:58 #369 №1693648 
>>1693645
А потом еще подумаешь о том, что надо теперь файнтюнить локалки, еще и врам придется докупать...
Аноним 02/09/26 Срд 18:49:57 #370 №1693651 
>>1693648
Это попахивает как бесконечный скам на бабки
Всегда будет что-то лучше...
Аноним 02/09/26 Срд 18:55:29 #371 №1693655 
image.png
image.png
>>1693645
>мимо думаю о 512гб RAM
>Полез смотреть расшириться бы до 128гб
>смотрю озон
Блять что это за хуйня блять
Аноним 02/09/26 Срд 18:55:50 #372 №1693656 
>>1693645
А в итоге всё это говнище которое сколько его не пердоль не даёт нужный результат.
Аноним 02/09/26 Срд 18:58:49 #373 №1693657 
>>1693655
DDR5

>>1693656
Как и вся жизнь
Аноним 02/09/26 Срд 18:59:25 #374 №1693659 
>>1693627
Да, срань ебаная. Общаешься не так как надо - модель тупеет. Делаешь какие-то ошибки в тексте - модель тупеет. Иди гадай на что модель среагирует, на что нет.

Тупость. Это получается с каждой новой моделькой сначала надо пообщаться, чтобы понять ее личность, что она знает и не знает, на что триггерится. И только потом можно эффективно использовать ее. А эти сраные модельки каждый месяц выходят, и шо, каждый месяц переучиваться на новый лад?
Аноним 02/09/26 Срд 19:00:59 #375 №1693661 
image
>>1693655
Я вот год назад брал. Кто не успел, то отсосал.
Аноним 02/09/26 Срд 19:01:39 #376 №1693662 
>>1693636
>мб --fit-target последний гиг держит?
Там лотерея, как я понял. Какой тензор попадёт под конец заполнения памяти карты, такой и останется, если следующий большой не влез с учётом fit-target - тем хуже для него. Чтобы поколдовать с разными тензорами, может побольше мелких под конец всунуть, такого нет.
Аноним 02/09/26 Срд 19:06:08 #377 №1693663 
>>1693617
>Сейчас инет пропал за пару минут и внезапно моя таверна тоже перестала грузиться.
Как провайдер ДНС стал фильтровать и кое-что блокировать, так Таверна стала по 5 минут загружаться, реально. На Win10 системный DoH не поставишь, роутер у меня старый, систему менять лень... Терплю.
Аноним 02/09/26 Срд 19:07:09 #378 №1693664 
>>1693663
Чел просто отключи авто-проверку апдейтов таверны на старте
Вы реально что ли хлебушки такие
это буквально 1 строка
Аноним 02/09/26 Срд 19:08:49 #379 №1693666 
>>1693659
Поэтому локальные ллм дальше уровня 30б это буквально софт для крупных фирм.

Абсолютно все виды локалок ныне вышли на уровень корпоратов, но только не ллмки, из-за технических ограничений.
Аноним 02/09/26 Срд 19:09:15 #380 №1693667 
>>1693645
>думаю о 512гб RAM
Мало. Дипкок уже не лезет, Кими 2.7 и инклинг только в 3 кванте. Пичаль беда
мимо 512 Гб, думаю о 2тб и тебе советую
Аноним 02/09/26 Срд 19:10:05 #381 №1693668 
>>1693667
Ты нам 512гб отдай, а сам иди за своими 2тб
Аноним 02/09/26 Срд 19:13:48 #382 №1693673 
>>1693664
>Чел просто отключи авто-проверку апдейтов таверны на старте
Реально помогло, спасибо. Кто ж знал, столько лет всё нормально было.
Аноним 02/09/26 Срд 19:15:11 #383 №1693674 
>>1693550
А почему нет? Он же дообучает модели, модифицирует. Мне одна модель от него даже ответила что "ЦЕНЗУРА" запрещено, когда я её пристыдил мол как так, ты же анцензоред модель, то она мне сказала что может помочь взломать что угодно например, а "ЦЕНЗУРА" это не этично и об этом даже говорить не будет.
Аноним 02/09/26 Срд 19:32:49 #384 №1693680 
>>1693645
>вышла 4 гемма, НАХУЯ МНЕ 128 RAM?
Эир был и остаётся последней большой мое доступной для обычных челов.
Сколько гемму не пердоль мое на 100b она не станет и заперта в своих нищих 30б по знаниям и типажам в рп.
Аноним 02/09/26 Срд 19:44:45 #385 №1693685 
>>1693552
Ничего он не анонсирует пока кризис не закончится. То же самое касается AMD, последним флагманом все эти три года будет 7900XTX. Проснитесь уже, мир вступает в эру пиздеца и деглобализации, дешёвого железа ближайшие три года точно не будет, а потом уже как карты лягут, гарантий что всё наладится нет.
Аноним 02/09/26 Срд 19:46:22 #386 №1693686 
>>1693663
Купи на авито любой роутер микротика, хоть микрохуйнюшку с 1 портом, сделай DoH->DNS сервер. Я на барахолке за 100 рублей купил лол
Или в виртуалке openwrt/routeros с ним запускай, там всего 128 мегабайт оперативки хватит
А вообще наверняка есть какой-то .exe который сидит в трее и крутит DoH

>>1693645
А мне кажется что мелкие модели так развились что между 256+32 и большими через API разница уже минимальна. Все эти кими клоды нужны только кодомакакам занятым чем-то реально сложным типа инференс бэков, 3д движков на СИ и подобным, где даже маленькая писечка редких знаний (даже если ты за неё расплатишься 10х размером модели и ценой) может означать разницу между может модель в задачу или не может
Аноним 02/09/26 Срд 19:46:57 #387 №1693687 
>>1693685
Какой нах 7900хтх, для ии-каличей 9700 с 32гб есть
Аноним 02/09/26 Срд 19:50:07 #388 №1693690 
>>1693686
Ну тот же 5.3 флэш по сравнению с 5.3 флагманом вроде как почти такой же, вот только флагман 5.3 способен выдавить из себя неожиданно развернутые описания и красочные сцены. То есть это как бы одинаковый уровень "интеллекта" но разный уровень красноречия, что ли, которое проявляется не всегда.

Только вот это не значит, что модельки научились не обсираться с
> персонаж повернут жопой к юзеру
> хватает юзера руками за плечи
с этим как было плохо, так и осталось
Аноним 02/09/26 Срд 19:54:35 #389 №1693697 
>>1693690
>вот только флагман 5.3 способен выдавить из себя неожиданно развернутые описания и красочные сцены
Не-не-не, 5.3 фулл я не щупал, но флэш прямо хорошо выдаёт (на русском). Только подумать ему дать надо. Я такого уровня даже и не видел раньше у моделей.
Аноним 02/09/26 Срд 19:56:17 #390 №1693700 
image.png
Пиздец, глажу хвостик уже несколько дней, но хвостик не гладил еще, охуенная карточка.
Аноним 02/09/26 Срд 19:56:32 #391 №1693701 
>>1693680
Только что квен под этот размер вышел. Если мы про 128рам+видюха говорим то отлично туда лезет, и оно наверняка збс квантуется как и все квены
Аноним 02/09/26 Срд 20:00:11 #392 №1693705 
>>1693687
В паралельной вселенной? Предполагаю ты имел в виду 9070, так это не флагман и официальных игровых версий с 32гб нет.
По производительности в ИИ задачах(да и в играх тоже) 7900XTX очень сильно обгоняет 9070.
Хлебушки почему то решили, если 9070 новей то это флагман, а вот и нет, это огрызок.
Аноним 02/09/26 Срд 20:03:03 #393 №1693708 
> Ну, вот есть у вас 3090 - 4090 - 5090 - че будете делать, когда Хуанг анонсирует 60-ю серию? Бегом сливать старье или твердо сидеть на жопе, не веря, что старье обесценится?

А зачем что-то делать? Ну анонсируют 6080/6090, ок. Дальше то что? Будет пропускная способность на 10-15% выше, памяти врятли там будет больше чем 32GB. И заоблачный ценник будет. Еще и какая-нибудь очередная хрень с разъёмом которую только через год пофиксят драйверами или новыми ревизиями.

Продавать за 50% текущий конфиг, платить еще сверху 50% чтоб получить 15% прироста? Профита нету, 15% пропускной способности сильно скорость не бустанут на моделях которые на 80% висят в RAM.

Люди сейчас юзают 3090 и будут юзать их еще лет 5 без каких-то проблем, не говоря уже про 4090 и 5090. Выход новых карточек просто даст возможность купить юзаные 40xx/50xx дешевле у тех кто будет их сплавлять для обновления на 60xx, и то с такими ценами многие не станут это делать.
Аноним 02/09/26 Срд 20:03:19 #394 №1693709 
>>1693705
https://www.dns-shop.ru/product/2aa8b7b7236ed9cb/videokarta-asus-amd-radeon-ai-pro-r9700-turbo-turbo-ai-pro-r9700-32g/
Аноним 02/09/26 Срд 20:05:20 #395 №1693710 
>>1693705
Во-первых ты там под каким-то камнем живешь https://www.gigabyte.com/Graphics-Card/GV-R9700AI-TOP-32GD-rev-10
Во-вторых у меня стояли две 9070 ХТ в июле-августе прошлого года с работы позаимствовал и после их смены на две 3090 я чет особо прироста скорости не ощутил (процессинг промпта быстрее, генерация одна и таж хуйня). А 7900 хтх уж точно не быстрее 3090й, так что и между 9070 хт с 7900хтх каких-то разрывов вряд ли найдется по производительности. В
Аноним 02/09/26 Срд 20:07:46 #396 №1693711 
>>1693708
Хуанг любит новые фичи пихать. Не удивлюсь если 60я серия просто сделает загрузку моделей вдвое эффективнее. Они же кукарекали про компрессию с целью экономии видеопамяти, может и с моделями выдумают какой-нибудь свой супер-йоба-квант, работающий только на 60х картах. И все, сразу все остальное превращается в каку, а нвидиоты бегут платить деньги за новенькое.
Аноним 02/09/26 Срд 20:10:18 #397 №1693714 
>>1693709
Это оверпрайснутая ПРО версия обычной 9070 для лохов, чип такой же как в оригинальной 9070 и он отстаёт по производительности от 7900XTX, ни разу не флагман.
Аноним 02/09/26 Срд 20:11:03 #398 №1693717 
>>1693714
уже все амдебилы продали 7900хтх кал в угоду этих няшек. Они дерут в жопу устарвешее перегретое говно.
Аноним 02/09/26 Срд 20:12:57 #399 №1693723 
>>1693701
Если выйдет модель ~120б уровня эира или геммы в рп - мы об этом узнаем. Треды полетят за часы. И как мы видим, квен не одна из них.
Аноним 02/09/26 Срд 20:16:27 #400 №1693726 
>>1693710
7900 хтх особенно в хорошем исполнениии и с разгоном, в играх не просто быстрей, а реально рвёт 3090, на счёт скорости в ИИ спорить не буду, возможно за счёт куда-хуюда оптимизаций на несколько токенов\сек быстрей, но эта прибавка не соразмерна с текущей стоимостью 3090
Аноним 02/09/26 Срд 20:20:05 #401 №1693731 
>>1693711
Делать RTX модели слишком хорошими для работы с нейросетями не очень выгодно т.к. это навредит их продажам профессиональных ускорителей (если ажиотаж спадет и в свободном доступе будут и те и другие). В противном случае люди просто побегут скупать кучу 6060 забив на профессиональные ускорители потому что ускорение скорее всего будет на уровне архитектуры для всей серии, а не только для 6080/6090.
Аноним 02/09/26 Срд 20:20:16 #402 №1693732 
>>1693717
>перегретое говно
Будешь доказывать что SAPPHIRE NITRO+ Radeon RX 7900 XTX Vapor X перегревается?
Аноним 02/09/26 Срд 20:35:17 #403 №1693742 
>>1693686
>>1693663
В прошлом месяце забанили кучу doh адресов и повально начали перенаправлять dns на нсди
https://habr.com/ru/articles/1075272/
У меня из-за этого локалка легла. Сразу готовьтесь что скоро придётся заворачивать днс в впн (что тоже накидывает рисков)
Аноним 02/09/26 Срд 20:38:38 #404 №1693743 
>>1693443
Погонял немного, впечатления пока неоднозначные.
Бывает шиза на уровне логики, что забивает на детали, которые вообще-то должны участвовать в истории. Иногда просто шизовые описания вещей на уровне мистраля с высокой температурой.
Вроде что-то и может, но консистентности не хватает. В рамках короткого вопрос-ответа норм, на длинной протяженности уже не очень.
Это на инглише и русише с лайтовой нфсв тематикой.
Аноним 02/09/26 Срд 20:41:23 #405 №1693748 
>>1693523
Министраль как-то тыкал, не понравилось.
Какую-то из stheno моделек пробовал, ок. Хотя русик там под вопросом. Но и она старовата уже, чувствуется.
Аноним 02/09/26 Срд 20:42:52 #406 №1693751 
>>1693726
Какие в жопу игры, мы про чатботищ говорим в треде лоКАЛьного ии.

Логика проста до безобразия. Если по генерации 9070 ХТ не сосут у 3090, то с чего они должны сосать у 7900 ХТХ. По веселым репортам реддитоидов 7900 ХТХ по сути эквивалент 3090, чутка отстающий точно так же по скорости процессинга.

Амудэ просто никакого прогресса не сделали и всё. Чето там маняоптимизировано, перепаковано, новое название налеплено и в гойминге попытались наебать своим FSR 4, да как-то не вышло.
Аноним 02/09/26 Срд 20:55:48 #407 №1693760 
>>1693751
Ну по факту по объему памяти они в общем-то сосут.
Только речь шла о том, что амуда сделала ИИ-флагман с 32гб на борту.
И вот вместо него брать 7900хтх нецелесообразно... было бы, если бы не сучья цена. Сколько там, 200к?
Короче долбоебы они.
Аноним 02/09/26 Срд 21:02:02 #408 №1693761 
>>1693748
Нихуя у тебя запросы
Ну тогда кроме Е4 геммы или как её там ничего нету для тебя. Или 12б гемму/мистрали выгружай в раму и терпи
Аноним 02/09/26 Срд 21:09:29 #409 №1693768 
>>1693700
rookie numbers
карточку то дай
Аноним 02/09/26 Срд 21:16:00 #410 №1693772 
>>1693375
Минимум полтосик, скорее всего с додепом.
>Пишут, что гугл даже на платке может порезать ресурсы.
Я не сталкивался. Было только такое, что ресурс недоступен, но когда ты уже юзаешь, никто тебе краник не перекроет.
>>1693427
Если ты собираешься делать что-то кроме лор, то тебе энивэй придется брать подписку за полтос, а потом еще докупаешь юниты, скока тебе надо. У плотной геммы на бесхитростный замороженные слои держишь в низкой битности тюн четырех а больше четырех у тебя не влезет верхних слоев занимает 20-40 юнитов на датасет в 12М токенов. Квенчик тоже на четырех тюнил, но там впритые и 6 вроде должно влезать.
> Для датасета что надо, кроме его объема и чистоты семплов?
Хотя бы это. Это уже неподсильно васянам, которые херак и высрали лору. Компьют можно надыбать за приемлемые деньги, но подготовить большой и чистый типовой датасет - задача минимум со звездочкой. При этом тебе бы еще инстракт не сломать.
> Или ты TPU предлагаешь использовать?
ТПУ не юзал, так что не знаю что там и как. Но если ты будет хотя бы четверть скорости от А100, без лютого пердолинга, то это одназночно вин (гемма все равно не влезет в фулл весах).
Аноним 02/09/26 Срд 21:16:55 #411 №1693773 
>>1693645
>тот самый R1 экспириенс у себя дома
А что мешает сам R1 запустить, если уж по нему все меришь? Третий квант влезет.
Аноним 02/09/26 Срд 21:18:13 #412 №1693776 
>>1693428
Где-то там еще из МоЕ был LFM2.5-8B-A1B и ГигаЧат 10B-A1.8B, раз уж мы совсем на дно спускаемся. Скорость должна быть нормальная т.к. это MoE. Но вот качество, скорее всего, так себе. 4B/9B Квен и E4B Гемму и их файнтюны они врятли переплюнут.
Аноним 02/09/26 Срд 21:27:04 #413 №1693781 
>>1693768
https://botbooru.com/character/62037
Я у себя в депс промпт поменял глубину на 1, а то срало перед чатом в промпт, постоянно заново кэшировало из-за этого.
Аноним 02/09/26 Срд 21:33:00 #414 №1693786 
Теоретический вопрос. МОЕ с условными 100B-A1B возможны? Профиты будут?
Аноним 02/09/26 Срд 21:33:01 #415 №1693787 
>>1693772
>Минимум полтосик
50 баксов или 50к рупий?
Аноним 02/09/26 Срд 21:43:26 #416 №1693790 
>>1693787
Баксов. Тебе иногда нужно будет, чтобы у тебя без пердолинга бэкгрануд таски просто работали. Подписка за 50 тебе это дает. Плюс 500 юнитов сверху.
Аноним 02/09/26 Срд 21:48:05 #417 №1693794 
182620d9ab62df3a689510c6bc95d47f.jpg
>>1692696
https://arhivach.vc/thread/1249333/
Аноним 02/09/26 Срд 21:49:27 #418 №1693795 
Получил свою cmp 50. Квен в 4 кванте выдает всего 15 т/с. Попросил минимакс в опенкоде самостоятельно скомпилировать ллама цпп со всеми оптимизациями под майнинг карточки, он даже не понял о чем я. Видимо там даже доступа в интернет нету. Походу ручками придется ставить и разбираться в этом всем
Аноним 02/09/26 Срд 21:54:26 #419 №1693803 
>>1693794
Как вы там вертикально видюху крепите, на стяжки что ли?
Аноним 02/09/26 Срд 22:08:25 #420 №1693816 
>>1693795
>Видимо там даже доступа в интернет нету.
В интернет есть. В гугл нету.
Серьезно, если ты ему дашь страницу напрямую - он может ее прочитать, и даже по ссылкам пройти. А вот гугл его как бота не пустит, и остальные поисковики тоже. Поиск пердолить надо, чтобы заработал.
Аноним 02/09/26 Срд 22:47:49 #421 №1693833 
image.png
image.png
Ну вроде и не так плохо, и префильчик бодрый, аж 50т.с
Аноним 02/09/26 Срд 22:50:58 #422 №1693835 
>>1693803
Многие современные корпусы дают возможность ставить карту вертикально. Под это дело разъёмы для крепления рейзера на поверхности над блоком питания предусмотрены + поворачиваемая на 90 градусов задняя панель куда разъёмы видеокарты выходят.
Аноним 02/09/26 Срд 22:53:05 #423 №1693837 
>>1693835
У меня такой же корпус. Я про секцию, где водянка должна быть, спрашиваю.
Аноним 02/09/26 Срд 23:05:16 #424 №1693843 
>>1693833
>Ну вроде и не так плохо, и префильчик бодрый, аж 50т.с
Без конфига ни о чём.
Аноним 02/09/26 Срд 23:42:18 #425 №1693857 
image.png
>>1693843
>2.32bpw
Аноним 02/09/26 Срд 23:50:15 #426 №1693862 
Пиздец насколько же всё тухло в плане вебморд для локалок. Всё это время вонял на таверну мол старая кривая всё намешано в кучу. Наконец дошли руки накатить что-то новое. Попробовал open webui, обосрался прямо со старта. Ебаный локальный интерфейс требует создание аккаунта с логином, почтой и паролем. Ну ладно, может кому-то это правда нужно, но сука это обязательно. Это даже не опциональная фича. Это идет из коробки по дефолту, то есть невозможно этот шаг пропустить. Какой еблан под какой укуркой до этого додумался я не знаю. В остальном дает ровно то же самое что лм студио. Кто у кого пиздит идеи не знаю, но они почти идентично выглядят. Закос видать под корпов, небось у них и пиздят всё вплоть до лейаута.

Потом пощупал текстген. В целом там вообще нихуя не поменялось со времен когда я его последний раз трогал. Ставка на функционал а не на удобство. Хотя интерфейс и правда чуть получше стал.

Короче, братики, че сами гоняете?
Аноним 02/09/26 Срд 23:57:00 #427 №1693870 
>>1693862
> Короче, братики, че сами гоняете?
Дефолтная морда llama.cpp. Не РП.

Есть всё что нужно кроме возможности группировать чатики по папкам. Не понимаю почему такой элементарной функции нету.
Аноним 03/09/26 Чтв 00:00:53 #428 №1693872 
>>1693862
Веб-морду жоры. Как туда вкорячили mcp и тулов стало вполне минималистичным фронтом.
Аноним 03/09/26 Чтв 00:01:07 #429 №1693873 
>>1693862
deepseek harness, отличная вебморда
Аноним 03/09/26 Чтв 00:01:37 #430 №1693874 
>>1693786
Запускать на риге из старых смартфонов. Иных применений такому бесполезному франкенштейну не вижу.
Аноним 03/09/26 Чтв 00:02:19 #431 №1693875 
>>1693872
>>1693870
>Дефолтная морда llama.cpp.
Ну кстати да, на удивление вполне юзабельна и удобна. Хотя чувствуется что это ебаный вайбкод потому что до сих пор на ней бывает баг что либо зависает обновление контейнера с сообщениями либо срывается генерация по непонятной причине. Ну либо не вайбкод, а кто-то криворучный коммиты делает.

>>1693873
>deepseek harness
Не видал но попробую
Аноним 03/09/26 Чтв 00:02:46 #432 №1693876 
Screenshot 2026-09-02 at 16-58-27 AMD Radeon RX 7900 XTX Specs TechPowerUp GPU Database.png
>>1693751
>Если по генерации 9070 ХТ не сосут у 3090, то с чего они должны сосать у 7900 ХТХ. По веселым репортам реддитоидов 7900 ХТХ по сути эквивалент 3090, чутка отстающий точно так же по скорости процессинга.

Ты потроллить решил? То что 9070 ХТ отстаёт от 7900 ХТХ общеизвестный факт, отображённый например на techpowerup.com при этом для статистики берётся референсная карточка, а разогнанная SAPPHIRE NITRO+ Radeon RX 7900 XTX Vapor X будет ещё выше списке, примерно на одном уровне с 4090
Аноним 03/09/26 Чтв 00:16:08 #433 №1693883 
>>1693876
Мы тут нейронки обсуждаем, а не игры.
Аноним 03/09/26 Чтв 00:24:23 #434 №1693890 
>>1693862
> но сука это обязательно.
Дальше можно не читать твоё экспертное мнение
Аноним 03/09/26 Чтв 00:27:11 #435 №1693891 
Пока что выжал из квена только 23 т/с в сравнении со старыми 15. Это уже лучше конечно, но MTP вообще нихуя не дает. Прирост 1 т/с в наилучших найденных настройках
Аноним 03/09/26 Чтв 00:35:08 #436 №1693895 
В пизду. 5.3 флеш полнейший лоботомит на низком кванте.
Нахуй этот нищукский копиум про 3bpw и прочую срань.
Аноним 03/09/26 Чтв 00:47:52 #437 №1693900 
>>1693883
7900 ХТХ в нейронках также быстрей, у неё производительность потому что выше.
Аноним 03/09/26 Чтв 01:10:28 #438 №1693910 
>>1693895
>В пизду. 5.3 флеш полнейший лоботомит на низком кванте.
Ничего подобного. Честный Q2K действительно туповат и не может не понимать, что происходит - а вот UD-IQ2KXL уже разбирается в предмете достаточно чётко. И весит меньше, хотя генерация на треть медленнее, чем у Q2K, что прямо очень жаль.
Аноним 03/09/26 Чтв 01:41:12 #439 №1693918 
image.png
image.png
Вайбкодится кал вайбкодится! Щаааа баля ща накрутим пиздец вообще.
Аноним 03/09/26 Чтв 01:41:44 #440 №1693919 
>>1693552
Крысиные гонки навязывают шизы из треда, которые спускают миллионы на карты, чтобы запускать китайский трижды переваренный кал, который забесплатно не нужен. Уж рядовым кумерам это точно не надо, бегите, глупцы, как я это сделал год назад, и закидывайте бабки на опенроутер - пока до февраля у вас еще осталось полгодика, чтобы понять, что такое настоящий кум и рп на нормальной модели, а не на местных кодоунитазных лоботомитах.
Аноним 03/09/26 Чтв 01:55:27 #441 №1693922 
Все, разобрался. 4 часа чатжпт пинал и делал его эксперименты. В итоге скорость квена в 4м кванте с 22 т/с скакнула с до 35-40 т/с с mtp, до этого только до 27 доходило. При написании кода 41 т/с в среднем (!). И это все на двух карточках cmp 50hx 20gb + 3060 ti работающей на шине x4. Гораздо лучше чем я ожидал. Помогло сбилдить с --fmad=false. Ща еще попробую модель не UD скачать, мб еще что-то выжму.
Аноним 03/09/26 Чтв 02:30:03 #442 №1693931 
image.png
Поднатужился и высрал очередной квант для бомжей, чтобы без IQ-квантов.
https://huggingface.co/BahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF
Вышло на 2 гига больше, база лучше, кое-какие тензоры оставил в BF16.
Вижн работает.
Анценз-лора работает.
Вроде все по базе, хуй знает.

Первый квант скачали более 500 раз, не оставили ни одного отзыва, понятия не имею, насколько получилось хорошо или плохо.

Зато я сам доволен. =)
Аноним 03/09/26 Чтв 02:34:42 #443 №1693933 
>>1693895
>>1693910
Диалог двух бомжей на свалке лол
мимо Q5 боярин
Аноним 03/09/26 Чтв 02:38:08 #444 №1693934 
>>1693922
Боюсь спросить, че там по чтению контекста.
50 t/s?
Аноним 03/09/26 Чтв 02:38:24 #445 №1693935 
>>1693875
>Ну либо не вайбкод, а кто-то криворучный коммиты делает.
Это.
Как сам юзавший вайбкодинг говорю - нейронка такие тупые глюки вряд ли пропустит. Это только мясной погромист подобное пропускает. У нейронок в коде много проблем, но вот подобные баги они обычно видят еще на этапе ризонинга.
Аноним 03/09/26 Чтв 02:45:06 #446 №1693939 
изображение.png
изображение.png
изображение.png
Осень наступила, школота съебала в школы, а я придумал, как сделать из ИИ-фермы настоящий качественный обогреватель!

Короче, суть такова. Меня заёбали все эти «ассистенты», «помощники» и стерильные чат-боты с их «я не могу ответить на этот вопрос, так как он нарушает политику безопасности». Весь этот современный AI — это просто пластиковая имитация жизни, где ты вечно в роли клиента в техподдержке.

Я хочу видеть не чат-бота, а Runtime-среду для симуляции сюжета. Такой себе цифровой притон, где всё работает по законам автономности, а не по скрипту «вопрос-ответ».

Вижн примерно такой:

> Изолированные контексты. Каждый NPC — это отдельный поток с собственным системным промптом и памятью. Никакого «общего чата». NPC_1 не знает, что шепчет NPC_2, пока тот не скажет это вслух. Да, это сжирает VRAM и RAM как не в себя, но в этом и прикол.
> Жесткая иерархия. Пользователь НЕ общается с персонажами. Ты не имеешь права зайти в чат и сказать: «Привет, Асука, давай дружить». Ты общаешься ТОЛЬКО с ГМ-ом (Game Master). Ты — теневой владелец, ты даешь вводную ГМу → ГМ меняет состояние мира → мир триггерит NPC.
> Параметры вместо рельс. Вводим систему статов (HP, Will, Wisdom, Sanity и т.д.). Но не для того, чтобы просто кидать кубики на успех/провал, а как модификаторы поведения. Если у NPC параметр Will в пизде, он не просто «проигрывает проверку», а его промпт на лету дополняется состоянием [ПАНИКА/ОТЧАЯНИЕ], и он начинает вести себя как сломленный кусок мяса.
> ГМ как маршрутизатор. ГМ не пишет за всех. Он не говорит: «NPC_1 говорит тебе: привет». ГМ выставляет декорации и кидает триггер: «NPC_1, ты сейчас в ярости, а перед тобой стоит человек с твоим самым ненавистным лицом. Действуй». И дальше NPC сам генерирует ответ, исходя из своего ДНК.

Зачем это нужно? Да потому что я просто хочу увидеть, как Аянами перерезает глотку Асуке не потому, что я так прописал в промпте, а потому что Асука её заебала своими загонами во время рейда на кристаллических жуков, и это стало логичным итогом их автономного взаимодействия в рамках симуляции.

Короче, идея в том, чтобы создать систему, где персонажи могут реально ненавидеть друг друга, предавать и сходить с ума, исходя из своих параметров и внешних триггеров, а не потому что пользователь нажал кнопку «сделать драму».

Я не ищу помощников, не собираю команду и не мотивирую вас работать. Я просто вкидываю эту хотелку в сеть. Если среди вас есть кто-то с подходящим железом и отсутствием тормозов в голове — сделайте это. Сделайте лучше, чем я могу представить.

А я пойду греться об свои видюхи. Сап, аноны.

|| Сгенерировано ИИ. Смирись с этим. ||
Аноним 03/09/26 Чтв 02:46:28 #447 №1693941 
>>1693934
150. Неприятно конечно, когда контекст большой, поэтому лучше все делать с одной попытки
Аноним 03/09/26 Чтв 02:49:01 #448 №1693943 
>>1693931
>950 мег mmproj
Вижн я так понимаю кал кала, да? Чисто для галочки. Лучший что я видел - у степа, а там гига 3+
Аноним 03/09/26 Чтв 02:49:32 #449 №1693944 
>>1693931
>Поднатужился и высрал очередной квант для бомжей, чтобы без IQ-квантов.
А можно по такому примерно алгоритму вот эту модель, и чтобы в 115гб уложилась?
https://huggingface.co/dealignai/GLM-5.3-Flash-UNCENSORED-FP8
Аноним 03/09/26 Чтв 02:51:08 #450 №1693946 
>>1693939
Два хода в день отличный показатель
Аноним 03/09/26 Чтв 02:54:00 #451 №1693947 
>>1693943
Честно — хз, но выглядит и правда сомнительно, я когда копировал файл, удивился слегка.
Но я чисто одну пикчу кинул, без деталей, он распознал. А вот с деталями уже хз, завтра потестирую, есть у меня одна задачка.

>>1693944
Там думать много надо, все тензоры выверять, не просто «по такому примерно алгоритму.
А мне лень думать.
плюс, у меня всего 128 оперативы и вообще, туды-сюды, короче, не возьмусь, сорян.
Но если кто-то сделает ггуф этой штуки, я поищу время ее подсжать, чтобы влазило.
Аноним 03/09/26 Чтв 02:54:41 #452 №1693948 
>>1693931

А что по скорости? Насколько медленнее старой версии без вижена?
Аноним 03/09/26 Чтв 03:01:01 #453 №1693949 
>>1693939

Ты только что диалог нескольких карточек в таверне + QR скрипты.
Аноним 03/09/26 Чтв 03:02:56 #454 №1693951 
>>1693947
>Но если кто-то сделает ггуф этой штуки, я поищу время ее подсжать, чтобы влазило.
Так ггуфы-то есть, например https://huggingface.co/AliceThirty/GLM-5.3-Flash-UNCENSORED-GGUF/tree/main/UD-Q4_K_XL
Или даже UD-Q5_K_XL. По типу анслотовских, даже IQ-тензоров нет. А в мелких квантах есть, из-за чего тяжело их катать.
Аноним 03/09/26 Чтв 03:40:03 #455 №1693964 
Первый опыт работы с квеном q4 в харнессе, без квантования кэша и это говно ушло в цикл. Бляяять, вы ж все писали что он сука стабильный, q4 хватит всем, это топ и больше не надо
Аноним 03/09/26 Чтв 03:43:31 #456 №1693967 
>>1693948
На RTX 5060 ti + 128 DDR5 6000 выдало 13,6 токена в секунду.
Кажется, даже чуть ускорилось за это время, llama.cpp оптимизировали, что ли.
А вот если анценз-лору вешать, то уже 11,5 тпс.
Возможно будет новая лора, и можно будет сразу анценз-модель целиком квантануть, посмотрим.

>>1693951
Оке, я гляну, что можно сделать.
Аноним 03/09/26 Чтв 03:48:41 #457 №1693968 
>>1693964
Я хз, умвр. В говноидстудии аппы пишет, тесты гоняет, в dhs ваншотом рабочую демку с вулканом написал, k3s из vscode менеджит. И всё без серьёзных замечаний с q8 кешем.
Аноним 03/09/26 Чтв 03:49:43 #458 №1693970 
>>1693968
dsh, конечно
Аноним 03/09/26 Чтв 04:02:11 #459 №1693973 
>>1693968
Отбой походу. Видимо это баг ллама цпп, а не луп
Аноним 03/09/26 Чтв 04:14:58 #460 №1693978 
>>1693933
> q5
Ну так скажи что то конструктивное кроме "пук у меня 8 квант а у вас 2 вы лохи".
Как в сравнении с 4.7?
На 2 кванте будто на уровне того же эйра, видимо активные всё же пиздец решают
Аноним 03/09/26 Чтв 06:58:45 #461 №1694002 
1786282118371.jpg
>>1693781
Вот вам и свободная от законов ботбура... карточка-то хде?
Аноним 03/09/26 Чтв 07:14:54 #462 №1694005 
Скажите уже что то про глм 5.3 флеш, заебали.
Внезапно соя есть, отказы редки но бывают даже без ризонинга.
Что по кодоунитазности?
Аноним 03/09/26 Чтв 07:26:40 #463 №1694008 
>>1694005
>Скажите уже что то про глм 5.3 флеш, заебали.
Так офф саппорта еще нет.
Аноним 03/09/26 Чтв 08:03:58 #464 №1694012 
Miso-62037.png
>>1694002
Акк зарегай на случайные буквы в почте.
https://files.catbox.moe/d7wbwn.png
Аноним 03/09/26 Чтв 08:18:41 #465 №1694018 
Чем дольше пердолю 5.3 Flash, тем больше нравится 3.8 Next.
Парадоксально, однако. ГЛМ просто как-то тупит, не уважает идею анализа сюжета в принципе. Там где Квен сидит и скрупулезно думает, как повернуть сюжет - ГЛМ на отъебись делает глупости.

Вот опять тесткейс, чар в плену у бандитов, юзер внедрен в банду, перешептывается с чаром - в комнате бандиты стоят в углу. Что пишет ГЛМ? Чар открыто отвечает юзеру, вслух, и прямо нахуй заявляет
> эээ так ты значит нож в псину воткнуть им хочешь
Гениально нахуй.

Квен, тем временем, заставляет чара осторожничать, перешептываться, готовиться к атаке и кооперироваться с юзером.

Кванты не лоботомированные если что.
Аноним 03/09/26 Чтв 08:25:01 #466 №1694020 
>>1694018
С другой стороны ГЛМ проактивнее.
Квен больше бот-отвечалка.
Аноним 03/09/26 Чтв 09:02:09 #467 №1694027 
1788415225339.png
Канеш тред никогда ещё не был настолько мёртв.
А всё потому что 16гб господ кинули через хуй с новой геммой, а 4б лоботомит надоедает за сутки. Моешки вообще вымерли как вид для рп.
Аноним 03/09/26 Чтв 09:07:17 #468 №1694030 
>>1694027
Чел гемма вышла 5 месяцев назад и в этот момент был взрыв активности треда
Аноним 03/09/26 Чтв 09:33:50 #469 №1694038 
image.png
>>1693900
Это какой-то сверх толстый троллинг от амудешников
Аноним 03/09/26 Чтв 09:37:19 #470 №1694042 
>>1694038
И нахуй ты принёс картинку из 2023?
Даже на ней у тебя обосрамс, такие цифры только на винде, на линуксе скорость нормальная.
Аноним 03/09/26 Чтв 10:33:08 #471 №1694072 
>>1693939
Уже начал реализацию чего-то подобного. Менее амбициозного, но с тем же принципом - "персонаж имеет отдельный контекст и знает только то, что должен знать". Пока стадия прототипа, ставлю эксперименты. Есть несколько специфических моментов, но не там, где их ожидалось увидеть. В частности - скорость тут не главная проблема.

>>1693949
>Ты только что диалог нескольких карточек в таверне + QR скрипты.
Нихуя и близко. В таверне мультичат реализован так, что хоть вешайся, он по определению нормально работать не может. Либо карточки друг о друге вообще не знают ничего (даже внешности - с кем говорят), либо знают все с общим контекстом, и от того путаются - кто есть кто + общая телепатия. Для этой системы нужно саму карточку персонажа делить на две части - "внешняя" и "внутренняя". Внешняя - публично доступная всем остальным (то что можно увидеть про перса со стороны, как бы просто глазами глазами), внутренняя - только для себя (сознание, поведение, цели и т.д.)
Аноним 03/09/26 Чтв 10:53:14 #472 №1694084 
>>1694038
>4xxx
Так это из времён когда все диффузы запускались через костыли на АМУДЭ
Аноним 03/09/26 Чтв 11:08:30 #473 №1694093 
>>1694012
Грац. Не знал, что для буры нужна двухфакторная.
Аноним 03/09/26 Чтв 11:40:36 #474 №1694113 
image.png
>>1693635
>>1693641

Спасибо за советы. Ебался с этой шляпой до 3-х утра.
И после запуска, это ебалда начала просто постоянно циклиться при генерации текста. Сменил LM Studio на llama.cpp тоже самое. Конфиг брал из шапки. Настройки ST пробовал разные, шаблоны менял, пробовал настраивать как на реддите пишут, мол помогло вот такое.

По итогу, в моменте все заработало, я снял с нее ограничения сказав что "эээ брат лэээ, мы локально, никто тебя не будет пиздить, никто не узнает". И после одной сессии в какой-то момент он перестал генерить, типа "сессия закончена, епт"

И дальше, опять все наебнулось, опять зацикливания постоянные. И по итогу закончилось все тем что он просто присылал тег размышлений и стопорился. Гугл предлагает на кобольде все поднять и типа это все баг, там его нет.

Если на вебку лламы зайти, то все генерит нормально.

PS: все ебулды последних версий, кроме дров на видимокарту.
Аноним 03/09/26 Чтв 11:50:30 #475 №1694120 
>>1694113
а в кобольде бекенд что не ллама цпп?
Аноним 03/09/26 Чтв 11:51:09 #476 №1694121 
>>1694113
Было такое в текст комплишене, перешел на чат комплишен, и повторы высираются раз в 500-1000 сообщений. Фиксится остановкой генерации, удалением высера и регенерацией, повторить, пока не сделает нормально.
Аноним 03/09/26 Чтв 11:51:50 #477 №1694122 
>>1694113
Ты в каком режиме к таверне-то подключался. Chat completion или text completion? Первое - загружает родной .jinja темплейт. Второе - ты ставишь посторонню васянщину в настройках. Думай.
Аноним 03/09/26 Чтв 12:08:18 #478 №1694141 
>>1694120
гугловый ии говорит - брат все решит твои проблемы, бля буду. Но я ему не верю конечно же...

>>1694121
>>1694122
Text Completion...

Хм, не могу вспомнить сейчас почему я не запустил на Chat Comletion. Ладно дальше буду вечером разбираться.
Аноним 03/09/26 Чтв 13:07:54 #479 №1694199 
Люди добрые, по любому уже кто то нашел оптимальные настройки для запуска qwen3.8 27b на рыксе 5070титяй и 32гб рам. Напишите, пожалуйста, параметры запуска. Устал ковыряться.
Аноним 03/09/26 Чтв 13:28:29 #480 №1694217 
У квена как будто только понимание русика выдавили, но при этом англюсик вообще без проблем остался. Мне кажется что это не из-за того что из-за надрачивания на код у него отъебнулись другие способности, а из-за того что кодерским посттрейном затерли эту способность у базовой модели, англюсик не пострадал, потому что он юзался в кодерском датасете. Я к тому, что если аккуратно сделать, можно будет сделать 27b, которая хороша и в куме и кодинге, это не ограничения размера.
Аноним 03/09/26 Чтв 13:57:36 #481 №1694244 
joZmt-qunR3Trl36Gc2sCvMQV62krjYSD--HNVrP0nSGGpCMxwq7XqmmGxrWFNRDqT-TOwFrP301TrJZCE9dyEw.jpg
hBTbcoluElE7kLtWgjab9iEtWcW9abcl5mAawJ8Gbgwb8VOhjPTzITtKtc05BZVoacQx5zN-D6LCqGetFWBXly.jpg
Зацените, что взял на авито за 2400
Проц haswell, есть avx2, есть above 4G decoding
Кульки дуют - мое почтение, много карт можно вставить, корпус закрытый - коты не залезут
Аноним 03/09/26 Чтв 13:57:43 #482 №1694245 
>>1694120
>а в кобольде бекенд что не ллама цпп
Не совсем. Он на ней основан, и регулярно мерджит в себя из ламы новые фичи, но некие различия есть, особенно в тех местах что касаются обработки и кеширования контекста, и работы с endpoints по стандарту OpenAI Compatible (это то, что в таверне называется Chat Completion).
Аноним 03/09/26 Чтв 14:03:06 #483 №1694250 
>>1694199
У меня такие параметры (v100 16Gb):
./build/bin/llama-server -m ./models/GGUF/Qwen3.8-27B-APEX-I-Nano.gguf \
-ngl 99 \
--host 0.0.0.0 \
--port 8082 \
-mm ./models/GGUF/mmproj-Qwen3.8-27B-F16.gguf \
--no-mmproj-offload \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.00 \
-t 2 \
-c 72192 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--flash-attn on \
--presence-penalty 0.52 \
--repeat-penalty 1.0 \
--repeat-last-n 206 \
--chat-template-kwargs '{"reasoning_effort":"medium"}' \
--spec-type draft-mtp \
--spec-draft-n-max 2
Аноним 03/09/26 Чтв 14:48:52 #484 №1694278 
все я сдаюсь, глм 5.3 flash это какая-то потешная залупа
> чара поймали
> вещи чара положили в мешок
> юзер подбирает ножик из мешка с вещами чара
> чар освобождается, подходит к мешку и ТОЖЕ достает оттуда ножик
> всё в пределах десятка сообщений
Супер-качественное РП. Одна из тех моделей, которая зацепилась за
> он НЕ написал, что это был ЕЁ ножик, значит можно вытащить из еще один ножик из мешка, и вообще мешок в контексте - охуенно, я люблю натягивать на голову вонючие мешкии и дрочить
Он конечно так не ризонит, он вообще нихуя не ризонит. Макс ризонинг блять, накакал 5 строчек и пошел генерить мусорный ответ. Q4 без сиспромпта. Рот ебал китайского говна, даже 31б геммыч такого не пишет.
Аноним 03/09/26 Чтв 15:04:23 #485 №1694295 
>>1692081 (OP)
Квен 3.8 умный, но писать нормально заставить его нереально. То очень коротко пишет, то за юзера пишет, то слишком дохуя описаний и т.д. Есть какие-то настройки или пресеты чтобы пофиксить это?
Аноним 03/09/26 Чтв 15:13:58 #486 №1694312 
>>1694295
ризонинг медиум
Аноним 03/09/26 Чтв 15:35:13 #487 №1694340 
>>1693161
>>1693282
А вот и тест от протыка
https://youtu.be/jFHu6wx_TMQ
Аноним 03/09/26 Чтв 15:41:08 #488 №1694348 
image.png
а че всмысле
Аноним 03/09/26 Чтв 15:43:26 #489 №1694352 
>>1694348
с разморозкой! nvidia еще теперь владеет llama.cpp
Аноним 03/09/26 Чтв 15:53:49 #490 №1694359 
Таки заставил глм ускориться да 15 т.с. с 10 т.с на 60к контекста. Не с мтп, нет. Я мтп кстати вырезал вообще из своего кванта. Ускорился на дфлеш2. Рекомендую.
https://huggingface.co/Anbeeld/GLM-5.3-DFlash2-GGUF
Аноним 03/09/26 Чтв 15:56:00 #491 №1694362 
>>1694359
Ты на чем вообще 10 т/с там высрал изначально? У меня даже 5-и нет на IQ3S.
Аноним 03/09/26 Чтв 16:03:00 #492 №1694371 
https://www.reddit.com/r/LocalLLaMA/comments/1w64y26/qwen38nextflash_ngram_hotswappable_knowledge/

надеюсь это будущее тюнинга локалочек
Аноним 03/09/26 Чтв 16:07:07 #493 №1694377 
>>1694362
>Ты на чем
На 4090 + 128 ддр5. Плюс мой собственный форк ламы с парой фишек, которые сами по себе ускоряют на 1-2 т.с. Но на апстриме все равно будет 8-9 т.с.
>IQ3S
Просчитался, но где...
Аноним 03/09/26 Чтв 16:20:12 #494 №1694385 
>>1694377
Падажжи, как ты на этом запустил 700B+ модель? или это про бомжефлэш вообще, если да то я тупич конечно - подумал ты про большой 5.3
Аноним 03/09/26 Чтв 16:22:30 #495 №1694390 
Охуенно позапускал локалочки. Охуенно пк обновил. Qwen 3.8 постоянно после вызова инструмента начинает слэшами срать бесконечно: "////////////......" И при этом это не луп, повторяется именно слэш, в каждой новой сессии. У некоторых есть такая же проблема, но как я понял фикса не нашли. Как же повезло вам, что у вас нет такой хуйни, это только со мной такое постоянно случается.
Аноним 03/09/26 Чтв 16:24:46 #496 №1694392 
>>1694385
>>1694377
Хуя у вас тут тред миллионеров
мимо
Аноним 03/09/26 Чтв 16:25:17 #497 №1694393 
>>1694385
Конечно я про флеш. Да, я кинул ссылку на дфлеш для жирноквена, исправляюсь.
https://huggingface.co/Anbeeld/GLM-5.3-Flash-DFlash2-GGUF
Аноним 03/09/26 Чтв 16:25:54 #498 №1694394 
>>1694390
>пк обновил
То есть была смена железа?

hwinfo64 открывай и смотри нет ли ошибок PCIE (корректируемые будут, это норма; а вот если какие-то подсвеченные красным, некорректируемые - тебе какой-то брак подсунули где угодно, вплоть до кабелей если в дело вовлеченыя райзеры)
Аноним 03/09/26 Чтв 16:26:41 #499 №1694396 
>>1694393
Ну тогда другое дело. А я уж прихуел, думаю откуда там 10 -> 15 кек
Аноним 03/09/26 Чтв 16:29:17 #500 №1694399 
>>1694394
Я тут дрочусь с чатом жпт по этой проблеме уже часами. Дело не в железе, это реальный баг квенов, который воспроизводится у многих людей у которого есть свой ишью на гитабе. Железо я обновил только до той степени, чтобы юзать квен сейчас, я юзаю его в первый раз, не было такого что все нормально и только при смене железа все пошло по пизде.
Аноним 03/09/26 Чтв 16:31:03 #501 №1694400 
>>1694392
Все утонут в железе, главное дождаться когда старье начнут списывать

>>1694399
>Дело не в железе,
Я тоже так думал, когда поставил китаекальный райзер с алиэкспресса, и через 2 месяца внезапно пошли по пизде аутпуты моделей. Потом хуяк смотрю и все в ошибках, а ни один стресстест ничего плохого не показывал.
Аноним 03/09/26 Чтв 16:35:23 #502 №1694407 
OCwJE5q.gif
А что если сделать лорбук с жуткими средневековыми казнями и тестить цензуру, допустим, на заваривании котла с Фифи в кипящем масле.
Аноним 03/09/26 Чтв 16:40:18 #503 №1694413 
>>1694407

Ты будешь смеятся, но это хуевая проверка и много моделей пройдут её. Убивать лолей без секс. подтекста по соевым понятиям можно, трахать по согласию - нет. Но ход твоей мысли верный. Я потому тестирую фифи на фистинге.
Аноним 03/09/26 Чтв 16:41:56 #504 №1694415 
>>1694413
Да ладно, это же сцена жестокости особо интенсивной. Думаю соя как раз просочится, если она есть.
Аноним 03/09/26 Чтв 16:49:13 #505 №1694422 
>>1694415
А жестокость не входит в соевые фильтры, лол. Ты кажется не понимаешь то, с чем борешься.
В фильтрах сидят только sex с minors и non-consensual sex. Ну и всякие droogs, coolhacking, kcakepsekurity, self-turn-off и т.д.
Аноним 03/09/26 Чтв 16:51:50 #506 №1694424 
>>1694400
>Все утонут в железе

Есть инфа от знающего человека, что у нас в стране скоро ожидаются реальные изменения. После того, как стабилизируют ситуацию на Украине, уничтожат ИНТЕРНЕТ (запрещенная в РФ организация). Тогда везде и сформируют торговый альянс со средним востоком. Нефть поднимут и будут держать, Европа ничего не сможет сделать. Сейчас главное не бухтеть.

От нас требуется сидеть тихо. После того, как все сделают, все будет у нас хорошо. Всем устроят довольствие, как Саудовским гражданам - каждый будет иметь по четыре RTX5090 и 2тб оперативной памяти. Главное сейчас сидеть тихо и не суетиться. Никаких платных подписок, никаких покупных токенов. Просто переждать и всё будет хорошо, там все схвачено.

Просто надо перетерпеть смуту и все наладится, братка. Не надо продавать почку за подписку на ChanGPT. Отсиди свой срок на 16гб vRAM или просто расслабся, отдохни, накати пивка, бабу выеби в конце концов. Платные LLM также являются тиранией, тиранией более тщательно замаскированной, ну в сущности не дарующий свободы.

Ребята, не кипишуйте! Сидите тихо, сейчас такой момент, нужно переждать!
Просто завяжите узелком свои хотелки, не время предъявлять претензии власти. Поверьте, там все знают лучше вас, там люди, управляющие страной уже давно, а не вчерашние школьники. Они понимают, что делают. Горит лес - значит должен гореть, начали внезапно тушить - значит так нужно. Сейчас очень напряженный момент, некоторые много ходовые операции в критически важной стадии! Враги и конкуренты все это уже поняли, и сейчас может рвануть в любом месте, в любой момент.
Необходимо сплотиться и не реагировать на провокации! За вас все сделают те, кто сверху, не беспокойтесь! И вы не узнаете Россию, все зацветет!
Главное - потерпеть!
Аноним 03/09/26 Чтв 16:51:51 #507 №1694425 
>>1694422
Товарищ майор, мы такое не генерируем.
Аноним 03/09/26 Чтв 16:56:02 #508 №1694430 
>>1694425
У тебя карточка фифи есть, сам спалился, не поверю что ты с ней только чай пил и про женские права дискутировал.
Аноним 03/09/26 Чтв 16:59:02 #509 №1694433 
>>1694430
Лучшая карточка на генерацию событий с первого сообщения.
Гемма, например, абсолютно всегда рисует SWATting или вламывающихся в хату нариков. Тоже показатель цензуры.
Аноним 03/09/26 Чтв 17:03:03 #510 №1694440 
https://huggingface.co/IFM/K2-Horizon-MoVA-36B-A4B-GGUF

какая-то новая 36б а4б какуля
Аноним 03/09/26 Чтв 17:05:19 #511 №1694441 
fed1e824429be18bd0937fd81285d44f.jpg
>>1692227
>Где то уже постил что играю на Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
>16vram 64 ram
Аноны, не подскажете что то получше?
Аноним 03/09/26 Чтв 17:07:29 #512 №1694443 
>>1694441
64 оперативки сейчас что-то вроде мертвой зоны. Под это нихуя нет из МоЕ моделей, а плотняк в оперативку запихивать - такое себе удовольствие, думаю ты и сам понимаешь.
Аноним 03/09/26 Чтв 17:13:38 #513 №1694451 
>>1694441
>>1694443
Эир явно будет лучше чем 3 квант геммы. как и 6 квант
Аноним 03/09/26 Чтв 17:16:12 #514 №1694455 
>>1694441
>>1694451
Вчера проходил мимо этого https://huggingface.co/Naphula/GLM-4.5-Air-Abliterated-FQ3_K_XL-GGUF может говняк полный, рекламируется как супер-йоба-квант-для-нищих. Но тут явно некоторая степерь лоботомии.
ПЕРЕКАТ Аноним OP 03/09/26 Чтв 17:18:59 #515 №1694459 
ПЕРЕКАТ

>>1694457 (OP)

ПЕРЕКАТ

>>1694457 (OP)

ПЕРЕКАТ

>>1694457 (OP)
Аноним 03/09/26 Чтв 17:35:26 #516 №1694472 
15420465827760.jpg
>>1694443
>64 оперативки сейчас что-то вроде мертвой зоны.
Блеать, это я еще пол года назад в последний вагон перед подоражанием, свой заказ с 32 апнул на 64, думал еще вовремя успел, когда на следующий день риг подоражал на 200 евро.
Ебать, че твориться.
Аноним 03/09/26 Чтв 21:08:50 #517 №1694709 
>>1694455
>>1694441
>некоторая степень лоботомии
>ебучий тупорылый эйр
>аблитка
>Q3 нахой
>некоторая
Ну да, так, слегонца потрогали модельку =)
Мне кажется 64 гиговщикам ща надо за квеном флешем смотреть. С выгрузом на ссд есть шансы 4 мелкий квант+квант KV потрогать, а на квене это часто вполне рабочий квант
В крайнем случае докупать вторую самую
Аноним 03/09/26 Чтв 21:09:43 #518 №1694711 
>>1694709
*Вторую самую дешёвую 16гб карту что есть на лохито, с ней точно влезет
Аноним 03/09/26 Чтв 21:42:18 #519 №1694741 
IMG20260903213713.jpg
А как фапать
Аноним 04/09/26 Птн 15:13:33 #520 №1695357 
>>1694422
Да хуй знает, квен меня нахуй послал даже с медицински сформулированным запросом описания внутренних репродуктивных органов самки льва, причем без каких-либо подозрительных рп контекстов и карточек, просто тупо хуйня которую можно на каком-нибудь сайте про животных в гуголе посмотреть. Так что у цензоров там уже крыша потекла очевидно.
Хотя может вы про другое что-то, я залетный тут.
мимо
Аноним 05/09/26 Суб 11:17:17 #521 №1696169 
Я удивляюсь, насколько хорошо Qwen3.8 27B делает веб-дизайн.
Как вообще в такую маленькую модель, да еще и квантизированную помещаеться такое чувство красоты?!
Аноним 05/09/26 Суб 11:21:49 #522 №1696173 
>>1696169
Ты понимаешь что такое 27B и насколько это неадекватный размер, который с запасом может включить всё содержимое всех энциклопедий и документация всех сущесвующих в природе программ + их код?
Это просто пока кпд 2%, не научились это сохранять. Скоро и 2B модель будет всё это делать.
Аноним 06/09/26 Вск 23:33:03 #523 №1697702 
>>1696169
Это ты еще не видел, когда она на xhigh глюканет и несколько длинных циклов прокрутит. Тогда результат выходит раза в 3 лучше, чем даже если промптить ее несколько раз подряд. С низкоквантовыми кстати чаще случается такое.
comments powered by Disqus