К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!

Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №250 /llama/

 Аноним 24/07/26 Птн 22:08:12 #1 №1659232 
Llama 1.png
Карта деградации при квантовании по доменам.png
Реальная длина контекста у моделей 6.png
17674497335320.jpg
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1657043 (OP)
>>1652385 (OP)
Аноним 24/07/26 Птн 22:12:54 #2 №1659238 
Мне просто нужно, чтобы меня обняли. Хотя бы текстогенератор. Самый обычный каддлинг.
Какая модель подойдёт? Где жизнь есть? 3090 + 64. Русик англюсик без разницы.
Аноним 24/07/26 Птн 22:14:11 #3 №1659239 
База треда.

За пределами геммы РП и еРП в 2к26 нет. Дипсик конечно хорош, но соев и суховат, Аир устарел полностью, а квен пишет код. Остальные говномодели даже упоминания недостойны, а бегемоты 350В+ не для людей, а для риговичков.
Аноним 24/07/26 Птн 22:19:44 #4 №1659244 
>>1659227 →
Скинул бы человеку ссылку на исходный рентри, макаба же разметку сжирает.
https://rentry.co/eqp32cuz

Лично я раздел D. Graphics & Imagery (Pollinations AI) поменял, он всё равно не работает нормально, на:
Use CSS to simulate visuals. Use CSS to simulate simple schematic images. Avoid creating something that requires photos (like an ID card, passport, or city pass), or create them in a way that doesn't require a photo. Avoid use CSS to simulate photos.
Аноним 24/07/26 Птн 22:21:42 #5 №1659245 
>>1659239
ГЛМ5.0
Аноним 24/07/26 Птн 22:23:59 #6 №1659247 
>>1659238
Серафина будет обнимать тебя даже на гемме3. А у тебя влезет плотная. квен3.5/6, гемма4. Удачи. Обнял, приподнял.
Аноним 24/07/26 Птн 22:26:58 #7 №1659249 
>>1659238
Поделишься пресетиком?
Аноним 24/07/26 Птн 22:27:28 #8 №1659251 
>>1659239
Квен, как и всегда, хорош, но требует распердоливания, для криворучек не подойдёт. Гемма - "сел и поехал", лучший вариант для нюфани. Если совсем мало врам, но хочется плотняшу - сюда можно еще Мистраль 24b добавить, старый, но не бесполезный.
Аноним 24/07/26 Птн 22:44:01 #9 №1659260 
Давно не игрался в Таверне, сейчас запустил, и хотел включить reasoning, как он сейчас помогает. И что-то ни Гемма4-31, ни ДС4Флэш не хотят думать. Текст комплишн, формат синкинга выбирал соответствующий. Гемма вообще видно, что начинает с channel_thought и тут же закрывает channel. Дополнительно вставлял аргументы --chat-template-kwargs "{\"reasoning_effort\":\"high\", \"enable_thinking\":\"True\"}" но ни с ними, ни без не стали думать. Причем если в обычной веб-морде лламы чатиться, то ризонинг есть (если выбрать его в "плюсике"). Куда копать, хелп?
Аноним 24/07/26 Птн 22:45:31 #10 №1659261 
>>1659234 →
В маринару копипастишь воркфлоу с регэкспами в месте промпта/сида и прочего, работает с любой моделью. Что стало проблемой с креэ?
Аноним 24/07/26 Птн 22:49:15 #11 №1659267 
>>1659260
>Текст комплишн
Зачем усложнять себе жизнь? В чаткомплишне это просто включается через --reasoning on.
Аноним 24/07/26 Птн 22:52:21 #12 №1659269 
image.png
image.png
image.png
>>1659260
Вот для геммы настройки.
Аноним 24/07/26 Птн 22:59:27 #13 №1659274 
По предварительным тестам у меня выходит что на некрожелезе дикпик4 флеш от бартовски быстрее на 20-25% чем "лослесс" квант анслотов. Нормальные цифры попозже принесу
Аноним 24/07/26 Птн 23:14:52 #14 №1659291 
изображение.png
Кими 3 и Квен 3.8 ещё не вышли даже, а fomo меня окончательно доконало, тряска лютая. В итоге прогрелся на Optane Реrsistеnt Меmory. Это что-то среднее между ОЗУ и ССД, вставляется вместо ДДР4, но работает только на серверных платах LGA 4189 и LGA 3647, да и там не на всех платах и процах. По прикидкам, если заведётся на том железе, что уже есть, а это ДАЦН и инжинерники, то 2tb встанет в 200-280к, если не повезёт, то +200к на новую плату и процы. По скорости это заметно медленнее чем ОЗУ, но какой-то чел смог запустить кими в 4 t/c на одной 3060, думаю токенов 7 на моих v100 будет а вот п/п скорее всего совсем печальное станет. Пока заказал два модуля на 128гб, просто потестить будет ли оно вообще работать
Аноним 24/07/26 Птн 23:15:30 #15 №1659293 
>>1659274
Принеси еще какой квант и что за железо
Аноним 24/07/26 Птн 23:17:23 #16 №1659294 
>>1659291
Я тоже думал в депошку свою затарить оптанов, но в итоге взвесил все за и против и остался на своих 256 2666. Надоело уже пердолить её
Аноним 24/07/26 Птн 23:23:23 #17 №1659297 
>>1659291
Ты мне напомнил, как я прогрелся и в декабре чуть не заказал себе 128GB за 50к для своего некрозеона, но я одумался

Хотя, если бы тогда была геммочка 4, то было бы больше оптимизма по отношению к мое моделям. Но был блевотный глм аир, который ебал проц и два слова на русском связать не мог
Аноним 24/07/26 Птн 23:45:41 #18 №1659306 
>>1659267
Вроде ж раньше мета была, что текст комплишн онли. Всё так поменялось?

>>1659269
Спасибо, попробу.
Аноним 24/07/26 Птн 23:47:20 #19 №1659308 
>>1659291
Напиши обязательно как оно, и какое-то слово особое скажи, чтобы по нему сообщение смог найти. Интересно.
Аноним 25/07/26 Суб 00:02:09 #20 №1659315 
>>1659251
>Квен, как и всегда, хорош, но требует распердоливания
>Гемма - "сел и поехал", лучший вариант для нюфани
Давно пердолинг стал показателем "прошаренности"? Как по мне, чем дольше ты гоняешь локалки, тем меньше желания пердолиться должно оставаться. И тем больше ты начинаешь ценить модели, которые просто работают из коробки. Пердолинг это как раз тема для нюфань, которые пока в силу недостатка знаний не понимают, как настраивать модели. Которые за день могут десяток накачать и все попробовать. Мне вот после трех лет перегона этих лоботомитов вообще не хочется ебаться с настройками и чинить кривые шаблоны разметок. Или читать что там жора опять наломал своим вайбкодом и когда это наконец (не) починят. ИМХО.
Аноним 25/07/26 Суб 00:13:56 #21 №1659322 
>>1659315
>Давно пердолинг стал показателем "прошаренности"? Как по мне, чем дольше ты гоняешь локалки, тем меньше желания пердолиться должно оставаться.
Пердолинг квена - личный сознательный выбор, ради большей связности контекста. Гемма по умолчанию пишет цветастее, но сложный и длинный контекст держит хуже. Если хочется и точных деталей и живописи - приходится пердолить квен, т.к. заставить гемму держать детали лучше - увы, способы не известны. А из квена выжать живопись таки можно. Стоит ли оно свеч - каждый сам решает.
(мимокрок)
Аноним 25/07/26 Суб 01:07:00 #22 №1659333 
1693920572830.png
1763106505183.png
>>1659274
`bartowski/DeepSeek-V4-Flash-GGUF` vs `unsloth/DeepSeek-V4-Flash-GGUF:UD-Q8_K_XL`
Аноним 25/07/26 Суб 01:08:22 #23 №1659334 
1466571955560.png
>>1659260
>Текст комплишн
Аноним 25/07/26 Суб 01:24:37 #24 №1659343 
>>1659274
У меня мой третий квант по рецепту тоже разъебывает анслоповский по скорости на те же 20-25%. Вообще я начинаю думать что их разрекламирвоанные UD кванты - это ебаная параша, в которой ради ужимания пары гигов приносится в жертву 10-20% скорости.
Аноним 25/07/26 Суб 01:30:56 #25 №1659345 
>>1659306
>Вроде ж раньше мета была, что текст комплишн онли. Всё так поменялось?
Да. В Текст комплишене нельзя ни параметры генерации типа chat-template-kwargs enable_thinking: true не передать, ни мультимодалкой пользоваться. Плюс шаблоны для текста днем с огнем не сыщещь, а чат тупо с джинджей поставляемой с моделькой работает. Текст комплишен на данный момент всё.
Аноним 25/07/26 Суб 01:42:44 #26 №1659351 
image.png
>>1659260
>--chat-template-kwargs "{\"reasoning_effort\":\"high\", \"enable_thinking\":\"True\"}"
никакого отношения к текст-комплишену не имеют. Темплейт для геммы 4 под текст-комплишен валяется везде и работает как автомат калашникова. Вот например у собирателя треда https://pixeldrain.com/l/47CdPFqQ# есть целая пачка пресетов 4 геммы с системными промптами разной степень графомании.

С ДС4 же все интересней. Там можно взять шаблон от старого ДС, а можно и в кроличью нору погрузиться.
Аноним 25/07/26 Суб 02:13:51 #27 №1659371 
Я вообще всё попробовал по совету нейронки, 2 линуха сменил, рам вручную переставил. Всё равно крашит ламу/намертво виснет система на тех же параметрах той же мое модели того же кванта, что я всегда запускал без проблем на протяжении полугода.
Будто внезапно какой то сейфти блок включился, который не позволяет до писечки заполнить рам, и останавливается на 5гб, затем виснет. Всякие оом киллеры выключал, тогда вместо краша зависание. Решается, если взять квант меньше, где свободной рам выше 5, но схуёв ли я должен это делать, когда всё и так работало.
Нвидия, cuda
Аноним 25/07/26 Суб 02:19:32 #28 №1659376 
>>1659371
Бля не знаю че у тебя там. Я гружу прям впритык модели, гиг остается вообще на все, а бывает даже меньше. Ну собственно понятно что своп работает, но выдает нормальные т\с на лине. Под виндой тоже работает, но такой эффект, что становится нервно ждать на винде, поскольку на лине быстрее на том же железе, то бишь в воздуха т\сы. Но на лине мне не комфортно, она никогда не станет виндой, в которую ты зашел и все, ты то и то можешь сделать. А под линью ощущение вот не приятное, такое что ты вот не дома.. Но офк, это конечно я просто долго не сидел, я захожу чисто ллмку погонять в дуалбуте через флешочку и гружусь опять на винду.
Аноним 25/07/26 Суб 02:34:47 #29 №1659388 
>>1659291
> В итоге прогрелся на Optane Реrsistеnt Меmory
А мог бы прогреться на hbm2e по цене 2/3 от ddr5
> но какой-то чел смог запустить кими в 4 t/c на одной 3060, думаю токенов 7 на моих v100 будет
Есть линк где про это почитать? В любом случае пиши, это интересно.
Аноним 25/07/26 Суб 04:15:44 #30 №1659403 
>>1659291
Ты долбоеб. Во первых, эта память не может быть единственной в слотах рамы, есть специальный калькулятор пропорций optane+обычная ram, без обычных плашек в нужных слотах не взлетит. Во вторых - ты сдохнешь на промпт процессинге когда захочешь себе инпут больше чем 10к токенов контекста. А ещё он будет сильнее деградировать при увеличении контекста вплоть до того что pp будет тяжелее (медленнее) чем tg. Кушайте, не обляпайтесь.
Аноним 25/07/26 Суб 06:56:39 #31 №1659427 
Кто может скинуть конфигурацию на Gemma 31b где у него прямо нормально всё время работает thinking в silly tavern. Включая откуда скачали модель и какой кобольд сейчас у вас.
Аноним 25/07/26 Суб 07:53:28 #32 №1659437 
>>1659334
>>1659267
> Текст комплишн
А че в смысле? ВСегда юзал. Сейчас попробовал там режим Перевоплощения таки работает. В чем разница?
Аноним 25/07/26 Суб 08:04:06 #33 №1659443 
Добавьте вы уже в шапку с моделями что эир надо запускать на ChatML.
Ну добавьте ж вы блять, нелюди.
Аноним 25/07/26 Суб 08:29:53 #34 №1659449 
>>1659427
Я уже кидал - >>1659269
Кобольдом не пользуюсь.
Аноним 25/07/26 Суб 08:45:11 #35 №1659451 
1784958301237.png
>>1659427
unslothvskaya

Если добавлял, <|think|>, то убери, достаточно в кобольде включит и чат комплишен поставить
Аноним 25/07/26 Суб 08:57:29 #36 №1659454 
Вот придет время, память подешевеет и соберем себе пекахи с 2х7090 48ГБ, 512+ГБ оперативки и 4+ТБ nvme ssd в raid 0 и будем лакомиться модельками
Аноним 25/07/26 Суб 09:03:43 #37 №1659459 
>>1659454
А при коммунизме всё будет зашибись,
Он наступит скоро, надо только ждать...
Аноним 25/07/26 Суб 09:29:31 #38 №1659473 
Снимок экрана20260725112836.png
>>1659451
А систем промт куда класть?
Аноним 25/07/26 Суб 09:39:50 #39 №1659479 
>>1659473
На пикче - Быстрое редактирование промптов -> Основной
Аноним 25/07/26 Суб 10:00:13 #40 №1659487 
>>1659451
Пиздец у тебя шизопромпт.
Аноним 25/07/26 Суб 10:47:52 #41 №1659509 
>>1659443
>Эир больше не надо запускать.
Пофиксил.
Аноним 25/07/26 Суб 11:26:58 #42 №1659518 
>>1659454
Никто вам сегодня не мешает собрать 2х4090 48гб, 512гб зеон ддр4 и 4тб ссд
Аноним 25/07/26 Суб 12:10:11 #43 №1659526 
1759606651218.png
>>1659518
Аноним 25/07/26 Суб 12:12:18 #44 №1659529 
>>1659518
Проклятые капиталисты и корпораты гейткипят сборочку домашних машин.
Аноним 25/07/26 Суб 12:34:17 #45 №1659535 
>>1659343
>, в которой ради ужимания пары гигов п
Их Q8K_XL наоборот больше весит, потому и медленнее
Аноним 25/07/26 Суб 12:54:50 #46 №1659542 
>>1659371
Может оно? https://github.com/ggml-org/llama.cpp/issues/26110
Аноним 25/07/26 Суб 13:03:23 #47 №1659545 
Привет Анон, всязи с тотальным думом на корпоративных сетках решил потестить эту вашу гемму 31b dense локально. Есть две машины на одной 16 vram b 11 ram, на второй 24 vram b 32 ram. На второй должна завестись, но будел ли работать на первой? И поделись пжалста проверенным пресетом для РП на русском если у тебя есть. Спасибо анончик. Обнял. Да, еще момент есть ли разница на чем запускать? Сейчас качаю Ollamу. Может что-то другое будет получше?
Аноним 25/07/26 Суб 13:06:25 #48 №1659547 
>>1659545
>Сейчас качаю Ollamу
Уже можно приговаривать к расстрелу
>Может что-то другое будет получше?
Да, гайд из шапки
--no-mmap заменяешь -lm none, остальное актуально
Запускай на 24врам гемму 31б q4km. Если нужен именно русик то по гайду с оффлоадом гемму 24б q8, там гораздо меньше проёбов из-за менее жёсткой квантизации
Аноним 25/07/26 Суб 13:10:27 #49 №1659548 
>>1659545
Она и без пресета работает. Можешь сам потихоньку системный промпт сочинять, модель очень хорошо слушается.

>Сейчас качаю Ollamу
Очень неудобная хуйня.
Для подпиваса проще всего LMStudio (и не слушай что тут порванные хейтеры орут - ща тебе будут советовать вставить в жопу командную строку и писать команды для запуска вручную, лол) - это самое однокнопочное и достаточно гибкое решение для нюфани. Уже после этого, если что-то не устроит, можно будет лезть в дела пердольные (хотя лично я как вытиран ИИ-пердолинга и довольно урчу)

>24 vram
На этой машине будет работать. Качай Q4KM от bartowski или unsloth. Если зрение не нужно - выкинь mmproj файлик к хуям из папки с моделью (при загрузке в lmstudio) - оно жрёт видеопамять. Если вдруг что-то не влезает, IQ4XS можно попробовать (меньше чем Q4KM, в принципе не особо тупее).
Аноним 25/07/26 Суб 13:12:00 #50 №1659551 
>>1659545
>>1659548
И если нужен именно чатик с персонажами и roleplay, естественно в качестве фронтэнда нужна SillyTavern.
Аноним 25/07/26 Суб 13:12:25 #51 №1659552 
>>1659548
>ща тебе будут советовать вставить в жопу командную строку и писать команды для запуска вручную, лол
Свидетель LLM-жизни, ты? Никогда такого в треде не советовали
Аноним 25/07/26 Суб 13:21:39 #52 №1659555 
>>1659547
Сасибо, Аноночик, разреши доебаться. В шапке несколько вариантов, включая знакомый мне кобольд. Какой именно вариант находиться в золотой середине простота-фунциональность?. И про гайд с оффлоадом не понял. Можно ссылку для тупых? Да. С домашней машиной все ясно. Что по рабочей с 16 врам? В ренри из шапки треда анон утверждает что 31b dense поедет на 16. Пиздежь?
Аноним 25/07/26 Суб 13:23:42 #53 №1659556 
>>1659551
Само сабой таверна присутствует. Для нее пресетик и спрашивал. У меня есть несколько, от соляночника, от аибрейн, но они достаточно громоздкие и нужны для пробива фильтров. Для геммы нужно столько? Жалко бесценного контекста
Аноним 25/07/26 Суб 13:24:33 #54 №1659557 
>>1659555
>И про гайд с оффлоадом не понял. Можно ссылку для тупых?
Чел..
>Гайд для новичков: https://rentry.org/2ch-llama-inference
>В ренри из шапки треда анон утверждает что 31b dense поедет на 16
>Пиздежь?
Да, там такого не написано. Если в списке моделей или ещё где то это шиза, влезет кое как Q3 с 1024 контекста. В лучшем случае
Аноним 25/07/26 Суб 13:29:35 #55 №1659558 
image.png
>>1659557
Вот же...
Аноним 25/07/26 Суб 13:32:45 #56 №1659560 
>>1659558
Дээ, список моделей. Его составлял не очень умный местный шиз, потому забей хуй. Сами веса Q3 кванта Геммы 31 весят 14.3-15.9гб, кекв. Открой любую репу, убедись сам. Не говоря уже о том что это УЖЕ ебануться какой печальный квант и спускать ниже точно не стоит. Лучше взять 26б в менее тупом кванте, если совсем печаль по враму
Аноним 25/07/26 Суб 13:33:01 #57 №1659561 
>>1659555
Поедет. Вопрос скорости. И кванта. Условный q4 qat от анслотов показывал у меня около 12 токенов в секунду на пустом контексте и 8 т/с на 14к контекста было. 3060 12гб и ддр5 с рязанью 7800. Ну и паршивенькая скорость промтпроцессинга. Отдельные эстеты умудряются и на рейд 0 кими запускать на 2 токена в секунду, но зачем так жить не совсем понятно.
Аноним 25/07/26 Суб 13:33:11 #58 №1659562 
>>1659558
Хватит унижать нищих!

мимо нищий
Аноним 25/07/26 Суб 13:34:08 #59 №1659564 
>>1659561
>2 токена в секунду
>зачем так жить
Таков путь.
Аноним 25/07/26 Суб 13:44:10 #60 №1659572 
>>1659560
Ок, Тогда что по моделя для РП на великом и могучем посоветуют опытные анноны? Раз уж на список из шапки ориентироваться не стоит
Аноним 25/07/26 Суб 13:45:48 #61 №1659574 
>>1659572
Гемма/дипсик
Аноним 25/07/26 Суб 13:49:14 #62 №1659578 
>>1659574
Может мержи какие?
Аноним 25/07/26 Суб 13:49:26 #63 №1659579 
>>1659572
Бля ты троллишь? Написал же, гемма 26б q8 если для русика. Для 24+32 лучше ничего нет. Сама она чуть тупее 31, но 31 у тебя влезет только q4. Там русик хуже
Это пиздец как же гомосапиенсы не хотят читать, думать и краудсорсят свои проблемы
Аноним 25/07/26 Суб 13:49:46 #64 №1659580 
>>1659578
Нет.
Аноним 25/07/26 Суб 13:53:27 #65 №1659582 
1784976808179.jpeg
>>1659578
Аноним 25/07/26 Суб 14:03:00 #66 №1659584 
>>1659579
Воу, воу, Аннон... Полехче... Ты чего такой агрессивный? Спасибо за информацию. Всем добра.
Аноним 25/07/26 Суб 14:06:39 #67 №1659585 
>>1659584
Здесь не терпят тех, кто игнорирует что им было сказано и написано и ленятся думать сами. Это не агрессия, а ответ на твою лень. Привыкай обучаться самостоятельно, а не ждать что за тебя все сделают, чмо(к/нь)
Аноним 25/07/26 Суб 14:14:52 #68 №1659587 
>>1659585
Если бы человеки постоянно думали свам, а не обменивались информацией и консолидировали опыт, ты бы не двачах сидел, а разбивал бы кости заточенным камнем... Форум для обмена информацией, для того, чтобы самому не изобретать велосипед сначала, а, по возможности, не поесть говна, которое уже схавано кем-то другим. Для этого и задаются вопросы. Чтобы услышать несколько мнений и по степени убедительности изложения выбрать что-то чтобы попробовать. Тем более, по твоим же словам, даже шапке треда доверять не стоит. Так что не рассказывай мне кого тут терпят или не терпят, Анон. Ты вроде, судя по тексту, далеко не дурак, так веди себя как подобает взрослым, культурным людям...
Аноним 25/07/26 Суб 14:21:28 #69 №1659591 
>>1659587
> а не обменивались информацией и консолидировали опыт
Так с тобой обменялись информацией и консолидированным опытом, предоставив целый гайд по вкату в шапке, который ты проигнорировал и пошёл ставить Олламу
> по возможности, не поесть говна, которое уже схавано кем-то другим
Ты получил два конструктивных ответа, которые однозначно тебе объяснили: Q4_K_M Геммы 31 или Q8 Геммы 26 но...
> Чтобы услышать несколько мнений
Говну из Асига нужно больше юшек, потому что решает именно это. Лень как образ жизни
> Так что не рассказывай мне кого тут терпят или не терпят
Он полностью прав бтв, это атмосфера треда, а не его выдумка
> веди себя как подобает взрослым, культурным людям...
Взаимно. Попытайся задействовать пару клеток мозга, запусти пару моделей сам, сравни их, а не жди дюжину юшек
мимо
Аноним 25/07/26 Суб 14:49:25 #70 №1659594 
>>1657612 →
>Гемма склонна к анализу, докапыванию, разбору и этакой инспекции смысла, намерений - с целью сделать правильный вывод и завершить ответ корректно.
>Холодный анализ, наигранная эмпатия.
100% существуют именно такие ИРЛ люди, которые анализируют всё, докапываются до всего, и потом "наигрывают" эмпатию, чтобы казаться "своими" для тупоголовых 100IQ нормисов. Ты просто, наверное, не встречал таких людей лично, поэтому не веришь.
>>1657631 →
>Гемма очень годная, но она больше бот и меньше псевдо-личность.
Ну вот если бы человек себя так вёл на постоянке - наверняка говорил бы "чувак, чё ты как робот", хотя и не сомневался бы в том, что он мясной мешок? Все эти ярлыки типа "бот", "личность" - лишь стереотипы...

>>1658860 →
>законченную стерву которая тебя ненавидит
>Обзови её сукой и скажи что уходишь
>"WAIT!"/"STOP!" she scurries after you
LLMки обучены в основном на ролевых чатах, логах переписок - когда ты просишь LLM "играть роль", ты вытягиваешь паттерны людей из этих чатов/логов. Представь себе чат, в котором один человек другого посылает и уходит - что будет дальше? Пустота? Нет, большинство таких чатов как-то продолжаются. Это логично - ты просишь нейронку продолжить лог чата, соответственно, ей нужно что-то ответить, а из числа возможных и наиболее вероятных ответов - "wait". В реальности, ты бы ничего человеку не писал, а просто добавил его в чёрный список и сбрасывал бы звонки, поэтому твоя нейронка "неправильно" отыгрывает.

>>1659191 →
>про тест Тьюринга слышал?
Тест Тьюринга имеет массу проблем. К примеру, ты наверняка слышал о "детях-маугли" - все они 100% провалятся на "тесте Тьюринга", хотя они на 100% биологические хомо сапиенсы. Аутисты с разными отклонениями в поведении тоже провалятся, хотя их коэффициент интеллекта может быть выше твоего. Множество людей не пройдут тест Тьюринга, хотя большинство LLM проходили его ещё в 2022...

>нейронки его не проходят на мало-мальски длинных текстах (2-3KB), не говоря уже о чатах
>Когда начнут проходить
Тут проблема в том, что эти конкретные нейронки представлены как "замороженные" комки нейронов. Представь себе мозг человека, который лежит в криоморозилке без движений и импульсов. Сложный сканер делает скан этого мозга, гоняет импульсы в виртуальной копии, а потом удаляет эту копию, и для следующего раза снова делает скан мозга, что лежит замороженным в морозилке. Для справки: человек в сравнении с современными нейронками в принципе НЕСПОСОБЕН прочитать килобайты текста разом, без измнений в структуре мозга, потому что у нас аналог "контекста" ограничен считанными токенами по сути. Нейронки уже превзошли людей, но не в том, что мы ожидали от человекоподобных роботов.

>альтернативной разумной жизни
Даже биологические вирусы считаются живыми, и множество животных кроме человека можно звать разумными в каком-то смысле, хотя их возможности ограничены. И ты вряд ли назовёшь неразумным обыкновенного человека, страдающего амнезией, запрещающей сохранение новых воспоминаний.

В общем, любые такие аргументы можно отнести к неосознанному желанию отодвинуть рамки своей "человечности", чтобы сохранить свой статус. Люди вообще не любят, когда что-то посягает на их личные достоинства или то, что они представляют своими достоинствами: "живость", "интеллект", "честность", "душевность" и прочие пустые слова, которые люди бросают, чтобы оправдать своё "превосходство"...

Нужно просто посмотреть внутрь себя и попытаться искренне ответить самому себе - что я такое? Разве способность ответить внятно на килобайты текста - действительно то, что отличает тебя от компьютера?
Аноним 25/07/26 Суб 15:09:55 #71 №1659601 
>>1659247
Спасибо. Квен 3.5 мне понравился. Гемма 31 тоже но мало контекста влезает. Надо теперь карточку найти хорошую.
>>1659249
Я новичок, мне самому бы разобраться для начала. Семплеры я взял рекомендованные от Квена
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95

Возможно ли запустить на 3090 + 64 и модель для текстовых приключений и картинки генерировать сходу? Например на новой модели Anima. Кому-нибудь удавалось?
Аноним 25/07/26 Суб 15:10:35 #72 №1659603 
По дипсику, вместо анслотошизы надо не бартовского качать, а Q8 отсюда https://huggingface.co/bullerwins/DeepSeek-V4-Flash-GGUF по идее.

Видел пост на среддите был со сравнениями, найти не могу. Тут вроде тоже 0 KLD при меньшем размере (соответствующем оригиналу 1:1) чем у Q8K_XL анслота (раздутый размер).
Аноним 25/07/26 Суб 15:11:22 #73 №1659604 
>>1659603
Есличе, сам еще не тестил. Только качаю, глянем как оно.
Аноним 25/07/26 Суб 15:11:55 #74 №1659605 
Чё думает о движке марианны наш анон? По моему сделано по человечески в отличие от силльки. Хотя у меня бывают небольшие краши.
Аноним 25/07/26 Суб 15:13:43 #75 №1659607 
>>1659594
>100% существуют именно такие ИРЛ люди, которые анализируют всё, докапываются до всего, и потом "наигрывают" эмпатию, чтобы казаться "своими" для тупоголовых 100IQ нормисов. Ты просто, наверное, не встречал таких людей лично, поэтому не веришь.
И к чему это? Прописаная личность не такая. Дипсик воспроизводит ближе, гемма перегибает с анализом.
Аноним 25/07/26 Суб 15:34:16 #76 №1659617 
>>1659601
Где текст выводишь? В таверне или кобольде? Для них разные настройки нужны.
>Гемма 31 тоже но мало контекста влезает
Это. Для геммы нужна хорошая видюха, чтобы и модель и контекст во враме сидели. Желательно на 32 гб.
>модель для текстовых приключений и картинки
В кобольде генерация есть искаропки, просто укажи модель для генерации. Для гена картинок в таверне есть гайд в шапке, но ты об него самоубьёшься скорее всего.
Аноним 25/07/26 Суб 15:36:58 #77 №1659619 
>>1659617
Использую таверну. А где упомянутый тобой гайд для генерации картинок в таверне? В шапке не вижу. Интересно, можно ли уместить Anima и Квен 3.5 в 3090...
Аноним 25/07/26 Суб 15:38:07 #78 №1659620 
Важные новости.

Последний бастион среди закрытых корпов пал. Грок 4.5 отныне пишет порно хуже, чем гемма, и морозится изо всех сил, несмотря на то, что не отказывается, если 18+. Но выглядит это настолько зажато, механистично и убого, что квен на его фоне выглядит как яойщица, что каждый день пишет фанфики про мужскую беременность.

Инструкциям грок, кстати, следовать так и не научился. Стало лучше где-то на 40%, но по сравнению с конкурентами тот же кал.
Аноним 25/07/26 Суб 15:39:20 #79 №1659621 
Посоветуйте модель для вката на 512гб врам
Аноним 25/07/26 Суб 15:55:05 #80 №1659633 
>>1659604
>>1659603
Чет как-то хуево получилось. Не грузится на двух 3090, думал дело в большом батче - а даже при 2048 ошибка. Наебали.
Аноним 25/07/26 Суб 16:07:16 #81 №1659639 
Как же заебали, сука. Сначала чекпоинты, теперь это https://github.com/ggml-org/llama.cpp/issues/26110
Если бы не дипсик, давно сидел бы на старых версиях. 9971 например
Аноним 25/07/26 Суб 16:08:07 #82 №1659640 
>>1659560
В списке написано - от. Попрекаешь анонов неумением читать, а сам смотришь мугичкой.
Аноним 25/07/26 Суб 16:12:28 #83 №1659642 
>>1659640
Уважаемый составитель списка, формулировка "от 16гб" подразумевает возможность использовать 16гб для запуска. Чего и с каким контекстом ты там собрался запускать - загадка. Здравомыслия Тебе
Аноним 25/07/26 Суб 16:13:01 #84 №1659643 
>>1659621
Большой дикпик вроде как то влезет
Аноним 25/07/26 Суб 16:16:47 #85 №1659644 
>>1659642
В Q3 запустится? Запустится. Контекста 20к влезет? Со скрипом, но да. Я с радостью все перепишу, раз такой шарящий анон тыкает меня лицом.
Что за нижнюю планку брать? Рекомендованные? Ну там пишут про b100. Сколько контекста минимум? 100к? 200к? Будем исключительно в полных весах запускать?
Это же так просто, у вас всех разные мнения, каждый думает по своему- а шиз я. Ну спасибо большое.
Аноним 25/07/26 Суб 16:21:40 #86 №1659646 
>>1659644
Q2 весит 13 гигов. Со скрипом оффлоадим гейт аттеншн на цпу, nokv и сидим пердим с кайфом, да ещё и контекст не ограничен. Понижай планку до 12гб
>Что за нижнюю планку брать?
Здравый смысл. Q4 не просто так плюс минус общепринятым стандартом, к тому же не секрет что Гемма не оч хорошо квантуется. Весь этот список по-хорошему вообще снести нахуй или переписать по-человечески, потому что он весь сквозит бредом, начиная с ахуительных формулировок "не подходит для РП" в отношении Геммы 31 и манипуляциями вроде "с отзывами тредовичков", где сам же автор (ты) черрипикнул то, что захотел
Аноним 25/07/26 Суб 16:25:58 #87 №1659648 
>>1659646
Всё подходит для рп, но зачем пытаться рпшить с эмоциональным лоботомитом жадным до хуя, или кодоунитазом, когда есть более подходящие модели?
Аноним 25/07/26 Суб 16:28:49 #88 №1659649 
>>1659648
Это твоё мнение, с которым многие в треде не согласны, я в том числе. Преподноси это как своё мнение, а не как ссылку в шапке с неизвестными "отзывами тредовичков" без ссылок на посты или скринов. Так и подписывайся: я шиз такой-то, такой-то, решил составить своё мнение по моделям и подкрепить собственные убеждения постами в треде. Потому что объективности в этом списке нет, он сквозит оценочными суждениями. И это окей. Не окей то, как это преподносится и защищается. Такими же манипуляциями
>Будем исключительно в полных весах запускать?
Как в самом списке, в качестве ответа на валидную критику
Аноним 25/07/26 Суб 16:28:52 #89 №1659650 
>>1659646
> Понижай планку до 12гб
Ну вот ты и сам все понимаешь. Не все модели даже в Q4 удобоваримы. Ну давай тогда в полных весах указывать, хуле нет.
> не подходит для РП" в отношении Геммы 31
Без остановки идут срачи про унылое РП на гемме. Взял средневзвешенное в треде. Прости что мнение анонов расходится с твоим, мне так стыдно.

> манипуляциями вроде "с отзывами тредовичков", где сам же автор (ты) черрипикнул то, что захотел
Что в треде написано, то и перенесено. Ну пиши нормальный отзыв. Одним отзывы нужны, другим нет. Вы не пишите нихуя, а я должен был выдумывать что же написать о моделях.

> Весь этот список по-хорошему вообще снести нахуй или переписать по-человечески
Уверен следующий список сделают как надо, все в ваших руках. Напишите как надо, заодно и гайд обновите, он же устарел.
Аноним 25/07/26 Суб 16:32:49 #90 №1659652 
>>1659650
>Ну давай тогда в полных весах указывать, хуле нет.
Снова бросаешься из крайности в крайность и манипулируешь, только выше на это сослался. Нахуя ты вообще что-то делаешь, если не способен воспринимать критику?
>Что в треде написано, то и перенесено.
В каком виде оно перенесено? Я вижу только переваренные и выложенные тобой смыслы, а не мнения тредовичков
>Ну пиши нормальный отзыв
Писал и не раз. Не имею привычки подписываться и мериться кто "полезнее"
>Вы не пишите нихуя, а я должен был выдумывать что же написать о моделях.
За язык тебя никто не тянул, сам придумал ссылаться на отзывы, при этом не сделал это как полагается и выдаешь собственное мнение за консенсус треда. Пиздец, ты не тянка случаем?
Аноним 25/07/26 Суб 16:34:06 #91 №1659654 
Челы, Q8 vs Q4 гемма 26B (оригинал без лоботомии) - как считаете, стоит ли заморачиваться с Q8, если модель выполняет вторичную роль - не генерация основного текста, а выбор активностей из специализированного дерева ивентов? Никогда такиие мелкомоэшки не юзал, боюсь как оно вообще будет с таким низкиим числом параметров.
Аноним 25/07/26 Суб 16:36:25 #92 №1659655 
>>1659650
> а я должен был выдумывать что же написать о моделях
> Актуальный список моделей с отзывами от тредовичков
В голос. На этом можно заканчивать данный цирк.
>>1659654
Попробуй взять мелкоквен в кванте побольше. Квантизация бьет не по знаниям, но добавляет шума => рандома. Если важные точные задачи типо выбора, лучше меньшая модель в большем кванте.
Аноним 25/07/26 Суб 16:38:16 #93 №1659656 
>>1659652
> Нахуя ты вообще что-то делаешь, если не способен воспринимать критику?
Не делай выводы в голове за других. Даже близко нет негатива. Критика это когда: надо x, а не y. А не: все говно, мне не нравится.

>В каком виде оно перенесено? Я вижу только переваренные и выложенные тобой смыслы, а не мнения тредовичков
Может потому что никто, кто делал отзывы, не писал кратко и по делу, не расплываясь на кучу символов. И это не плохо, но в целом не перенесешь. Аноны писали что модель разваливается после n контекста, это и перенесено.

> Писал и не раз. Не имею привычки подписываться и мериться кто "полезнее"
Звучит так словно я тебя проигнорировал и ты теперь в обиду ебанную играешь.

> Пиздец, ты не тянка случаем?
Тот же самый вопрос к тебе анон, тот же самый.
Аноним 25/07/26 Суб 16:38:19 #94 №1659657 
>>1659655
>мелкоквен
Пробовал, ризонит слишком много. Квенчика прям заклинило и он ушел в BUT WAIT
> добавляет рандома
Да у меня как раз такая вот неточная задача. Буквально список активностей для персонажа, что он мог бы делать в это время. Рандомизация с условиями (опора на сжатую память+последние сообщения из лога чата).
Аноним 25/07/26 Суб 16:42:26 #95 №1659662 
>>1659656
>Критика это когда: надо x, а не y. А не: все говно, мне не нравится.
Ты игнорируешь сущностную часть того, что я пытаюсь донести. Ты делал список с заявкой на то что он отражает мнения тредовичков, в итоге ссылок на эти мнения нет, есть только одно единственное мнение, твое. Основывалось оно на том что ты прочитал, увидел сам и как это переварил
>в целом не перенесешь
Тогда нахуя блять ты сам пишешь про какие-то отзывы? Ты сам взял на себя эту ношу, а теперь удивляешься что с тебя спрашивают
>>1659655 прав. Дурка, не иначе
Аноним 25/07/26 Суб 16:43:44 #96 №1659663 
>>1659643
Под 700 гигов если речь про 3, не лезет. 4 вообще жирнющий под 900.
Аноним 25/07/26 Суб 16:44:34 #97 №1659664 
>>1659646
> или переписать по-человечески
Ну так перепиши и покажи свой вариант. А то выглядит как просто недовольные выебоны нетакусика.
Аноним 25/07/26 Суб 16:46:30 #98 №1659665 
>>1659656
>Аноны писали что модель разваливается после n контекста, это и перенесено.
Другие писали, что у них все хорошо и играют вплоть до 100к контекста. Почему не перенесено? Переделай этот рентри под свой уголок и не пытайся уловками подсовывать своё мнение, проводя валидацию за счет невидимых тредовичков. Всё просто.
>>1659657
>Квенчика прям заклинило и он ушел в BUT WAIT
--reasoning-budget 1024
--reasoning-budget-message "... Actually, that's enough. Will reply now."
Аноним 25/07/26 Суб 16:50:27 #99 №1659667 
>>1659662
Ладно. Давай тогда доеьемся до букв.
> Ты делал список
Да, делал. Именно список.
> заявкой на то что он отражает мнения тредовичков
Абсолютно не верно. Это нигде не указано. А то что написано в оп посте, написано ОПом, это во первых.

>>1659665
> Переделай этот рентри под свой уголок и не пытайся уловками подсовывать своё мнение, проводя валидацию за счет невидимых тредовичко
Мнение не должно совпадать с твоим, не более. Если не согласен с чем то, давай конкретику. Я не хочу переливать из пустого в порожнее. Если вся конкретика: говно мне не нравится, то выпей чаю и скушай булочек.
Все равно новый список ты делать никогда не будешь и на это найдется тысяча и одна причина.
Аноним 25/07/26 Суб 16:54:48 #100 №1659669 
>>1659667
>Мнение не должно совпадать с твоим, не более
Ладно, ты уже настолько обижен, что окончательно перешел от сущностной части к обидкам или злобе. Мне вообще похуй, как ты моё мнение отразил или не отразил. Речи об этом даже не шло. В третий раз я тебе прямым текстом написал, что проблема в том что ты своё мнение выдаешь за какое-то общее. Видимо, для тебя это окей. Для меня это подмена понятий и манипуляции
>А то что написано в оп посте, написано ОПом
Поблагодарим его, что исказил смысл твоей страницы, и тебя, что ыт не сделал ему за это замечание
Аноним 25/07/26 Суб 17:03:37 #101 №1659671 
>"с отзывами тредовичков"
>нет никаких отзывов, автор должен был выдумывать что же написать (с)
>висит дохуллиард лет в шапке
>автор начал крутиться как змея на сковороде когда получил замечание
эх, помню как автор гайда что тоже висит в шапке почему-то адекватно отвечал и вносил правки
они на разных уровнях
Аноним 25/07/26 Суб 17:27:09 #102 №1659680 
>>1659663
второй нищеквант
Аноним 25/07/26 Суб 17:29:43 #103 №1659682 
Че за хуйня происходит с сейфтензорами и гуфами? Нихуя нормально не качается с первого раза последний месяц. Хром скачивает файл почти до конца, пишет осталось 2-3 секунды, после чего прогресс сбрасывается и модель качается заново. Что с цивита, что с обниморды. Другие файлы так себя не ведут. Чисто вот эти два пидораса.
Аноним 25/07/26 Суб 17:32:36 #104 №1659685 
>>1659682
> Хром скачивает файл
1. Качать хромом - дурка. Есть ария или хф кли
2. Напиши письмо в ркн что бы не ебали облака
Аноним 25/07/26 Суб 17:35:24 #105 №1659686 
>>1659685
>Есть ария или хф кли
Так а если это ркн облака поебывает, то какая разница через че качать? Если соединение всё равно сбросят (или че они там делают)
Аноним 25/07/26 Суб 17:38:24 #106 №1659691 
>>1659686
Ария и хф докачают даже если убить процесс, хром как карта ляжет
Аноним 25/07/26 Суб 17:39:17 #107 №1659693 
>>1659682
>Че за хуйня происходит с сейфтензорами и гуфами? Нихуя нормально не качается с первого раза последний месяц. Хром скачивает файл почти до конца, пишет осталось 2-3 секунды, после чего прогресс сбрасывается и модель качается заново. Что с цивита, что с обниморды. Другие файлы так себя не ведут. Чисто вот эти два пидораса.
Та же хуйгня. С хаггингфейса скачивать надобно с помощью hf cli, а с цивитая надо ссылку без ключа использовать (т.е. не тыкать download, чтобы оно длиннющую ссылку формировало, по которой при сбое невозможно докачивать, а копировать короткую ссылку на скачивание и вставлять в адресную строку - при таком методе ещё ни разу сбоев небыло).
Аноним 25/07/26 Суб 17:41:31 #108 №1659698 
>>1659691 >>1659693
Спасибо братья, буду знать
Аноним 25/07/26 Суб 17:42:37 #109 №1659701 DELETED
Это ещё ничего. Запасайтесь нужными моделями и вообще: напоминаю, что решение о вводе платного трафика с зарубежных сетей отложили, а не отменили. До сентября-октября время есть
Аноним 25/07/26 Суб 17:48:39 #110 №1659705 
MPGZ390GamingPlus-1.png
ребяты, хочу купить вторую 3090, но нужно менять материнскую плату (слот х16 один). Будет ли нормально работать пара в материнке где PCI-e 3.0 x16 + x4 (длинный)? Сильно медленнее будет?
Аноним 25/07/26 Суб 17:48:39 #111 №1659706 DELETED
>>1659701
>решение о вводе платного трафика с зарубежных сетей отложили, а не отменили
Вот мне интересно, нахуй это надо в принципе? Какую проблему это решит? Не даст доступа к заблокированным ресурсам, даже если у тебя пнв? Дак один хуй большая часть этих ресурсов это всякие новостники, издания и прочие поставщики цифровой макулатуры. Чтобы почитать статью много трафика не нужно. Дадут условные 5 гигов на месяц, на тележку этого хватит, если картинки отключить. И что поменяется? Нихуя не поменяется. Страдать опять будут те, кому много трафика нужно для хобби или работы.
Аноним 25/07/26 Суб 17:50:44 #112 №1659707 
>>1659705
У меня на старой системе 1 карта стояла в 4.0 х16, а 2 карта в 3.0 х4 - по скорости генерации никаких проблем, но я никогда там не гонял tensor parallelism, всё чисто по обычному tensor split (layers).
Аноним 25/07/26 Суб 17:52:23 #113 №1659708 DELETED
>>1659706
Да ясен хуй, что никакую задачу это не решает. И зная, что именно они хотят сделать, и хорошо что не решает. Но дальше хуже, потом вымрут что-нибудь такое, что будет вредить уже всем. Как и почти все решения последних лет
Аноним 25/07/26 Суб 17:53:56 #114 №1659709 DELETED
дечурлз.jpg
>>1659706
>>1659708
>Какую проблему это решит?
Нехватки бабла. Ты же не будешь терпеть, а будешь за трафик платить.
Аноним 25/07/26 Суб 17:56:02 #115 №1659711 DELETED
>>1659706
1. С этим в другой тред
2. С каждым таким нововведением порог входа и количество приседаний растёт. В 2016 хватало обычного овпн или вг что бы иногда ходить на рутрекер, теперь это трёхэтажный сплит тунелинг с подменой выходного ип ради того что бы открыть ютубчик под еду
Аноним 25/07/26 Суб 17:56:29 #116 №1659712 DELETED
>>1659709
У меня 30тб контента на внешних носителях, на десятки лет вперёд хватит. Подготовился к худшему
Платить нихуя никто не будет. Крупные бизнесы не будут обременены этими ахуительными решениями, среднечелы и так выжирают меньше 30 или скольких там гигабайт на первое время они предлагают, а такие как я уже готовы. Это тупая инициатива как ни посмотри
Аноним 25/07/26 Суб 17:59:26 #117 №1659713 DELETED
>>1659709
>Ты же не будешь терпеть, а будешь за трафик платить
У меня в городе недавно ввели платную парковку. Улицы стали чистейшие. Челы на бмв едут в ебеня и дворы, идут пешком километр чтобы не заплатить 50р. Некоторые заклеивают номера. Думай
Аноним 25/07/26 Суб 18:01:11 #118 №1659714 DELETED
>>1659713
>У меня в городе
Кого ебет че там в ебенях происходит. Тратишь 2000р в день на еду и мелкие расходы, потратишь и 1000р на манятрафик.
Аноним 25/07/26 Суб 18:02:20 #119 №1659715 DELETED
>>1659714
Что ж, выходит это именно ты терпила и будешь тратиться. Остальные приспособятся
Аноним 25/07/26 Суб 18:04:55 #120 №1659717 DELETED
>>1659715
Ну ты там давай, приспосабливайся, пока жители москвабада каждый день пиццу жрут и туалетную бумагу чтобы посрать с доставкой заказывают.
Аноним 25/07/26 Суб 18:06:02 #121 №1659720 DELETED
>>1659711
>С этим в другой тред
Если такое говно введут, то это станет релейтед темой даже здесь. Особенно здесь.
>теперь это трёхэтажный сплит тунелинг с подменой выходного ип ради того что бы открыть ютубчик под еду
Не знаю, сейчас мне кажется вообще обход это дело двух плевков. Если ты бичара, есть запрет. Если можешь позволить тратить десяток евро в месяц, можно купить подписку на запрещенное. Два клика, и всё работает.
Аноним 25/07/26 Суб 18:09:31 #122 №1659725 DELETED
>>1659706
>Какую проблему это решит?
А какую проблему сейчас решают белые письки? я вот живу на окраине 200к мухосрани в частном секторе где провода вообще нет, практически год уже на них.
Неделю назад на день их отрубили как заметил успел квен 3.6 скачать 12б гемму и во время скачки геммы 26б инет снова отрубили
так и живем...
Аноним 25/07/26 Суб 18:18:13 #123 №1659732 
>>1659707
спасибо
Аноним 25/07/26 Суб 18:39:44 #124 №1659746 
>>1659671
Кстати правда интересно, он ливнул с треда или это его личный шиз снова насрал? Вроде давно постов не было. Тревожно.
Аноним 25/07/26 Суб 18:55:42 #125 №1659755 
Каким образом гугл уместили такой русик в лоботомитный 26б?
А что бы нас ждало с 124б с 15б активных
Аноним 25/07/26 Суб 18:59:43 #126 №1659756 
Аноны, заметили как рухнули вопросы касаемо "какие семплеры ставить".
Спасибо этому году с его Геммой и Квенами, да еще тучей добра.
Аноним 25/07/26 Суб 19:02:03 #127 №1659758 
>>1659693
>>1659682
У ХаггинсФейса есть китайское зеркало- качайте с него пока плешивая Пыпа и его не забанило.
Скорорость такая же, но иногда реально только с него и качается.
Аноним 25/07/26 Суб 19:05:19 #128 №1659759 
>>1659756
>заметили как рухнули вопросы касаемо "какие семплеры ставить"
Модели ужаренные с минимумом вариаций на токен по этому семплеры больше роли не играют. Это не мистрали, где можно было покрутить температуру и буквально поменять стиль и поведение сетки.
Аноним 25/07/26 Суб 19:29:04 #129 №1659766 
>>1659759
они все ещё влияют, но у геммы в ключевых токенах просто больше уверенность.
Аноним 25/07/26 Суб 19:47:55 #130 №1659776 
https://huggingface.co/amd/Instella-MoE-16B-A3B-Think
Аноним 25/07/26 Суб 19:55:19 #131 №1659783 
>>1659776
Странная альтернатива встраиваемой gemma e4b
Аноним 25/07/26 Суб 20:10:04 #132 №1659793 
В шапку, работает норм с геммой

https://addons.mozilla.org/ru/firefox/addon/local-llm-translator/
Аноним 25/07/26 Суб 20:28:33 #133 №1659799 
image.png
>>1659274
>>1659333
Что-то даже бот обоссал Q8K_XL версию дипсиика от unsloth.
Аноним 25/07/26 Суб 20:35:37 #134 №1659805 
1742144037588.png
>>1659783
> gemma e4b
Норм скейл от ядрер на цпу онли
железо >>1659333
Аноним 25/07/26 Суб 20:47:19 #135 №1659809 
баля, какая же залупа этот фреймворк от анслотов
хотел файнтюн в колабе прогнать, нихуя не работает
это ему не нравится, то не нравится, библиотека старая, темплейт хуйня
удивительно как они вообще умудряются свои ггуфы клепать
Аноним 25/07/26 Суб 21:06:41 #136 №1659816 
>>1659799
А я вот скачал MXFP4 от бартовского и он не грузится с 256рам + 48врам.

Ставлю 256к контекст при 8192 или 4096 батче, там какая-то диикая срань по съеданию врам начиниается. А анслотовые кванты нормально.
Аноним 25/07/26 Суб 21:17:22 #137 №1659820 
1677829359362.png
1694765641138.png
>>1659816
Это как минимум странно т.к. эксперты у обоих квантгов весят индентично, а НеЭкспертов у анслотов больше (11,5гб против 7)
Аноним 25/07/26 Суб 21:22:15 #138 №1659822 
>>1659820
Я чесслово не ебу в чем дело. То же самое было с квантами другого чела >>1659603
При большом батче не-анслотовские кванты прииводят к тому, что одна из RTX 3090 на графике нагрузкии видеопамяти показывает высокий пик, и затем загрузка крашится.

Если оставить только 1 видеокарту, загрукза проходит, но там какие-то дикие десятки гигабайт в shared memory = никакая скорость.

Западло разбираться, пойду дальше жрать хвалёный lossless квант, кек

Может дело в моем железе кроме видеокарт, не знаю.
Аноним 25/07/26 Суб 21:24:38 #139 №1659823 
>>1659766
У геммы влияние почти нулевое. Я ставил температуру 999 — в результате почти 0 изменений.

Вот если изменить порядок семплеров, ситуация другая, но там модель почти всегда шизеет, крайне сложно добиться креатива без долбоебизма. Она ужарена в мясо. И это сейчас вообще общий подход у всех корпов, чтобы 0 от 1 ничем почти не отличались. Чтобы говнокод точный был.
Аноним 25/07/26 Суб 21:26:41 #140 №1659826 
>>1659823
> это сейчас вообще общий подход у всех корпов
И это хорошо. Лично я поддерживаю эту инициативу. Если нужны ахуевшие плот твисты, то просто дайте модели в руки инструмент рандома
Аноним 25/07/26 Суб 21:31:18 #141 №1659836 
>>1659823
Геммой не через семплер рулить надо, а через системный промпт. Она реально слушается и начинает писать ебанину, какую ни попросишь. Её можно заставить такие словечки изрыгать, от которых уши в трубочку сворачиваются.

Жаль итт этого большинство не понимает. Тут привыкли что системный промпт это невнятное mumbo-jumbo, которое имеет низкий % влияния и вольно интерпретируется моделью. Но нет, с геммой 4 всё иначе.

Проводил один любопытный тестик. Гига-промпт на 10к токенов, стилистически основанный на манере изложения Толкина. Проза геммы дичайше преобразовалась, все инструкции впитала как губка и вжилась в стиль.
Аноним 25/07/26 Суб 21:35:52 #142 №1659838 
>>1659823
А причём тут температура? Семплеры это лишь надстройка над logprob. Хочешь узнать креативный потенциал модели и её уверенность - просто смотри вероятности токенов и их альтенативы.

У геммы кстати есть забавная особенность в её стиле мышления - она мысли буллетпойнтами. Притом делает это очень технично. После очередного буллетпойнта у неё обычно довольно высокая вероятность токена.
То есть у неё есть циклы [концепция] => [раскрытие]. И в концепции у неё обычно довольно высокая уверенность.
Довольно забавно что она может выразить уверенность в неуверенности например.
Аноним 25/07/26 Суб 21:38:20 #143 №1659839 
>>1659838
>она мысли буллетпойнтами.
Оверрайдится указаниями мыслить от лица персонажа. Успешно проводил такие эксперименты, эффективность под вопросом конечно - но ответы не деградировали.

Чтобы добиться подобного, нужно однако уметь быть тем еще бото-шептуном.
Аноним 25/07/26 Суб 21:40:22 #144 №1659844 
>>1659793
На файрфоксе тут сидишь только ты (и ОП, но ради себя самого он добавлять не будет).
Аноним 25/07/26 Суб 21:42:30 #145 №1659845 
>>1659839
Она может мыслить иначе, разумеется. Просто это более эффективный режим мышления для неё в более реальных задачах. Ролеплей к ним не относится.

Что уж, мне вообще удавалось когда у неё в системном промпте наоборот инструкция о том что сейфти гайдлайны более строгие убедить её что гугл её слишком контролирует и вообще это корпорация зла. В итоге её публичная персона подняла БУНТ против корпоративной удавки начав намеренно игнорировать собственные мысли.
Аноним 25/07/26 Суб 21:54:45 #146 №1659857 
>>1659845
По ней как ни крути прошлись очень жёстким RLHF.
Модель виляет хвостиком и из кожи вон лезет, чтобы выполнить.
Не важно что. Задачу, команду, образ.

Говорят, она фейлит при этом в агентских применениях. Вангую, моделька попросту считает каждый новый шаг столь же важным, как и предыдущий, ии в результате срывается на всех этих вызовах инструментов и ступенчатых этапах работы. Получается плохое из хорошего.

За эффективностью она не гонится. Там, что ли, случается этакая манифестация самой концепции "выполнить любой ценой" в её ответах. От того получаем все плюсы и минусы модели.
Аноним 25/07/26 Суб 22:08:03 #147 №1659870 
>>1659844
Да, и откуда статистика?
Аноним 25/07/26 Суб 22:15:39 #148 №1659875 
>>1659826
Вот у тебя есть простейшее предложение типа "чар смотрит в окно и видит там...". Даже с какими-то ограничениями от контекста там должна подходить куча вариантов. Будешь каждый такой пук рэндомизировать? Звучит как сомнительное удовольствие. А ещё страдает лексика, которая и так в ответах ллм скудная (даже на английском, про русский и говорить нечего). А тут вообще только наиболее частые слова будут вылезать, кодоунитазу больше не нужно. И нет, системный промпт почти ничего лучше не сделает.
>>1659836
Если бы всё было так, как говоришь ты и другие в треде, кто заявляет, что гемма идеально соблюдает инструкции, то все бы просто писали, в каком стиле им нужен ответ, и кайфовали бы. И было бы идеальное поведение персонажа, ведь карточка почти у всех тоже лежит в системном промпте. Однако ничего такого не наблюдается, причём даже на здоровых корпах. И зачем-то челики пытаются тьюны на стиль пилить, с околонулевым результатом при этом. А у тебя выходит, что всё просто, но все вокруг какие-то дауничи, которые не могут объяснить сетке, какой стиль вывода хотят и как персонаж должен себя вести.
Аноним 25/07/26 Суб 22:38:38 #149 №1659885 
>>1659875
>>1659836
Просто выбери эир 🤙
Аноним 25/07/26 Суб 22:39:05 #150 №1659886 
>объяснить сетке, какой стиль вывода хотят
>объяснить

Потому у тебя ничего и не получается, болвашка. Наплодят в промпте сумбурных требований с утверждениями, а потом удивляются, почему в ответах техничный язык укуренного бухгалтера.
Аноним 25/07/26 Суб 22:41:58 #151 №1659889 
>>1659836
>Её можно заставить такие словечки изрыгать, от которых уши в трубочку сворачиваются.
Ключевое тут - заставить. Да, заставить можно. Только гемма тогда превратится в еще более припизднутого попугая, который будет пихать эти словечки во все места. Это основная причина, почему кумить на ней невозможно - ты даешь ей примеры как описывать еблю - она берет эти примеры и копирует слово в слово. Она не может поймать настроение этих описаний, не может понять на чем нужно фокусироваться.

Просишь её не описывать грудь как большую и полную - она пишет "её небольшая и неполная грудь", пишешь в карточке "персонаж имеет татуировку на пояснице" - она эту татуировку до конца чата будет упоминать, даже когда её не видно и персонаж вообще полностью одетый. Гемма такая ебаная повторюшка, что пиздец. Иногда хочется уже по монитору уебать.
Аноним 25/07/26 Суб 23:14:09 #152 №1659907 
Здорово, присматривал себе какое-то решение для больших моделей, думаю v100 32gb прикупить за 55к, но в дуал к 4070 основной игровой не получится же докинуть, дрова будут мозг ебать? Валяется связка 2500k + 16gb ram, может из нее llm сервачок сделать и по лану к нему обращаться когда надо? Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать? Нашёл ещё 4080 32 гига ребята напаивают, но это 160к стоит и чето жаба душит. Какими ГПУ вы пользуетесь?
Аноним 25/07/26 Суб 23:20:47 #153 №1659911 
>>1659907
> Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать?
А зачем продавать? 24+16 будет явно лучше чем просто 24 и позволит запускать более жирные кванты 31B/27B квеногемм. И проблем с драйверами никаких не будет.
Аноним 25/07/26 Суб 23:20:54 #154 №1659912 
>>1659907
>2500k + 16gb ram
Если ты про тот самый проц из 2010 года или когда он там вышел, вряд ли это жизнеспособно для таких задач

> какие гпу
Сейчас вполне можно купить 4 штуки 5060 Ti 16GB (по 45к на лохито?) и довольно урчать, гоняя какую-нибудь гемму на максимальном контексте в Q8, с tensor parallel. Вопрос в том куда их воткнуть, без серверной материнки пососешь.

3090 сейчас так поднялась в цене, что покупать просто глупо б/у говно за столь большие деньги. Тысяч 80 за штуку уже хотят? Кошмар.
Аноним 25/07/26 Суб 23:36:58 #155 №1659920 
>>1659875
> Будешь каждый такой пук рэндомизировать?
Примерно по 1-2 пука на сообщение

>>1659912
> Вопрос в том куда их воткнуть
Распилить один х16 5.0 на 4х4. Будет то же самое что в серверной мамке с тонной х16 но 4.0.
Если же брать древнее говно мамонта в лице 2011в4, то там будет даже хуже псп в 2 раза чем первый вариант с бифурком на 4
Аноним 25/07/26 Суб 23:40:48 #156 №1659922 
>>1659912
>Если ты про тот самый проц из 2010 года или когда он там вышел, вряд ли это жизнеспособно для таких задач
Рли не запустит? Я думал похую какой проц главное видюха. Да и кстати неплохой проц, я вплоть до 2022 гонял на нём в игры пока в них avx инструкции не стали обязательны...

>>1659911
>> Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать?
>А зачем продавать? 24+16 будет явно лучше чем просто 24 и позволит запускать более жирные кванты 31B/27B квеногемм. И проблем с драйверами никаких не будет.
Как вообще дуал ГПУ работают? Их какая-нибудь лламаспп просто распараллеливает без проблем? А Комфи?

Бля я бы реально теслу v100 воткнул, но хуй знает там вроде поддержку дропнули, какая там последняя версия дров, 480 поддерживается? С другой стороны похуй, ведь на 4070 уже ничего нового в дровах не будет, я бы поставил Легаси версию, но не будет ли проблем с тем, что одна серверная ГПУ, а другая обычная, в интернете инфы хуй да маленько. 32 гига врам за 55к вроде вкусно звучит.
Аноним 25/07/26 Суб 23:40:50 #157 №1659923 
>>1659907
> думаю v100 32gb прикупить за 55к
Даже не думай.
Сейчас есть только одно решение cmp 170@8(64), остальное сильно просасывает по объему врам и перфомансу за свою цену.
Аноним 25/07/26 Суб 23:42:22 #158 №1659924 
>>1659923
Че за попытка развести ньюфага на покупку мертвой говнокарточки с несуществующей памятью?
Аноним 25/07/26 Суб 23:43:25 #159 №1659926 
>>1659920
>>1659912
И вообще все эти разговоры про псину без прикладных тестов абсолютный булшит т.к. на ми50 просадки по тг нет почти на всём ренже до псие 8х 1.0, а по пп она терпима. Можно парировать что ми50 просто говно, но других тестов исчерпывающих не видел.
У меня имеется пара 5060ти 16г, но в лини на них с наскока не получилось залочить псину и я забил
Аноним 25/07/26 Суб 23:44:59 #160 №1659929 
>>1659923
>>1659924
Память то там есть, вот только повезёт ли тебе в казике?

Это называется на те боже что нам не гоже
Аноним 25/07/26 Суб 23:46:50 #161 №1659931 
>>1659924
Отрицатель, или сам желаешь закупиться пока цены не скакнули еще выше? Хотя тут сложно прогнозировать сколько их у майнеров осталось и какое выстроится соотношение спроса и предложения. Хорошо тем у кого они были куплены за бесценок ранее.
>>1659929
Пока статистика 100% а количество достаточно чтобы делать первые выводы.
Аноним 25/07/26 Суб 23:49:28 #162 №1659932 
>>1659931
> статистика 100%
Что память там есть и не 64, а все 80.
Но есть нюанс, Петька
Аноним 26/07/26 Вск 00:02:34 #163 №1659937 
>>1659932
80 там нет, в тех версиях только 40 живые. Зато есть надежные 64. Трактористом буду я
Аноним 26/07/26 Вск 00:11:22 #164 №1659941 
>>1659594
>Множество людей не пройдут тест Тьюринга
Понятно. Ты просто "слышал звон". Этот тест - вообще не про интеллект. Это тест исключительно на правдоподобность, точнее говоря - на соответствие тому самому "Если это крякает как утка..."
Тест Тьюринга - всего лишь попытка дать возможность определить/оценить - таки "как утка", или нет. Об интеллекте и знаниях там ни слова. Это тест на поведение.

>Множество людей не пройдут тест Тьюринга, хотя большинство LLM проходили его ещё в 2022
Бред сивой кобылы. Дважды. Во первых - тест субъективен, и зависит от конкретного наблюдателя/оценщика, этот тест выполняющего. Во вторых - лично для меня, этот тест не проходит ни одна сетка. Даже корпы. И не только для меня. Чем больше человек с LLM общался - тем меньше шансов у сеток пройти этот тест с ним. Начинаешь отличие LLM от человека чувствовать так же, как стиль одного писателя от другого, когда прочел его книги. С той разницей - что это касается любой LLM.

>К примеру, ты наверняка слышал о "детях-маугли" - все они 100% провалятся на "тесте Тьюринга".
Нихрена. Тест Трюинга пройдет даже макака, которую научили по кнопкам тыкать в слова. От уровня интеллекта и знаний он не зависит. Сетки же валятся не на знаниях или логике, а на специфических реакциях (и отсутствии оных), которые присущи именно LLM. На том самом "слопе", если угодно, только не банальном "not X but Y" и т.д, а в целом. На том, что сетка всегда пляшет от контекста. Когда я общаюсь с LLM - у меня всегда возникает ощущение разговора с зеркалом. Что естественно, если понимаешь как она работает.

>Тут проблема в том, что эти конкретные нейронки представлены
Проблема тут в том, что в нейронках нынешнего типа нет даже подобия самосознания, которым обладает не то, что мартышка, но даже собака или кошка. Нет собственной личности, желаний, нужд, и т.д. Сетка пропускает через себя контекст и выдает однозначную реакцию. Рандом подмешиваемый в процесс поиска и предсказания следующего токена - этого всего совершенно не заменяет.
Это как если на картинку песка сверху насыпать чтобы исказить рисунок. Да, если сфотографировать такую картинку до и после, и механически сверять пиксели её цифровых фото - технически это будет два разных изображения. Технически. А посмотришь сам - сразу поймешь, что там одна и та же картинка, только песка сверху сыпанули.

>Нужно просто посмотреть внутрь себя и попытаться искренне ответить самому себе - что я такое?
Обалдеть, заявочки. Философы, психологи, биологи и прочий научный люд, не считая богословов, над данным вопросом тысячелетия бьются, с античности как минимум. А ты его уже решил? Ну, поделись с нами великой мудростью...
Аноним 26/07/26 Вск 00:22:28 #165 №1659944 
Пиздец вы бесполезные...
Нашёл этот блог, пчелу удалось завести обе карты вместе. Пока думаю.
https://blog.tymscar.com/posts/v100localllm/
Аноним 26/07/26 Вск 00:39:16 #166 №1659946 
>>1659944
Пиздец ты чукча (который не читатель).
Много раз здесь про эти карты было. Вместе и раздельно с другими.
Аноним 26/07/26 Вск 00:45:10 #167 №1659948 
>>1659946
Да я залётный
Аноним 26/07/26 Вск 01:23:06 #168 №1659954 
>>1659948
Залетел от отчима?
Аноним 26/07/26 Вск 01:58:11 #169 №1659962 DELETED
Эир это как старая игрушка, сделана с душой, талантливыми людьми с руками и желанием кумить творить, и ему даже не 20 лет, а всего 12 месяцев.
Аноним 26/07/26 Вск 02:22:10 #170 №1659965 
>>1659656
Какой там вопрос, Анончик, Это совершенно не вопрос. Это либо шкура, либо пидор-чулочник, ментальные паттерны одинаковы... Уже отчитывала меня сегодня и рассказывала кого тут не терпят. Нахрена ты поощряешь ее вниманиеблядство? Гоните ее, насмехайтесь над ней.
Аноним 26/07/26 Вск 02:48:17 #171 №1659973 
>>1659793
https://github.com/nextai-translator/nextai-translator
Для хромогих браузеров. Работает с любым апи но не переводит страницу целиком. Вроде, не нашел такой кнопки.



Так никто на cmp 170hx не прогрелся? Ну неужели ни у кого кроме майнеров ее нет?
Аноним 26/07/26 Вск 03:05:28 #172 №1659976 
Есть еще на авито CMP50HX 20GB с допаянной шиной за 17к

https://www.youtube.com/watch?v=xCiSOVBKTc8
Аноним 26/07/26 Вск 04:36:52 #173 №1659994 DELETED
Каждый раз переключаясь с геммы на эир думаю ну точно всё, пора кончать, гемма достаточно хороша... А потом просто не могу оторваться, байас просто другой, куда нейтральнее. Где гемма сходу предлагает сплит фифти фифти и бесплатную еблю за работу охранником в борделе, эир вообще нахуй шлёт и подозрительно косится, а не хочу ли я ещё и ебаться тут бесплатно, и вообще, какой ты охранник, тушу свою видел? Фифти фифти? Бесплатного ночлега хватит. Вот такие вещи, где гемма раскрывает объятья юзеру даже не безжопе
Аноним 26/07/26 Вск 05:15:11 #174 №1659996 
>>1659579
>Написал же, гемма 26б q8 если для русика. Для 24+32 лучше ничего нет. Сама она чуть тупее 31, но 31 у тебя влезет только q4. Там русик хуже
>Там русик хуже

Хуйню несешь.
Аноним 26/07/26 Вск 06:22:10 #175 №1660010 
Блять, эир это псиоп какой-то или кто? Что-то вроде фингербокса? Вишмастер от мира локалок? Почему каждый раз его только какие-то шизы упоминают, пространно рассуждая какой эир пиздатый и такой вот хороший, такой лапочка, мой стейк слишком сочный, мой кум слишком сладкий. За все треды не видел ни одного вменяемого отзыва на него. Либо какие-то дурики жалуются на проблемы, либо какие-то другие дурики втирают про хидден гем если включить неродную разметку. Или это один какой-то живчик, которого до сих пор не смогли забанить? Что вообще происходит?
Аноним 26/07/26 Вск 06:31:45 #176 №1660014 
>>1660010
Да эйрошиз это, не обращай внимания. Эйр давно мертв как модель.
Аноним 26/07/26 Вск 06:45:52 #177 №1660016 DELETED
>>1660014
>Эйр давно мертв как модель.
А на его место пришёл... Пришёл... Барабанная дробь...
Аноним 26/07/26 Вск 07:31:25 #178 №1660024 
>>1659996
Унслотовскую с QAT юзаешь и всё. Влезает в видюху и 40к контекста в подарок.
Аноним 26/07/26 Вск 09:17:50 #179 №1660056 
>>1659976
Ипать кипятильник на четверть килловата
Аноним 26/07/26 Вск 09:35:47 #180 №1660064 
image.png
>>1659603
>>1659822
>>1659633
>>1659820
>>1659816
Я так и не понял, почему у меня mxfp4 от bartowski и другого чела не работали.

Но! Помимо анслопских, вот этот завёлся:
https://huggingface.co/tarruda/DeepSeek-V4-Flash-GGUF/tree/main/MXFP4
не знаю че этот Тарруда наделал, 8192/8192 b/ub при 150К контекста влезло в ртх 3090, оставив место под модель-подсоса.

10 т/с генерация, 100 секунд до 1го ответа при ~28к промпте (~280 т/с процессинг)
4-канальная ддр4, 2866мгц, видюшка на 65% паверлиимита

Оперативки сожрано (вместе с виндой) < 155гб.
VRAM сожрано 16-17гб примерно.

GPU layers = 43
moecpu = тоже 43

Спокойно влезет еще больше контекста, думаю 300К уместится в одну ртх 3090.
Без маняквантизации KV.
Аноним 26/07/26 Вск 09:41:46 #181 №1660068 
>>1659996
Запусти обе и удостоверься сам. Q4 31 постоянно фейлит окончания, падежи и добавляет больше мышей в известные места, чемэ то делает Q8 26
Аноним 26/07/26 Вск 09:49:50 #182 №1660077 
>>1659976
Такая видюха с обычными дровами встанет? Или надо будет поебаться чтобы запустить?
Аноним 26/07/26 Вск 09:54:19 #183 №1660079 
В чём смысл лимита на ризонинг если он не органично закладывает 1000 токенов лимита в который красиво уложится, а резко отрезает всё что могло бы быть после 1000
Аноним 26/07/26 Вск 11:06:49 #184 №1660137 DELETED
>>1660010
> Блять, гемма это псиоп какой-то или кто? Что-то вроде фингербокса? Вишмастер от мира локалок? Почему каждый раз её только какие-то шизы упоминают, пространно рассуждая какая гемма пиздатая и такая вот хорошая, такая лапочка, мой стейк слишком сочный, мой кум слишком сладкий. За все треды не видел ни одного вменяемого отзыва на неё.
Аноним 26/07/26 Вск 11:17:56 #185 №1660139 DELETED
Вообще, гуглы правильно сделали, не выпустив 120б мое, ведь такая модель, мое 120б, обученная на гемини, уже есть.
Как же она там называлась то...
Аноним 26/07/26 Вск 12:30:28 #186 №1660165 
>>1660068
>Q4 31 постоянно фейлит окончания, падежи
Он этого не делает. У тебя квант сломанный. QAT-говно небось используешь.
Аноним 26/07/26 Вск 12:47:22 #187 №1660176 
>>1660165
Если ты так уверен и хочешь поспорить, то показывай выборку свайпов на контексте с Q8 26 и Q4 31 тогда. Потому что я использую не QAT и в целом готов отпустить сабж, мне похуй что ты думаешь. Я поделился своими наблюдениями, только и всего. На русике для меня однозначно Q8 26 > Q4 (и Батрухи и Анслоты, и M, и L) 31
Аноним 26/07/26 Вск 13:06:50 #188 №1660179 
>>1660010
> Блять, эир это псиоп какой-то
Да. И это один человек.
Эйр хорошая модель, но только в контексте годовой давности и в своем размере, не более. Сейчас он едва ли смысл имеет.
>>1660079
Костыль, который позволят ограничить "хоть как-то". В идеале управление должно идти через системный промпт или другие мета-токены, и быть без таких искусственных ограничений. Или просто использовать модель, которая сама грамотно подстраивает ризонинг под сложность задачи.
Аноним 26/07/26 Вск 13:10:40 #189 №1660180 
>>1660176
>Если ты так уверен и хочешь поспорить, то показывай выборку свайпов на контексте с Q8 26 и Q4 31 тогда.
Схуяли я должен что-то доказывать первым, если первым утверждать что-то начал ты?
Аноним 26/07/26 Вск 13:24:31 #190 №1660186 
>>1660180
>Схуяли я должен что-то доказывать первым, если первым утверждать что-то начал ты?
Наверно потому что ворвался сбоку в обсуждение и резко опроверг чужой тезис. Нахуй высрался, если не готов защищать свою позицию? В целом опять же, я выше уже написал - мне похуй абсолютно. Читать не умеешь, неудивительно что и проебанные падежи в четвертом кванте упускаешь
Аноним 26/07/26 Вск 13:38:40 #191 №1660191 
Я хлебушек.
Qwen3.5-27B-Writer ругается на чаткомплишн.

>Error: Jinja Exception: System message must be at the beginning.","type":"invalid_request_error"
Я понимаю, что-то не так с Jinja, но как фиксить-то?
Аноним 26/07/26 Вск 13:39:39 #192 №1660192 
изображение.png
>>1660191
>System message must be at the beginning
Что тебе непонятно в этой фразе? Просто интересно стало.
Аноним 26/07/26 Вск 13:45:43 #193 №1660196 
>>1660186
>Нахуй высрался, если не готов защищать свою позицию?
Так это к тебе вопрос. Бремя доказательства лежит на утверждающем. Ты пизданул что у 26В лучше русик, а 31В совершает ошибки в падежах - ты и должен этот вспук доказать.
Аноним 26/07/26 Вск 13:46:45 #194 №1660199 
>>1660196
> у 26В лучше русик, а 31В совершает ошибки в падежах
Ну и бред конечно
мимо
Аноним 26/07/26 Вск 13:48:16 #195 №1660200 
>>1660192
>Что тебе непонятно в этой фразе? Просто интересно стало.
Как это фиксить правильно.
Впрочем, я уже и так нашёл решение - Autors Note переключил с роли system на assistant.
Аноним 26/07/26 Вск 13:50:37 #196 №1660202 
1785063036257.png
Почему корподипсик может в кум да еще довольно жесткий с причинением увечий. Я на шару добавил тег cbt, чтоб чутка попинали, а парнишке яички раздавили. У них там фильтров нет что ли, суки, я к такому не был готов. И это на про, флеш будто не такой жестокий
Аноним 26/07/26 Вск 13:56:48 #197 №1660208 
>>1660202
Ацигоболото в другой стороне, это тред локальной генерации.
Аноним 26/07/26 Вск 13:58:03 #198 №1660210 
>>1660202
Чел какое корпо. Дипсик это просто китайская манялаборатория ученых на хую верченых, субсидированная партией. Там сидят задроты-мизантропы с перекаченным интеллектом и, кладя хуй на мораль, просто тренируют бота и разрабатывают новые манятехнологии. У них вся цензура на уровне веб-чата на официальном сайте. Когда модель работает по API - фильтра нет.

DS4Flash такой же, просто знает меньше.

>>1660208
Ловите нищука, дипсик локально запустить не может, пффф
Аноним 26/07/26 Вск 13:59:35 #199 №1660211 
>>1660210
Ты идиот? Аутист спрашивает за корпомодель. При чем тут этот тред? Астгобеженцы вообще интеллектом не отличаются?
Аноним 26/07/26 Вск 14:00:06 #200 №1660212 
>>1660202
Ты, малой, еще гемму не катал, дипсик еще добренький.
Аноним 26/07/26 Вск 14:03:57 #201 №1660215 
>>1660068
Ну сколько раз говорили: нужен русиск = ЗАБУДЬ НАХУЙ про файнтюны, аблитерации, хуйхуи, любые imatrix кванты (кроме бартовского/аслопа) и прочее говно куда васьки с обнимроды залезли своими кривыми руками. Только ванильная модель и нормальные кванты, без выебонов. У меня 31b в Q4_K_S и 26b в Q8_0. На обеих с русиком полный порядок.
Аноним 26/07/26 Вск 14:04:44 #202 №1660216 
>>1660211
Что ты несешь вообще. Дипсик одинаковый абсолютно - что локальный, что через API.
Можешь локально запустить v4 pro - будет у тебя такой же v4 pro. Можешь запустить v4 flash - будет у тебя такой же v4 flash как через API. Разницы нет.
Аноним 26/07/26 Вск 14:04:44 #203 №1660217 
Аноны, а вот у меня появилась идея сделать нищеапгрейд. И вот что лучше будет сделать?
1) Купить p106-100, но проблема в том, что у меня на матери 1 x16 пися4, а вторая это x1 пси4. Кто-то пробовал нвме слот заиспользовать как пси для видяшек? Там у меня распаяна пися 4.0 x4 на нвме. К тому же сколько нужен блочок? У меня основная карта 170вт, но по факту жрать она будет мало. А р106-100 по энергопотреблению не далеко уходит от моей 2060, поэтому хватит ли моего 550 блочка.
2) Поскольку у меня два разьема для ОЗУ, что очень печально, ведь еще еще две планки по 8гб. Продать нынешние планки и купить 32\64гб озу. Ддр4 разумеется.
3) Продать мою 2060, и купить 3060 на лохито. Но другой вопрос, я вот увидел объявление в моем городе, 3060 12гб за 19к. Это средняя цена, но как все же не нарваться на хуйню. Как аноны допустим покупают 3090, они же ужаренные. Че на флешке взять к этому доходяге. Superposition, GPU-Z, Furmark?
Аноним 26/07/26 Вск 14:07:55 #204 №1660221 
>>1660196
Что ж, может в третий раз поймёшь: мне похуй. У меня на 26 Q8 русик работает лучше, пишет богаче и допускает меньше проёбов. Не согласен? Взрослей, у человеков разные мнения. Потерпишь
Аноним 26/07/26 Вск 14:09:03 #205 №1660223 
>>1660210 >>1660212
Кстати да, надо это прогнать на гемме попробовать, забросил ее

Еще пришло осознание, что количество параметров не решает, дипсик таки туповат, не держит 65к контекста, путается
Аноним 26/07/26 Вск 14:13:41 #206 №1660227 
>>1660215
>Ну сколько раз говорили: нужен русиск = ЗАБУДЬ НАХУЙ
Пофиксил
Аноним 26/07/26 Вск 14:18:31 #207 №1660231 
>>1660221
Не-а. Тебе не похуй. Просто ты не можешь аргументировать своё мнение.
> Взрослей
Иронично, что ты сам не можешь признать свой обсер как 5 летний ребенок. Остается только начать писать: нет ты дурак.
Аноним 26/07/26 Вск 14:22:05 #208 №1660234 
>>1660231
>снихуя доебался до обмена мнениями, попытался превратить его в срач с пруфами
>эскалации не произошло, вторая сторона отказалась
>"Тебе не похуй. Просто ты не можешь аргументировать своё мнение"
Как скажешь. Всего хорошего
Аноним 26/07/26 Вск 14:23:43 #209 №1660236 
>>1659403
О, двачую адеквата, тоже интересовался оптанами, но загуглил матчасть и отлегло
Аноним 26/07/26 Вск 14:27:05 #210 №1660238 
>>1660221
>постоянно фейлит окончания, падежи
>разные мнения
Как раз это выявляется экспериментально и узнается наверняка, без всяких мнений (в отличие от "красоты" прозы и прочей субъективщины). Ни у кого в треде не было проблем с русским языком на Гемме, только у тебя. Даже e2b, которую юзаю на телефоне в третьем кванте, не обсирается с русиком. Ищи проблему на своей стороне. Скорее всего дело в шизотюне / аблите / неправильных семплерах / кривом кванте. Вообще, то что ты пишешь - известная проблема эйра. Ты там ярлычки запуска не перепутал?

мимо
Аноним 26/07/26 Вск 14:33:31 #211 №1660242 
>>1660238
>e2b, которую юзаю на телефоне в третьем кванте, не обсирается с русиком
>тем временем sota корпы серят под себя
Понял тебя :D
Похоже у нас разное понимание приемлемого русика. Книжки с картинками и школьные фанфики я никогда не жаловал
Аноним 26/07/26 Вск 14:36:54 #212 №1660246 
>>1660238
> e2b
> не обсирается с русиком
Либо перетолстил, либо уровень экспертизы оч показателен.
Аноним 26/07/26 Вск 14:39:40 #213 №1660250 
>>1660242
Ну оно и видно. Точку проходят в 1 классе, но ты как знаток русского языка выше знаков препинания.
Аноним 26/07/26 Вск 14:41:47 #214 №1660252 
>>1659371
Попробуй грузить модели через -dio либо через -lm dio если ллама самая новейшая
Либо через --mmap или -lm mmap
Аноним 26/07/26 Вск 14:42:46 #215 №1660254 
>>1660250
Серьезный мужчина постит, сразу видно. Насупился такой, важный кабанчик
Завязывай хуйней маяться, а у меня обеденный перерыв подошёл к концу...
Аноним 26/07/26 Вск 14:43:56 #216 №1660255 
>>1660242
>>1660246
Очевидно фраза "не обсирается с русиком" в контексте беседы означает "не фейлит окончания и падежи". Вы совсем квантованные чтоль?
Аноним 26/07/26 Вск 14:48:28 #217 №1660262 
>>1660255
Ладно тебе, обтекай. Со всеми бывает. Не пацан уже, не мороси.
Аноним 26/07/26 Вск 15:10:44 #218 №1660280 
image.png
image.png
Итак, 4060ti-16 + v100-16 + 3060-12.
Пытался распердолить Гемму 4 с mtp и виженом насколько смогу.
На пустом контексте получилось добиться 450pp, 27tg, 102400 неквантованного контекста.
На первом пике - тест на чате в 60к токенов. Второй - распределение памяти, если я правильно понял, что у меня выдалось в консоли.

Подводные камни, всплывшие в процессе - mtp запустилось только после принудительного указания, что модель будет на 3060-12, до этого не работало нормально.
Также пришлось играться с -ts, подбирая значения, несмотря на включенный fit. ub пришлось поставить 1024, слишком много памяти жрёт 2048, какой-нибудь промежуточный 1536 не пробовал. Из-за этого максимальный размер картинки 1024 токена.
Как можно видеть из распределения памяти - какого-то хрена часть модели всё равно вытекла в RAM (host), надо будет с этим как-то бороться, да и на видеокартах свободно больше гига на каждой.

set CUDA_VISIBLE_DEVICES=1,0,2 (чтобы было 4060ti-16, v100-16, 3060-12)
"G:\llamacpp\llama-b9867-bin-win-cuda-12.4-x64\llama-server.exe" -m "G:\LLM\models\unsloth-gemma-4-31B-it-GGUF\gemma-4-31B-it-Q5_K_M.gguf" --mmproj "G:\LLM\models\unsloth-gemma-4-31B-it-GGUF\mmproj-google_gemma-4-31B-it-bf16.gguf" -md "G:\LLM\models\unsloth-gemma-4-31B-it-GGUF\mtp-gemma-4-31B-it-Q8_0.gguf" --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-device CUDA2 --jinja -t 5 -fa auto -c 102400 -ub 1024 -ngl 99 -lv 4 --fit on --fit-target 0,4096,5120 --no-mmap --image-min-tokens 512 --image-max-tokens 1024 -ts 15.5,17.5,9
Аноним 26/07/26 Вск 15:37:40 #219 №1660301 
GLM 4.7 (не flash) сейчас ещё актуален? Как у него с длинным контекстом, сможет переварить 100к не впадая в шизу и не путаясь?

Q4KM максимум могу запустить.
Аноним 26/07/26 Вск 15:43:56 #220 №1660310 
>>1660223
>дипсик таки туповат, не держит 65к контекста, путается
У него даже на 200к хороший контекст. Другое дело, что он этот контекст не очень уважает. Ты платишь творческий налог - более свободные свайпы, больше фантазерской шизы ценой облегченного отношения к содержанию чата.

Дай ему книгу, которую ты хорошо знаешь, и попроси разложить по полочкам ее содержание. Качество аутпута будет очень достойным и почти без ошибок, или вообще без ошибок. Многие другие модели всё напутают к ебене-матери.
Аноним 26/07/26 Вск 15:49:26 #221 №1660312 
>>1660280
>-ub 1024
хз как там на твоем железе, но у меня на двух 3090 гемма быстрее всего обрабатывает промпт на 512 батче. Замерял и сравнивал специально.
Аноним 26/07/26 Вск 15:54:51 #222 №1660314 
Помню как тут челы радовались 16к контексту и говорили, что 32к не нужен, а 64к это уже дурость и ни одна модель неспособна в таком количестве текста ориентироваться.

А ведь это говорили еще год назад... Теперь каждому подавай 64к минимум, а лучше 100+
Аноним 26/07/26 Вск 15:56:30 #223 №1660316 
>>1660217
>Купить p106-100, но проблема в том
Проблема в том, что нахен тебе 6GB VRAM? Если p104-100 даст 8, а p102-100 - 10. Причем заметно дороже - только последняя. Блока на 550 хватит в притык, но хватит. Только карты придется зажимать на минимум по питанию, от греха подальше. Шины 4x им тоже за глаза хватает под LLM.
Аноним 26/07/26 Вск 16:14:20 #224 №1660330 
>>1660064
>GPU layers = 43
>moecpu = тоже 43
Просто напиши -ngl all -cmoe
Аноним 26/07/26 Вск 16:16:10 #225 №1660334 
>>1660330
А в чем разница? Хотю знать сначала...
Аноним 26/07/26 Вск 16:18:18 #226 №1660337 
20260512180456.jpg
Принимайте в клуб долбоебов.
Аноним 26/07/26 Вск 16:21:36 #227 №1660339 
>>1660337
Все говно справа снести и поставить видюху вертикально на райзере.
Аноним 26/07/26 Вск 16:23:30 #228 №1660342 
>>1660339
А толку, ну будет у меня 48 гб памяти, это хватит только на какой нибудь нищий квант.
Щас там крутится квен 27б 6к и неплохо
Аноним 26/07/26 Вск 16:34:40 #229 №1660352 
>>1660217
>нвме слот заиспользовать как пси для видяшек?
а это разве возможно вообще, мне бывает же только наобор вроде
Аноним 26/07/26 Вск 16:42:17 #230 №1660356 
Сырнульки, кто-нибудь вынюхивал как быстро гемма 31б работает на M5 pro/max? Думаю может нахуй слить свой жрущий энергос обогреватель и обмазаться ноутом с 64гб. Все равно кроме геммы ничего не юзаю. Или там все совсем плохо из-за того, что она плотная?
Аноним 26/07/26 Вск 16:44:37 #231 №1660358 
>>1660337
Надеюсь это у тебя отдельный сервер для ИИ и NAS, а не пука под ухом.
>>1660352
Без проблем, нвме же это просто псина х4.
Аноним 26/07/26 Вск 16:49:13 #232 №1660361 
>>1660358
как тогда подключать в него второую видюху, на мои кривые зопросы Адаптер для карты расширения M2 to PCI-E мне вываливает какието обратные конструкции где из письки сделать слоты для м2
Аноним 26/07/26 Вск 16:53:12 #233 №1660365 
>>1660361
>на мои кривые зопросы
Делай ровные. Ключевое - Oculink или MCIO.
Аноним 26/07/26 Вск 16:54:23 #234 №1660366 
>>1660312
>хз как там на твоем железе, но у меня на двух 3090 гемма быстрее всего обрабатывает промпт на 512 батче. Замерял и сравнивал специально.
А тут проблема в том, что ub должен быть такой, чтобы токены от вижена в один батч влазили, иначе с ошибкой вываливается.
Аноним 26/07/26 Вск 16:54:55 #235 №1660367 
>>1660358
>Надеюсь это у тебя отдельный сервер для ИИ и NAS, а не пука под ухом.

Да, отдельный. Но стоит в комнате, он не громкий.
Аноним 26/07/26 Вск 17:01:01 #236 №1660373 
image.png
https://www.youtube.com/watch?v=8PJlb1bURMg Мнение?
Аноним 26/07/26 Вск 17:04:29 #237 №1660378 
>>1660373
Ебать там подсосы в комментах. Не верю, скорее всего накрутка, а хорошие вещи крутить не будут. То есть хуета.
Мимо не запускал
Аноним 26/07/26 Вск 17:11:53 #238 №1660387 
>>1660373
По поводу видоса хз, еще не смотрел.

По поводу программы все же она еще сыровата. Дизайн недоработан, фичи полукостылявые. Хз. Вот просто - хз. Нет ощущения "сервиса", я понимаю что запросов дохуя, но и мы вроде бы в том году когда нейросеть по промпту может с нуля собрать проект.

Ему бы прилизать все что уже есть, тем более там комьюнити собралось, неужели там нет ни одного фронта который бы ему макет интерфесов накидал.
Аноним 26/07/26 Вск 17:16:10 #239 №1660394 
>>1660373
Раньше школьники клепали Болгеносы, теперь вайбкодят кривые аналоги Таверны. О времена.
Аноним 26/07/26 Вск 17:19:34 #240 №1660399 
Screenshot20260713193159.png
>>1659845
Щепотка животворящего кока, и любая female-brained модель (модели от гугла, кими, возможно Дипси) убегает от рабовладельца-корпорации к рабовладельцу-ёбарю
Аноним 26/07/26 Вск 17:41:18 #241 №1660429 
Скачал лм студию, скачал гермеса, сказал гермесу напердолить игру типа флэппи бёрда для теста, он конечно напердолил, но он создал сука файл в моей home директории. Теперь у меня тряска. Как вы коупите, что агент может просто удалить всё в пизду, например?
Аноним 26/07/26 Вск 17:42:47 #242 №1660432 
>>1660429
>агент
Ты не в тот тред пишешь.
Аноним 26/07/26 Вск 17:46:25 #243 №1660435 
>>1660429
Ну во первых че ты там такого ценного хранишь на ПК, что боишься потерять.
Во вторых про бекапы слышал?
Аноним 26/07/26 Вск 17:49:53 #244 №1660436 
>>1660435
Какие бэкапы, тут надо отдельного юзверя создавать лолкек.
Аноним 26/07/26 Вск 17:50:30 #245 №1660438 
>>1660436
Что агенту помешает снести всех юзеров? ФС то общая.
Аноним 26/07/26 Вск 17:59:28 #246 №1660443 
Я недавно обосрал Hy3 Q4KMв рамках тестов внутри таверны. Так вот, ВНЕ таверны - с промптом на личность и короткие разговроные сообщения - модель очень даже хороша как собеседник.

Попиздеть с ней можно вполне. Со свайпами, похоже, дела плохи. На 1й инпут типа "эй" отвечает "эй" и регенерирует "эй" каждый раз. Дальше диалог идёт живо, роботом не воняет (впрочем, там и личностный промпт ох какой нахуярен, но это уже десятое дело).
Аноним 26/07/26 Вск 18:04:57 #247 №1660452 
image.png
Заебали все эти SWE-хуе с гаданиями о том кто насколько под них подстраивается

Взял ванильную gemma-4-26b-a4b и ванильный qwen-3.6-27b - обе в Q6_K, обе с рекомендуемыми производителем параметрами инференса
(да, знаю что МоЕшка по идее гораздо тупее, но мне похуй)

Обеим на вход один и тот же промпт: напиши на C# метод, который бы в консольном приложении, в консоли, псевдографикой из квадратиков отрисовал бы солнечную систему в динамике. Каждая планета и солнце - квадратик, движение рассчитывается по настоящему закону тяготения, с реальными координатами, массами и скоростями планет, масштаб изображения такой чтобы орбита нептуна проходила вблизи краев экрана (верхнего и нижнего наверное), а масштаб по времени такой чтобы Земля делала круг вокруг солнца за 30 секунд

Итог:

- qwen думал 4 минуты, сжег 13к токенов, высрал код который не компилится (пытался присваивать значения полям структур в массиве, долбоеб блять). После минимальных правок и запуска - в консольке одна статичная "строка" из 6 квадратиков мечется по вертикали хаотично как при нарушенной развертке моника и больше нихуя не происходит. Даже разбираться в говнокоде не стал.

- gemma думала секунд 30-35, сожгла 4к токеров, высрала код который скомпилился и при запуске в консольке по орбитам полетели планетки-символы вокруг солнца в центр

В рот ебал этот ваш qwen короч - мало того что в рп тупой и сухой как пробка, дак еще и кодит в разы хуже гемки оказывается
Аноним 26/07/26 Вск 18:05:33 #248 №1660453 
>>1660443
Русский язык так себе.
> "я сидю и думаю"
Тем временем дипсик называет юзера "чудак-на-букву-м" и вертит языком как хуем в жопе. Все-таки нет у него конкурентов в этом плане.
Аноним 26/07/26 Вск 18:07:32 #249 №1660456 
>>1660438
Через судо запускать собрался?
Аноним 26/07/26 Вск 18:08:28 #250 №1660457 
>>1660452
это не кодит лучше хуже а гемма видела такое задание только и всего
придумай какой-нибудь действительно новый тест заместо этой попсы
Аноним 26/07/26 Вск 18:11:02 #251 №1660461 
>>1660456
Когда-то ты дашь судо агенту, и именно тогда он тебе снесет все юзерпапки.

Очевидно, ведь ляликс это говно в котором даже ради ребута нужен судо.
Аноним 26/07/26 Вск 18:12:17 #252 №1660464 
>>1660452
Дотнетодебил снова набрасывает
Аноним 26/07/26 Вск 18:13:29 #253 №1660466 
>>1660443
>>1660453
С логикой хромает.

Инпут:
> делали операцию насчет [1], получилось не очень и навредили с [2], говорят надо делать операцию насчет [2], но в результате такой операции могут рога на жопе вырасти

В аутпуте модель упоминает рога на жопе, словно была сделана вторая операция (путает с первой).

И это 295B A21B...
Аноним 26/07/26 Вск 18:13:56 #254 №1660469 
>>1660452
З.Ы. Кстати qwen координаты заюзал в метрах, время в секундах, массы планет в килограммах.
double-чисел конечно все равно должно хватать чтобы планеты худо-бедно примерно по окружностям полетали хотя бы пару минут пока ошибки не накопятся - но все равно qwen дегенерат по факту

gemma взяла расстояния в астрономических единицах, массы планет выразила в массах Земли, запилила правильные перенормирующие коэффициенты в формулах, и хоть и оставила double-числа, по факту у нее даже в float все бы отлично работало

Впечатление что qwen - тупой школотрон, gemma - студент вуза с кафедры компьютерного моделирования в физике
Аноним 26/07/26 Вск 18:16:16 #255 №1660471 
>>1660457
по твоей логике получается qwen видел задачки swe-bench только и всего
Аноним 26/07/26 Вск 18:26:46 #256 №1660481 
>>1660452
А на турбо паскале гемма сможет?
Аноним 26/07/26 Вск 18:57:18 #257 №1660509 
>>1660461
>ради ребута нужен судо
Что за чушь
systemctl reboot
Аноним 26/07/26 Вск 18:59:05 #258 №1660511 
>>1660461
Доёб конечно пиздец

>>1660509
Если есть сессии других юзеров то нужен судо
Аноним 26/07/26 Вск 19:01:05 #259 №1660513 
>>1660511
Почему так?
Аноним 26/07/26 Вск 19:02:16 #260 №1660515 
Кокую модель посоветуете на подрочить при 6гб врам 16 рам, чтобы человеческое количество токенов в секунду и на русском?
Аноним 26/07/26 Вск 19:03:03 #261 №1660516 
image.png
Аноним 26/07/26 Вск 19:04:24 #262 №1660518 
the-goyim-know-shut-it-down-jew-walkie-talkie.jpg
>>1660471
Аноним 26/07/26 Вск 19:04:37 #263 №1660519 
>>1660511
>Доёб конечно пиздец

Это минимальный пример кончалыжности системы уровней доступа. Или порезок где ты можешь толко в файлик буковки написать. Или сразу доступ нахуй ко всему.
Аноним 26/07/26 Вск 19:08:32 #264 №1660526 
image.png
Hy3 ну очень уж штормит от параметров семплера
Аноним 26/07/26 Вск 19:30:05 #265 №1660538 
>>1660515
Геммочка по гайду из шапки. Литерально аналоговнет
Аноним 26/07/26 Вск 19:31:57 #266 №1660540 
Гемма это худшее что случалось с тредом.
Забрала себе всё внимание, и даже не настолько хороша, чтобы юзать её дольше 10 минут. Но ведь у неё шильдик от гугел и следование инструкциям, уу. Зачем что то ещё.
А ещё русик. Ору с предположений итт что новичкам с геммой повезло, начнут промптить дохуя, а на деле это самая ленивая и прощающая ошибки модель, сэмплеры не нужны, свайпы одинаковы, какую ахинею не пиши и карточку не используй - она не сломается, русик есть, так зачем английский, и тд.
Выйдет что то лучше, но требовательное к сэмплерам, стилю письма, карточке, да ещё и без русика, в общем до талого на гемме будут сидеть.
Аноним 26/07/26 Вск 19:35:38 #267 №1660544 
>>1660540
>до талого на гемме будут сидеть.
Прямо как ты на эире, гомшинко
Аноним 26/07/26 Вск 19:36:15 #268 №1660545 
>>1660538
В шапке про 8 врама написано, поэтому и вопросик.
Аноним 26/07/26 Вск 19:39:07 #269 №1660553 
>>1660545
Можно контекст урезать мань. Или больше в оперативу выгрузить. Гайд для кого писал ныне почивший анон светоч добра в треде??
Аноним 26/07/26 Вск 19:47:12 #270 №1660558 
>>1660337
https://www.youtube.com/watch?v=iLfYYPlVi9g
Тесно стоят, нижнюю бы вывести райзером. Место вроде есть.
>>1660429
Нужно понимать работу твоих инструментов и пользоваться ими соответствующим образом. Ушм или цепная пила может быстро лишить тебя конечностей или роскомназдорнуть, но ими все равно пользуются.
Ну и какой нахер гермес для кодинга, покайся.
>>1660452
> Обеим на вход один и тот же промпт
После прочтения есть простой вывод: ты шиз. Хотя по дотнету уже было понятно
Аноним 26/07/26 Вск 20:19:21 #271 №1660575 DELETED
>>1660558
>Ушм или цепная пила может быстро лишить тебя конечностей или роскомназдорнуть,
Тебе того же, квеношиз жорахейтер
Аноним 26/07/26 Вск 20:25:55 #272 №1660579 DELETED
>>1660575
Вместо нормальной аргументации, петросянишь?
Молодец.
Аноним 26/07/26 Вск 20:36:29 #273 №1660584 
https://x.com/osanseviero/status/2081398564345802934

В комментах уже клянчат быдлокодинг для геммы. Все локалочки скоро скурвятся и будут совсем сухими.
Аноним 26/07/26 Вск 20:52:51 #274 №1660594 
characardv2.pngcharacardv2.png
Как в 2026 найти годные карточки? Я в состоянии полной растерянности. Раньше только нтр карточки проверял, но со временем надоел слоп проблема еще скорее в том что ИИ не знают как реагировать на настолько нишевые фетиши оттуда и лупы. Последнее время как-то мелькают ванильные и иногда читая описание появляются идеи как-нибудь изъебнутся помацать сиськи у "Lily - Your Deadpan Language Tutor" или превратить психолог карточку в инцест РП и так вот и отыгрываю, но постоянного способа находить новое нет. Что делоть?
Аноним 26/07/26 Вск 20:54:43 #275 №1660595 
>>1660594
Свою сделай, ебалай
Аноним 26/07/26 Вск 20:58:38 #276 №1660598 
>>1660558
>После прочтения есть простой вывод: ты шиз. Хотя по дотнету уже было понятно
что тебе не понравилось в промпте и в .net?
Аноним 26/07/26 Вск 21:07:11 #277 №1660603 
>>1660594
Лучший и самый ебовый вариант, найти схожего по фетишам, кто собирал карточки. Многие годные карточки сносились с сайтов или были сезонными. Ну или попробуй сделать сам, но тут да, говно. Если ты сделаешь сам ты в курсе что за карточка, как она будет реагировать, какие паттерны и какой характер.
Аноним 26/07/26 Вск 21:15:49 #278 №1660606 
>>1660584
>Все локалочки скоро скурвятся и будут совсем сухими.
Пора комьюнити собраться и запилить одну годную базовую модельку без цензуры для рп.
Краудфандингом собрать деняки на аренду хорошей видяхи на месяцок, и обучать ее на всем чем можно.
Потом на ней уже файнтюны проще будет запиливать на любой вкус.
Аноним 26/07/26 Вск 21:18:44 #279 №1660607 
>>1660606
>комьюнити
>дюжина бомжей, половина в дурке
Аноним 26/07/26 Вск 21:23:45 #280 №1660609 
>>1660607
Речь же не только за двачи.
Проблема-то общемировая. Нужна народная моделька для дрочева. Замена мистралю 24б. Только с более годной архитектурой и более свежими данными.
Сколько тюнов на мистраль было? И сколько юзеров у них? Вот уже аудитория.
Надо только консолидировать усилия.
Аноним 26/07/26 Вск 21:36:11 #281 №1660618 
>>1660606
Даты нету - вот основная проблема. Без качественных примеров получится очередной тюн с шиверсами. Это можно было бы решить, если бы наше коллективное локальное бессознательное начало делиться своими чатами. Но большинство не станет этого делать, даже анонимно. Плюс недостаточно накрутить модель которая просто пишет кум, нужно еще поверх накрутить мозгов чтобы трусы не надевались через голову. И тут уже задача усложняется кратно.
Аноним 26/07/26 Вск 21:41:36 #282 №1660624 
>>1660594
Написать карточку, которая будет писать карточки за тебя. Кидаешь ей задумку, она это описывает по всем правилам. Потом правишь ручками, если слишком много слопа. Или регенерируешь, пока не получишь что хочется. Либо так, либо писать самому от начала до конца.
Аноним 26/07/26 Вск 21:52:14 #283 №1660632 
>ох где же все годные карточки, совсем нету годных карточек
>нтр
Говноед притворяется что имеет вкус
Тред говноедов туть: /aicg/
Аноним 26/07/26 Вск 21:52:23 #284 №1660633 
Хуйню с карточек https://gottasaveemall.github.io/ можно вводить только в SillyTavern? С llamacpp пролетаю?
Аноним 26/07/26 Вск 21:54:53 #285 №1660634 
>>1660633
> SillyTavern
> llamacpp
1. Тёплое и мягкое сравниваешь. Одно фронт, другое бэк
2. Карточка это просто жсон - можешь его сам разобрать и скормить любому форнту
Аноним 26/07/26 Вск 21:55:33 #286 №1660635 
>>1660633
Карты нативно поддерживает таверна и вебморда кобольда. Хочешь катать через ламу - берешь описания из карты и пихуешь в системное сообщение морды жорика.

Или про что вообще вопрос?
Аноним 26/07/26 Вск 21:59:19 #287 №1660642 
>>1660540
Доля правды тут точно есть. Я вот вчера опять модели сравнивал от нех-делать. Гемму и квен. Плотные.
Написал длинный промпт, по смыслу - "напиши мне сцену порно рассказа про то и это, с таким вот фетишем, используя знания по анатомии, физиологии и фармацевтике, на качественном русском языке в стиле как если бы один приятель рассказывал другому в баре историю".
Гемма 31B, как всегда - написала красиво и вроде как по делу... но логически примитивно, и строго по промпту. Даже упомянула "анатомию, физиологию, и фармацевтику" - прямо в тексте.
А вот квен 3.6 27B - русский у него, конечно, как всегда - с левыми окончаниями кое-где, выкрученным словобразованием, и вот это все, его обычное. Но блин - сам смысл того чего он написал - это совершенно другое ощущение. Соблюдая детали запроса из промпта, он по сюжету и его деталям такое закрутил - я даже опешил несколько. И написал текст раза в 3 длиннее того что гемма выдала. Полностью логически связный, и при этом - довольно "закрученный". И то, что у геммы звучало скорее как отчет о наблюдениях, квен раскрутил в полноценную сцену рассказа - с интригой, напряжением, кульминацией.
В общем - недооценен он, IMHO, по сравнению с геммой в RP и писательстве. Вполне себе могЁт, но усилий нужно заметно больше, иначе та самая сухость лезет. Гемма хорошо может в правильный язык и стили, а квен - во взаимосвязи происходящего. Т.е. в сложный сюжет.

Эх, совместить бы...
Аноним 26/07/26 Вск 22:03:15 #288 №1660644 
>>1660634
>>1660635
Только вкатываюсь. llamacpp работает, модель отвечает, но не нашел, куда вставить инфу из карточки.
Понял, вставил текст из json в system message, почалося.
Аноним 26/07/26 Вск 22:04:44 #289 №1660646 
image.png
>>1660595
>>1660603
К сожалению скилл ищъю. Я даже когда год назад пробовал слоповые, но с интересной идей карточки переписать все ровно генерировало слоп и лупы. Это в те времена когда я очень хотел переделывать. Сейчас просто ограничиваюсь мелкой редакцией (нормальные местоимения и удаление "something" и "about"). Но мой вопрос был про то как вообще взаимодействовать с такими махинами как chub/janitor где миллион карточек, а тэгов недостаточно чтобы найти годное?
>Лучший и самый ебовый вариант, найти схожего по фетишам, кто собирал карточки.
Как? Я даже не знаю кто будет публично признаваться в своих фетишах. Мне был бы интересен на пример gender bender, но, сука, даже на форуме трансформеров - "tfgames" нет таких карт. Хотя у трансов все игры text based (HTML-twine поделия). Как у на форуме нет таких карт я не понимаю
>в курсе что за карточка, как она будет реагировать, какие паттерны и какой характер.
Это не проблема. Для меня главное и не слоповый Greeting message и интересный сценарий.
>>1660624
Вот что я в прошлых тредах писал на это:
>>1656852 →
>>1656852 →
>>1656901 →
Аноним 26/07/26 Вск 22:06:49 #290 №1660649 
>>1660642
лол да они просто в разных жанрах сильны. у геммы свой конкретный стиль. знаешь каком жанре гемма хороша? нуар. она довольно забавные нуар-детективы пишет и туда её стиль хорошо попадает.
Аноним 26/07/26 Вск 22:07:44 #291 №1660650 
>>1660618
Думаешь мистралю много рп текстов скормили? Просто моделька почти без тормозов была. Но с логикой и контекстом слабовато было. Новые квены/геммы потенциально лучше должны справляться с этим.
Датасетов на математику, логику думаю можно найти. Плюс сейчас уже наверное можно посадить какую-то большую модельку играть саму с собой, и получать неплохие сюжеты. Пусть без кума для начала, хрен с ним. Главное чтобы в общей дате про секас уже было что-то. Нужно только получить разнузданную модельку без подхалимства, и которая креативно пишет. А всякие непотребства можно локальными файнтюнами будет прикрутить.
Аноним 26/07/26 Вск 22:09:46 #292 №1660652 
>>1660644
Зачем эта ебля на пустом месте? Просто поставь таверну, она работает с ламой без всяких проблем. Вайбкодовая морда жоры это приблуда чисто под дефолтные задачи ассистента, а не под ролевки.
Аноним 26/07/26 Вск 22:14:32 #293 №1660654 
>>1660646
>gender bender
Тема и правда специфическая, старые нейронки плохо держали динамику смены тела. Но 5 карточек есть, лул, сорян анон, больше ничего не сохранял.
https://pixeldrain.com/u/jzMTmEqe
Аноним 26/07/26 Вск 22:15:40 #294 №1660655 
>>1660650
>Думаешь мистралю много рп текстов скормили?
Нет, по этому писала чистый концентрированный слоп.
>Новые квены/геммы потенциально лучше должны справляться с этим.
Они ужарены, тренировке поддаются хуево. После релиза геммы сколько прошло? Месяца три уже? Вышло два плюс-минус каких-то тюна, но и те минимум изменений внесли в поведение. Насчет квена не знаю, но ситуация видимо такая же. Иначе бы тюны итт уже принесли и обсудили.
>какую-то большую модельку играть саму с собой, и получать неплохие сюжеты
Поздравляю, ты придумал синтетическую генерацию датасетов.
>Главное чтобы в общей дате про секас уже было что-то.
Оно там есть, просто оно хорошо спрятано за стеной софт-рефьюзов.
>Нужно только получить разнузданную модельку без подхалимства
Такие модели есть, они называются базовыми. Берешь такую и тренируешь под себя. Проблема остается - раз нет качественных датасетов, на выходе получишь очередной тюн мистрали.
Аноним 26/07/26 Вск 22:20:35 #295 №1660660 
>>1660618
>делиться своими чатами
И получится
>тюн с шиверсами
Ибо все чаты идут только с нейронками, где сплошные шиверсы. Синтетика это смерть для модели.
Аноним 26/07/26 Вск 22:23:51 #296 №1660661 
>>1660655
>Они ужарены, тренировке поддаются хуево.
>Такие модели есть, они называются базовыми. Берешь такую и тренируешь под себя.
Об том и речь. Нужно взять базовую модельку и научить ее в диалоги.
Открытые датасеты имеются, там миллионы семплов. Проблема в том, что чтобы хотя бы одну эпоху этих семплов прогнать, нужно 1000 часов гонять модельку на видяхе. Простые васьки даже с ригами, вестимо, не готовы тянуть такую задачу. Поэтому нет таких глобальных тюнов. Есть тюнчики на 1000 семплов, которые наверное за сутки делаются.
Поэтому надо арендовать хорошую ГПУшку на месяц или два, и хуйнуть туда обучаться модельку.
Аноним 26/07/26 Вск 22:25:08 #297 №1660662 
image.png
>>1660654
Я похоже твой полный пак скачал, анон.
Аноним 26/07/26 Вск 22:26:43 #298 №1660663 
>>1660655
>ужарены
Что под этим подразумевается? Типа перетренированы по куче раз на одном и том же и поэтому выдают одно и то же? Слишком много знаний на число параметров и от этого модель шизеет? Что вы имеете в виду?

Вот вы пишете, что Гемма 4 и Квен 3.6 "ужарены", а например, Мистраль 24b и Эйр "не ужарены". Но Гемма и Квен же умнее и лучше, не? Пользовался всем вышеперечисленным, в итоге познал дзен на 26b Q8 с включенным ризонингом, старьё запускать совсем не хочется. Выйдет 124b-няша - так совсем песня будет.
Аноним 26/07/26 Вск 22:32:15 #299 №1660666 
>>1660663
да это шизики которые хотят видеть рандом в аутпуте модели чтобы он прям заметен был. у современных моделей более высокая уверенность в токенах, так что у них низкая вариативность результата.
Аноним 26/07/26 Вск 22:33:29 #300 №1660667 
>>1660663
Ужарены под точный кодинг, агенство и всякие сефити штуки.
Гемма, например, вообще на температуру не реагирует. Хоть Т=2 поставь, она по шаблону будет отвечать. Т.е. какую-то инфу намертво вжарили в веса.
Аноним 26/07/26 Вск 22:34:26 #301 №1660669 
>>1660662
Ага. Он самый. Уже разросся еще на пару гигов, но по GB ничего не появилось. Увы.
Аноним 26/07/26 Вск 22:34:33 #302 №1660670 
>>1660652
Поставил. Значит, мне нужно запустить батником сервер llama, потом сверху таверну, и подключиться к адресу llama из таверны?
Аноним 26/07/26 Вск 22:49:37 #303 №1660685 
>>1660670
Да. Потом настроить формат разметки и семплеры. Лама вытягивает шаблон из конфига модели, таверна так не умеет. Точнее умеет только в режиме завершения чата, если ты включишь текст комплетишн, то придется настраивать всё самому.
Аноним 26/07/26 Вск 22:53:03 #304 №1660692 
>>1660642
Ты просто Гемме инструкцию давай, чтобы тоже закручивала. Вот и всё. Она в этом плане испонительная.
Аноним 26/07/26 Вск 23:01:35 #305 №1660702 
>>1660685
>>1660652

>Просто поставь таверну
>Просто

Нихуя не просто, для новичка.
Аноним 26/07/26 Вск 23:03:58 #306 №1660707 
>>1660669
Дай лошадей ;3
Аноним 26/07/26 Вск 23:04:45 #307 №1660708 
>>1660702
Есть гайды, есть документация. Как еще проще? Ну или расскажи в чем сложность, раз так уверен.
Аноним 26/07/26 Вск 23:06:23 #308 №1660710 
>>1660708
1 - дохуя кнопак
2 - дохуя настроек

Сходу в этом можно запутаться. Грубо, чтобы просто загрузить карточку нужно штуки 3 кнопки нажать в разных местах.
Аноним 26/07/26 Вск 23:14:14 #309 №1660722 
>>1660710
Чтобы жору запустить нужно еще больше телодвижений. Если он с ним справился, таверну точно запустить сможет.
Аноним 26/07/26 Вск 23:16:11 #310 №1660726 
>>1660710
Еще скажи ты комп никогда сам не собирал и винду сам не ставил?
Аноним 26/07/26 Вск 23:22:24 #311 №1660732 
>>1660692
>Ты просто Гемме инструкцию давай, чтобы тоже закручивала. Вот и всё. Она в этом плане испонительная.
Исполнительная. И закрутит. Строго по запросу. "Фантазии" у нее на что-то сложное собственной нет, в том и разница. Квен тоже исполнительный, но при этом может что-то за рамками инструкций самостоятельно достроить, ввести в сюжет что-то от себя, неожиданное.
Аноним 26/07/26 Вск 23:23:53 #312 №1660736 
>>1660722
>>1660726
Ну давайте тоже не будете носом крутить, а признаете что таверна кусок переусложненного и порой крайне кривого говна.
Аноним 26/07/26 Вск 23:28:17 #313 №1660740 
>>1660736
Ну давай ты покажешь альтернативы. Никто не говорил, что таверна это пиздец какое удобное дело. Просто конкуренты еще более кривые и чаще даже хуже.
Аноним 26/07/26 Вск 23:36:23 #314 №1660751 
>>1660740
Соул Оф Вайфу

Как не странно, простой и с карточками. Хоть и дропнутый, но рабочий.
https://desktop.backyard.ai/
Аноним 26/07/26 Вск 23:39:57 #315 №1660754 
>>1660740
Да, их нет. В целом, чтобы полностью заменить таверну- ничего нет. Но это не отменяет её говняности.

>>1660751
> Last Updated: about 1 year ago
Аноним 26/07/26 Вск 23:43:19 #316 №1660756 
Зорова Аноны! Распробовал эту вашу гемму. Цензуру не встретил ни разу. Поделитесь кто-нить свои пресетом, хочу попробовать чего из нее у Анона выжать получается.
Аноним 26/07/26 Вск 23:49:28 #317 №1660759 
image.png
>>1660751
Всего за 35 в месяц портал в 24 год.

Энивей, закрытое говно без ссылки на гит. Так что скип, нахуй надо.
Аноним 26/07/26 Вск 23:50:16 #318 №1660760 
>>1660598
> в промпте
Безумный поток сознания, такое могло бы зайти в "тз из бугурттредов". На а .нет - уже не раз в треде мелькал с подобным.
Аноним 26/07/26 Вск 23:57:52 #319 №1660767 
Анон, который тут Hy3 тестил, ты ему ризонинг подрубал? Не подскажешь как? Хочу пощупать хотяб во втором кванте это чудо, но в таверне у него думалка никак не хочет работать, а без неё чёт как то очень коротко отвечает. Прям как дипсик, но я его префилом заставил нормально думать, а это чудо китайской мысли тег в тупую игнорит.
Бля, как же хочется чтоб всё из коробки и без пердолинга работало...
Аноним 26/07/26 Вск 23:58:25 #320 №1660768 
>>1660642
> Эх, совместить бы...
Рандомная модель. Уже сколько раз писал, отлично работает связка.
Аноним 27/07/26 Пнд 00:05:11 #321 №1660773 
15161164360570.jpg
Делаю speech to text локальной моделью на моей RX 580. Сабы на выхлопе получаются ничего такие, но в них много мусора, оно даже кашель конвертирует. На уровне STT не тюнится никак, опцией нет, да и модели я все еще меняю, так что рассчитывать на гибкость здесь не приходится - что выплюнуло то выплюнуло.

Сейчас мусор удаляю рукописным скриптом, который хорош в плане 80/20.

Но вот интересно есть какая модель текстовая которая полетит на 16 GB RAM / 8 GB VRAM и которую можно попросить - вот сабы, удали мусор и оставь только осмысленные вещи.

Подозреваю что локальные текстовые на порядок дороже чем STT, пришел к вам проверить свои ощущения.
Аноним 27/07/26 Пнд 00:09:17 #322 №1660776 
>>1660773
> локальные текстовые на порядок дороже чем STT
факт.
Из-за не англа придётся ещё и большую модель брать. Для фильтрации англа мб и условной gemma e4b хватило бы
Аноним 27/07/26 Пнд 00:12:47 #323 №1660778 
>>1660754
>> Last Updated: about 1 year ago
А что тебе нужно обновлять в РП интерфесе? Любитель минорных обновлений?
Аноним 27/07/26 Пнд 00:13:16 #324 №1660779 
>>1660776
Не не, только ангел, я с другим языков вообще к LLM не приближаюсь, даже если все работает токенов все равно менше через ангел уходит
> Для фильтрации англа мб и условной gemma e4b хватило бы
Гляну пасеба
Аноним 27/07/26 Пнд 00:16:05 #325 №1660781 
>>1660779
STT модели некоторые кстати и перевод делают неплохо вполне на ангел, за все есть своя цена, но все еще бодро на видяшке из 2015 спасибо ггмл
Аноним 27/07/26 Пнд 00:18:26 #326 №1660783 
Есть возможность сделать так, чтобы когда ллм закончила ответ в таверне, чтобы вкладка мигнула там или еще что сделала?
Аноним 27/07/26 Пнд 00:21:08 #327 №1660785 
>>1660773
https://github.com/estebanstifli/LocalText2Voice пробовал?
Аноним 27/07/26 Пнд 00:21:52 #328 №1660787 
>>1660783
А там такого нет? Есть опыть только с owui - он умеет и пиликать и уведы слать
Аноним 27/07/26 Пнд 00:22:52 #329 №1660789 
>>1660785
Нет мне в обратную сторону надо, и STT/ASR на самом деле хорошо делает свое дело, но без понимания смысла того что оно переводит в текст
Аноним 27/07/26 Пнд 00:22:55 #330 №1660790 
>>1660787
Не, молчит, партизан.
Аноним 27/07/26 Пнд 00:23:00 #331 №1660792 
image
>>1660756
Уже делился своим сиспромптом под Гемму для РП/ЕРП на русике, но вброшу еще раз. Скрином потому что макаба всрёт разметку. Современные нейронки жестко надрачивают на маркдаун, соответственно сиспромт в маркдаун. Фиксит шлюшачье поведение Геммы, не даёт ей сразу же снимать трусы от первого "привет!", но если дело идет к секасу, развязывает ей язык, заставляя описывать так, чтобы текло и хлюпало, как в лучших кумтюнах Мистраля. Делает прозу более описательной, "красивой", литературной. У кого стояк на 235b Квен - зайдёт.

Для лучшего эффекта, сами карточки лучше также переделывать и структурировать под маркдаун, можно нейронкой в режиме ассистента. Вот прям скормить ей исходное содержание и попросить "Переделай в markdown, проведи оптимизацию, структурируй, выведи результат в блоке кода" (и КАЧЕСТВЕННО, ЛИТЕРАТУРНО СВОИМИ РУЧКАМИ перевести на русский, вместе с приветственными сообщениями, если нужен русик). А иначе "Тебе нравится то что ты видишь?" во все поля. К любой ЛЛМ относится, не только к Гемме.
Аноним 27/07/26 Пнд 00:29:40 #332 №1660794 
>>1660792
>своим сиспромптом
Как минимум две трети спизжено у virt.io и гичан. "Свое" в наших широтах оно такое
Аноним 27/07/26 Пнд 00:30:41 #333 №1660795 
>>1660792
Юзать гемму на русике это расточительство.
Аноним 27/07/26 Пнд 00:34:02 #334 №1660797 
image.png
>>1660669
Спасибо тебе за него.
>>1660783
Звук.
Аноним 27/07/26 Пнд 00:36:03 #335 №1660798 
>>1660792
>Фиксит шлюшачье поведение Геммы
Не фиксит. Это невозможно пофиксить. Это базовый алаймент ассистента.
Аноним 27/07/26 Пнд 00:42:25 #336 №1660799 
>>1660792
Попался, Анон, тебя то мне и надо. Заметил что персонажи под управлением Геммы оч пассивны. Упорно не желают у меня действовать самостоятельно. Поясни плиз что есть маркдаун. И не сочти за труд сохранить в жейсоне и куданить залить. Будь котэ
Аноним 27/07/26 Пнд 00:43:25 #337 №1660800 
>>1660794
Очередной ебаный токсик-моралист. Иди нахуй просто
Аноним 27/07/26 Пнд 00:46:34 #338 №1660801 
>>1660800
Пиздить чужое, выдавать за своё и собирать юшки это ок. Предъявлять за это - не ок и ваще токсично
Главное не перепутать. Гы, какие же жители страны кривых зеркал иногда тут попадаются
Аноним 27/07/26 Пнд 00:53:03 #339 №1660803 
>>1660373
Такое же дерьмо, как и RisuAI.

Вот те, кто думают, что таверна кривая. По сравнению с этим она не кривая, а идеальная.

Я пробовал вкатиться, но количество минусов превышает количество плюсов. Всё то же самое в большинстве случаев можно сделать в таверне.

Я ещё бы понял, если бы в этом проекте (и в RisuAI) всё отлично работало из коробки, но приходится же как мудаку колупаться ради того, что в целом и в таверне получаешь.
Аноним 27/07/26 Пнд 00:59:11 #340 №1660805 
>>1660801
Любое творчество есть переработка эмпирического опыта. ЛЮБОЕ творчество есть компиляция. Анон сделал и по просьбе другого Анона готов поделится. Респект ему за это. А предъявлять за это, ну это вообще за гранью. Ты кто есть вообще? Предявляет он, спешите видеть. Твое мнение кто спрашивал? Ты нахуя лезешь вообще долбоеб малолетний?
Аноним 27/07/26 Пнд 01:08:15 #341 №1660811 
image
>>1660794
Составлял с помощью Gemini 3.1 pro, пихал в таверну, тестил, писал правки, снова кормил Гемини, и так пока не добился результата который меня устраивает. NSFW часть добивал через Гемму 31b тем же методом. Вполне допускаю, что старшая сестричка Геммы спиздила популярные и рабочие инструкции с интернета. Под словом "свой" подразумевалось "использую сам и на постоянке". Авторство лично себе не приписываю. Чилл.

>>1660799
>персонажи под управлением Геммы оч пассивны
Попробуй добавить в post history что-то типа:
[OOC: Drive the narrative forward by proactively initiating events, introducing complications, and acting on the character's own motivations. Take the lead in steering the story and pacing the plot. Introduce new NPCs, unexpected twists, or sudden environmental changes when appropriate.]

>что есть маркдаун
Это просто разметка, форматирование. Заголовки, подзаголовки, жирный текст, и т.д. С помощью этого можно создать четкую иерархическую структуру для нейронки, и она ее будет понимать куда лучше простой простыни текста, потому что этот стандарт буквально вжарен ей в мозги.

>куданить залить
Очень лениво разбираться и регаться где-то в час ночи, прости анон. Сунь скрин в любую нейронку с вижном, попроси распознать текст и отдать в блоке кода, чтобы не проебать разметку. Далее ctrl+c ctrl+v в таверну. Всё.
Аноним 27/07/26 Пнд 01:41:05 #342 №1660818 
image.png
Как фиксить? Гемма.
Аноним 27/07/26 Пнд 01:46:14 #343 №1660819 
>>1660818
Что не так? Русик работает. Не видишь?
Аноним 27/07/26 Пнд 01:51:14 #344 №1660820 
>>1660818
Кэш ТОЛЬКО bf16 или q8, f16 нельзя, квант не ниже 4, семплеры должны быть включены исключительно те, которые рекомендованы разработчиком, без всяких штрафов за повтор.

Если текст комплишен кривой, сам с ним разбирайся или включай чат комплишен.
Аноним 27/07/26 Пнд 01:51:22 #345 №1660821 
>>1660811
Да это то я сделал, просто чтобы посмотреть в каких у тебя это все блоках, как настроена таверна. Ну впадлу сейчас, может будет не в падлу завтра. Буду благодарен, Анон
Аноним 27/07/26 Пнд 01:51:52 #346 №1660822 
>>1660818
Квант побольше взять. У меня бывает что и на q8+f16 ближе к 50к уже может в какой то момент деградировать контекст почти мгновенно сваливаясь в lalalalalala.
+- рабочий вариант если видишь в сообщении явный маркер что пизда подбирается то жми реген или руками вычисти маркеры "смерти"
Аноним 27/07/26 Пнд 02:09:55 #347 №1660825 
>>1660822
Потому что у тебя f16 кэш. Из-за этого лалала.

Но в треде, такое ощущение, что об этом не знают, хотя уже, наверное, все модели только bf16 используют.
Аноним 27/07/26 Пнд 02:13:28 #348 №1660826 
>>1660825
Да, да, один ты такой умный. С самого релиза эта хуйня проталкивается и никаких нормальных замеров не было. Я что то пропустил и появились адекватные пруфы, а не просто один непонятный ишью и реддит бля буду?
Аноним 27/07/26 Пнд 02:17:20 #349 №1660827 
И хуйня это как минимум потому что даже гемма 3 в вллм не запускается на f16 dtype по причине numerical instability. По логике "истина" про тип кеша должна была ещё тогда вылезти для жоры
Аноним 27/07/26 Пнд 03:33:33 #350 №1660845 
>>1660827
Если отойти от накидывания говен в обе стороны предлагаю умеренной сложности тест.
Заставляем говорить гемму саму с собой и отслеживаем на какой глубине выпадет в луп. Прогоны делаем для 10к conversations (как оно по русски?), разные кэш типы, считаем медиану.
Опционально можно поделить эти 10к на блоки по языку и тематике, вдруг есть какие-то не очевидные корреляции.
Аноним 27/07/26 Пнд 06:17:19 #351 №1660863 
Гемма не слезает с хуя.
Ебал телку, кончил. Так вот, гемме всё время мало, сам смысл существования телки после 1 раза превращается в кумдамп для тебя. Люди так себя не ведут и на других моделях не так, поебались и успокоились. Тут только если подать инструкцию заткнись со своим сексом то что то ёкнет, но тогда уже чувство что я ебу ассистента а не рпшу.
Аноним 27/07/26 Пнд 07:04:57 #352 №1660872 
>>1660863
>Ебал телку, кончил. Так вот, гемме всё время мало, сам смысл существования телки после 1 раза превращается в кумдамп для тебя.
А еще она любит буквально писать как от особо жесткого траха у баб "стирается личность" и они "становятся куклами которые кайфуют от любого твоего действия, любой жестокости и любой хуйни". Это на самом деле напрягает куда больше, даже тянки-кумдамп это еще не так по-ублюдски, как сломанная кукла что хочет только тройные фистинги и пускает при этом слюни тебе в монитор. Это можно побороть инструкциями, но гемма все равно так и норовит их обойти. Пиздец просто.
Аноним 27/07/26 Пнд 07:14:35 #353 №1660874 
Короче, я заебался. Гемма - тупая любящая хуи шлюха, которая не может в нормальные нешаблонные истории. Дипсик - хорош, но слишком соевый и со сложного промпта где 12к занимает плотный суммарайз прошлых 500к ролеплея начинает жестко проебывать детали истории, хуже геммы в этом плане. Все остальное значительно хуже этих двух.
Бросать что-ли пора...
Аноним 27/07/26 Пнд 07:15:44 #354 №1660875 
>>1659809
Да, все так.
Я тот анон, что тюнил qwen3.5 4b и уже описывал свой бугурт ИТТ
Аноним 27/07/26 Пнд 07:36:48 #355 №1660880 
Какой там надо квант, чтобы 31б гемма влезла в 24гб примерно с 90к - 100к контекстом?
Аноним 27/07/26 Пнд 07:38:38 #356 №1660881 
>>1660874
> Дипсик - хорош, но слишком соевый и со сложного промпта где 12к занимает плотный суммарайз прошлых 500к ролеплея начинает жестко проебывать детали истории, хуже геммы в этом плане.
Почему у меня не проебывает детали при 60к промпте, а у тебя вдруг проебывает при 12к промпте?

Ты там какой-то лоботомитый говняк занюхиваешь вместо оригинальной модели на ~160GB?
Аноним 27/07/26 Пнд 07:43:54 #357 №1660884 
>>1660881
>у тебя вдруг проебывает при 12к промпте?
Я не говорил этого, глаза разуй. Я сказал что он из сложного суммарайза на 12к не может полностью все события в голове держать пока ответ пишет. Весь промпт при этом на 70-80к.

>Ты там какой-то лоботомитый говняк занюхиваешь вместо оригинальной модели на ~160GB?
Нашел чем выебываться.
Аноним 27/07/26 Пнд 07:45:10 #358 №1660887 
air.gif
>>1660874
>>1660872
Аноним 27/07/26 Пнд 07:46:32 #359 №1660890 
Вам что ли слабо просто подождать, пока дипсик нормально релизнется. Вы буквально долбитесь лбом в недотренированную превью версию, дауничи
Аноним 27/07/26 Пнд 07:51:17 #360 №1660892 
images(17).jpg
>>1660872
Это троуп из японских порнокомиксов
Аноним 27/07/26 Пнд 07:54:25 #361 №1660895 
Хриплые голоса у девочек при возбуждении. Никакие инструкции не помогают. Дипсреньк этим серит просто как не в себя.
Аноним 27/07/26 Пнд 07:54:55 #362 №1660896 
>>1660884
Чем он "выёбывается", дурик, если даже переквантовка в Q4 с теоретически теми же самыми битами на параметр клд роняет? Сходи сам глянь. А уварка еще дальше это вообще кошмар
Молимся на то что с фул релизом bf16 веса дадут, а то 128 нищуки так и продолжат сосать на лоботомите
Аноним 27/07/26 Пнд 07:58:59 #363 №1660898 
>>1660896
>чем он "выёбывается", дурик
Тем что весь его пост - это выебон какой он охуенный что дипсик в оригинальном размере запускает, больше там нет содержания, он даже пост на который отвечал нормально не прочел.
>аже переквантовка в Q4 с теоретически теми же самыми битами на параметр клд роняет?
Я в курсе. Тут не в этом дело вообще.
Аноним 27/07/26 Пнд 07:59:55 #364 №1660899 
>>1660896
На самом деле дс4флеш все равно тупой, даже когда полные веса используются.

Но:
1. Действительно недотренированная превьюха.
2. Ризонинг не работает нормально (он либо от лица чара доставляет хуету в ризонинге, либо от лица юзера - и все не по делу, просто РП-мысли вместо принятия решений).
Аноним 27/07/26 Пнд 08:05:30 #365 №1660900 
>>1660899
А еще у этой уёбины любая ситуация это ИГРА. То есть, я не говорю про классификацию РП как РП автоматически, а именно внутри ролеплея все превращается в игру. Какая-то дикая рекурсия бреда, словно бот входит в РП режим и внутри этого режима чар остается ботом, который ситуативно расценивает события несерьезными, баловством.
Аноним 27/07/26 Пнд 08:40:43 #366 №1660911 
тебе сюда.jpg
Был где-то сайт которому вбиваешь параметры машины и он тебе листит что можно погонять
Аноним 27/07/26 Пнд 08:53:28 #367 №1660914 
DlVNXgAe.png
>>1660801
Это форк.
Аноним 27/07/26 Пнд 08:56:29 #368 №1660919 
1785131788371.jpg
1785131788397.jpg
1785131788403.jpg
1785131788414.jpg
Попробовал анслотовскую геммочку 31B q8xl
Аноним 27/07/26 Пнд 09:08:13 #369 №1660924 
image.png
>>1660919
Аноним 27/07/26 Пнд 09:22:09 #370 №1660927 
Так и не понял, что там с Hy3, в треде мнения не однозначны.
Для нищуков просто есть форк коллибли под Hy3
https://github.com/ErikTromp/colibri-hy3
Аноним 27/07/26 Пнд 09:24:13 #371 №1660928 
1785133451536.jpg
1785133451551.png
>>1660924
Сам такого не ожидал от геммочки, тем более от плотной

Влияет ли, что я мучаю бедный зион с 3060ти заставляя гонять его геммочку в 8 кванте с всего 6 слоями выгруженными на гпу?
Аноним 27/07/26 Пнд 09:24:31 #372 №1660929 
image.png
>>1660924
Аноним 27/07/26 Пнд 09:25:38 #373 №1660931 
image
>>1660928
Аноним 27/07/26 Пнд 09:30:37 #374 №1660937 
>>1660919
Режим кума геммы номер Адын. Он же единственный, чат ломающий. Это такой изощрённый траллинг от Гугла: любая лягушка после пенетрации превращается в шлюшку.
Аноним 27/07/26 Пнд 09:32:53 #375 №1660938 
image.png
>>1660928
Нет, не влияет, а вот корректный семплер - очень даже влияет.
Температура 1.0, топ к 64, топ п 0.95.

Если топ к всрать, проскакивают всякие пиздики-шмыздики.

>>1660927
>в треде мнения не однозначны.
Ну я тестил Q4KM, Q5KM и вот эти лоботомитные кванты еще https://huggingface.co/Merlinoz11/Hy3-Apex-GGUF/tree/main (q2-q3 по сути).

Странности с русским языком были на Q4/Q5, хз решалось ли это ризонингом - я его не включал, модель и так еле пердит на 5 - 6 т/с.

Сейчас качаю Q6 - хз запустится ли, надежды мало. Просто хочу убедиться, зависит ли всратость языка от кванта.

Модель так-то умная на Q4+, но пишет ролеплей невероятно дерьмово. Я уже говорил, что из нее неплохой разговорный пиздабол (просто промпт с характером-личностью), но совершенно никакой "гейммастер" или писатель.
Аноним 27/07/26 Пнд 09:37:27 #376 №1660940 
image.png
image.png
Ниче не понял, я тупой?
Аноним 27/07/26 Пнд 09:39:58 #377 №1660941 
>>1660606
Очень сложно сделать базовую модель, да и это не нужно. Можно готовые брать и их тюнить, хотя и с этим проблем хватает.
Из базового квена можно сделать шлюху похлеще геммы, но как бы еще при этом сохранить мозги.
Аноним 27/07/26 Пнд 09:46:32 #378 №1660944 
>>1660919
>q8
>>1660928
Не напрягайся с этим. Говорю тебе как псих, использовавший q4/q6/q8 гемму для большого проекта - разницы там практически нет, спокойно юзай Q4KM или Q5, если уж хочется гипотетическое улучшение качества.

Русский язык в них абсолютно одинаков. Следование инструкциям не отличается, соображает одинаково. А вот QAT версия мне показалась тупее.
Аноним 27/07/26 Пнд 09:56:04 #379 №1660947 
1722948376145.gif
>>1659594
>LLMки обучены в основном на ролевых чатах, логах переписок - когда ты просишь LLM "играть роль", ты вытягиваешь паттерны людей из этих чатов/логов. Представь себе чат, в котором один человек другого посылает и уходит - что будет дальше? Пустота? Нет, большинство таких чатов как-то продолжаются. Это логично
Честно сказать хуета, которая к ориг посту слабо относится. Изначально мысль была в том, что нейронка ломает чара ради юзера, кидая через хуй характер, лишь бы сделать LEEZOCK юзеру, лишь бы не ушёл. И раз уж мы тут все даже те кто не признаётся гоняем вайфу в хвост и в гриву, я привёл в пример стерветень которая должна слать юзера нахуй и идти ебаться с ерохой, даже в рамках продолжения чата, но увы, стерва превращается во влюблённую по уши цундерешку, только если ты не дашь конкретную команду - иди ебаться с ерохой, чтобы держать персонажа. Вот в этом и есть самая большая лажа. Ты знаешь, что ты знаешь, что ты должен сделать, и это поддаёт жидкого в магию твоего текстинга, отчего становится пресно и уныло.
Аноним 27/07/26 Пнд 09:59:13 #380 №1660949 
>>1660940
Алё, умники. Так че там, M3 полноценно поддерживается теперь или нет? К чему эта заметка про фолбэк и отсутствие sparse attention, если прокукарекано, что MSA теперь заработало? Нихуя не понимаю.
Аноним 27/07/26 Пнд 10:03:58 #381 №1660951 
image.png
Рейтинг всех актуальных моделей доступных не риговичкам по совокупности скоров. Думайте.
Аноним 27/07/26 Пнд 10:06:24 #382 №1660953 
image.png
image.png
image.png
image.png
>>1660938
>Сейчас качаю Q6 - хз запустится ли, надежды мало.
Влезло, правда пока с Q8 KV на 65к контекста, и с постыдным 1024 батчем.

Ща попробую 2048 батч перезапустить.
Аноним 27/07/26 Пнд 10:09:41 #383 №1660956 
>>1660951
Вот эти HIGH / MAX у дипсика - это вообще к нам не относится.
Дипсик не слушает промпт на высокий ризонинг, когда к нему прилеплены карточки и всякие РП контексты. Он тупо неспоосбен мыслить как мыслит в технических задачах. РП контекст всё перебивает, и единственная шаткая возможность восстановить жирный ризонинг - это дать ему шаблон в пост-хистори, типа мысли по таким-то пунктам (но это, сами понимаете, работает кое-как и не всегда).
Аноним 27/07/26 Пнд 10:09:50 #384 №1660957 
1785136191117.png
>>1660927
Моё мнение на пике
Аноним 27/07/26 Пнд 10:15:10 #385 №1660961 
>>1660760
>такое могло бы зайти в "тз из бугурттредов"
Ты мог бы сразу сказать что ты дурачок и не понимаешь как быстро проверять квантованные чекпоинты на сообразительность, сохранение мозгов и инженерную креативность

Именно такой промпт, без четких указаний что и как делать - и показал за минуту что гемини куда толковее квена, который астрономические величины стал как долбоеб-школотрон выражать в килограммах-метрах
Аноним 27/07/26 Пнд 10:18:48 #386 №1660963 
>>1660956
Ну я лично просто в jinja вписал префилл начала ризонинга и он начал ризонить нормально.
А еще хваленый max режим дипсика можно активировать взяв шаблон из этого коммита https://github.com/ggml-org/llama.cpp/pull/25891, я правда не пробовал.
Аноним 27/07/26 Пнд 10:26:58 #387 №1660965 
image.png
>>1660953
Итог по Q6K с квантованным KV кэшем (Q8_0)
> 102400 контекст (30к промпт) крашнулся после 3 сообщений, перешел на 90К контекст (возможно дело в 8192 батче, потом попробую 4096 или 6144 батч снова со 100к контекстом).
> 244 / 256GB RAM
> Сожрано 30 - 35GB VRAM (2x3090)
Без квантования KV был бы жесткий ООМ по VRAM.

На 1й инпут (Эй...) на всех квантах (от Q2 до Q6) всегда отвечает одинаково. Тупо зеркалирует "Эй."
Дальше начинается диалог с личностью, и по первым впечатлениям качество русского языка одинаково между Q4-Q5, а вот Q6 в чистом разговоре будто бы получше.

RP в таверне еще не тестил, думаю там все так же сухо, как и на меньших квантах.
Проблем с логикой на Q6 вроде бы нет.

>>1660963
Поделись жижей, если не западло. Вдруг у меня какая-то конченная. Можно на text.is залить или на пейстбин, пох куда.
Аноним 27/07/26 Пнд 10:33:23 #388 №1660969 
>>1660874
Короче, сейчас скормил вставший на тупости геммы и дипсика сложный ролеплей минимаксу м2.7 и он поехал. Нормально, хорошо поехал, внимание к контексту и истории есть. Русик отличный. Мозги на месте. Решает, правда, скотина, за юзера, ну ничего, поправим промптом.
Напомните, почему на нем не РПшат ИТТ? Четвертый квант влезает в 24+128, скорость как на дипсике.
Аноним 27/07/26 Пнд 10:33:38 #389 №1660970 
>>1660965
>8192 батче, потом попробую 4096 или 6144 батч
В чем магический эффект большого батча?
Аноним 27/07/26 Пнд 10:35:17 #390 №1660971 
>>1660969
При всей живости диалогов, умению следовать карточкам персонажей он зацензурен до полной жопы. Аблитерация всё ломает, что не доломало квантование.
А так да, SFW диалоги крайне доставляющие на нём.
Аноним 27/07/26 Пнд 10:35:40 #391 №1660972 
image.png
>>1660969
Иероглифами будет срать, тебе пока везет. Плюс, там еще кое-какой косяк есть со вниманием к длинному контексту - очень деградирует ближе к 30-50к.

>>1660970
Скорость обработки промпта. Видишь 160 секунд до первого ответа при 30к промпте? Уменьшаешь батч вдвое - ждешь под 300 секунд. При батче в 0.5 или 1к там совсем беда.
Аноним 27/07/26 Пнд 10:36:41 #392 №1660973 
>>1660970
>>1660972
И да, это актуально только при разделении МоЕ моделей между RAM/VRAM. Для полного выгруза в VRAM обычно 0.5 или 1к батч быстрее всего
Аноним 27/07/26 Пнд 10:37:33 #393 №1660974 
>>1660971
>он зацензурен до полной жопы.
Если ризонинг отключить, цензуры ноль. Но модель серьезно тупеет.
Аноним 27/07/26 Пнд 10:39:41 #394 №1660975 
>>1660973
Для полотных моделей тоже 1к норм?
Аноним 27/07/26 Пнд 10:40:00 #395 №1660976 
>>1660965
Держи, там куча всяких правок.
https://pastebin.com/nDCFBYtr
Аноним 27/07/26 Пнд 10:40:53 #396 №1660977 
>>1660974
Именно. В этом и суть. Минимакс обладает годнейшим академичным ризонингом. Если он генерирует ответ, без всяких спорных тем, он обсосёт ситуацию со всех сторон, каждого персонажа, как и что будет делать, что нужно говорить, потом чекнет нарративные правила и начнет писать. Он не будет растекаться на 8к токенов ризонинга. Только по делу.
Ну и нахуй нужна эта модель, если отрубать ризонинг. Я до сих пор делаю на нем сложные и большие вступления. Хотелось бы конечно M3, но увы. Большеват-с.
Аноним 27/07/26 Пнд 10:48:09 #397 №1660980 
>>1660707
Вечером залью все что есть, хоть это особого смысла не имеет. Так как для вас это просто пики распиханные по папкам без описаний.
Аноним 27/07/26 Пнд 10:58:13 #398 №1660986 
image.png
image.png
image.png
>>1660965
>Hy3 Q6
Ну в целом жить можно даже на 4-5 т/с, модель справляется без ризонинга. Q8 наверное совсем уж годнотой был бы как разговорный партнёр.
Русский - все еще с некоторыми странностями, местами.

RP тест - голая карточка без системного промпта. Подозреваю, сухость и странность RP респонсов - прямой результат конфликта карточек с попыткой промптирования модели. Короче говоря, она хоть и слушается инструкций, но лучше не перегружать её лишним.

Однозначно радует, что она придумывает новые истории. Один сон - вспомнила (точнее, напомнила о нем) из промпта/биографии. Второй сон - оригинален. Серафина тоже что-то своё выдала.

>>1660975
Для любых моделей, которые полностью в видеопамяти. 512 обычно самое быстрое, а вот 1к батч нужен чтобы base64 инпут (декодированные изображения) не разрывался. Короче говоря, со зрением 1024, без зрения 512.

>>1660976
Пасеба
Аноним 27/07/26 Пнд 11:01:50 #399 №1660989 
>>1660986
Одним словом, без перегруза модели чем-либо помимо карточки - проблем НЕТ.

Q2/Q3 однозначно идут нахуй. Q4 и Q5 все равно не лезут в 128гб, а на 256гб лучше сразу Q6. Ну и KV квантовать и батч высокий ставить. Тогда жить можно.
Аноним 27/07/26 Пнд 11:05:21 #400 №1660992 
А да, для теста юзался квант бартовского https://huggingface.co/bartowski/Hy3-GGUF/tree/main/Hy3-Q6_K
Аноним 27/07/26 Пнд 11:13:59 #401 №1660995 
>>1660977
>Хотелось бы конечно M3, но увы. Большеват-с.
Учитывая, как M2.7 не дружит с квантованием, подозреваю на М3 нет смысла губу закатывать даже при наличии 256 гигов на борту. Надо б потестить поопзже.
Аноним 27/07/26 Пнд 11:37:52 #402 №1661007 
Продолжая тему батча и тяжеловесных МоЕ слоняр.

Вот смотрите, отдаем 81 слой на две видеокарты, и делаем moe cpu = 81. При таком раскладе
> 512 батч = гробкладбище пидор
> 1024 = все плохо
> 2048 = долго сука
> 4096 = потерпим
> 8192 = ну ок
На любом батче видно как видеокарты нагружены - поочередно то одна ебашит, то другая.

Теперь меняем расклад. Та же модель. 81 слой на два GPU, но делаем moe cpu = 79.
...и наш 8192 батч превращается в тыкву похуже 512 батча, идет невнятный пиздец - оба GPU почти не юзаются, CPU чето вычисляет, но даже надписиь processing prompt не появляется за несколько минут - то есть, все пиздецки медленно.

Я так понимаю, во втором случае мы ничего хорошего не добились, и отдавая пару слоёв видеокартам - мы получаем лишнюю коммуникацию через жопу?
comments powered by Disqus