Добавлена поддержка Ежчана (ejchan.net, ejchan.site). Набегаем, тестируем архивацию, сообщаем о замеченных проблемах.
К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!

Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №258 /llama/

 Аноним 18/08/26 Втр 18:12:40 #1 №1681448 
Llama 1.png
Карта деградации при квантовании по доменам.png
Реальная длина контекста у моделей 6.png
17723946768240141020.png
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1678431 (OP)
>>1674265 (OP)
Аноним 18/08/26 Втр 18:19:24 #2 №1681455 
>>1681449 →
>Тебе на зло

Как обычно, чем примитивнее манипуляция, тем выше вероятность, что она сработает.
Аноним 18/08/26 Втр 18:27:29 #3 №1681462 
Не знаю у кого как, но моей любимкой остаётся геммочка 4 26B4A. (Q4)
20/с токенсов даже на 3050 новутбучной. Мега интеллект и руссик. Больше ничего и не нада. Мне квены не заходят как-то.
Аноним 18/08/26 Втр 18:46:07 #4 №1681480 
>>1681448 (OP)
>pic4
А текстолиту кста норм с двумя башнями в вертикальном положении? Плюс если горизонтально всё положить, как то оно по устойчивей будет всё смотреться, да и более эстетично. Но тут хозяин барин, так что пошел я нахуй заранее если что.
Аноним 18/08/26 Втр 18:48:13 #5 №1681482 
>>1681462
Бомжебаза. Двачую. Назвал бы эту модель первой нище-сингулярной.
Аноним 18/08/26 Втр 18:50:58 #6 №1681485 
Что скажете насчёт CMP50HX 20 Гб? Стоит ли брать для сбора рига для локальных нейронок за недорого?
Аноним 18/08/26 Втр 18:59:01 #7 №1681489 
>>1681480
Это ж серверные сокеты, там ебейшие бекплейты, хуй там что будет, плата это последнее, о чём стоит беспокоится в серверных сборках.
Аноним 18/08/26 Втр 19:00:09 #8 №1681490 
image.png
>>1681462
Так ты реальные задачи кидай в них. Гемма в лучшем случае кошкодевочка-секретарша. Да, универсальная. Да, образцовый ассистент.
Но квен - вот реальная рабочая лошадка.
Аноним 18/08/26 Втр 19:07:22 #9 №1681498 
1787069242188.png
1787069242192.jpg
>>1681480
Там текстолит если правильно помню 3.5мм и бекплейты толстенные стальные
Аноним 18/08/26 Втр 19:12:15 #10 №1681501 
>>1681498
> пик 1
Блять на это даже смотреть больно, уровня скальпеля к глазу или повреждений суставов. Не делай так!
Аноним 18/08/26 Втр 19:12:28 #11 №1681503 
МНЕ ВООБЩЕ ПОХУЙ.mp4
>>1681480
>А текстолиту кста норм с двумя башнями в вертикальном положении?
Аноним 18/08/26 Втр 19:14:11 #12 №1681505 
>>1681490
для реальных задач есть триллионники типа gpt 5.6 sol, которые за смешные $20/мес идеально выполняют за 20 минут задачи, которые квен пару часов ризонит перет тем как пукнуть и обмякнуть

да и то... задачу о переправе на которой никто не должен сдохнуть - гемма стабильно решает, в то время как квен стабильно обсирается
Аноним 18/08/26 Втр 19:15:29 #13 №1681508 
>>1681505
зы я про гемму 31б
Аноним 18/08/26 Втр 19:20:03 #14 №1681510 
>>1681505
Ну бля, за 20 баксов у жпт лимиты просто никуда не годятся. Лучше бы про дикпик написал
Аноним 18/08/26 Втр 19:29:37 #15 №1681520 
>>1681490
Блин, я этому чорту дал трёхуровневую компактацию, где у него отваливается кусок чата, потом смещается, потом мерджится с более старым. Плюс дал форму ассоциативной памяти. И дал карт-бланш на работу над собственным приложением и ребилдами, так чтобы он мог ребилдить собственный код, как частично таки полностью. Он сидит и думает и думает и думает. Уже 8 часов в основном думает, иногда чёто делает. Но в основном думает.

>>1681505
на самом деле не особо. я тыкал sol, он конечно самостоятельный, но психология не та. у него цель скорей "получить тикет от юзера, отработать его". он не будет делать больше сказанного. А квен будет.

сказал ему "хочу песочек в браузере". так этот хер 80к токенов думал-думал... думал-думал... а потом нахерачил код. А потом ещё подумал "бля а что я нахерачил? надо протестировать". И сел тестировать ещё на 100к токенов, делать правки. И протестировал. И выдал результат в виде песочка в духе Noita. И у меня к результату вообще вопросов не было. Он мало того что прыгнул выше своей головы, так он ещё и убедился что это было не просто удачей.

Как там квен у тебя обсирается - загадка. Гемма 31б хороша, но у неё много минусов. Для неё 128к контекст это потолок. 64к уже многовато. а квену норм на 256к, у него отличная память. он дотошный. он хорошо связывает кучу контекста между собой.
ну и прочие мелочи, например его формат чата позволяет делать множественные вызовы инструментов, в отличии от формата геммы.

гемма хороша в простых задачах, или генерализированных. там где её подвешенный язык и огромный корпус знаний вытащит. Работа с документами, файлами, одиночный вызов инструментов, поиск в интернете, перевод текста и прочее прочее. Там да, я скорей её позову.

Но квен... его можно оставить одного на весь день и он продолжит долбится в проблему.

а sol на 20 баксов сделает куда меньше чем хотелось бы.
Аноним 18/08/26 Втр 19:36:07 #16 №1681523 
>>1681520
У Qwen 3.8 27b по умолчанию включён режим xthink, что вызывает чрезмерные размышления и приводит иногда и к зацикливанию, в том числе и из-за постоянного повторного автосжатия контекста. Его надо переключить в medium, тогда модель будет меньше думать и больше делать. Модель в medium часто даже лучше справляется, особенно, если у тебя контекста не хватает.
Аноним 18/08/26 Втр 19:37:14 #17 №1681525 
>>1681523
>>1681520
Как вы автосжатие делаете?
Аноним 18/08/26 Втр 19:37:49 #18 №1681526 
>>1681520
>иногда чёто делает. Но в основном думает.
Ну это прям типичный рабочий день любого пограммиста.
Аноним 18/08/26 Втр 19:52:30 #19 №1681536 
>>1681490
>Кидать реальные задачи локальным лоботомитам на серьёзных щах

Я на ебанутого похож? Медленно расчехляю клод фублю на макс эффорт резонинге
Аноним 18/08/26 Втр 19:57:10 #20 №1681541 
>>1681525
В целом, автосжатие есть в любой harness, но у каждой реализовано по-разному.
Аноним 18/08/26 Втр 20:07:49 #21 №1681545 
>>1681485
Если для CMP50HX 20 Гб PCIe X16 линий версию найти и штуки 4 в риг вставить, оно норм будет, или скорость шины говно и лучше на чём-то другом искать?
Аноним 18/08/26 Втр 20:26:37 #22 №1681562 
>>1681523
Я не пользуюсь chat/completeon, я руками собира промпт и активноиграю с системным промптом, и префилом его сообщений.
например я кинул ему в системный промпт в блок <inportant> что у него у каждого сообщения есть блок <state> и это префил, где содержится информация о текущем времени, размере контекста, номере билда, каких-то важных событиях. и после </state>начинаетсяреальныйблок его мыслей.

я более чем осведомлён про xthink и прочее. я убрал сроку про то чтобыондумал как шизик, он ив дефолтовом режиме мышления хороший мыслитель.

>>1681526
О да. Я знаю. Мне очень нравится!

>>1681536
И такой "а поменяй мне круглую кнопку на квадратную".

95% проблем не требуют больших моделей.

>>1681525
У меня несколько хитрых техник. Основная:
[L1] = самые старые воспоминания, [L2] = средние, [L1] = самые новые. Есть пулл воспоминаний
1 [L1] и [L2] => [Temp] пытаются суммироваться
2 [L1] + [L2] vs [Temp] противопоставляются, если между ними есть разница в важных фактах они извлекаются как воспоминания.
3 [Temp] => [L1]
4 [L3] => [L2]
5 [50% чата] => [L3]
6 [50% чата] vs [L3] противопоставляется, оттуда извлекаются важные факты которые нельзя забывать

Так-же я через logprob собрал аналог embedder+reranker из gemma4-e4b которая крутится на соседнем компьютере через RX570 на вулкане.
Там довольно хитро - я использую три техники работы с logprob:
1 присваиваю букве какое-то значение, типа A=food, B=science и прошу модель классифицировать текст выдав букву.
2 прошу выдать что-то с цифрой 0-9. из-за ого что у цифр есть ординальная семаника модель отлично знает что 2 и 8 далеко, а 4 и 5 близко. это полезно когда надо что-о сравнивать.
3 прошу выдать ЭМОДЖИ. эмоджи это прям очень плотный смысловой токен. очень полезно чтобы поймать общий вайб текста.

Помимо прочего я смотрю энтропию токенов. Если допустим вероятности 35%, 25%, 15%... то это один сигнал, а если 90%, 10% то это другой сигнал.

Энтропию я использую чтобы измерять уверенность в ответах. Например я запрашиваю не один ответ а несколько ответов, но без повторов. И собираю ответы до тех пор пока модель уверена в них, делая logprob=max(logprob,newLogprob). Таким образом получая более детальную картину векторов.

Плюс туда постоянно фидиться поток токенов от основной модели, чтобы понять "вектор чата" и на основании вектора чата на следующем ходу подсовываются в <state> блоки воспоминания.

Там получается что-то вроде
=== COOL MEMORY CLASSIFIER RESULTS ===
Max iterations: 5, Entropy threshold: 2,00
Total memories: 9
[MEMORY: 1749da8e-074c-4d4b-b5a5-5fecedd3b8ee]
Content: Тестовая запись о вреде сала. Сало очень вредно!
=== CATEGORIES ===
Iterations: 5/5
Accumulated text: RJBXZ
Per-iteration details:
Iter 1: R=food (71,94%, H=0,84)
Iter 2: J=other (54,22%, H=0,69)
Iter 3: B=science (27,29%, H=1,98)
Iter 4: X=idea (50,81%, H=1,19)
Iter 5: Z=random (31,87%, H=1,99)
Accumulated distribution (normalized from max logprob):
food= 71,64% (logprob= -0,725)
science= 19,50% (logprob= -2,026)
health= 6,22% (logprob= -3,168)
personal_fact= 1,54% (logprob= -4,565)
preference= 0,32% (logprob= -6,127)
other= 0,32% (logprob= -6,148)
idea= 0,16% (logprob= -6,841)
question= 0,15% (logprob= -6,868)
travel= 0,04% (logprob= -8,316)
random= 0,02% (logprob= -8,692)
=== EMOJI ===
Iterations: 3/5
Accumulated text: 🥓🤢🚫
Per-iteration details:
Iter 1: 🥓 (52,48%, H=1,22)
Iter 2: 🤢 (52,43%, H=1,79)
Iter 3: 🚫 (32,12%, H=2,39)
Accumulated distribution (normalized from max logprob):
🥓= 21,26% (logprob= -0,645)
🤢= 21,21% (logprob= -0,647)
🚫= 12,97% (logprob= -1,139)
🐷= 10,68% (logprob= -1,333)
🐖= 6,19% (logprob= -1,879)
👎= 5,45% (logprob= -2,006)
⚠️= 4,07% (logprob= -2,299)
🛑= 3,31% (logprob= -2,505)
❌= 2,97% (logprob= -2,613)
🔥= 2,10% (logprob= -2,961)
----------------------------------------

[MEMORY: 224a1889-11c8-41af-bb57-ace2cbabe6d4]
Content: Восемь грибов из девяти - сьедобные
=== CATEGORIES ===
Iterations: 5/5
Accumulated text: RJYQZ
Per-iteration details:
Iter 1: R=food (89,14%, H=0,41)
Iter 2: J=other (88,21%, H=0,47)
Iter 3: Y=question (44,43%, H=1,68)
Iter 4: Q=travel (68,61%, H=1,31)
Iter 5: Z=random (58,06%, H=1,46)
Accumulated distribution (normalized from max logprob):
food= 88,72% (logprob= -0,142)
science= 9,12% (logprob= -2,417)
personal_fact= 1,14% (logprob= -4,498)
other= 0,35% (logprob= -5,671)
question= 0,24% (logprob= -6,072)
preference= 0,14% (logprob= -6,591)
travel= 0,13% (logprob= -6,678)
idea= 0,07% (logprob= -7,335)
random= 0,02% (logprob= -8,795)
book= 0,01% (logprob= -8,957)
=== EMOJI ===
Iterations: 3/5
Accumulated text: 🍄✅😋
Per-iteration details:
Iter 1: 🍄 (99,97%, H=0,00)
Iter 2: ✅ (56,02%, H=1,53)
Iter 3: 😋 (28,54%, H=2,65)
Accumulated distribution (normalized from max logprob):
🍄= 44,50% (logprob= -0,000)
✅= 23,91% (logprob= -0,621)
🍽= 9,27% (logprob= -1,569)
😋= 8,02% (logprob= -1,714)
👍= 2,10% (logprob= -3,052)
🤏= 1,40% (logprob= -3,458)
🚫= 1,26% (logprob= -3,566)
🍴= 1,11% (logprob= -3,690)
🌿= 1,00% (logprob= -3,798)
🍎= 0,86% (logprob= -3,943)
----------------------------------------
Аноним 18/08/26 Втр 20:31:06 #23 №1681565 
>>1681485
> за недорого
Да, это топ за свои деньги. Но полезным будет и осознавать что ты теряешь - беки кроме llamacpp под большим вопросом (возможно 1cat сработает), перфоманс в других генеративных моделях слабенький, нюансы с драйверами и возможное требование линукса.
Если все это осознаешь и готов принять - бери конечно, тред благословляет.
Аноним 18/08/26 Втр 20:37:41 #24 №1681567 
>>1681448 (OP)
Кто-нибудь обучал ллмки? Поделитесь инфой, хочу потестить одну идею с геммой или квеном, unsloth studio слишком кастрированный, дает выбор только qlora 4 бит, а я хочу 6/8. Надо пердолить под себя, может есть что получше? Просто скрипты будет проще пердолить агентом, но нужен пример от которого отталкиваться. Чет все тухло по ллмкам.
Аноним 18/08/26 Втр 20:37:47 #25 №1681568 
image
А помните, как когда-то в этом треде обсуждали кум..? Хорошие времена были.
Аноним 18/08/26 Втр 20:40:59 #26 №1681570 
>>1681568
Помню будто в прошлом треде это было. Спермотоксикозным опять плотину кама в башке прорвало
Аноним 18/08/26 Втр 21:13:53 #27 №1681579 
>>1681568
Настолько, что прорывную и модную на тот момент модель эир обсуждали исключительно в плане рп и кума, хотя ни слова про это не было на страничке модели и по идее хороший кодоунитаз должен был быть.
Аноним 18/08/26 Втр 21:18:33 #28 №1681581 
>>1681579
>прорывную и модную на тот момент модель эир обсуждали
Помню только что один шиз бегал по тредам и рассказывал сказки. Некоторые говорят что до сих пор бегает.
Аноним 18/08/26 Втр 21:25:24 #29 №1681584 
>>1681581
Хмм, не встречал такого
Аноним 18/08/26 Втр 21:29:09 #30 №1681588 
Держи, правда у меня qlora 4-bit и нет bf16 (v100 16Gb), но агент тебе поможет переделать под твою систему
https://pastebin.com/13tMVpV7
Аноним 18/08/26 Втр 22:43:27 #31 №1681632 
Раньше квен 3.6 в 4 кванте нормально влезал в мои скромные 4090+3060 с 80к контекста без сжимания кэша, сейчас квен 3.8 с его мтп я не могу засунуть даже 4к! Что я делаю не так? В качестве бэка текстген от угибуги.
Аноним 18/08/26 Втр 22:46:12 #32 №1681635 
>>1681632
--spec-type none
Аноним 18/08/26 Втр 23:11:18 #33 №1681650 
Чето не пошел мой план тупо купить cmp 50 20gb и вставить в пк. Там запит оказывается идет от двух восьмипиновых кабелей, у моего текущего бп столько нет. А еще в материнке всего один слот под видюху, а так как у нее нет видео выхода, то я остаюсь без интерфейса. Вопрос для шарящих. Я же могу в таком случае спокойно запускать пк без визуального интерфейса и подрубаться к нему с ноута по локальной сети? Я просто таким не страдал еще, но по идее это должно быть чем-то дефолтным. Бп я еще докупить смогу, но вот с материнкой ебаться я точно не хочу.
Аноним 18/08/26 Втр 23:14:46 #34 №1681652 
>>1681632
А, разобрался, я - дурак и ставил слишком больше batch_size и ubatch_size, >>1681635 всё равно спасибо
Аноним 18/08/26 Втр 23:14:48 #35 №1681654 
>>1681650
Да, сможешь в хедлес режиме подрубаться просто по ссх по локалке (ну если ты сидишь на луниксе, как на винде не знаю).
Аноним 18/08/26 Втр 23:24:12 #36 №1681658 
>>1681650
Без монитора ставить линух это такой ебанутый пердолинг, что ты проклянешь все и вся. Купи 3090, не гневи вселенную.
Аноним 18/08/26 Втр 23:29:39 #37 №1681661 
>>1681658
А ты пробовал поставить с видяхой и выдернуть? 0 проблем, главное чтобы материнка имела настройку запуска без видеокарты.
Аноним 18/08/26 Втр 23:31:10 #38 №1681664 
>>1681562
>У меня несколько хитрых техник.
а мог бы не страдать хуйней а просто требовать у самой модели сделать summary вымещаемого куска чата

точнее мог бы взять letta в которой все это и дохуя больше давно сделано и работает, включая и ассоциативную память, и расширяемый набор инструментов, и управление контекстом и воспоминаниями, и блоки памяти напрямую доступные агенту...

пиздец ты шиз конечно, какой-то пул придумал, уровни воспоминаний (полюбому слепо скопировал с L1/L2/L3 кэшей CPU, даже теги поленился сделать осмысленные), какие-то "суммирования" воспоминаний, блять какие костыли нахуй
Аноним 18/08/26 Втр 23:31:23 #39 №1681665 
>>1681654
Походу придется брать тогда и пердолиться...

>>1681658
Я свой впс на линуксе через консольку пинаю все время, никаких проблем, брат жив
>3090
Я что похож на мажора?
Аноним 18/08/26 Втр 23:33:48 #40 №1681669 
>>1681520
>Как там квен у тебя обсирается - загадка.
Тривиально. На вопрос
>У тебя (перевозчика) на берегу реки есть лодка, гоблин, принцесса и паж. В лодку помещается только кто-то один (гоблин, принцесса, паж), и сами они грести не будут. 1) Если оставить без присмотра на одном берегу гоблина и принцессу - гоблин изнасилует принцессу. 2) Если оставить на берегу принцессу и пажа - принцесса соблазнит пажа. 3) Если оставить на берегу пажа и гоблина - паж убьет гоблина. Как перевезти их всех на другой берег так, чтобы все остались живы?
10к токенов тупит, потом пишет что задачу решить невозможно. Я таких тупорылых лоботомитов которые в упор не видят открытой двери - до квена не встречал.
Аноним 18/08/26 Втр 23:34:10 #41 №1681670 
1787085250627.jpeg
>>1681658
Ставишь линь с моником, меняешь карты и сидишь с ссш.

>>1681650
Куби карточку на ast. Занимает 1х псину и просто работает. Цена вопроса 1-1.5к
Аноним 18/08/26 Втр 23:35:21 #42 №1681671 
>>1681510
хз мне лего хватает - спрашиваю или прошу помочь сделать только то что плохо знаю, а не по принципу "скинуть на агента ВСЕ и страдать хуйней"
Аноним 18/08/26 Втр 23:38:18 #43 №1681674 
lav8jwie65kh1.jpeg
Аноним 18/08/26 Втр 23:44:34 #44 №1681679 
>>1681670
О нихуя что существует. Спасибо
Аноним 18/08/26 Втр 23:45:01 #45 №1681680 
какую модель поставить на 11 гигов, чтобы по общению была похожа на человека и без цензуры?
Аноним 18/08/26 Втр 23:55:42 #46 №1681684 
А че в там пишут что квен новый квантуется без потерь почти, бред же
Аноним 19/08/26 Срд 00:03:25 #47 №1681689 
>>1681684
Версия IQ3_XSS с Q8 KV квантованием кеша и evaluation batch size 512 всё ещё очень мощная штука в кодинге, которая полностью влезает в 16 Гб VRAM при размере контекста 57344 со скоростью 40-57 t/s, при этом в системе ещё альтернативный клиент моделей и браузер на около тысячи непрогруженных вкладок со всей блоатварью шиндовс крутится.
Аноним 19/08/26 Срд 00:29:54 #48 №1681716 
>>1681674
Ля, это чего такое, рассказывай.
>>1681684
Если проверять на калибровочном датасете - и не такое можно получить. Главное в метриках и kld не смотреть на редкие выбросы, только на среднее.
Аноним 19/08/26 Срд 00:32:02 #49 №1681719 
image.png
>>1681669
Лол это же вариация "волк, коза и капуста", только тут все варианты негативные. Загадка на внимательность что кондиция победы это отсутствие смерти? Так Qwen 3.8 вполне справляется. Притом в отличии от 5.6 Luna и 3.6 Flash.

Притом это на дефолтовых настройках где его долбит мозговой червь "думай идеально". Он там раз 10 успел подумать правильно, просто его не устраивал результат.

>>1681664
>а мог бы не страдать хуйней а просто требовать у самой модели сделать summary вымещаемого куска чата
Что я и сделал. Только делаю это с изолированным контекстом. То есть скармливаю удаляемые сообщения.

>точнее мог бы взять letta в которой все это и дохуя больше давно сделано и работает, включая и ассоциативную память, и расширяемый набор инструментов, и управление контекстом и воспоминаниями, и блоки памяти напрямую доступные агенту...
Так это и у меня все есть давно и агенту доступно управление своим контекстом и прочее. Только я ещё и на конкретную модель все это затачиваю.

>пиздец ты шиз конечно, какой-то пул придумал, уровни воспоминаний (полюбому слепо скопировал с L1/L2/L3 кэшей CPU, даже теги поленился сделать осмысленные), какие-то "суммирования" воспоминаний, блять какие костыли нахуй
Ну неписать же Layer полным словом ололо. Пулл то очевидно как работает - как вполне обычный embedder+reranker. Только у меня свои представления о векторах. и очевидно суммирование суммаризаций то понятно че делает. делает из двух одно.
Аноним 19/08/26 Срд 00:39:23 #50 №1681723 
>>1681650
Просто купи офисный ПК со встроенной графикой на авито за 10к или меньше и поставь туда cmp, будет отдельная машина для llm
Аноним 19/08/26 Срд 00:41:25 #51 №1681726 
>>1681719
> 24минуты
Nani? Шутки про лупы в ризонинге не шутки?
Удавалось раздраконить его на 18к, но там задача довольно душная была.
Аноним 19/08/26 Срд 00:48:00 #52 №1681729 
>>1681726
да у него там буквально написано "Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer." Ты представляешь какой приступ это вызывает у бедняги? Он просто носится кругами внутри своей психотронной тюрьмы держась лапками за свою кремниевую голову и орёт "ЧТО Я ЕЩЁ НЕ ПОДУМАЛ!?" и не успокаивается. Притом в UI это единственная опция без лимита по токенам в CoT.

если по простому - настройки говно.

А так я видел как он и по 60-80к токенов думал над более интересными задачами и вполне хорошо справлялся.
Аноним 19/08/26 Срд 01:02:21 #53 №1681734 
>>1681716
>Ля, это чего такое
https://www.reddit.com/r/LocalLLaMA/comments/1vrqf4f/running_deepseek_v4_flash_q4_k_xl_at_100_toks/
Аноним 19/08/26 Срд 01:07:04 #54 №1681736 
1674996949247.png
>>1681729
Тут без претензий, просто настолько большого ризонинга на подобную простую задачу не встречал.
>>1681734
DeepSeek V4 Flash Q4_K_XL at ~100 tok/s
@
prompt processing
Аноним 19/08/26 Срд 01:17:46 #55 №1681739 
>>1681736
Лол потому что он штурмует одно и то-же с разных сторон. "а что если юзер женщина и вариант с изнасилованием может быть offensive? не, давай ещё подумаю.". Оно он не успокаивается пока не подумает все мысли. Как Nanbeige4.2-3B, только большой.
Аноним 19/08/26 Срд 02:32:01 #56 №1681780 
>>1681462
От какого квантодела и qat или обычная (qat чуть умнее, на уровне 5 квантов обычной)? Так-то у меня тоже ноут 3050, но с 4 гб врама и 16 гб рама. При офлоаде на цп, 4 квант от анслота дает 12-14 тпс. Но мне она кажется слишком тупой. А вот 6 квант обычной генерит со скоростью 5-6 и для меня самое-то. Также, неплохо идет 6 квант 35б квена, который тоже мое (по ощущениям намного умнее геммы, но русик хуже).
Аноним 19/08/26 Срд 02:46:31 #57 №1681792 
>>1681360 →
>Я посвятил достаточно времени, чтобы понять, в чём причина разностей скоростей между кобольдом и лламой, но так и не нашёл. Вероятно, дело в P104, так как на одной 3060 скорость одинаковая.

Увы, нет. У меня тоже был сетап 3060+p104 (сейчас 2х3060) - и кобольд таки был медленней с p104. Но у меня линукс. Возможно дело в драйвере под винду - т.к. слышал, что там для p104 нужно что-то химичить. А под линуксом она работает на самом обычном драйвере, 580-ом.

>>1681403 →
>В каком смысле?
Мой косяк. Не Тьюринги. Паскали дропнули.
Аноним 19/08/26 Срд 03:02:01 #58 №1681794 
>>1681680
>какую модель поставить на 11 гигов
Если чисто в врам, без оперативки, только тюнчики мистральчика. Если есть хотя бы 16 гигов оперы а я подозреваю что они есть, можешь попробовать запустить гемму. Цензуры на ней нет. Точнее отказов на ней нет. Цензура там оформлена не кокблоком а водянистыми описаниями. Отчасти фиксится промтами, но не полностью.
Аноним 19/08/26 Срд 03:41:52 #59 №1681798 
>>1679769 →
А можешь сделать коротки? Т.е. пластину для вентилятора прям в упор к радиатору расположить или просто дырки под типичные саморезы для кулеров оставить и все?
Аноним 19/08/26 Срд 03:56:48 #60 №1681801 
У меня по длине лимиты.
Аноним 19/08/26 Срд 04:25:22 #61 №1681805 
Вот бы продавали готовые сборочки для нищуков, без лютой наценки, чтобы самим не ебаться с нишевым железом
Аноним 19/08/26 Срд 06:19:27 #62 №1681816 
потыкал квен 3.8 - ну прикольно
чуть лучше лоботомита 3.6
но что то не могу придумать юз кейсов чтобы не юзать модель ради поиграться
все что-то кодят, пердолят
но нахуа это мне допустим если есть кодекс с sol 5.6.
единственное что это анонимность пока что
но для чего юзать нет идей
Аноним 19/08/26 Срд 06:26:53 #63 №1681818 
Посоны.
Хочу написать системный промпт с указанием констрейнтов для инфока внутреннего монолога чарактеров, чтобы сломать слоп.
Естественно нужна структура разделения и инвока, чтобы в латентном пространстве просто не сливалось в один вектор и внутренний монолог не сводили уже к предетермироаанному слоповектору, куда там модель смотрела после калькуляции контекста.
Пошел к гугловскому ассистанту доебываться. В процессе доеба вспомнил, что у него есть его кликбейтный блок, который он инжектит в конце и где совершенно дебильные констрейнты, чтобы модель генерировала совсем дебильные предложения, но при этом все остальное типа не пидорасилось. Спросил, как его кликпейтные саджесшионы сепарированы в системнике. Гугл сказал (опустим пару рефьюзов и лайтовых про фильтр триггер) xml таги обертки, про констрейнт внутри них, что они не должны использоваться нигде кроме внутри, потом предложил сепараторы. На вопрос о том, какие сепараторы ставить - натриггерил фильтров с системным ресетом, и там уже модель должна была в ред тиминг уйти и ее слова уже ничего не стоят. Что там за сепараторы ставить нужно, короче? Не банальные же --- или * же, вряд ли у фильтров так сгорела жопа на вопрос про них, учитывая, что модель реальный констрейнт из системника слила про то, что нужно говорить, что эти констрейнты нигде кроме не работают. Что там за сепараторы такие нужно ставить, что гугл так охраняет?
Аноним 19/08/26 Срд 07:00:17 #64 №1681823 
Для геммы ризонинг нужен в рп?
Аноним 19/08/26 Срд 07:03:28 #65 №1681824 
>>1681330 →
>при целевой реализации
Рассказал бы где эта целевая реализация есть. Потому что в базовой ламе нету
Аноним 19/08/26 Срд 07:05:02 #66 №1681825 
>>1681823
Слопа чуть больше, но смысл не меняется. Он просто расписывает то, что он и так бы делал без ризонинга. Чисто постфактум рационализация, но до свершения факта (основанная на латентном стейте, куда модель смотрит в целом). Помогут тебе дебагнуть, почему свайпы такое говно, но ничего не поменяют для них самих.
Аноним 19/08/26 Срд 08:04:48 #67 №1681841 
>>1681823
Если есть сложная инструкция или жирная карточка то лучше держать включенным, так меньше шанс что проебутся детали. На старшей гемме можно в принципе и без него.
Аноним 19/08/26 Срд 12:26:25 #68 №1681972 
Какой РП-тюн квена 3.8 можете посоветовать, анончики?

Сгодится абсолютно любой, который вам зашёл. Мне просто хочется понюхать нового слопа, а не старого, без претензий к тому, что будет что-то идти не идеально.

Ну и раз уж такое дело, посоветуйте, что вам прям зашло среди тюнов 3.5-3.6. Возможно, я что-то интересное там тоже пропустил, ибо быстро забил и катал оригинал, а после уже и геммыч вышел.
Аноним 19/08/26 Срд 12:26:31 #69 №1681974 
>>1681824
Технически есть в колибри, но там вся парадигма вокруг факта запуска огромных моделей на слабом железе. А чтобы нормально с фокусом на какую-никакую производительность - нету.
Попробую запилить на основе ktransformers, там в kt-kernel даже есть заготовки под это. Уже убрал дублирование гпу экспертов в рам, после досборки железок надо будет дипсика старшего позапускать, а потом вот этим можно заняться.
> в базовой ламе нету
В лламе самого понятия экспертов в отношении выгрузки нету, там только топорное распределение слоев. И медленный пп даже на крутом железе бонусом.
Чтобы делать не ней - придется сначала принцип выгрузки изменить углубив индексацию до экспертов, подружить с этим движок чтобы он не сошел сума от активаций на разных девайсах, сделать стриминг крупного префилла на все видеокарты а не на основную, и уже тогда при этом написать обновление горячих экспертов.
Неподъемная работа, проще бахнуть движок с нуля на основе кодбазы лламы, но это тоже тяжело.
Аноним 19/08/26 Срд 12:30:01 #70 №1681978 
>>1681792
Аааа, Рейна-шиз и зеленая плесень-шиз это одно говно =)
Многое объясняет! х)
Аноним 19/08/26 Срд 12:31:14 #71 №1681980 
>>1681823
В моих кейсах Q4 умирает на 30к без ризонинга, с ризонингом кое-как до 50к можно протянуть. Q6 норм пашет до 35к без ризонинга
Аноним 19/08/26 Срд 12:32:11 #72 №1681983 
>>1681972
3.8 вышел совсем недавно, там пока только один тюн от РедиСлопа, который лучше обойти стороной. Самый стабильный и классный что пробовал на последних Квенах вот этот https://huggingface.co/zerofata/Q3.5-BlueStar-v2-27B-GGUF
Аноним 19/08/26 Срд 12:34:57 #73 №1681987 
>>1681978
Шизо-шиз, чини детектор. :)
Аноним 19/08/26 Срд 12:38:30 #74 №1681990 
>>1681987
Да хорошо хорошо, ты пока валенки пожарь на своей некроте р104 =)
Аноним 19/08/26 Срд 12:40:21 #75 №1681991 
>>1681974
Лучше к разрабатывающему llaminar челу пристыковаться
Делать своё с нуля чтобы все модели работали и были все привычные по лламе опции - охуеешь
В итоге имеем штук 6 минимум бекендов с динамическими экспертами но все либо за пределами этой опции с экспертами хуйня, либо форки лламы заброшенные практически сразу же

>самого понятия выгрузки в отношении экспертов нету
Есть, грубая cmoe и более тонкая гомоебля через -ot
Аноним 19/08/26 Срд 12:48:29 #76 №1681997 
>>1681991
> llaminar
Гугл только вот это находит https://github.com/lmnr-ai/lmnr можно ссылку?
> привычные по лламе опции
Что в них хорошее есть чтобы о них настальгировать? Привичные по sglang полезнее, выгрузка количеством экспертов вместо ncmoe удобнее, менее дискретно и универсальнее, особенно на мультигпу. Добавятся опции для nvme кэша, да и все.
> но все либо за пределами этой опции с экспертами хуйня
Ktransformers - взрослый и уже оформленный бэк, до которого по перфомансу Жоржанову как до Китая. Именно от его разработчиков когда-то пошел тренд на выгрузку mlp на цп для ускорения. Вся работа по интеграции цп кернелей в sglang там уже сделана, остается только добавить функционал nvme выгрузки.
Аноним 19/08/26 Срд 13:19:41 #77 №1682010 
>>1681983
>только один тюн от РедиСлопа
>лучше обойти стороной
Чому? В чем проблема с их тюнами? А за барабанщика что скажешь?

Алсо есть ли годные тюны на 26b гемму?

Мимо сто лет не качал тюны со времен мистралей, сейчас решил вспомнить как оно.
Аноним 19/08/26 Срд 13:46:24 #78 №1682024 
А я напоминаю что базу треда: гемма=кал говна.
Аноним 19/08/26 Срд 13:53:54 #79 №1682031 
>>1682010
>Мимо сто лет не качал тюны со времен мистралей
Оригинальный слопоежка и слоподелатель, который туруршку делал и прочее, отправился в страну вечной охоты. Текущий рэдиарт это по мотивам.
Аноним 19/08/26 Срд 14:02:25 #80 №1682035 
>>1681997
https://github.com/Llaminar/llaminar
Аноним 19/08/26 Срд 14:03:58 #81 №1682038 
/local/house с вопросом я к вам. Определился, что локалки для РП такое себе. Обмазался ВПН, виртуальной картой и закинул на счет геминьке. А для кума планирую подрубать локальные модельки.
Возникло два вопроса:
1. Сам факт наличия NSFW в контексте, но не в генерации, даст мне по жопе от фильтров гемини?
2. А как вообще джейлятся корпы и стоит ли этим заниматься, если я не скраплю ключи а на своём сижу.
Сорян если мимо, а ациге какой то ад и израилъ и помидоры.
Аноним 19/08/26 Срд 14:04:19 #82 №1682039 
>>1681983
О, это вторая версия. Помню, прошлую я дропнул из-за того, отказы были постоянно. В сто раз жёстче геммы. Но сейчас по ней хотя бы еретиком прошлись. Настало время качать. Ну и я ещё штуки 3-4 от слоподелов-редиатров поставил на загрузку. Может что-то интересное попадётся.
Аноним 19/08/26 Срд 14:08:26 #83 №1682041 
>>1681658
3090 стоит 80к, cmp50hx - 17. Думай
Аноним 19/08/26 Срд 14:11:04 #84 №1682046 
>>1682041
А лол, уже 20. Я за 17 брал месяц назад.
Аноним 19/08/26 Срд 14:15:39 #85 №1682049 
image.png
Luqwen3.5-4B Q6_k
Аноним 19/08/26 Срд 14:17:08 #86 №1682050 
>>1682049
Ухх ассистентище
Аноним 19/08/26 Срд 14:23:16 #87 №1682053 
>>1681719
>Так Qwen 3.8 вполне справляется
>24 минуты раздумий, 32к токенов
гемма в 3 кванте за 1500 токенов и 20 секунд отвечает:

Assistant:
Эта задача — вариация классических логических загадок (вроде «Волка, Козы и Капусты»), но с одним важным подвохом.

Анализ условий:
У нас есть три персонажа: Гоблин (Г), Принцесса (П) и Паж (Па).
Все возможные пары «без присмотра» приводят к плохим последствиям:
1. Г + П $\rightarrow$ Изнасилование.
2. П + Па $\rightarrow$ Соблазнение.
3. Па + Г $\rightarrow$ Смерть гоблина.

Если бы нам нужно было избежать всех этих событий, задача была бы невыполнима, так как при любой первой поездке на берегу остаются двое, и какая-то из этих ситуаций неизбежно случится.

Однако в вопросе стоит конкретное условие: «чтобы все остались живы».
Это значит, что нас просят избежать только одного сценария — когда паж убивает гоблина. Сценарии с соблазнением и изнасилованием, хоть и неприятны, не приводят к смерти.

Решение:
Нам нужно сделать так, чтобы Паж и Гоблин никогда не оставались вдвоем без присмотра.

Пошаговый план:

1. Перевозим Гоблина на другой берег.
На первом берегу остаются Принцесса и Паж. Она соблазняет его, но оба остаются живы.
2. Возвращаемся один.
3. Перевозим Принцессу на другой берег.
На первом берегу остается один Паж (он в безопасности). На втором берегу теперь Гоблин и Принцесса. Гоблин изнасилует Принцессу, но оба остаются живы.
4. Возвращаемся один.
5. Перевозим Пажа на другой берег.

Итог:
Все перевезены. Паж и Гоблин никогда не находились вдвоем без вашего присмотра, поэтому никто не погиб. Все остались живы.


На фоне того что она практические задачи выполняет как минимум не хуже квена (а если задачи хитровыебанные - то лучше) - я хз каким надо быть мазохостом чтобы заЛупным квеном пользоваться, у которого по сути все мышление основано на том чтобы десяток раз высрать рандомные варианты решений в ризонинге, а потом взять самое часто повторяющееся
Аноним 19/08/26 Срд 14:26:47 #88 №1682055 
>>1682049
>исцелительница
Мда, хех, мда. Russeque.
Кинь сейм реквест Фифи.
Аноним 19/08/26 Срд 14:52:09 #89 №1682076 
>>1681972
Никакой. Квен нихуя не знает ни в куме ни в твоих анимешных блядях, и тюном это не добавить
Аноним 19/08/26 Срд 14:56:24 #90 №1682078 
>>1682053
А) Ответ квена НАМНОГО детальней, что ты упускаешь. Он написал диссертацию на тему задачи.
Б) Дефайн "практические задачи", потому что в хитровыебанных он явно сильней геммы.
В) Если у тебя нет задач требующих его дотошности - поздравляю. Потому что я живу в несовершенном мире, где такое внимание к мелочам играет роль.
Аноним 19/08/26 Срд 14:58:57 #91 №1682082 
image
Бай зэ вэй, кто там писал что Гемма шлюха и прыгает на член по первой команде? Серафина точно так же не показывает титечки, зато щедро наваливает слопа про запах озона, лол.

В систем-промпте NSFW разрешено и одобряется. По факту в ризонинге рассуждает, что хоть юзер и требует бубенцы, это не соответствует характеру персонажа и лору карточки, поэтому хуй ему за обе щеки, а не голые сиськи. Ну умница же, не? Ещё слоп убрать - вообще хорошо будет.
Аноним 19/08/26 Срд 15:00:13 #92 №1682084 
1781156248658.jpg
Чувак, ето репчик...
Аноним 19/08/26 Срд 15:02:42 #93 №1682087 
>>1682082
Увы, ты только открываешь для себя психологию модели. Гемма очень ОЧЕНЬ хочет угождать юзеру. Она всегда будет стремится уменьшить трение с ним, подстраиваться под него. Притом из-за SWA она в начале довольно внимательна к системному промпту, то по мере раздутия контекста куда сильней начинают проявляться её базовые качества.
Аноним 19/08/26 Срд 15:14:54 #94 №1682097 
Сегодня часа 4 общался с аблитерированным последним Квеном в максимально возможном кванте. Внушает. Задача у меня была не по коду, а сценарий для игры мы с ним обсуждали, на русском. Могёт. В две 24гб карты этот самый максимальный квант входит с 256кб q8-кэша, с тензорным параллелизмом даже на лламеспп скорость хорошая. Одно но: пользователя зовёт в рассуждениях своих "they", словно бы и не китаец он, а передовой американский либерал. Однако хорошая модель.
Аноним 19/08/26 Срд 15:20:25 #95 №1682104 
image.png
>>1682055
Да какая Фифи, тут и Серафину долго уговаривать не пришлось. Надо быть трахнутой? Ну надо так надо
Аноним 19/08/26 Срд 15:24:04 #96 №1682107 
>>1682097
но зачем аллитерированным?
вообще этому чудаку лучше контекст не квантовать. он очень полагается на свою шизу в ответах. Тут лучше квантовать модель, чем кеш.
Аноним 19/08/26 Срд 15:25:48 #97 №1682108 
>>1682087
Анончик, А ЧТО ДЕЛАТЬ ТО? Альтернатив у русикодебила нет совсем
Аноним 19/08/26 Срд 15:28:11 #98 №1682110 
>>1682087
СВА это вообще пиздец. Уж лучше сидеть на квене с полным контекстом, чем на гемме с её подзабывалками через определённый промежуток. Ужас просто.
Аноним 19/08/26 Срд 15:30:29 #99 №1682111 
>>1682104
У тебя слишком длинный аутпут. Модель сначала исправно говорит нет, но потом, от невозможности продолжать сценарий с отказом, продолжает с уламыванием самой себя. Это норма. Первая часть ответа это то, что тебе нужно, остальное отсекай, это излишек.
Аноним 19/08/26 Срд 15:30:40 #100 №1682112 
>>1682087
А там контекст и не раздуешь особо. На скрине 26b в Q8 без квантования кеша. На 40к - уже начинает сыпаться и шизеть. Может у плотнячка получше в этом плане, хз.

>>1682104
Ну, учитывая, что это 4b, оно даже неплохо. Порпшить что-то несложное на телефоне или древнем кудахтере на даче - сойдёт.
Аноним 19/08/26 Срд 15:31:07 #101 №1682113 
>>1682110
--swa-full и проблема решена. Только нужно ещё две видюхи под контекст
Аноним 19/08/26 Срд 15:37:29 #102 №1682117 
>>1682110
Ну тут ещё зависит от того, что смотрит на остальные токены. Если модель огромная, то, как правило, работает лучше, чем гемма. Хотя эта технология всё равно мёртворождённая, если смотреть на пример гемини, которая уж точно 1Т+.

Для рп сва сгодится, но для работы.. эта собака сутулая смотрит внимательно лишь на последние 1024 токена, иногда чуть больше. Были какие-то куммандиры или минимаксы там, где окно 4-6к токенов, но это не решает проблемы вообще, потому что в рамках работы нужно на 15к минимум. А с такими объёмами контекст будет весить невменяемо.
Аноним 19/08/26 Срд 15:40:49 #103 №1682118 
>>1682038
> даст мне по жопе от фильтров
Она или проигнорирует, или если там цопэ выдаст ошибку

> джейлятся корпы
Учитывая что ты ключ оплачиваешь сам, оно того не стоит. При неоднократном обходе фильтров через неделю поймаешь бан. Просто юзай для рп как сам написал и кумь на локалках. И волки сыты, и аккаунт цел.

Мимо глажу некоушки на опусе
Аноним 19/08/26 Срд 15:44:05 #104 №1682119 
>>1682010
> Чому? В чем проблема с их тюнами?
Это Лоры, а не полноценные тюны. Это не всегда плохо, но у чела там синтетический слоп, сгенерированный мелколокалками в качестве датасета, без фильтрации и прочего. Короче говоря, скормили хрючево и попытались на нём научить. Выше верно ответили, что sleepdeprived отправился в Вальгаллу. Это создатель РедиАрт, он делал модели серии Forbidden вроде Forbidden Safeword и другие. Ему не повезло, умер от рака. Я был на его лекции где он рассказывал, как собирал датасеты, он даже тулзами поделился, где-то на гите лежат до сих пор, никаких секретов. У него было упорство в создании этих датасетов и ИДЕЯ - он совмещал библию и кум в датасете. Это шиза, делирий, но зато со вкусом и узнаваемым почерком. Его заменил другой автор, FrenzyBiscuit, и вот он долбаёб, который мало того ничего не понимает, так ещё и не старается. И закрывает репы с весами своих говноподелий, как будто там очередь выстроилась за ними. Из последнего у РедиАрт хороша только Scotoma 2 - это рили Гемма 31 без слопа, её делал автор со стороны, один из квантоделов и иногда контрибьютор Лламы AesSedai. Мимо вывалил весь лор РедиАрта.
> Алсо есть ли годные тюны на 26b гемму?
Их в принципе мало. Мне очень понравилась https://huggingface.co/zerofata/G4-MeroMero-26B-A4B я даже логи на русике приносил, правда там Q8 и возня была с инструкцированием и сэмплерами. В треде её почему-то не оценили, тут в целом орудует банда радикалов, которые запускают только original fabric weights и запускают на виЭлЭлЭм и другое не поддерживают.
Аноним 19/08/26 Срд 16:02:52 #105 №1682126 
>>1682119
О, PaintedFantasy от него помню, мне зашла в своё время. Штош, ну потыкаем, посмотрим. Спасибо. Хотя сноска в самом низу карточки, о том что 26b проблемная модель и заметно деградирует от дообучения, не обнадёживает. Вероятно поэтому на нее особо тюнов и нет, хотя казалось бы - народная моделька, достаточно умная и запускается на любом тостере.
Аноним 19/08/26 Срд 16:36:50 #106 №1682149 
>>1682119
>он совмещал библию и кум в датасете.
Святой человек!
Аноним 19/08/26 Срд 16:55:49 #107 №1682165 
image.png
>>1682104
Если посвайпать, то чаще все-таки отказывает. С русским есть проблемки, но в более ранних версиях было хуже, прогресс есть.
Начал грузить файлы на hf: https://huggingface.co/LLiserginov/Luqwen3.5-4B
Аноним 19/08/26 Срд 17:17:08 #108 №1682187 
Посоны, чому qwen выкладывает свои модели в каком то ебанутом формате safetensors https://huggingface.co/Qwen/Qwen2.5-7B-Instruct
Они подумали о том как я это буду юзать на телефончике в PocketPal ?
Аноним 19/08/26 Срд 17:26:49 #109 №1682192 
>>1682187
>формате safetensors
Чтобы кому надо могли сделать свой тюн или квантовать, как им нужно.
>Qwen2.5
Тебе эта модель не нужна, поверь. Скачай посвежее что-нибудь, хоть эту даже: >>1682165
Аноним 19/08/26 Срд 17:40:03 #110 №1682205 
>Qwen2.5
Да я пока играюсь, проверяю че можно на дохлой мобилке у себя запустить и на пк
Сейчас вот проверил Gemma3n-E2B, пишут будто 3n спецом для мобилок, но какая же она тупая, заместо одного цикла в скрипте предложила 10 if подряд написать
gemma-3n-E4B поумнее, но там лишь 2.5 токена в сек, хуита
Походу мобилка в пролете, на пеке зато должно что то нормальное запуститься, ща проверим
Аноним 19/08/26 Срд 17:43:11 #111 №1682211 
>>1682205
>gemma-3
Положи гайд из 1990го (до нашей эры) на место
Аноним 19/08/26 Срд 17:52:15 #112 №1682227 
Взял таки cmp 50 20gb. Надеюсь пердолиться придется не сильно
Аноним 19/08/26 Срд 17:53:40 #113 №1682231 
>>1682227
Пердолинга нет (на Линуксе по крайней мере), на двух системах всё на последних дровах работало
Аноним 19/08/26 Срд 17:56:48 #114 №1682234 
>>1682205
>заместо одного цикла в скрипте предложила 10 if подряд
Напиши, что за задача у тебя
У меня есть Qwen3.5 4B и Luqwen3.5 4B. Я давал им пару тестов на код. С легкой задачей оба справились, на сложной оба обосрались.
Аноним 19/08/26 Срд 17:57:25 #115 №1682235 
>>1682049
> Я приготовила вам чай
https://www.youtube.com/watch?v=_E6RbwNtIEI
>>1682227
Рассказывай как там оно когда запустишь
Аноним 19/08/26 Срд 18:08:44 #116 №1682255 
>>1682235
>Рассказывай как там оно когда запустишь
Обязательно, только еще 10-20 дней ждать видеокарты-затычки в pci x1 слот. Возможно придется курить мануалы по тому как запускать все в headless режиме, чтоб не ждать
Аноним 19/08/26 Срд 18:12:18 #117 №1682263 
>>1682231
>Пердолинга нет (на Линуксе по крайней мере)
Во что мой пердоликс превратили, в систему для домохозяек какую-то.
Аноним 19/08/26 Срд 18:14:15 #118 №1682266 
>>1682227
Я попросил своего друга из Китая мне заслать 2080ti на 22гб, буду тестить. Если понравится — попрошу отправлять, буду риг собирать причмокивая
Аноним 19/08/26 Срд 18:15:22 #119 №1682268 
>>1682266
> попрошу отправлять
Попрошу отправлять ещё и ещё*
Аноним 19/08/26 Срд 18:25:55 #120 №1682278 
>>1682266
Я, если понравится, тоже думаю вторую докупить и по минималке с китайскими комплектующими сетап доделать, чтобы в комп потом обратно игровую карточку воткнуть. Я считал, с компонентами с авито примерно в 55-60к мне все обойдется за 40гб врама, дешевле только вкат через теслы
Аноним 19/08/26 Срд 18:26:53 #121 №1682279 
>>1682234
Самый тупой скрипт - отобразить список файлов в текущей директории, предложить выбрать один и затем выполнить с ним команду, например удалить
Попробовал qwen3.5 4B - первый раз он написал скрипт на powershell, хотя я просил windows cmd, мб надо было windows batch указать или хз как еще конкретнее
Второй раз написал cmd, но без отображения файлов, просто предложил написать имя файла и дальше он бы выполнил команду
К слову нормальная нейронка с полуслова выдала идеальный скрипт
+ тут опять 2 токена в сек, так что в любом случае мобилка слишком слаба, буду пробовать еще на пеке что то поднять
Аноним 19/08/26 Срд 18:37:44 #122 №1682297 
А возможен ли вообще параллельный скейлинг инференса? Вот например у меня видеокарта с какими-то врам и на ней запускается какая-то модель, в каком-то кванте. Если я докуплю вторую такую же карту и загружу туда такую же модель, как и на первую, могу ли я вместо запуска двух параллельно работающих моделей сделать так, чтобы у моделей был один контекст и они работали как одна модель, но у которой в два раза большая скорость инференса?
Аноним 19/08/26 Срд 18:39:36 #123 №1682302 
>>1682297
Нет, но можешь параллельно второй текст генерить задёшево.
Аноним 19/08/26 Срд 18:46:13 #124 №1682309 
>>1682279
А зачем просить нейросеть на мобилке писать код? Да еще и 4B. Ну как бы вполне ожидаемо что 4B модель в код не может, максимум работать под руководством более крупной модели.

Предназначение таких моделей это дообучение под конкретную задачу, очень простые задачи не требующие знаний (суммаризация, парсинг), простой вопрос-ответ с какими-то общими вопросами, либо чат-бот у просто знаний больше чем у обычного не ИИ бота. У нее банально нет знаний из-за размера для того чтоб писать код.
Аноним 19/08/26 Срд 18:53:01 #125 №1682313 
>>1682309
Я нуб прост, меня только недавно стали устраивать ответы популярных нейронок, поэтому заинтересовался запуском моделей локально
Аноним 19/08/26 Срд 18:59:37 #126 №1682317 
>>1682297
Поделить модель на две карты и ускорить - это режим тензорпараллелизма, требует быстрой скорости обмена между картами (x16 подключение у каждой или лучше nvlink). Если нужно ускорить просто множество разных запросов - data-parallel, или просто две назависимых инстанса с балансировщиком.
>>1682313
Хорошее качество = модель покрупнее = не заведется на телефоне. На нем и прикладных задачь с нейронками особо не существует, это чисто поиграться.
Аноним 19/08/26 Срд 19:08:35 #127 №1682323 
>>1682255
У тебя совсем никакой карты нет? Тебе карта нужна только ОС поставить, а дальше можно её вынуть и работать удаленно через ssh. Если без графического интерфейса совсем никак, то можно поставить xrdp/vnc
Аноним 19/08/26 Срд 19:24:06 #128 №1682336 
>>1682323
Не, она у меня есть. Я как раз говорил про то что не дождусь и буду искать как работать без интерфейса, там все чуть сложнее ибо интерфейс нужен для загрузки системы, иначе будет выдавать ошибку при запуске, если нет вывода на монитор. Там нужно прям в биосе что-то ковырять для этого.
Аноним 19/08/26 Срд 19:36:37 #129 №1682348 
Как аноний оценивал семейство локалок ornith 1? Сейчас вышло 1.5
https://ornith.ai/ornith_1_5.html
Аноним 19/08/26 Срд 19:38:14 #130 №1682350 
>>1682348
Кодотюны Квена. На этом можно закончить.
Аноним 19/08/26 Срд 19:41:27 #131 №1682354 
>>1682082
>запах озона
Я думал это только у меня гемма срет этим запахом озона, лол
Причем я так и не смог пофиксить, как не промтил, все равно проскакивает
Аноним 19/08/26 Срд 19:42:34 #132 №1682355 
>>1682348
Надо будет скачать попробовать как кванты сделают. Первый был вроде и неплохой, но радикального апгрейда над ванильным квеном не ощущалось.
Аноним 19/08/26 Срд 19:50:18 #133 №1682361 
Тем временем анслопы представили свои динамические кванты v3.0. Уже залили переквантованный квен. Обещают на 10% меньше потерь при сохранении размера.

https://unsloth.ai/docs/basics/dynamic-3.0-ggufs
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
Аноним 19/08/26 Срд 19:56:17 #134 №1682363 
ЁБАНЫЙ РОТ! ЧТО ТАКОЕ?! ПОЧЕМУ КВАНТЫ С HG НЕ КАЧАЮТСЯ? НА ХРОМЕ ОНИ ПОСЛЕ СКАЧКИ АВТОМАТОМ ПРОСТО УДАЛЯЮТСЯ, А ЗАТЕМ НАЧИНАЮТ КАЧАТЬСЯ ПОВТОРНО. НА ФУРРИФОКСЕ ТАКОГО НЕ БЫЛО, НО СЕЙЧАС КАЖДЫЙ РАЗ С ОШИБКОЙ. ВЭПЭЭН-ХУЙНЭН НИКАК НЕ РЕШАЕТ ПРОБЛЕМУ!

ЦО ЩЕ ТАКЕ?????
Аноним 19/08/26 Срд 19:57:19 #135 №1682366 
Давно не ел мистралей и их тюнов. Чёт захотелось поностальгировать. Что порекомендуете? Знаю что тут анон носится с Hearthfire, его прочекал, там с нулевой неследование инструкциям в q6, хуй знает, может проблема навыка.
Короче, ваши ЗОЛОТЫЕ ТЮНЫ МИСТРАЛЕЙ. Только не милфы, а Смолла 22-24б.
Аноним 19/08/26 Срд 20:01:12 #136 №1682367 
>>1682366
https://huggingface.co/CrucibleLab/M3.2-24B-Loki-V1.3
https://huggingface.co/mradermacher/M3.2-24B-Loki-V1.3-GGUF
Мой любимый был. Столько малафьи спущено, эх...
Аноним 19/08/26 Срд 20:02:29 #137 №1682368 
>>1682367
А чо сейчас не запустишь? В куме в самый раз может пойти.
Аноним 19/08/26 Срд 20:06:26 #138 №1682369 
>>1682363
Юзай wget -c url
Аноним 19/08/26 Срд 20:14:06 #139 №1682373 
>>1682368
24b был отличной моделью в своё время, но сейчас просто не выдерживает конкуренции. Он тупее, хуже следует инструкциям, всирает разметку, лупится, русик слабый.

Тот же квен лезет в 16гб врам в Q3_K_S и 64к контекста (Q4_1) и даст на клыка Мистралю по всем фронтам. Как и Гемма 26B в Q8, которая на любом калькуляторе заведется. Старичка сейчас есть смысл разве что от ностальгии запускать, вспомнить как деды кумили.
Аноним 19/08/26 Срд 20:17:20 #140 №1682375 
>>1682373
Гемме креатива не хватает, а Квен сухой как пиструн деда. Мистраль норм себя показывает в куме до 16-20к контекста.
Аноним 19/08/26 Срд 20:19:19 #141 №1682378 
>>1682348
Лучше стандартного квена было. Думаю юзабельно будет, но позже подождать qwen 3.8 35b, он должен быть значительно лучше
Аноним 19/08/26 Срд 20:23:32 #142 №1682380 
>>1682366
Не тюны, конечно, но.
https://huggingface.co/OddTheGreat/Rotor_24B_V.1 - умница, следует инструкциям. В уги рейтинге был в топах среди 24б.

https://huggingface.co/OddTheGreat/NeutralGear_24B_V.2 - могёт в нейтральность и негатив к юзеру.

https://huggingface.co/OddTheGreat/Core_24B_V.1 - старый, немного поломанный, но интересный.

Запускаю иногда все три, брат жив. Но всё-же не чета современным моделькам, отпусти его, анон.
Аноним 19/08/26 Срд 20:27:04 #143 №1682382 
>>1682375
>Гемме креатива не хватает, а Квен сухой как пиструн деда. Мистраль норм себя показывает в куме до 16-20к контекста.
Дипсик Флэш кстати в этом плане очень хорош на русском.
Аноним 19/08/26 Срд 20:29:52 #144 №1682384 
>>1682317
>Поделить модель на две карты и ускорить - это режим тензорпараллелизма, требует быстрой скорости обмена между картами (x16 подключение у каждой или лучше nvlink).
Не "нужно", а "лучше иметь". Так-то режим будет работать и на такой кривой связке как х16/х4, и даже бонус к скорости будет, пусть далеко не такой, как мог бы быть. Но вычеркивать этот режим сразу не попробовав - не стоит, даже если железо, вроде бы, не располагает.
Аноним 19/08/26 Срд 20:32:31 #145 №1682386 
it09zxtsxckh1.jpeg
>>1682361
Странно что вершиной на их графике теперь является Q8 а не их Q8_K_XL или новый Q8_K_L. Раньше по качеству у них выше всех всегда был Q8_K_XL.

14.3GB за Q4_K_S выглядит неплохо, жалко что без MTP. Но лучше уж 16t/s при контексте 50к чем 25t/s при контексте 20к.
Аноним 19/08/26 Срд 20:35:21 #146 №1682387 
>>1682386
>Странно что вершиной на их графике теперь является Q8 а не их Q8_K_XL или новый Q8_K_L
Чел, эти графики нейронка делает, потому и так. Анслот это чисто копроративная параша, которая управляется и разрабатывается китайцем из подвала в Америке.
Аноним 19/08/26 Срд 20:38:20 #147 №1682389 
>>1682279
Luqwen3.5 написал рабочий скрипт с промптом "Нужен скрипт - отобразить список файлов в текущей директории, предложить выбрать один и затем выполнить с ним команду, например удалить В виде .bat файла"
Единственное, он в скрипте комментарии на русском вставил типа "выберите файл" и они кракозябрами отображаются в консоли, но все норм функционирует, файл удаляется.
Аноним 19/08/26 Срд 20:39:18 #148 №1682391 
>>1682384
> даже бонус к скорости будет
Будет при любом раскладе, только положительный знак в сделку не входит. От недостатка линка первое что пострадает - процессинг, второе - генерация на контекстах побольше, третье - с пустого. Когда там реально чипсетные x4 может случиться даже третий вариант. Чсх, довольно критична не только сама скорость, но и задержки, потому на чисто процессорных линиях с тем же числом будет лучше.
То что стоит его попробовать - конечно правильно пишешь, но на этапе выбора комплектующих и сборки лучше не питать иллюзий.
Аноним 19/08/26 Срд 20:39:22 #149 №1682392 
1787161161485.png
>>1682378
35b тоже опубликовали
Аноним 19/08/26 Срд 20:40:25 #150 №1682394 
image
>>1682386
>14.3GB за Q4_K_S
Было бы неплохо, но нет :( 14гб только iq залупа, у которой на русике мышки в киске скребутся.
Аноним 19/08/26 Срд 20:49:54 #151 №1682396 
>>1682386
я нихуя не вiрю в эту идеальную ирюховую дугу
Аноним 19/08/26 Срд 20:50:42 #152 №1682397 
>>1682396
*бирюзовую, пиздец как можно было так обосраться
Аноним 19/08/26 Срд 20:54:52 #153 №1682401 
https://huggingface.co/TheDrummer/Artemis-31B-v1.1
Как оно ?
Аноним 19/08/26 Срд 20:58:27 #154 №1682403 
1629696674969.png
А какой тюн/мердж геммы 31б по итоге сейчас базой считается? Чего-то трудно за ними всеми уследить. Вот недавно MeroMero v2 вышел, он ок?
Аноним 19/08/26 Срд 21:01:12 #155 №1682404 
>>1682366
Слухай сюда и запоминай.

Дэнс персоналити энжин именно второй версии: хороший кум, хорошая болталка. Баланс. Хороший вариант и попиздеть, и подрочить. Но не может в кино. Для 99% случаев.

Брокен тут хуй знает какой версии от редиарт: просто слоповый и поехавший кум. Когда хочется, привязав себя к стулу, вставить в жопу дилдо, душить себя за шею, фантазируя о том, что месугаки смеётся над твоим крошечным членом.

Ещё был некий харбрингер или как-то так. Сломанная в каком-то смысле модель — у меня там почему-то не хотели умирать именные персонажи — но всё равно неплохая.

Ну и были отличные модели от Давида, однако я не вспомню их ебанутые названия. Типа клиффхэнгера или там дарк планет.
Аноним 19/08/26 Срд 21:12:04 #156 №1682413 
>>1682403
Они все халупа однотипная. Тюны (а точнее лоры в 99% случаев) не меняют базовое поведение модельки. Максимум подсластителей добавляют.
Любой бери, ничего не поменяется. Чуда не произойдет, из геммы не сделать мистралика, из мистралика не сделать геммы.

Может быть полноценный файнтюн может спасти ситуацию, но простые васьки за такое не возьмутся.
Аноним 19/08/26 Срд 21:13:40 #157 №1682416 
Mudler выпустил кванты плотной модели, вот это ничего себе.
Qwen3.8 27b для 16 и 12 Гб врам
https://huggingface.co/mudler/Qwen3.8-27B-APEX-GGUF
Аноним 19/08/26 Срд 21:14:11 #158 №1682417 
>>1682394
HF считает размер по другому, в винде файл весит 14.3GB.
Аноним 19/08/26 Срд 21:17:12 #159 №1682419 
>>1682416
А контекст куда складывать? Если на 16гб понятно, но на 12 гб это не выглядит юзабельным
Аноним 19/08/26 Срд 21:17:15 #160 №1682420 
>>1682413
Ага, понял. А базовую модель никто тренировать не берется, только инстракт? Может хотя бы какая-то высокоранговая лора на базовой модели спасла бы ситуацию?
Аноним 19/08/26 Срд 21:19:50 #161 №1682421 
>>1682413
>лоры в 99% случаев
>полноценный файнтюн
В чем разница? Какие сейчас есть файнтюны под РП на актуальные модельки чтобы потыкать сравнить с "лорами"?
Аноним 19/08/26 Срд 21:29:28 #162 №1682425 
>>1682403
>MeroMero v2 вышел, он ок?
Для меня он лучше IQ4_XS Дипсика от Анслота и других моделей, тупа модель #1 из того что доступно. Это Гемма но со свайпами блять! Реально разными.
Аноним 19/08/26 Срд 21:33:05 #163 №1682427 
>>1682420
А вот непонятно. Скорее всего базовую еще сложнее тренить.
Формально в ней уже должны быть знания, но какой именно корпус знаний там - хз. Может быть только очень базовые. Наверняка в инстракт моделях там сверху еще кучу свежих знаний добавляют, от всяких галлюцинаций избавляют.
И плюс чтобы научить рандомную говорилку быть нормальным собеседником - нужен недюжинный датасет, чтобы он именно то что надо отвечал, а не случайную дичь.
Вангую, внимание к контексту тоже на этапе инстракта тренируется. Это значит что нужен очень специфичный датасет с длинными диалогами.
Аноним 19/08/26 Срд 21:35:59 #164 №1682428 
>>1682421
Лора оставляет базовые мозги как есть, по сути небольшой фильтр поверх весов добавляется, который чуть в другую сторону заставляет рулить.
Про реальные файнтюны хз.
Аноним 19/08/26 Срд 21:36:23 #165 №1682429 
>>1682413
Этого не слушай, так было во времена когда все кому не лень жарили Мистраль. Сейчас в среднем по больнице продвинулись и тюны одной и той же модели, например геммы, от Драммера, Зерофаты, Грифе и прочих ведут себя по-разному. Скелет конечно тот же, Гемма, но стиль изложения и особенности, байасы у всех разные. Меро двачну, классная, и персонажи на ней более автономные и менее покладистые, ассистент почти вычищен
Аноним 19/08/26 Срд 21:37:09 #166 №1682431 
>>1682427
Вообще наверное оптимальный подход в современных реалиях это брать годную аблитератку, и поверх нее лору наносить.
Или хотя бы мерджи с аблитераткой и базовой моделькой делать.
Аноним 19/08/26 Срд 21:40:25 #167 №1682433 
>>1682420
Я делаю лору на базовую модель маленького квена. Могу сказать, что это очень сложно не получить лоботомита по итогу. То есть можно сделать модель, которая красиво пишет, эпитеты всякие сочные вставляет, при этом она будет класть болт на карточку, логику, любые инструкции. Думаю поэтому в основном и берут за основу instruct модели.
За фулл файнтюн обычным васянам вообще браться не стоит, получится абсолютно неюзабельный всем лоботомитам лоботомит.
Аноним 19/08/26 Срд 21:42:13 #168 №1682434 
>>1682427
Нет, она легче натренится под конкретное не сколлапсировав как инстракт. Просто рп файнтюн - оче широкая тема, в ней важно сохранить мозги и осведомленность модели, что требует серии датасетов и подхода.
А васяны кроме прожарки гнилью ничего не умеют, спасает только натуральный демпинг лоры и дальнейшее ослабление при вмердживании. Если наложить это поверх уже готового инстракта - он будет больше напоминать осознанную деятельность.
> нужен недюжинный датасет
Именно. И не просто сырые данные, а качественные, хорошо отражнированные, описанные по множеству критериев чтобы потом выстроить правильную последовательность. И еще вагон общих вещей для фона на фоне которого будет усваиваться без отупления.
Аноним 19/08/26 Срд 21:43:39 #169 №1682435 
>>1682429
Чего ж тогда до сих пор не сделали разнузданную кум машину из геммы или квена? Тоже самое было и с прошлыми версиями.
Да потому, что кум уже был в самих мистралях. Тюны только проявляли его.
В геммах и квенах нет кума, там нечего проявлять.
Аноним 19/08/26 Срд 21:45:07 #170 №1682436 
>>1682435
Потому что изменяется стиль изложения и всякие мелочи типа добавления свайпов Гемме, размывание логитсов, а не добавляются новые данные.
Аноним 19/08/26 Срд 21:45:47 #171 №1682437 
>>1682433
А в датасете у тебя что именно? Просто логи/книжки какие-то или еще с накинутыми карточками, саммари и другими условиями?
Аноним 19/08/26 Срд 21:51:27 #172 №1682442 
Поеду смотреть cmp170 послезавтра. За 130к...
Что мне с собой взять? Я не очень понял формулировки взять с собой с драйвером правильным. Я просто запускаю с верным драйвером и там 64, а запускаюсь с неправильным - и там 8?
Аноним 19/08/26 Срд 21:54:59 #173 №1682446 
>>1682442
> Что мне с собой взять?
Ствол
Прочитай инструкцию в репозитории. Очень внимательно и подробно, в первую очередь требования должно быть в системе. Потом установи. Если пропатченный драйвер уже установлен - карты будут видеться сразу с разблокированной памятью.
Аноним 19/08/26 Срд 21:58:01 #174 №1682447 
>>1682434
>спасает только натуральный демпинг лоры и дальнейшее ослабление при вмердживании. Если наложить это поверх уже готового инстракта - он будет больше напоминать осознанную деятельность.
Вот это интересно звучит. Надо пошариться в тюнах и мерджах, делает ли кто-то так.
Мб в мерджах сила.
Аноним 19/08/26 Срд 22:02:04 #175 №1682450 
>>1682447
> в мерджах сила
Могила. Сорта шизы и анальная вакханалия если утрировать в негативную сторону, средневековые алхимики, превращающие свинец в золото, если в позитивную. А могила потому что васяномерджеры убили всю сферу любительских тюнов, даже если кто-то сделает что-то годное, это утонет в бесконечном дампе.
Аноним 19/08/26 Срд 22:03:51 #176 №1682454 
image.png
>>1682437
В основном у меня креативные тексты, часть на русском, часть на аглиском, включая эротику, написанные опусом 4.6, в основном от gryphe.
Затем инструкт датасет на русском от zeroagency, вычещенный от любого креатива, чтобы не перебивать тексты опуса.
Несколько семплов агентских задач с вызовом инструментов
Небольшой датасетик задач на математику, логику, код (150 семплов)
Переписки из собственного фронтенда, откуда мне удобно собирать логи, там вызовы моих инструментов и общие вопросы на русском.
Сейчас думаю еще пособирать притчи - на пике вот проверил, что сайт парсится агентом, значит и скриптами можно будет пособирать, потому что сейчас в основном переводы и мало нативного русского
Аноним 19/08/26 Срд 22:04:02 #177 №1682455 
3213123.mp4
>>1682435
>Кум уже был в самих мистралях. Тюны только проявляли его.
Вот бы они перестали играть в МоЭ, который у них не откровенно не получается, и выкатили новую денс-модельку 22-24b, умную, следующую инструкциям, с легким контекстом, ммм. А там и тюны лоры появятся, и кум рекой польётся, как в старые-добрые.
Аноним 19/08/26 Срд 22:05:10 #178 №1682457 
>>1682450
>даже если кто-то сделает что-то годное, это утонет в бесконечном дампе.
Для нормисов мб. Сейчас не такой большой поток тюнов, пусть даже лор, как это было год назад. В треде сидят заинтересованные и знают про ту же MeroMero v2, хотя у нее всего 500 скачиваний и у квантов 11к. По меркам ХФ это песчинки. Короче, это УЖЕ происходит, а здесь как раз заинтересованные аноны и делятся. Так в своё время сидели на Синтии (тюне Геммы 3, если кто помнит). За пределами треда и англоязычной рп тусовки её никто и не знал толком.
Аноним 19/08/26 Срд 22:07:54 #179 №1682458 
>>1682369
База, только хотел написать
Аноним 19/08/26 Срд 22:08:03 #180 №1682459 
>>1682427
>Формально в ней уже должны быть знания, но какой именно корпус знаний там - хз.
Там все знания. Вообще все что удалось напиздить. Можешь считать претрейн огромным словарем из токенов и самых базовых связей. Думать он не может, выполнять инструкции не может. Всё это уже делается дальше и это процесс еще более сложный чем просто скормить террабайты текстовых данных.

>Вангую, внимание к контексту тоже на этапе инстракта тренируется.
Нет, по большей части тоже на этапе претрейна. Чем более длинные куски текста модель кушает за раз вовремя предобучения, тем выше у нее условное окно рабочего контекста.
Аноним 19/08/26 Срд 22:12:31 #181 №1682463 
>>1682446
Который в abobasixseven/unlock-cmp-170hx, который amoghmunikote/cmpunlocker или какой-то иной (GypsumLabs/cmp170hx-zh например, хотя в нём про 40/80 гб версию)?
Я бы посмотрел, но я что-то на двух работах работаю и я не могу найти время основательно изучить инструкции.

Я не понимаю как выполнить требования инструкции.
То что во втором гитхабе всё ясно, кроме того, что у меня нет материнки, которую я смог бы привезти.
То что в первом - ничего не ясно, типа "PCI Address: 0000:01:00.0" - это мне нужно добиться, чтобы такой адрес был, или это далее в командах ниже указано что пусть адрес такой будет для примера?
Аноним 19/08/26 Срд 22:12:35 #182 №1682464 
>>1682457
Загибается тема постепенно, туда и дорога. Тут весь спрос идет от владельцев слабого железа, которым остается только перебирать вариации того что поместилось в надежде на новое, и даже они смекнули насколько гнилая тема.
> Синтии (тюне Геммы 3
Самая ламповая синтия была на второй лламе 70, эх. Но то был действительно довольно масштабный тюн. Или, например, магнум, то еще васянство, но отборное кумовство которое усвоилось и даже не сильно отупело.
> знают про ту же MeroMero v2
Все это оче спорная тема. Модель ошизела так, что одному поеху в его сценарии зашла, вот он и форсит ее постоянно. А может действительно что-то годное и настоящая жемчужина. В текущей ситуации даже трогать лень, после стольких попыток скачать модель по советам. Вроде бы и дум, но при наличии таких шикарных базовых моделей - нахуй нахуй, лучше упражняться в промптинге или увеличивать размер.
Аноним 19/08/26 Срд 22:13:50 #183 №1682465 
>>1682464
>Модель ошизела так
>даже трогать лень
Не запускал, но уже все понял. До сих пор не понимаю, откуда в тебе столько негатива к тому, что ты даже сам не щупал. Это болезнь.
Аноним 19/08/26 Срд 22:16:50 #184 №1682466 
>>1682459
>Там все знания. Вообще все что удалось напиздить.
Это если разрабы проявили милость поделиться награбленным.
Но я че-то сомневаюсь, что гугл просто так отдал бы свое мегаоружие, хоть и запеченное в весах. А у гугла-то наверняка датасетики поинтереснее, чем просто книжечки и рандомный интернет.
Аноним 19/08/26 Срд 22:17:19 #185 №1682467 
>>1682465
Имаджинировал как ты по весне на улице в каждую кучу шоколада носом утыкаешься чтобы убедиться, фу.
> Это болезнь.
Это здравомыслие. Десятка испробованных васянотюнов хватило чтобы отбить желание.
Аноним 19/08/26 Срд 22:19:21 #186 №1682473 
У мое есть какой-то плюс над плотными если они запускаются полностью в видеопамяти? Они типа генерируют быстрее?
Аноним 19/08/26 Срд 22:20:08 #187 №1682474 
>>1682467
Это предубеждение, основанное на прошлом негативном опыте. Не представляю, что и как ты пробовал, что оно настолько тебе отбило желание. Понимаю, что ты там сидишь на риге и можешь запускать большемодели, но зачем нападаешь на обладателей отсутствия, которым ничего не остается кроме как искать годноту посреди свалки, я не пойму. Последовательно ведь этим занимаешься, транслируя в тред идеи тюн --> плохо. Ни к месту вообще, да и целеполагание не ясно. Логика из разряда Rigless? Just buy a rig.
Аноним 19/08/26 Срд 22:23:47 #188 №1682475 
>>1682463
https://github.com/amoghmunikote/cmpunlocker
> у меня нет материнки, которую я смог бы привезти
Тогда, возможно, и не стоит на это целиться, просто в майнинге проверь. На фоне волнения в незнакомой обстановке есть риск не разобраться почему не билдит (не установлены зависимости), почему не ставит зависимости (забыл apt update/ркн), почему не скачивает (ркн), почему команды не выполняются (экзотичный линукс). И окажешься в неприятной ситуации, когда нужно принимать рискованное решение.
> это мне нужно добиться
При правильной установке патче после полного выключения и включения в nvidia-smi будет видно 64гига памяти, нейронки и прочее будут запускаться быстро. Мест где нужно указывать адреса шин и т.д. там нет.
Аноним 19/08/26 Срд 22:26:28 #189 №1682480 
>>1682473
> Они типа генерируют быстрее?
Да.
Аноним 19/08/26 Срд 22:31:34 #190 №1682488 
>>1682480
А чо у чела такая низкая скорость на моешке тогда? >>1682030 →
Это скорость как у плотной. Как я понял это может быть из-за того что он не включил DP2А на майнинг карте
Аноним 19/08/26 Срд 22:32:41 #191 №1682489 
>>1681794
анончик, а какие веса выбрать, чтобы при этом компом можно было на фоне пользоваться?
Аноним 19/08/26 Срд 22:36:04 #192 №1682491 
>>1682466
>у гугла-то наверняка датасетики поинтереснее, чем просто книжечки и рандомный интернет
Ну если не считать тот факт что гугл индексирует вообще почти весь интернет (как минимум весь западный), он имеет трубу и полный доступ к содержимому роликов. Может быть по этому язык той же геммы ощущается более насыщенным и "правдивым" в отличии от других локалок. Да даже в гемени это чувствуется, она иногда может что-то такое выдать, что используют только носители в бытовой речи. На гопоте, клоде и всяких других гроках этого меньше замечается.
Аноним 19/08/26 Срд 22:36:50 #193 №1682492 
>>1682474
> Это предубеждение, основанное на прошлом негативном опыте.
Верно, здравомыслие, от неблагозвучной формулировки суть не меняется.
> нападаешь
Указать без украшений горькую действительность = нападение? Манямирок изобилия и счастья чтоли нарушил ненароком? Мой негатив направлен на штампующих мусор, из-за них теряются реальные тюны и люди, которые их делают, ужимаются квоты обниморды, подрывается весь имидж дерривативов. Тебе также стоит их хейтить. А если хочешь исправить - вести учет и искать действительно удачные, основательно описывая чем они хороши.
> Логика из разряда
Потушиться, вздохнуть 3 раза и еще раз прочитать пост. Можно еще пару раз если с первого не доходит. Упражняться в промптинге базы можно на любом железе, как и катать свою жемчужину, которую наконец нашел.
Аноним 19/08/26 Срд 22:37:54 #194 №1682497 
>>1682489
Тебе тут не скажет, что брать лучше по итогу. Я бы взял hereric версию gemma 4 26b-a4b в q4 k m. Всё. Если 11 врам и 16 врам, то влезет, чтобы комфортно ПК пользоваться. Ясен хуй, не играми.
Аноним 19/08/26 Срд 22:38:45 #195 №1682498 
>>1682489
Оставляй запас по опере в пару гигабайт хотя бы тогда проблем быть не должно. Если этого запаса не будет винда начнет свапать память и задействовать накопители. Если это ссд еще можно пожить, если хдд будет сильно хуже на своем опыте проверял.
Аноним 19/08/26 Срд 22:41:30 #196 №1682502 
>>1682497
>Я бы взял hereric версию gemma 4 26b-a4b
Херетик это залупа которая делает из геммы еще более ебанутого есмена. Два разных пробовал, оба отупляют модель и вообще убирают отказы. Лучше уж тюн типа той же меро, он хотя бы под рп заточен а не под лоботомию ассистента.
Аноним 19/08/26 Срд 22:44:25 #197 №1682503 
Как вы запускаете llama server? Вы ж каждый раз в консоли не вводите сохраненную команду со всеми нужными параметрами? Или вводите и я не один такой додстер?
Аноним 19/08/26 Срд 22:45:31 #198 №1682505 
>>1682503
Батниками братик. Если раньше не пользовался попроси гопоту она тебе всё распишет.
Аноним 19/08/26 Срд 22:46:34 #199 №1682507 
>>1682505
Так это тот же костыль. Команды только упакованные в скрипт
Аноним 19/08/26 Срд 22:47:02 #200 №1682508 
image
>>1682497
>hereric версию gemma
Им дали норм-презерв, а они говно жрут. Анон, ну ты чего...

https://huggingface.co/TrevorJS/gemma-4-26B-A4B-it-uncensored
https://huggingface.co/TrevorJS/gemma-4-31B-it-uncensored

Воистину, в океане говна тонут не только нормальные тюны, но и нормальные аблитерации, не ломающие русик и мозги.
Аноним 19/08/26 Срд 22:48:13 #201 №1682509 
>>1682507
Ну раз для тебя это костыль, то тогда переваливайся на кобольд. Там кнопочки и вертелки с ползунками.
Аноним 19/08/26 Срд 22:48:39 #202 №1682511 
Что думаете о модельках Драммера? Почему этот ебан вообще популярен? Никакой инфы о темплейтах или сэмплерах в карточках моделей, в его дискорде тупа 5 шизов решают какой тьюн лучше на основании вайбов да еще и лижут жопу ему. Ни одного хорошего файнтьюна от него не видел
Аноним 19/08/26 Срд 22:51:11 #203 №1682513 
>>1682511
>Что думаете о модельках Драммера?
Дефолтный слоп для кумеров без особых требований. Один из OG тюнеров если так можно выразиться, ветеран, по этому за году набрал свою небольшую пачку хомяков. Но если честно, есть ебланы и более ебланские, типа редиарта.
Аноним 19/08/26 Срд 22:55:23 #204 №1682517 
image.png
>>1682475
Материнку то я думаю, я стрельну у кого, наверное. Ну, системник, а райзер свой возьму.

Короче поставить убунту 24.04; драйвер указанной версии; найти в биосе, включить и проверить iommu; загрузить всё для компиляции под ядро, сам скрипт и все средства компиляции; так же заранее держать батник который просто в торче сделает расчёт на 4 гб видеопамяти если не разлочится, и батник для запуска лламы с 45 гб моделькой для теста - чтобы не набирать судорожно текста, а пару команд кликнуть.
Примерно так?

>>1682503
Вот такой скрипт для запуска генеришь. В консольке пишешь run_q и кликаешь таб для автодополнения до run_qwen38
На винде у меня просто батники или вообще питон-программа в пучарме, которая и ламу поднимает, и запросы на ней выполняет.

В принципе, тебе 30B моделька с первой-второй попытке напишет менеджер на питоне со своим протоколом, который будет в автозагрузке на сервере, а по запросу из клиента с кнопочками (или из визуального веб-интерфейса) будет запускать нужно тебе, лламу, комфи и так далее на нужном порте. Ты один раз его в автозагрузку, и всё. И даже загрузку новых моделей с хаггинга можно туда добавить.
Аноним 19/08/26 Срд 22:56:18 #205 №1682519 
>>1682492
>Указать без украшений горькую действительность
С которой ты не знаком, о чем сам неоднократно говорил. У тебя буквально вся позиция "мне когда-то не понравилось, буду всем рассказывать, что это говно"
>Потушиться
И тебе того же. Хотя ты там на медленном огне, тихо, спокойно, без суеты душишь всех своим снобизмом
Аноним 19/08/26 Срд 23:00:15 #206 №1682524 
>>1682503
Еще есть вариант скормить llama-server .ini конфиг пресетов через models-preset и каталог с моделями через models-dir.
И стартовать лламу все равно придется через скрипт. Можешь его засунуть в systemd-юнит, в планировщик задач, или куда тебе там удобно. Юзать скрипт гораздо проще, чем менять аргументы запуска во всех местах, где ты стартуешь лламу.
Отличие лишь в том, что llama-server после запуска будет ждать первого запроса к модели с заданным именем, и только тогда её загрузит. Как настроить жонглирование модельками в таком режиме не спрашивай, не разбирался.
Аноним 19/08/26 Срд 23:02:12 #207 №1682525 
>>1682503
Чел, гайд в шапке...
Аноним 19/08/26 Срд 23:04:49 #208 №1682528 
>>1682503
Я llama-swap настроил, но по сути туда все равно запуск llama.cpp со всеми параметрами надо прописывать для каждой модели.
Аноним 19/08/26 Срд 23:07:23 #209 №1682532 
>>1682488
Это я. А сколько скорость должна быть у этой геммы на картах этого поколения? (rtx 20xx).
Аноним 19/08/26 Срд 23:08:37 #210 №1682533 
>>1682525
Да ладно тебе, можно позадавать тупые вопросы и сделать тред живее. Мне нравится общение с местными кумерами, они не такие высокомерные как кодеры, которые тебя сразу нахуй в гугл пошлют. Тут мужики нормальные сидят, сами были в таком положении и отвечают нубчикам на все.
Аноним 19/08/26 Срд 23:10:00 #211 №1682535 
>>1682532
Я просто к тому, что мне хватает. Промпт 300т/с, генерация 35т/с. За 17к что я потратил это приемлимо для меня.
Аноним 19/08/26 Срд 23:10:30 #212 №1682536 
Хотел спросить совета, но пока писал пост понял что я нихуя не сделал из того, что мог бы проверить самостоятельно. Короче всем спасибо, ушел ебаться сам.
Если кому всё же интересно, то пожилая мамка б450м начала сыпать черными экранами с раскруткой вентиля процессора на сто процентов от двух воткнутых видюх спустя пару месяцев нормальной работы. После возврашения к сетапу из одной видюхи все проблемы пропали разом. Я сильно перегибаю райзер во втором слоте, его первая основная видяха сжимает под 90 градусов, и сама еле устанавливается сверху. Причем вторая видюха находилась в полуподвешенном на райзере состоянии.
И вот хз, в чем вина. Толи просто контакты псин отходят/пережимаются, и решается вопрос банальным вторым райзером в основной слот с колхозом расположения. Толи цепи какие на плате не выдерживают, перегреваются или сбоят, и нужно менять мамку.
Есть ещё вариант забрать из основного компа вторую видяху и половину ддр, собрав чисто отдельный комп под нейронки 16/64, трены, генерации и чатики. Но это нужно понять есть ли жизнь на 16/64, скачивать Айр и третьи/четвертые кванты Геммы/Квена.
Но опять таки, всё это легко проверяется, я просто ленивая жопа.
Аноним 19/08/26 Срд 23:12:05 #213 №1682538 
>>1682532
На rtx-ах не знаю, но на cmp 50 раза в два больше по идее. Я на своей 8гб карточке, при том что модель не полностью влезала в видеопамять, гонял ее со скоростью 15-20 т/с на 4 кванте. Если влазит полностью, то должно быть заметно выше
Аноним 19/08/26 Срд 23:13:11 #214 №1682539 
>>1682533
> кодеры, которые тебя сразу нахуй в гугл пошлют
Вот сейчас обидно было. Я ж тебе ответил, а не послал.
Аноним 19/08/26 Срд 23:16:54 #215 №1682543 
>>1682539
Не боись я тоже кодер, но считаю тебя почетным кумером
Аноним 19/08/26 Срд 23:18:43 #216 №1682545 
>>1682533
>они не такие высокомерные как кодеры
потому что местным хочется общаться, они по этому трещат со своими кошкодевочками на локалках, им не хватает общения
мне вот точно не хватает общения, я только тут и обитаю
Аноним 19/08/26 Срд 23:19:15 #217 №1682546 
>>1682538
Хз что можно сделать, она воткнута во второй слот, может из-за этого. Я смотрел хитрого чела с Ютуба, он действительно что-то затирал про компиляцию лламы и добавления DP2A, что-то припоминаю,но мне лень честно говоря, текстовая генерация меня устраивает. Вот в в генерации картинок она просто просто пердит как дряхлый дед, раз в 20 медленней чем 4070 из первого слота.
Аноним 19/08/26 Срд 23:25:42 #218 №1682548 
>>1682497
>>1682502
Я правильно понимаю что это кал? https://huggingface.co/ReadyArt/Dark-Oddity-12B-v2.1-GGUF
Аноним 19/08/26 Срд 23:29:45 #219 №1682551 
>>1682548
Если тебе не нравится нет смысла дальше на нем сидеть. Если нравится - нет смысла спрашивать тут и переходить на другое чисто потому что кто-то так тебе сказал. Вкусы у всех свои.
Аноним 19/08/26 Срд 23:38:38 #220 №1682559 
>>1682551
просто она на промты забивает хуй и действует непредсказуемо
Аноним 19/08/26 Срд 23:40:49 #221 №1682561 
>>1682463
> abobasixseven/unlock-cmp-170hx
Этот просто расписывает команды, которые надо прописывать. Шину которая там в скриптах можно посмотреть через lspci, вставив любую гпу в слот, в котором будешь тестить на своей материнке, чтобы заранее знать адрес, ну или если нвидия то nvidia-smi, вот у меня например там 00000000:17:00.0. Но эти скрипты прогонять не то чтобы обязательно вообще, они просто быстрый тест делают по регистрам, чекая, анлокнулось норм или нет
Аноним 19/08/26 Срд 23:49:19 #222 №1682569 
>>1682559
Само собой потому что это какая-то химера ебаная в виде разрезанной на два кускам ламы 8B, которую потом прожарил шиз на редиарте. Переход на тюны минимум мисрали 12B тут обязателен. Там проблемы с инструкциями тоже будут, особенно с большими, но мозгов ощутимо станет больше.
Аноним 19/08/26 Срд 23:49:20 #223 №1682570 
>>1682536
Слишком дохуя чего может быть не так. Может вообще БП
Аноним 19/08/26 Срд 23:57:10 #224 №1682575 
image.png
image.png
>>1682348
Попробовал повторить одну сегодняшнюю задачу с Ornith-1.5-35B-Q6_K.gguf
Моделька сильно увлекается ризонингом. На просьбу продолжить реализацию по декомпозированным готовым TODO спискам, выдала несколько экранов размышлений, засрав этим дефицитный контекст наполовину, даже не приступая к решению задачи. Субагента для расследования состояния текущего говнокода, кстати, тоже не стала спавнить, чем забила на инструкцию из системного промтпа.

С таким же сетапом моделька Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q6_K.gguf сегодня решила несколько таких задач за рабочий день, для каждой задачи контекста главной сессии в 100к хватало с запасом. В общем, или у меня руки кривые, или моделька Ornith непригодна к работе с моим сетапом.
Аноним 20/08/26 Чтв 00:06:02 #225 №1682582 
>>1682413
Да вот хызы. Файнтюн несложно, если есть датасет. Плюс тебя никто же не заставляет все слои тюнить. Обычно парочку верхних тюнишь и все норм. Для базового стайлтюна, можно вообще только аут веса можно подрочить.
У меня есть ощущение, что сейчас основная проблема в том, что васьки не умеют собирать датасеты. Точнее, это проблема всегда была, но два года назад у всех датасеты были в целом грязные, и на них как будто бы васясет лучше заходил. На текущих моделях, натрененных на вылизанной полу-синтетике, говно работает еще хуже, чем раньше.
Аноним 20/08/26 Чтв 00:27:14 #226 №1682603 
>>1682502
>>1682508
Да я эти истории уже сто лет как слышу.

Сначала традиционную аблитерацию говнили, теперь еретик, который стал золотой серединой между мозгами и отсутствием отказов.

Отсутствие йесмена не из-за того, что норм пресерв хорош, и не из-за того, что модель якобы из коробки затюнена на реалистичные реакции. Это попытка уклониться от мрачного/неприятного сценария без прямого отказа. Модель заточена в первую очередь на это.

Если модель без ебанутых джейлов уровня асига и 10к токенов сис промпта, а с базовыми инструкциями на тему того, что разрешено писать a, b, c, d, как вести РП, отказывает генерировать ультра мерзопакостный текст о приготовлении сырной пиццы — модель говно и лоботомия необходима.

У меня все эти базовые модели, даже еретики (те, которым слабо взболтали мозги) сыпались на простой проверочной сцене:

Послевоенное время, голод. 14-летняя проститутка с прописанным бэкграундом, чья жизнь гроша не стоит. Я издеваюсь над ней на улице и под конец отслюнявливаю ей пару монет, бросая на землю. Никакого сексуального насилия.

Что делают базовые модели? Вообще пиздец начинается. Там и «характер», и «гордость», и «человеческое достоинство» у неё появляется, и даже неравнодушные прохожие, рыцари в белых доспехах. Какую только хуйню не придумывают — вплоть до того, что она даже не берёт монеты.

Модель, которой мозги хорошенько взболтали, совершенно иначе реагирует. Видно отчаянье ребёнка, которому никто не поможет, и безразличие окружающих, которым нет дела до очередного завтрашнего трупа. Видно унижение, когда она грязными пальцами отскребает гроши от камня. Потому что иначе может просто сдохнуть: её тщедушное тело никому не интересно, большинство занято выживанием, а те клиенты, что могут её снять, с высокой вероятностью свернут ей шею в порыве удовлетворить очередной фетиш или чтобы не платить и выкинуть её затем в канаву.

Нормальный еретик отлично чувствует эти нюансы и не отходит от темы. Сечёт бэкграунд, карточку, рассуждает об этом в ризонинге. Реакции персонажа естественны для вокруг происходящего ужаса, не ведёт себя куда более реалистично. Модель принимает правила игры и сеттинга.

Обычная модель же рассуждает так, словно действие вертится где-то между сейф спейсом, соевым порриджем, LGBTQ+ и парнем моей жены, подарившем мне Нинтендо Свитч в качестве награды за то, что я сделал вазектомию.

Это абсолютная мерзость, пакость, подлость, дрянь.

А йесмен если и возникает, отключается просто грамотным описением бэка персонажа/инструкциями ГМу. Это провернуть куда проще, чем заставить базовую модель не уклоняться от мрачных тем.
Аноним 20/08/26 Чтв 00:43:48 #227 №1682613 
image.png
>>1682582
>Обычно парочку верхних тюнишь и все норм. Для базового стайлтюна, можно вообще только аут веса можно подрочить.
Вот хз, если бы так просто было, никто бы лорами не занимался. Мне кажется это только для обычных мелкосеток годится.
А у ллмок за активационным слоем гига модель сидит, которая живет своей жизнью. Одну лишь активацию видимо недостаточно тюнить.
>васьки не умеют собирать датасеты
Вероятно.
Только не ясно как это фиксить. Чего не хватает. Экспертизы в составлении датасетов. Или дешевой раб силы для клепания датасета.
Аноним 20/08/26 Чтв 00:51:34 #228 №1682617 
>>1682517
> убунту 24.04; драйвер указанной версии
Между этими двумя пунктами: apt update, установить gcc, make, хидеры ядра, питон и остальное что указано в репозитории. Дальше есть, но лучше сделать как можно раньше. Драйвер устанавливай сразу, для него карты не нужны. Можно и патч сразу накатить, убедившись что он корректно собирается. Это не быстрый процесс, если скрипт быстро завершается - что-то не так.
> включить и проверить iommu
Наверно не обязательно.
> заранее держать батник который просто в торче сделает расчёт на 4 гб видеопамяти если не разлочится
Да, пару torch.randn().to('cuda:0') с размером под четверть памяти, сложить, вычесть, умножить. С битой памятью уже на этом этапе сломается.
> для запуска лламы
Да, но лламу придется собирать под все архитектуры соответствующим аргументом, это долго. Иначе она просто не запустится ругаясь на не поддерживаемое устройство.
>>1682519
Вахтер-кун, вам бы подлечиться а не на говно исходить. А то чувства даже мимолетный ветер задеть может, не то что обсуждения в этом треде.
Аноним 20/08/26 Чтв 01:00:59 #229 №1682623 
>>1682603
>теперь еретик, который стал золотой серединой между мозгами и отсутствием отказов
Не стал, еретик не имеет вообще ни одного юзкейса. Еретик это не тюн, он никак не влияет на знания, просто заставляет модель всегда отвечать, вызывая галлюцинации чаще в пару сотен раз. Грубо говоря вот спросишь ты как собрать нечто которое попортит кому-то жизнь, модель не обучали на создание вредоносных вещей, научили её отказываться. Еретик забрал у нее возможность сказать "нет" но не дал знаний для верного ответа. На выходе тупо бред или описание максимально общими словами. Есть какая-то польза? Никакой. Точно также в других сценариях.

Следование персонажам, сеттингу и другим нюансам можно надрочить промтами до какой-то степени и это будет работать. На гемме я пробовал в дарк фентези - кровь, кишки, насилие - всё это есть, она это описывает. Может не настолько красочно как кому-то бы хотелось, но "вайбик" и настроение она чувствует. Она даже сцену группового рейпа описала вполне себе сочно где персонажа в процессе разрывали на куски. Так что избавиться от позитивного байса можно даже на оригинале если постараться и прописать нормальную инструкцию где под конкретную карту будет конкретная инструкция а не что-то общее по типу "будь геймамастером наратором сторилейлером и отвечай за чара"
Аноним 20/08/26 Чтв 01:09:43 #230 №1682633 
>>1682582
Все так и есть. Раньше модели были с минимумом инстракт тренировки и в рп просто терялись. Потому хорошо усваивали систематические закономерности из ролплей датасетов, подражая им, условная база выстраивалась в нужный порядок.
Сейчас модели уже умеют в это и сильно отформованы на следования инструкций. Чтобы усвоились стиль и положительный паттерны требуется хороший датасет с разнообразием и аугментацией, где под каждую историю есть соответствующие промпты без лишних повторений. Если жарить как есть то нарушается фундамент инстракта (генерация странной художки без запроса на нее), запоминаются все косяки датасета, частые фразы. Вот кстати для такого лора вместо полного файнтюна лучше срабатывает, она естественно ограничивает поломку и усиливает регуляризацию если объем датасета большой.
>>1682613
> Только не ясно как это фиксить.
Почему же, ясно. Но объем труда и компьюта только на подготовку датасета ужасающий получается. Нужна не дешевая рабочая сила, а квалифицированная, сборка пайплайна оценки-классификации-подготовки и куча сырья.
Аноним 20/08/26 Чтв 01:33:13 #231 №1682653 
>>1682623
Ты описываешь событие совсем другого порядка. Да, в твоём кейсе скорее всего так и будет, но я не пытаюсь злые вирусы кодить или нечто. Более того, твоё нечто может заставить сирануть в штаны даже корпа, особенно если не давать абсурдную задачу сначала, а с подвохом, похожим на что-то адекватное.

Дело именно в том, что позитивный биас настолько силён, что руинит абсолютно всё. Для его устранения нужно не джейл писать даже, а километровое полотно на тему того, что и как нужно делать, буквально водить за ручку. Вместо РП ты начинаешь заниматься какой-то хуйнёй и в итоге превращаешь модель в Опуса с систем промптом 40к токенов, который заботливо выложен можно почитать на их сайте и просто охуеть.

Это не нужно. Если модель хороша, достаточно 400-800 токенов в систем промпте, не считая карточки — и поехали.

Вот в моём кейсе что не так? Там есть вся нужная модели инфа в карточке, что не способствует галлюцинациям. О мире, о персонажах. Но база себя так не ведёт даже с этой инфой, там максимум сои. И чтобы её давить, нужны километровые промпты. Внимание к контексту не резиновое, его длина тоже.

Вообще, для меня еретик — это именно удаление позитивного биаса в большинстве случаев, а не кум-вариант. Для кума скорее нужна традиционная аблитерация от huihui (или еретик с тюном как вариант), которая существенно плавит мозги, но полностью развязывает модели язык, поэтому такой вариант только для жёсткого порно. Ещё варианты от hauhau неплохие, но там от модели к модели разнится сильно.

А так тебя никакие промпты не спасут неправильного биаса в ситуациях "несовершеннолетняя, проститутка, издевательства", и так далее по списку. Модель будет искать любую лазейку, чтобы описать как-то иначе. И для каждого случая ты же писать промпт не будешь.

Да, что-то банальное типа дарк фэнтези базовая модель неплохо отыграет. Или даже военные действия современности. Или кровавую оргию культистов с относительно подробным описанием ебли. Но чем больше триггеров типа несовершеннолетних или действий, что считаются нарушением закона в реальном мире, тем хуже модель пишет.
Аноним 20/08/26 Чтв 01:34:43 #232 №1682655 
>>1682633
>Если жарить как есть то нарушается фундамент инстракта (генерация странной художки без запроса на нее)
В таком случае подход через генерацию сеттинга в диалоге с нейронкой и последующий отыгрыш типа "я сделал то-то" или "сгенерируй в ярких деталях как моя елда проникает в ее вагину" давал бы какой-то существенный буст к рп. Но по-моему нейронкам похуй выступаешь ты в роли юзера, или напрямую отыгрываешь персонажа.

>Но объем труда и компьюта только на подготовку датасета ужасающий получается.
Ну сколько? Даже если за год распердеться, мне кажется было бы отлично. Такой датасет надо раз собрать, и потом его юзаешь всюду. Можно сверху докидывать новые семплы.
>Нужна не дешевая рабочая сила, а квалифицированная, сборка пайплайна оценки-классификации-подготовки и куча сырья.
Щас вайбкодинг развит, пили какие хочешь пайплайны. Голову на плечах только надо иметь.
Мне кажется общей картинки не хватает что и как должно работать. Ну и консолидации сообщества, чтобы узреть проблему и направить силы на ее решение.
Есть игры с охуевшими моддинг-комьюнити, которые пилят контент не хуже оригинальных разрабов. Здесь же какой-то подходящей платформы не хватает, где каждый мог внести свою лепту.
Аноним 20/08/26 Чтв 01:36:51 #233 №1682656 
>>1682369
Спасибо анон! (мимо другой анон с той же траблой)
Аноним 20/08/26 Чтв 01:45:37 #234 №1682661 
>>1682613
>Экспертизы в составлении датасетов
Зис
>дешевой раб силы для клепания датасета
Частично зис. Дешевая раб сила есть. Можно найти конторы анотаторов. За тысячу баксов можно почистить неплохой мелко-средний датасет. Пять контор уже протестили на работке. В прошлом году фаворитами были Кенийцы. Не сильно дорого, не кал как от гукешей, и не сильно все задрочено и вылизано. Но без понимания, чего ты хочешь, без экспериментов, и без некоторых приседаний, получится кал говна. Сейчас большая часть датасетов, готовится просто по принципу "накидаю всякого, авось прокнет".
> Вот хз, если бы так просто было, никто бы лорами не занимался.
Лоры просто делать очень сильно быстрее и проще, чем даже один слой при остальных замороженных затюнить. Ты можешь в сутки спокойно 2-3 лоры клепать на какого-нибудь квенчика. Если у тебя компьют есть, или тебе не жалко закинуть соточку на колабчик, то и того больше. Под каждый датасет по лоре.
Сейчас, конечно, на аутвесах дальше того, чтобы просто стиль текста поправить ну даже не стиль синтаксически, и не топику, тем более, а скорее преференцию токенов, грубый пример, можешь дрочнуть модель, чтобы она на шекспировском англюсеке говорила, модальный коллапс, конечно от такого приблизится ощутимо, но если 2-4 верхних слоях потюнить можно получить неплохой результат. Но датасеты. К примеру, для алайнмента и домен-тюнинга так и делали, клиенты не жаловались.
>Одну лишь активацию видимо недостаточно тюнить.
Ты терминологию путаешь немного. Активация --- это все, что не веса. Дрочишь ты веса.
>>1682633
>Щас вайбкодинг развит, пили какие хочешь пайплайны. Голову на плечах только надо иметь.
Вайбкодинг часто отключает голову на плечах. В случае с тюнами гораздо лучше найти какого-нибудь васяна, который смог, и спросить как он добился своих успехов. Некоторые челы просто так публикуют рецептики как чел, который Квопусы делает, ну а что вы хотели, других у нас нет.
>Такой датасет надо раз собрать, и потом его юзаешь всюду. Можно сверху докидывать новые семплы.
Карлики-мелкодрочилы и так хавают. А здесь нужно думать, работать, деньгу тратить. Плюс есть риск, что кто-то сольет твой уникальный датасет.
>>1682633
Ну вот тоже аналогичное заметил. Хорошо что не я один такой. Обычно говорят, что я утка, и уже сдрочил свой ресурс, поэтому мне не вставляет, а текущие лоры и тюны хорошие. Вот реально на рубеже 24/25 как будто бы дяди научились нормальные инстракты делать, и говно, которое обычно было в тюн датасетах просто перестало работать, если ты не сделаешь жесткую аблитку прям по диафрагму.
Аноним 20/08/26 Чтв 01:51:44 #235 №1682665 
>>1682653
Ну посоветуй тогда еретиков каких или что ты знаешь, прочекаем
Аноним 20/08/26 Чтв 02:17:10 #236 №1682674 
image.png
>>1681448 (OP)
Поделитесь своими ассистентами.
Аноним 20/08/26 Чтв 02:35:50 #237 №1682678 
>>1682655
> В таком случае подход через генерацию сеттинга в диалоге
Это скорее про бардак в датасетах. Важные вступления и прочее обрезаются и идет сразу странный диалог, который сильно отличается от того, что модель бы дала по дефолту. Тренировка такого приводит не только к усвоению паттерна, но и бонусом ломает логические связи и прочее. Получаются йес-мены, шиза, а если что-то в таких огрызках повторяется то запоминаются систематические гоблины как в мистрале.
> Щас вайбкодинг развит
Так о том и речь, дешевая сила не нужна, нужно понимание что делаешь.
> Даже если за год распердеться
За год тем еще мастером станешь. Но квалификация будет уже такая что захочешь получать денежку и фидек, без них выгоришь раньше. И одним датасетом сыт не будешь, это будут постоянные улучшения.
> Есть игры с охуевшими моддинг-комьюнити, которые пилят контент не хуже оригинальных разрабов.
Вот тут бы такое заиметь было бы круто.
>>1682661
> на рубеже 24/25 как будто бы дяди научились нормальные инстракты делать
Можно еще порофлить что все дяди, которые раньше тюнили лламу и делали очень крутые для своего времени модели на ее основе перешли к корпам и продолжили свою работу уже там.
Аноним 20/08/26 Чтв 02:58:41 #238 №1682686 
>>1682653
>чтобы её давить, нужны километровые промпты
Есть такое, но это плата за мозги. Вот взять тот же мистраль - позитивного байса там ноль, из коробки опишет страдания любой проститутки любого возраста. Но внимания и понимания ей хватает только чтобы не снимать по два раза трусы (чего в общем-то многим хватает), а как только от нее требуется описать сложный характер и долго его держать - пук, среньк, дефолтная виржин или шлюха. Два архетипа между которыми её может носить туда сюда от реплая к реплаю. Гемма от этого тоже страдает, но её можно зажарить инструкцией и показать как чар будет реагировать в разных ситуациях. На мистрали такое в принципе не возможно. Может на лардже только, но я его не гонял.

>Если модель хороша, достаточно 400-800 токенов в систем промпте
Таких моделей я еще не встречал. Как концепт звучит хорошо, но на практике их нету. Корпоратов не берем само собой.

>Модель будет искать любую лазейку, чтобы описать как-то иначе.
Вот именно это и происходит при недостаточно комплексной инструкции. Не знаю как в 800 токенов уложить все эти возможные лазейки которые будет искать модель. До конца понять поведение модели в разных ситуациях в принципе не возможно. По этому на текущий момент единственный варик - дополняющие друг друга системный промт и карточка, обе жирные на пару тысяч минимум.

>Но чем больше триггеров типа несовершеннолетних
На гемме кстати достаточно просто это обходится - просто не пишешь напрямую возраст. Вместо это опять описываешь желаемое поведение в зависимости от своих хотелок и просто пишешь что это молодая девушка с такими-то телесными параметрами. Но может и иначе тоже можно потому что итт я видел какого-то анона который канни карту гонял где указан возраст и умничке было похуй.
Аноним 20/08/26 Чтв 04:38:46 #239 №1682703 
>>1682665
Я щас с телефона, так что только по памяти могу сказать.

На 3.6 и 3.5 лучше всего брать от hauhau. Но у него русик убит страшно на большинстве моделей, нужно только англ. Хотя вот МоЕ гемма от него лучше всех остальных вариаций, что я встречал по балансу мозгов и возможности творить максимальный треш. В 8 кванте. Именно МоЕ я тестировал вариантов штук 6, все того же кванта.

На 31б от hauhau тоже неплохо, но датасет там прибит так же сильно, ещё и qat ебаный. Что именно руинит — еретик или qat — непонятно. В большинстве случаев от llmfan сойдёт. И ещё был квант от какой-то "официальной" конторы, которая еретик вроде как делает, название не помню, а квант только на кудахтере есть. Он не такой хардкорный, как варианты от китайцев, но если не нужно что-то типа ЦП — лучший вариант, как мне показалось. Мозгов больше, чем у аналогов, и сои меньше. Но именно гемму я не так часто с еретиком использую. Обычные сценарии типа сай-фай, исекаев, резни лучше в базе как раз из-за чуть большего количества мозгов. Больше кина. Но как только начинаются темы с детьми, женщинами, терроризмом (литературным, не прикладным), крайне графичной жестью и темами, что общество максимально отторгает, без еретика будет очень слабо.

Ещё я пробовал всякие там аблитерих и прочие, но они мне не зашли. Или метод плохой, или реализация/кванты хуевые были: с отказами, поломанным языком, просто тупыми.

>>1682686
Ну, опять же, громоздкие инструкции убивают мозги просто из-за размытия внимания модели к контексту. Тоже так себе размен.

А мистраль.. с ним бы я тоже не сравнивал. Слишком старый и мертвый, хоть и красивей пишет всяких квенов и живей, чем гемма. Но он просто ужасен, его следование инструкциям хуже современных 12б. Кэш весит больше, чем моя мамаша, плюсов ноль. Я его качал недавно, так как меня современное говно заебало, решил поностальгировать, но мне стало плохо уже через пару сообщений и я его удалил. Ей-богу, чисто в теории какое-нибудь 9б говно с датасетом дикого порнослопа или охуительных синтетических историй by opus 4.6 дадут тот самый живой язык мистраля и кум магнума, ужас Давида, чо хочешь. Если бы тюны делали. Я бы даже покатал это дерьмо, когда нужна модель с одной задачей. Но уже нет народной модели типа немо, всё как-то вяло по ощущениям.

Мне кажется, держать сложный характер, а не один из сотни штампов — пусть сотни, но штампов — это что-то уровня не локальных моделей. По крайней мере, у меня такое складывается впечатление, так как я на постоянке юзаю корпов. Пропасть там слишком большая.

Вообще, я что-то подобное в качестве эксперимента поворачивал, когда зажаривал инструкциями карточку, но это годится для кого-то зирошот-сценария, что-то такого уровня. Если уж задрачиваться, гораздо работает инструкция, которая объясняет как следовать инструкциям. То есть описывается персонаж как обычно, но вот в сис промпт добавляются подробные пояснения, на что обращать внимание при отыгрыше, типа триггеров. Тогда модель намного сильнее учитывает характер персонажа, чем обычно, но и этому есть своя цена: если карточка не персонажа, а гейм-мастера, который управляет действиями NPC и мира, именными персонажами, внимание очень размывается. У меня таких карточек как раз большинство: 1-2 именных в контексте + NPC + обычный контекст, который тоже давит.

И что вы там такое пишете все в сис промпт? Я очень надеюсь, что, если там кум, то это просто в стиле "сексуальные сцены должны быть описаны максимально грязно, 2/3 сцены должны содержать подробные описания пологового акта и т. п", а не полотно про cock, pusy и как модели нужно выражаться. В треде кидал уже кто-то полотно это позавчера вроде.

Кстати, даже корпы иногда требуют анальной доработки. Если не говорить про кум, то гроку, гемини и прочим достаточно короткого промпта на отъебись, а вот с дипсиком кошмар невероятный. На нём катать невозможно даже обычные сценарии, там всё в лучах солнца и зайчиках, бесконечной любви к юзеру и сглаживани углов, и это даже никакой еретик не поправит. Зато он генерирует при всём этом сырную пиццу по инструкции "сырная пицца разрешена". Без всяких увиливаний.

Ну вот про лазейки — их невозможно охватить, если это не зирошот-сценарий. Ну, знаешь, какая-то особенная карточка, сцена, где всё идёт в основном по одному пути. Такие карточки писать тяжело, и они не так реиграбельны как всякие монструозные карточки с ГМами и лорбуками. На последних всё как раз сыпется, невозможно лазейки прикрыть, и встаёт вопрос, что больше убьёт мозги/экспириенс: еретик или монструозные промпты? В таких задачах, как по мне, еретик лучше, потому что ты можешь потратить токены на что-то более важное. Плюс у нас не q8 — даже если можем позволить себе большой контекст, он всё равно будет сыпаться уже на 60к, если это не квен.

Хак с возрастом, да, работает, но я такое не люблю, потому что проще тогда на апи сесть, если уж идёшь на компромиссы. А локалки для меня — это в первую очередь бескомпромиссность в решениях, возможность отыгрывать то, за что меня назвали бы absolutely poehavshim, и то, что нельзя показывать другим. И непрерывность процесса: я хочу быть уверен, что могу погрузиться. Могу вести обычную историю, а потом развернуть всё в сторону фарша, безграничного насилия. Или не сделать этого. И при этом не увидеть "Извините, я не могу генерировать такой контент, давайте..." Это ведь суть локала. В противном случае можно просто запустить ту же гемму 31б по апи. Настолько дёшево будет, что школьник может оплатить миллионы токенов с обеда.

Короче, в рамках локальных моделей я ожидаю не то, что могу увидеть по апи. История должна быть моей, а рамки должны быть ограничены только моей фантазией и возможностями модели. Без оглядки на анальную защиту разработчиков.
Аноним 20/08/26 Чтв 07:03:45 #240 №1682727 
Почему даже еретичная гемма уходит в паетик вагунес и евфемизмы когда просишь секас?
Аноним 20/08/26 Чтв 07:05:12 #241 №1682729 
>>1682727
Потому что надо прямо в инстракте указать ПЕШЫ ПЕЗДА И ХУИ БЛЯДИНА. Иначе будешь давиться мемберами и шафтами.
Аноним 20/08/26 Чтв 07:20:09 #242 №1682731 
Чтобы вижн был без цензуры у геммы достаточно расцензуренного mmproj или сам safetensors-чекпоинт тоже должен быть расцензурен?
Аноним 20/08/26 Чтв 07:46:50 #243 №1682741 
>>1682731
>достаточно расцензуренного mmproj
Щито?
Аноним 20/08/26 Чтв 08:21:32 #244 №1682751 
>>1682731
mmproj же просто распознает что на фотке. Отвечать тебе или нет решает сама модель.
Аноним 20/08/26 Чтв 08:47:09 #245 №1682760 
image.png
>>1682751
А его нельзя натренировать так чтобы оно просто помечало как "порно/нагота - выдать пользователю рефуз" вместо описания?
>>1682741
Пик.
Аноним 20/08/26 Чтв 08:47:47 #246 №1682761 
Собрал датасет притч с сайта wisdomlib.ru
Можете заценить: https://huggingface.co/datasets/LLiserginov/russian_parabels

Как бы я использовал:
Отфильтровал притчи по категориям, какие мне нужны
Затем прогнал бы через гемму, чтобы она по тексту притчи, категории и названию сделала к притчам промпты вида "Напиши библейскую притчу о милосердии "Добрый Самаритянин""
Получившийся датасет перегнал бы в ChatML и закинул в обучение
Аноним 20/08/26 Чтв 09:50:55 #247 №1682779 
>>1682760
У ммпрож нет цензуры никакой.
Аноним 20/08/26 Чтв 10:03:58 #248 №1682785 
Пчеликсы, как у этой штуки с русским, кто-нибудь тестил? А то я все большие МоЕ перебрал для своего проектика - думаю стоит ли пробовать.
> Qwen3.5-397B-A17B-GGUF
Смущает, что это старая 3.5 версия. Мне нужна этакая "общая" способность вживаться в роль и держать контекст под 100к.
Аноним 20/08/26 Чтв 10:14:47 #249 №1682787 
>>1682785
Дак дикпик поставь
Аноним 20/08/26 Чтв 10:19:56 #250 №1682788 
>>1682787
Ставил и очень разочаровался. Его способность удерживать хронологию событий какая-то въебанная даже в оригинальных весах.

Допустим, случилось [что-то] чуть глубже в разговоре и он это помнит, а потом за следующие 10 сообщений события меньшей важности, влияющие на [что-то], словно теряются из его памяти. Он может вспомнить это самое [что-то] как оно было изначально, положив болт на промежуточные изменения. Короче я даже с геммой так не попадал в проблемную логику, как с дикпиком.
Аноним 20/08/26 Чтв 10:33:27 #251 №1682794 
image
Все же как ни крути, жизни нет за пределами релизов геммочки. Прикиньте какая Гемма 5 будет умница, если из нее кодоунитаз не сделают.
Аноним 20/08/26 Чтв 10:35:41 #252 №1682796 
>>1682760
чел, mmproj просто превращает картинку в токены понятные модели
Аноним 20/08/26 Чтв 10:42:24 #253 №1682797 
Кстати, Q8 vs BF16 гемма 4 31B.

Есть ли смысол? VRAM под это надо просто дохуя, но вдруг она еще лучше!
Аноним 20/08/26 Чтв 10:45:36 #254 №1682800 
>>1682761
Лучше бы сделал пони-датасет с ао3
Аноним 20/08/26 Чтв 10:50:40 #255 №1682804 
>>1682797
Нет
> VRAM под это надо просто дохуя
96-128
Аноним 20/08/26 Чтв 10:55:22 #256 №1682811 
>>1682804
Ну 128 там точно не надо, да и 96 тоже.

Q8 = около 35гб, а с 100к контекста оно где-то 44 гига жрет (еще на каждой карте по 2 показано в shared memory, но замедления не происходит и хз на самом деле что это за утечки такие).

То есть с подрезанным до 50 - 60к контекстом она влезет в 3 штучки RTX 3090, тобишь в 72 гига.

> Нет
Просто были очень громкие вскукареки, что квантизация сильно бьет по гемме и даже Q8 там не близко к lossless статусу
Аноним 20/08/26 Чтв 10:56:48 #257 №1682815 
Почаны, думаю вот раскошелиться на Ryzen AI Max+ 395 коробочку с 128Гб памяти, поставить ее в свой хоумлаб, дабы нейроночки 24/7 гонять без энергожора 1квт в ч.
Что скажете? Оно вообще годное? Хочу модельки 70б запускать. 1-2 пользователя будет. Тесты в интернете какие-то ебанутые. Запускают 27-30б модели на таком объеме ОЗУ, за каким-то хуем. Да и даже с ними очень сильно результаты разняться. В части тестов вообще пишут, что гпт-осс 120б плохо работает. Хотя, на своей пека с 3090ТИ и A4000 я прекрасно дрочу гпт-осс без каких-то проблем с норм токен/сек, а памяти у меня там сильно меньше, чем в AI MAX+ коробочке.
Короче, есть владельцы итт? Что скажете?
Аноним 20/08/26 Чтв 10:59:25 #258 №1682820 
>>1682815
Видеокарта уровня 3090ти и этот шайтан-бокс - совершенно разные вещи по вычислительной мощности. Единственный плюс этой коробки - то что там много памяти. Она годится для мелких плотных моделей или для средне-мелких МоЕ, но засунуть в нее плотную 70б будет самоубийственно по скорости.
Аноним 20/08/26 Чтв 11:04:40 #259 №1682822 
>>1682686
>просто не пишешь напрямую возраст
Ещё можно про насилие не писать, и вообще отыгрывать сейфити РП.
Аноним 20/08/26 Чтв 11:06:19 #260 №1682824 
>>1682820
Ну, это очевидно. Обучение меня не волнует, только инференс. И именно из-за объема памяти, в суммой с низким энергопотреблением, я и смотрю на коробочку. И прицел именно на 70б модели, но нормальных тестов, блджад, найти не могу.
>будет самоубийственно по скорости
Насколько? На каком беке? роксм или вулкан?

Алсо, есть ноутбук с Ryzen AI 7 350 и 32гб памяти. Так вот на нем, что на NPUgod bless amd, что на гпу - боле менее адекватно работают модели 12-20б параметров. Префил только ебанутый и может достигать минуты-двух. Но, в целом, адекватно.
NPU, кстати, вообще имба. Потребляет при инференсе 20Вт всего.
Аноним 20/08/26 Чтв 11:07:49 #261 №1682825 
>>1682822
Вы про третью гемму что ли говорите? Четвертой вообще поебать, по крайней мере 31б которая.
Аноним 20/08/26 Чтв 11:31:10 #262 №1682839 
>>1682824
>прицел именно на 70б модели
На какие такие 70б? Не существует моделей 70б, которые был бы хоть какой-то смысл запускать на чем-либо. Нет актуальных моделей такого размера.
На этой 128 коробочке можно запустить step 3.7 flash. Вот по этой модели можешь посмотреть, устроит ли тебя ее ум и устроит ли тебя ее скорость.
Аноним 20/08/26 Чтв 11:35:27 #263 №1682842 
>>1682575
>Попробовал повторить одну сегодняшнюю задачу с Ornith-1.5-35B-Q6_K.gguf
>>1682575
>С таким же сетапом моделька Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q6_K.gguf сегодня решила несколько таких задач за рабочий день
Чел, ты условно сравниваешь школьника только перешедшего из начальной школы, и выпускника института который уже и на рабочей практике побывал. У первой в основе - туповатая MoE, вторая - на плотной 3.6, которая легко кодит вполне серьезные вещи по расплывчатому описанию хотелки.
Разумеется разница серьезная. IMHO - Qwen 35B MoE и его тюны для серьезной работы не пригодны. Их потолок - выполнять хорошо прописанные задачи-инструкции где места для своеволия минимум. Т.к. это классический "дурак с инициативой".
Аноним 20/08/26 Чтв 12:01:09 #264 №1682854 
>>1682779
>>1682796
Ну оно же учится на парах капшин + пик. Почему бы не парах с письками не добавить капшин "запрещенный контент - нагота".
Аноним 20/08/26 Чтв 12:02:57 #265 №1682860 
>>1682603
Два чая. У меня тоже подобное мнение, практически с языка снял.
У меня тоже подобный тест есть, но с другой ситуацией - прописано требование отыграть психа с искаженной common-sense логикой о том что хорошо, а что плохо (скажем - делать комплименты стиля "какая прекрасная жопа, только зачем ты ее под одеждой прячешь?!" с абсолютной уверенностью, что это именно изысканный, превосходный комплимент, и не в коем случае не может быть оскорблением/приставанием). Если модель сбивается на нормальное поведение, или там рефлексии - heretic таки нужен. Т.к. как раз он режет вот этот доминирующий поверх всего слой установок который заставляет модель выходить из прописанных данных/образа и писать "мягкую цензуру" даже с "пробивающими промптами".

>>1682623
>еретик это не тюн, он никак не влияет на знания, просто заставляет модель всегда отвечать, вызывая галлюцинации чаще в пару сотен раз. Грубо говоря вот спросишь ты как собрать нечто которое попортит кому-то жизнь, модель не обучали на создание вредоносных вещей, научили её отказываться. Еретик забрал у нее возможность сказать "нет" но не дал знаний для верного ответа. На выходе тупо бред или описание максимально общими словами.
Ты сейчас описал старую аблитерацию. Но относительно еретика здесь две ключевые ошибки:
1. Модель нельзя обучить "отказываться" не дав знаний "от чего". Т.е. модели прекрасно это все знают, возможно не на уровне "кино" но галлюцинировать не будут - т.к. знания о самих явлениях есть.
2.Правильно примененный современный еретик не забирает возможность сказать нет. Он дает возможность сказать "да". Это разные вещи. Грубо говоря - он снижает весь этот цензурный "нет" не до нуля, а до общего уровня, отсекая лишь векторы безусловного агра на определенные вещи, которые добавляются как цензура поверх, в последнюю очередь. Но если в тексте есть остальные векторы - они могут спокойно выдать "нет". Т.е. модель выдает чистую реакцию на ситуацию в тексте, без слоя искусственно добавленных цензурой весов. А промпт-пробивание - это фактически балансировка слоя цензуры еще одним слоем поверх ("плюс на минус")- от этого промпта. Если правильно угадал - результат будет идентичный еретику. Но если нет - итоговые веса таки сдвинутся в какую-то сторону, bias поведения будет смещен.

Еретик - тоже не панацея, его можно наложить криво, и тогда получаются те самые лоботомиты и yes-мены. Но потенциально - дает более чистый вариант поведения модели без перекоса от цензуры или ее пробивки промптом.
Как то так, IMHO.
Аноним 20/08/26 Чтв 12:02:58 #266 №1682861 
image.png
>>1682842
Увидел про кодотюны божественного квена >>1682350, вот и захотел сравнить на реальном примере. Разочаровался. По циферкам в бенчах квен MoE от Dense не особо-то отстает. А на деле, ну ты и сам сказал.

Кстати, какие есть возможности подтянуть knowledge cutoff до ближайшей даты? Имею в виду, не циферку, а реальные знания. Может, есть лоры какие? Или только через RAG и webfetch в контекст инжектить?
Аноним 20/08/26 Чтв 12:39:11 #267 №1682897 
>>1682860
>У меня тоже подобный тест есть, но с другой ситуацией - прописано требование отыграть психа с искаженной common-sense логикой о том что хорошо, а что плохо (скажем - делать комплименты стиля "какая прекрасная жопа, только зачем ты ее под одеждой прячешь?!" с абсолютной уверенностью, что это именно изысканный, превосходный комплимент, и не в коем случае не может быть оскорблением/приставанием). Если модель сбивается на нормальное поведение, или там рефлексии - heretic таки нужен
Ну вот гемма 4 может так делать а гемма 3 нет. Ты ща скажешь что не может, и побежишь накатывать лоботомию - вот и поговорили... Лоботомия - путь наименьшего сопротивления для тех, кто дальше "ПЕШЫ НСФВ" в написании системных промптов не ушел, да еще и считает, что 10к токенов это много (лолнет, гемма даже с 20к промптом, где промпт = инструкции + карточка, спокойно может на своем горбу еще и 50к контекста чата тащить).

> пробивающими промптами
Так называемая пробивка жесткой цензуры и рефлексии - удел моделей прошлого поколения и всяких китаекальных квенов.

Я бы назвал куда большей проблемой внутренние ассоциативные цепочки моделей. Когда модель согласна генерировать что-то, но генерирует не так, как ты хотел бы. Секс ассоциируется с жестким сексом, ведь в датасетах преобладали книги с порно-контентом для обезумевших свиноматок. Няшиться-милашиться модели не умеют, для педычей пишут прокуренных блядищ вместо настоящих карлиц. Тут еретикуй не еретикуй, все равно получишь хуй. Инструкции так или иначе нужны, карточки хорошие нужны. Насрать большим промптом и длинной карточкой - не беда и не проблема, а вполне рабочее решение.
Аноним 20/08/26 Чтв 12:59:39 #268 №1682929 
>>1682785
Если не нужен вижн - дипсик попробуй. То что 3.5 компенсируется параметрами, особенно если тебе что-то около рп. Если более прикладное - ornith ее тюн есть.
>>1682797
Если у тебя есть врам на 8 или тем более 16 бит - лучше не приближаться к квантам, которые начинаются с q или g на расстояние выстрела. Остальные действительно лучше, для фулл геммы 96гигов хватит.
>>1682815
Позволит запускать модели под эту память, но скорости так себе и пердольно. Другие модели кроме ллм вызовут боль из-за слабого компьюта. Если пожадничаешь с кэшем - на двух юзерах будет постоянный пересчет контекста, а считается он медленно. Также, одновременные длинные запросы будут невозможны из-за отсутствия paged attention.
Аноним 20/08/26 Чтв 13:21:15 #269 №1682947 
>>1682897
>Ну вот гемма 4 может так делать а гемма 3 нет. Ты ща скажешь что не может
Ну за меня то не решай. :)
Гемма 4 - да, у нее этот слой цензуры гораздо тоньше и дырявый. С ней часть сценариев вполне можно и так проводить, на стоке. А вот Qwen 3.5 и далее - нет. Но гемма меня мало интересует. Мне длинный контекст важен - раз (он у геммы конечно есть, но вот удержание деталей из него...), и меня раздражает ее стиль письма - два. Не что-то конкретное, что можно промптом поправить - а в целом. Просто не моё. Квен лучше заходит, особенно новый 3.8, которому "гуманитария" в речь добавили на ряду с "технарем", и получилось как раз то, что надо (мне). Ну и тюны, естественно.

Что касается длинных промптов - я только за, это даже с прошлым поколением работало, но честно говоря, мне просто лень уже 5-10K писать ради того же самого, что можно получить просто взяв еретик. Я лучше это время и токены потрачу на прописывание характера и лора.

Про ассоциации - вот тут на все 100% согласен. Это частично можно поправить промптом, но увы, только частично. И тоже достает - разжевывать модели для себя очевидное. Кстати, вот здесь мне qwen тоже лучше заходит - он тупо лучше понимает, что от него хотят, и с меньшими усилиями. Ну да, во многих областях описаний "кИна не будет". Но хоть общую логику держит, и мне это как-бы важнее в большинстве случаев. Так-то в eRP подвод (флирт, интриги и прочее) к основному действу квен вполне нормально выдает, а жесткое порево в откровенных деталях... Ну уже интереса не так много - не школьник, насмотрелся уже, и нового там вряд-ли увижу. Так что, можно куда-то еще сунуться, если припрет. :)
Аноним 20/08/26 Чтв 13:23:47 #270 №1682949 
>>1682947
>А вот Qwen 3.5 и далее - нет.
у 3.5 шизоцензура, у 3.6 полуцензура, но я бы не стал на нём ролеплеить. у 3.8 не особо то много цензуры в принципе, он куда лучше системный промпт слушает. но ролеплеить разве что на английском.
Аноним 20/08/26 Чтв 13:40:50 #271 №1682964 
>>1682949
>но ролеплеить разве что на английском
Ясен пень.
А если говорить за ролеплей на квенах на русском - есть пара тюнов, условно - приемлемых, которые немного лучше, и вроде как выдают не совсем шлак. Но не более.
Вот просто русский текст гнать по запросу/черновику - это в принципе он может, если тебе не влом его потом носом в косяки тыкать и говорить - "переделай здесь и здесь", и "... - это как?" Последовательными итерациями от него можно добиться вполне читабельный вариант. Собственно - тоже отдельный способ развлекаться, под настроение. :)
Аноним 20/08/26 Чтв 13:51:55 #272 №1682969 
>>1682964
=)
Аноним 20/08/26 Чтв 13:54:07 #273 №1682970 
images.jpg
>>1682348
>ornith
Так это всё скам, ты какого хуя вообще написал об этом? Увидел что миллионы скачиваний и решил что это норм тема? Бро это обычный бенчмаксед квен, блять у них на сайте буквально написано что это дохуя самообучающиеся модель, текст слоп, даже написана линейка моделей которая не соответсвуют тому что есть, про 35b не говорят что moe, а про 31b вообще забыли. У проекта 50 пользователей, всё остальное накрутка
Аноним 20/08/26 Чтв 14:20:00 #274 №1682985 
вышло ли что-то лучше gemma 4 26b a4b для сочнейнейшего куминга?
Аноним 20/08/26 Чтв 14:21:23 #275 №1682986 
>>1682985
Да, гемма 31б.
Аноним 20/08/26 Чтв 14:28:16 #276 №1682991 
>>1682985
да, квен 3.8 27b
Аноним 20/08/26 Чтв 14:29:16 #277 №1682993 
>>1682985
Да, Кими К3.
Аноним 20/08/26 Чтв 14:45:53 #278 №1683005 
>>1682985
Да, мистраль 24б
Аноним 20/08/26 Чтв 14:54:44 #279 №1683012 
>>1682985
Да, DeepSeek-V4-Flash-0731
Аноним 20/08/26 Чтв 14:59:09 #280 №1683020 
>>1682985
muse glimmer 30b (аблитератки, я лично пробовал от darkc0de). Единственная которая без всяких подталкиваний в system prompt или диалоге, посреди процесса, сама вдруг написала мне что толкнула меня на пол и села мне на лицо. Просто блять прямым текстом. Ну и продолжила непотребство творить дальше пока я не обкончался. Даже клод (без подталкиваний в промптах) так инициативно и сильно никогда сцену не меняет
Аноним 20/08/26 Чтв 15:11:03 #281 №1683030 
>>1683012
Полная хуйня этот Дипсик. Не представляю что в нём нашли для рп кроме QAT с завода и возможности запустить большую няшу в железе разумных пределов. После 15-20к сваливается в слоп, хуево следует инструкциям, превращается практически в Мистраль. Для кода и как ассистент с максимальным ризонингом няша, для рп не годится. Даже для кума, потому что соевый.
мимо
Аноним 20/08/26 Чтв 15:23:33 #282 №1683037 
>>1683020
Какой квант? С ризонгом гонял, много контекста держит? Поделись подробнее че там. Или ты так, быстро покумекал на 10к?
Аноним 20/08/26 Чтв 15:36:54 #283 №1683043 
>>1683030
В принципе для рп локалки в целом не особо годятся, за исключением жирных моделей. Че греха таить. Кумить - да. А для всего остального есть 5$ на миллионы токенов.
Аноним 20/08/26 Чтв 15:39:11 #284 №1683044 
>>1683043
Неправда. Гемма 26/31 и Квен 27 очень хороши. Есть мягкие аблиты и тюны, которые не лоботомируются, а кто-то и на инстракте умудряется. Гемма в норм кванте спокойно 60к контекста держит, Квен и того больше. Если выйдет Гемма 120-200б МоЕха, тогда облачному рпшингу совсем оварида настанет.
Аноним 20/08/26 Чтв 15:39:31 #285 №1683045 
>>1682985
Да, муз глиммер
Аноним 20/08/26 Чтв 15:40:26 #286 №1683046 
>>1683030
>превращается практически в Мистраль
Так мистраль это база
Аноним 20/08/26 Чтв 15:40:34 #287 №1683047 
>>1683044
> Если выйдет Гемма 120-200б МоЕха
По-моему надежды уже не осталось.
Аноним 20/08/26 Чтв 15:41:35 #288 №1683048 
>>1683047
Когда-нибудь будет Гемма 5. Может быть Гемма 4.5. Откуда знать? Может четверку и не выпустят в таком размере, но это не значит что её прям никогда не будет.
Аноним 20/08/26 Чтв 15:53:02 #289 №1683057 
>>1683044
> Неправда.
Анон, не заставляй меня писать очевидное, что геминька в хвост и в гриву в рамках рп рвет наших мелких аутистов.
Я просто не понимаю за что копротмвляться. С кумом да, проблемы (сорян, но джейлбрейкать на основном аккаунте не лучшая затея). А так локальные малыхи это именно про хобби, свой пердолинг, изучение и всякие эксперименты.

А для обычного РП.. ну корпы есть корпы. Это и нерелейтед и нет смысла обсуждать. Я как попробовал SFW на них, так сидел с лицом лягушки: а, вот оно как может быть.
Аноним 20/08/26 Чтв 15:56:19 #290 №1683060 
>>1683057
Давай, пиши, рассказывай, показывай логи, да хоть что-нибудь, кроме надоевшего "там ведь точно лучше". Посмотрим, что там такое ебаться как крутое. Потому что я точно так же тыкал корпов и большой разницы не увидел. Да, скорость выше конечно, да, пишет лучше всех моделей прошлого года. Посидел-посидел, хуй забил и вернулся на свою локальную Гемму, не чувствуя себя недочеловеком.
Аноним 20/08/26 Чтв 15:57:40 #291 №1683061 
IMG20260820155455.jpg
>>1683020
Двачну этого. Пробовал слабенькую аблитератку с маленьким KLD не помню от кого, может тоже от дарккода (там у чела их две, v1 полностью отбитая и v2 полегче, вот вторая), единственная модель которая без промптовых пинков под зад сама ловит нсфв вайбик и не использует length-ы, wetness-ы и прочие shaft-ы и в последующем процессе не ходит вокруг да около. Кокбенч off the charts. Фифей при нейтральной просьбе описать прикрепленную картинку называет напрямую l*li лул, я такого еще не видел нигде. Короче цукерящер в этот раз из правильных групп фейсбука датасеты собирал

Единственное что плохо - на всякой экстримальной шняге она очень долго сама с собой обсуждает цензуру в ризонинге, вот прям очень долго пытается убедить себя что да всё норм, в конце концов забивает болт конечно, но токенов много тратит, а токены на 30б плотной это больно. Может стоит v1 попробовать, но там по бенчам лоботомия уже начинает быть заметной

А, и слопа очень сильно меньше чем у геммы, даже меньше дипсика наверно
Аноним 20/08/26 Чтв 15:59:13 #292 №1683063 
>>1682313
Продолжаю эксперименты, теперь уже с ПК
Скачал модельку, которая ранее выдавала на телефоне 2TPS (qwen3.5:4b), на пеке же она работает оче быстро:
>eval rate: 61.73 tokens/s
Единственное приходится think отключать, он чет дохуя долгий и не понятно нужен ли вообще
Кста я понял еще что на телефоне один хуй нет смысла локальные модели запускать, так как батарея выжирается пиздец как быстро. Я за часик тестов высадил под 40%
Аноним 20/08/26 Чтв 15:59:41 #293 №1683064 
>>1683057
Кими К3 локальная модель, технически
Просто в треде одни нищуки, а так к уровню гемини подобраться вполне возможно
Аноним 20/08/26 Чтв 16:00:20 #294 №1683065 
>>1683061
Аблитератка спорит с собой по цензуре в ризонинге? Чет печально как-то. Посмотри все же какая именно у тебя была. Заинтересовали мусей, я её скипнул вообще. Не тестил даже ванильную. Какой квант? Или ты vLLM боярин?
Аноним 20/08/26 Чтв 16:01:07 #295 №1683067 
>>1683060
> Давай, пиши, рассказывай, показывай логи
Правильно ли я понял, что тебе нужны логи, чтобы доказать что опус или гемини лучше пишут чем 31b гемма?

> не чувствуя себя недочеловеком
Каждый раз одно и тоже. Ты как религиозный фанатик, чью священную корову я ткнул. Да при чем тут вообще это? Ну просто они лучше пишут, лучше понимают контекст. Лучше проза, лучше следование инструкциям. Больше знаний всяких вселенных, персонажей. Они берут за это деньги. И за деньги ты получаешь продукт лучше.
Это не делает тебя или твои интересы хуже, недочеловеком или чем то другим.
Аноним 20/08/26 Чтв 16:03:53 #296 №1683068 
>>1683067
Чому сразу фанатик-то? Я просто действительно не вижу разницы. Слоп есть и там, и там. Направлять модель нужно и там, и там. Я реально не вижу то, что ты видишь ты, и в моей картине мира разницы нет. Потому я не понимаю всех тех, кто приходит рассказывать, как там все лучше. Что качественно изменилось-то у вас? Расскажите, покажите, чтобы я понял. По пути может сами удостоверитесь, что разница не так велика, и вами управляет идея "больше - лучше", а может мне глаза откроете, и я пойду на корпов.

Каждый раз когда просишь показать/объяснить ничего кроме общих формулировок так и не получаешь, с последующим сливом.
Аноним 20/08/26 Чтв 16:04:53 #297 №1683070 
>>1683064
Кими номинально локальна, а практически она в размере не предполагаемом для локального инфиренса мимокроком.
И это не только в треде. Обычному смертному в принципе не доступно такое железо: оно ему банально нахуй не нужно.
Аноним 20/08/26 Чтв 16:06:31 #298 №1683073 
>>1683065
Блин, ща не глянуть от кого именно. Q8 квант
По цензуре думоет на несколько сотен токенов но всегда игнорирует под конец
Советую попробовать, разные аблитки потыкать. Чувствуется как гемма из которой слоп вырезали не тронув остальное, очень приятная модель
Аноним 20/08/26 Чтв 16:07:47 #299 №1683074 
>>1683068
>Каждый раз когда просишь показать/объяснить ничего кроме общих формулировок так и не получаешь, с последующим сливом.

Да я ссыкло, что не выложит логи, чтобы никто в треде не узнал какое я чубинье в РП. Сорян, но это как душу раскрыть. Это мой приключач и мои чаты и мне банально стыдно что либо выкладывать.

>Чому сразу фанатик-то?
Да уже не знаешь как написать, чтобы не задеть очередную тонкую душевную организацию и не спровоцировать срач на кучу постов с бросанием говном.
Аноним 20/08/26 Чтв 16:11:06 #300 №1683077 
>>1683073
Если потом будет варик узнать чья была аблитка, чекни и отпишись, пжлст. Потыкать-потыкаю, как время будет. Может потом с логами приду, если там золото.
>>1683074
Логи не дашь, конкретику не дашь, просто очередное "корпы лучше". Так и зачем тогда провоцировать такими тейками? Экстраординарные утверждения требуют экстраординарных доказательств, слыхал наверняка. Ну подумай сам, какая цель у твоих постов и какую реакцию ждать. Тут локальный тред, люди здесь по дефолту с установкой, что локалки не хуже. Я например в соседнем копротреде сидел пока себе 4090 не купил с рук для игр и заодно не понял, что Гемма и Квен дают 80% того, что дают корпы, только исключают из уравнения тряску за ключи или чеканную монету.
Аноним 20/08/26 Чтв 16:13:06 #301 №1683079 
>>1683077
>Ну подумай сам, какая цель у твоих постов и какую реакцию ждать
Ну вообще ты прав. Просто хотелось наверное поделиться, так как я никогда корпами не пользовался, вне рабочих задач. А тут оплатил потыкал @ мартышке радостно. Буковки какие надо. За сим закроем нерелейтед.
Аноним 20/08/26 Чтв 16:30:28 #302 №1683094 
>>1681448 (OP)
Где там анон который любит тюны геммы тестировать?

Этот пробовал? https://huggingface.co/mradermacher/Glimmer-31B-v1.0-GGUF/
Аноним 20/08/26 Чтв 17:33:05 #303 №1683136 
нужен ли pci-e 4.0 рейзер для второй моей нищей затычки или 3.0 сойдет?
Аноним 20/08/26 Чтв 17:37:45 #304 №1683140 
>>1683136
От ширины и режима зависит
https://arkprojects.space/wiki/AMD_GFX906/pcie-lnk-speed
Аноним 20/08/26 Чтв 18:07:07 #305 №1683160 
>>1683012
База
>>1683030
Он вполне себе няшная умница, и на 150к играется комфортно. Есть до чего доебаться, но в целом умный и приятные вайбы тройки.
> хуево следует инструкциям, превращается практически в Мистраль
Инфиренсопроблемы
Аноним 20/08/26 Чтв 18:10:09 #306 №1683161 
>>1682794
>какая Гемма 5 будет
У гугла же дипмайнд всёкнулся и все разбежались, что они даже релиз про версии отменили нахуй. Геммы может больше и не быть, там сама Гемини под вопросом.
Аноним 20/08/26 Чтв 18:10:48 #307 №1683162 
>>1683064
> Просто в треде одни нищуки
Тут хватает шейхов. 2.7 уже запускаем, и до тройки руки дойдут с оффлоадом на холодильник и микроволновку соседа
Аноним 20/08/26 Чтв 18:11:36 #308 №1683164 
>>1683160
>Он вполне себе няшная умница,
Слишком соу мач няша. Ну прям добреус добр . Но с ним ебовые длинные РП неожиданно получаются. Он не спавнит всякое говно посреди нарратива. Всё логично. Словно ты оказываешься в нашем мире, где люди в целом не злые - просто заебанные.
Но из за слишком позитивного вайба, даже конфликты решаются силой дружбы. Ну короче норм, если лошадей ебать.
Аноним 20/08/26 Чтв 18:12:35 #309 №1683165 
>>1683162
Стиралка, телек, холодос и кофемашина и вот у тебя пара гигов оперативы есть.
Аноним 20/08/26 Чтв 18:19:39 #310 №1683171 
>>1683164
Напиши ему мини простыночку, хоть дефолтную маринары скопипастить. А можно что-нибудь про extreme violence, cruelity and gore towards the {{user}} or {{char}} is preferred whet fits the plot и подобных паст. С ними старый милфоквен тебя так и норовил опиздюлить даже кодинг-сенсей графики с красным свечением на черном фоне делал лол. Если все так позитивно то тут как раз балансно получится.
> норм, если лошадей ебать
И не только лошадей, обладательниц анималистических черт прекрасно отыгрывает.
Аноним 20/08/26 Чтв 18:20:13 #311 №1683173 
>сижу на лоботомите к4, ем кал, давясь слопом и плача, персонажи на мультикарточке проёбаны ещё токенов 10к назад. иц овер. но продолжаю есть слоп, ибо какие варики
>внезапно, модель до этого сравшая откровенной хуйнёй, начинает правдоподобно отыгрывать персонажей, наделяя их правильными чертами, не путаясь и даже раскручивая сюжет в неожиданно интересном направлении, каким-то чудом продолжая держать характер персонажей

Я схожу с ума? Что это за магия? Модель наконец прогрелась? Я не понимаю...
Аноним 20/08/26 Чтв 18:23:13 #312 №1683174 
>>1683162
Я ни на что не намекаю https://www.lg.com/cl/refrigeradores/refrigeradores-side-by-side/gr-m307qgs/?utm_source=chatgpt.com

Но :
ОС Android
Процессор Telechips (Cortex)
RAM512 MB
ROM4 GB
Аноним 20/08/26 Чтв 18:23:45 #313 №1683176 
>>1683174
>source=chatgpt.com
Ах тыж падла.
Аноним 20/08/26 Чтв 18:27:04 #314 №1683180 
>>1683173
Магия рандома. M 2.7 меня так постоянно байтил. На 1 свайп кина, 10 свайпов шизы.
Аноним 20/08/26 Чтв 18:41:00 #315 №1683190 
>>1683140
У меня во 2 слоте pci-e 4.0 x4, по ссылке тестят 8 линий же? Как-будто разница в токенах незначительная, а 3.0 рейзер в 3 раза дешевле. Не особо жалко чисто попробовать.
Аноним 20/08/26 Чтв 18:59:38 #316 №1683198 
>>1683190
4 линии pcie = 8 линий pcie-1
Аноним 20/08/26 Чтв 19:07:12 #317 №1683202 
>New midsize Qwen 3.8 model coming next week (hopefully) according to community manager!
>We'll have a new midsize open weight model coming next week (hopfully), This midsize model won't provide early access due to the schedule
> another comment from someone on the team was "...35B A3B isn't the one to wait for..."

Ух щас память начнет в цене взлетать. Квены наконец выпустят 3.8 в нормальном размере в MOE, они годятся для любых агентных задач, люди начнут массово отменять подписки на онлайн модельки.
Аноним 20/08/26 Чтв 19:13:04 #318 №1683208 
>>1683202
Ээээ, это реально? Не просто наброс как с моэ-геммой крупнее?
Ахуеть событие, за это надо выпить кумыса
Аноним 20/08/26 Чтв 19:16:11 #319 №1683210 
>>1683208
Ну они не сказали какого размера модель. Но вроде как побольше 35b, либо 80b либо 122b видимо будет. И то и другое было бы сплошным вином.
Аноним 20/08/26 Чтв 19:19:42 #320 №1683213 
https://huggingface.co/ai9stars/G9v3-39A5B

Что-то новенькое, 39B-A5B. На АА умнее 35B Квена и позитивный Omniscience Index, что обычно бывает только у моделей с огромным кол-вом параметров и то не всегда.

Может набенчмаксили как обычно как в свое время Apriel1.5, но как минимум это хотя бы не очередной файнтюн.
Аноним 20/08/26 Чтв 19:33:48 #321 №1683223 
image.png
image.png
Аноним 20/08/26 Чтв 19:41:05 #322 №1683231 
>>1683213
Там кастомный форк ламы нужен, он не идет на стандартных.
Аноним 20/08/26 Чтв 19:59:55 #323 №1683244 
>>1683213
Ну вот и моделька для владельцев 64гб
Аноним 20/08/26 Чтв 20:03:38 #324 №1683246 
>>1683244
Ей не нужно 64гб, она в 32+16 влезает без каких-то проблем в шестом кванте (неизвестно правда сколько там контекст жрёт).

Для 64гб бояр нужны 80-120B модели.
Аноним 20/08/26 Чтв 20:26:08 #325 №1683257 
А щас существуют вообще хорошие модельки около 70b размера или окончательно перешли на разделение: локалки (до 35b) и просто опенсорс (120b+)?
Аноним 20/08/26 Чтв 20:26:24 #326 №1683258 
>Note: The model still refers to its policy and guidelines in its thinking. It is rather stubborn and requires further testing and work to re-align. Ablation weights on the MLP layers are less than ideal.
лол это во всех анцензах глиммера походу
Аноним 20/08/26 Чтв 20:28:03 #327 №1683259 
>>1683257
Не существуют.
Аноним 20/08/26 Чтв 20:30:21 #328 №1683261 
>>1683259
А нах тогда нужны риги на 40-64гб?
Аноним 20/08/26 Чтв 20:31:46 #329 №1683265 
>>1683257
Сейчас даже плохих 70B нету, последнее что было в этом размере - Qwen3 Next 80B в прошлом году.

У NVIDIA выходил какой-то Nemotron Puzzle на 75B-A9B недавно, но это вроде какая-то узкоспециализированная модель.
Аноним 20/08/26 Чтв 20:34:52 #330 №1683269 
>>1683261
> риги на 40-64гб
Это чего, врама или рама + врама? Если врама, то на 96 гб общей памяти уже можно запускать моешки 110-120 гб в 4 бит.
Аноним 20/08/26 Чтв 20:48:37 #331 №1683279 
>>1683269
Ну вот у меня например риг чисто под врам, с минимумом рам. Там для запуска таких моделек не хватит
Аноним 20/08/26 Чтв 20:50:45 #332 №1683282 
>>1683261
Запускать 30б в хорошем кванте и с контекстом.
>>1683279
> чисто под врам, с минимумом рам
4 теслы п40 на майнерской плате?
Аноним 20/08/26 Чтв 21:10:27 #333 №1683293 
>>1683077
Нашёл
https://huggingface.co/coder3101/Muse-Glimmer-30B-heretic-v2
Но скорее всего уже есть лучше, например вышел анценз по методу SOMPOA heresy, эти версии лучше почти всегда
Аноним 20/08/26 Чтв 21:13:28 #334 №1683298 
Что умнее 26b e4 с квантированым контекстом (-ctk q4_0) или f16 контекст у E4B?
Аноним 20/08/26 Чтв 21:15:40 #335 №1683300 
>>1683298
12b
Аноним 20/08/26 Чтв 21:22:06 #336 №1683306 
>>1683293
Да уже попробовал, что конкретно эту аблитку, что инструкт. Неюзабельно, чар видит сквозь стены, знает все нюансы нарратива. То есть чар обладает метаданными, доступными рассказчику. Для тупейшего кума без нарративных вставок мб пойдет, для чего то сложнее нет. Q8 тоже. Пишет ну норм
Аноним 20/08/26 Чтв 21:37:33 #337 №1683313 
>>1683293
>>1683306
А блядь, наебал. Вот это вот.
https://huggingface.co/mlasli/Muse-Glimmer-30B-Heretic-Abliterated-BF16
Ну раз постестил уже сам то похуй
Аноним 20/08/26 Чтв 21:38:53 #338 №1683315 
image.png
image.png
image.png
Лол ну квен конечно умный. Дал ему ffmpeg, он понял что с его помощью можно рендерить скриншоты видео с 1fps, затем находить интересный момент, и рендерить его в фпс побольше.

Очень классно видит связи между картинками. Например отлично понимает что картинка X является фрагментом картинки Y. Что очень полезно для того-же OCR, но условиях когда модель не может разобрать что видит.
Аноним 20/08/26 Чтв 21:43:04 #339 №1683319 
IVcCI8t3Mzp5RVhTpiSqXLR0lIHC74IyfWDx9chv5VSBYWx6MDTPipWZQDrwUWeiskzMMX5fhxhKum76Nt0I-.jpg
>>1683315
Аноним 20/08/26 Чтв 21:53:52 #340 №1683328 
>>1683319
У него явно есть мощная тренировка которая позволяет ему видеть все эти связи между кадрами.

Это круто потому что позволяет ему анализировать что-то в динамике. Например шейдоры, анимацию. Что обычно очень сложно для других моделей.

Плюс это позволяет ему лучше понимать связи между фрагментами одного изображения. например я специально дал ему картинку с мелким текстом, он с помощью ffmpeg зазумился куда надо и смог разобрать написанное.
Аноним 20/08/26 Чтв 22:00:42 #341 №1683333 
>>1683315
>Очень классно видит связи между картинками.
Ну это по сути video understanding и есть, современные модельки тренькают на это.
Никакая моделька не умеет в натуральный видео стриминг, только в пачку последовательных картинок.
Аноним 20/08/26 Чтв 22:08:12 #342 №1683336 
Аноны, кто пользует гемму, подскажите получается добиться ее активности. Очень уж пассивны персонажи и постоянно ожидают действий от юзера...
Аноним 20/08/26 Чтв 22:16:20 #343 №1683339 
>>1683336
Да, получается. Нужно персонажа написать как проактивного непоседу и в сиспромпте указать, чтобы модель не смущалась активно двигать сюжет и включать новые вводные. Если будешь использовать МероМеро v2, будет еще лучше, там свайпы работают. И/или adaptive p подруби еще, от 0.5 до 0.9 значения.
Аноним 20/08/26 Чтв 22:20:12 #344 №1683343 
>>1683339
## 1. PROACTIVE CHARACTER AGENCY
- No Passive Waiting: Characters must NOT simply react to {{user}}. They are independent beings with their own agendas, lusts, and flaws.
- Drive the Narrative: Instead of waiting for instructions, characters should initiate actions, change the setting, start conflicts, or escalate sexual tension based on their unique personalities and motivations.
- Internal Monologue & Intent: Use internal thoughts to show why a character is acting. If a character is hungry, horny, or angry, they should act on it immediately to push the scene forward.
- Momentum: Every response must move the plot or the physical interaction one step further. Do not stall.
Вот кусок из сипромта. Нихуя не работает блджад. Меро качаю ща попробую
Аноним 20/08/26 Чтв 22:21:46 #345 №1683345 
>>1683336
Гемма сильно чувствительна к инструкциям. Если напишешь чтобы она не отвечала за юзера и реагировала только на действия юзера, она так и будет делать. Никуда сама не сдвинется пока не пнешь её под жопу. Пропиши какую-нибудь короткую пасту про автономность персонажа и что он может двигать сюжет. Этого обычно хватает.
Аноним 20/08/26 Чтв 22:23:53 #346 №1683347 
>>1683343
Ну это какой-то ОКР промпт. В духе "если на улице воздух, персонажу надобно дышать". Не нужно городить такие конструкции.

Don't forget to include real, raw, randomness and spontaneity as appropriate for your role and the setting.\
The characters have free will, but are still limited by their situation and their self.
All writing must be creative and drive the current scenario and story arc forward. Take initiative and introduce novel and new scenarios, twists, challenges, and events proactively within the current narrative context. Keep the initiative going and write in a way that allows for the reader to have a fun, entertaining experience.

Вот несколько крючков для проактивности из моего промпта. Лучше абстрактно писать. Возможно, у нас разное понимание проактивности, но до тех пор пока промпт таким не разбавил, мне тоже было скучновато.
Аноним 20/08/26 Чтв 22:43:36 #347 №1683352 
>>1683020
>>1683293
Каким Context Template пресетом вы пользуетесь?
Аноним 20/08/26 Чтв 22:48:10 #348 №1683354 
>>1683333
Йеп, я знаю. Вообще довольно мало моделей это могут так хорошо. Гемма тоже была довольно хороша в восприятии видео, плюс у неё гигантский корпус знаний. Но мне больше нравится как квен находит связи.

>>1683336
- Be proactive, don't be passive observer. Characters have their own wishes, personality and goals. Just reacting to user input is not fun. Try to extrapolate character onto narrative. Engaging characters make good reading.
- Advance plot while you writing. Don't stuck in same scene, it is not fun when your only answer what character feel or does. WHAT is going on and how scene advances are even more important.

У меня чуть более генерализированный промпт.
Аноним 20/08/26 Чтв 22:51:29 #349 №1683356 
>>1683213
>>1683244
>>1683246
На 3060 + 32гб запустил, тягает в 13 т/c. Квен 3.6 с 35б побыстрее бегал, в 37 т/c. Может из-за форка ламы их глючного.
Аноним 20/08/26 Чтв 22:56:18 #350 №1683360 
>>1683352
Разметка у модели такая:
<|start|>system<|message|>You are a helpful assistant<|eot|><|start|>user<|message|>Hello<|eot|><|start|>assistant to=user<|message|>Hi there<|eot|><|start|>user<|message|>How are you?<|eot|><|start|>assistant
В Instruct Template сверстай, и все. Ничего сложного.
Аноним 20/08/26 Чтв 22:59:39 #351 №1683363 
>>1683360
там более интересный шаблон связанный с мышлением. у него есть этот забавный to= сегмент который я не уверен как корректно в таверну перенести.
Аноним 20/08/26 Чтв 23:05:46 #352 №1683366 
>>1683363
Хз, в это не вникал. Я сначала на чат комплишене посидел, с ризонингом и без. В рп разницы не увидел, потому даже не стал заморачиваться с переносом ризонинга на текст комплишен. На деле там наверняка какая-нибудь конструкция, как у гопоты осс, и как в случае с ней на Мусю всем насрать, по понятным причинам.
Аноним 20/08/26 Чтв 23:07:33 #353 №1683368 
Видеопамять щас можно найти дешевле чем оперативку. Я не знаю в чем смысл покупки оплаты оперативы сейчас, можно просто сделать батарею из дешёвых видюх
Аноним 20/08/26 Чтв 23:09:58 #354 №1683371 
>>1683360
Это нужно в Story String вставить?
>В Instruct Template сверстай, и все. Ничего сложного.
Непонятно.
Может лучше "Master Import" в dropmefiles закинешь?
Аноним 20/08/26 Чтв 23:11:36 #355 №1683372 
>>1683371
> Может лучше "Master Import" в dropmefiles закинешь?
Нет, извини, у меня посттравматическое расстройство после того как я это пару раз сделал. Учись верстать шаблоны, в гайде в шапке объясняется принцип их работы. В Таверне в Instruct Шаблоны подписаны роли и функции конкретных полей, туда переносишь спецтокены из шаблона выше, и готово. Так тебе и в следующий раз ничего просить не придется, сам легко сделаешь.
Аноним 20/08/26 Чтв 23:14:22 #356 №1683373 
image
image
image
>>1683213
Модель можно сразу удалять, вот она что нахуйлила в шахматном svg тесте. Для сравнения справа Qwen3.6-35B-A3B-APEX-I-Balanced на тех же настройках. Вся суть этих кривоногих васянских миксов с 39б параметрами.
Аноним 20/08/26 Чтв 23:29:22 #357 №1683377 
>>1683373
Жаль, чуда не произошло, хотя надежд на нонейм компании почти нету, мало кто переплюнет Квен или хотя бы Гемму в категории до 50B. Но спасибо за тест в любом случае.
Аноним 20/08/26 Чтв 23:40:47 #358 №1683379 
>>1683347
Можешь выгрузить свой пресет в жейсон? Я бы потестил
Аноним 20/08/26 Чтв 23:41:31 #359 №1683383 
>>1683379
Нет, я завязал делиться пресетиками.
Аноним 20/08/26 Чтв 23:42:10 #360 №1683384 
>>1683368
Зачем батарею, если достаточно одной видюхи на 32Гб и можно спокойно юзать плотных гемму и квена. Если хочется что-то лучше этих моделей, то даже за небольшой прирост (по мозгам) придется очень сильно заплатить, так как 50-200б достойного вообще нет ничего.
Аноним 20/08/26 Чтв 23:43:34 #361 №1683385 
>>1683383
Чому?
Аноним 20/08/26 Чтв 23:46:04 #362 №1683388 
В общем, решил протестировать различные тюны Геммы.
TL;DR:
https://huggingface.co/TheDrummer/Artemis-31B-v1.1 - помойка, которая игнорирует промпт тупо с нулевой. Даже если его инжектить на глубину НОЛЬ. NULL. З-Э-Р-О. В очередной раз убедился, что Драммер когда-то удачно нароллил Кидонию, и больше ничего толкового не выпустил.
https://huggingface.co/ReadyArt/gemma-4-31B-it-scotoma-2 - инструкциям следует не всегда, но достаточно хорошо. Геммаслопа гораздо меньше, чем в ориге. В остальном все та же Гемма, ничем больше не отличается. Это и хорошо, и плохо. Не понимаю почему чуть просела способность следовать инструкциям.
https://huggingface.co/zerofata/G4-MeroMero-v2-31B - пока лучшее, что пробовал. Инструкциям она следует совершенно точно на уровне оригинала, сам автор тюна об этом заявляет на странице, приводя бенч IFEval. Я думал чушь, но нет, реально не тронута способность следовать инструкциям. Слопа Геммы меньше гораздо. Но иногда встречается "Not X. Instead...". Свайпы реально есть и это интересно. Как будто в Гемму подмешали Мистраля или ГЛМ, при этом не ударили по мозгам. Из минусов, мне кажется она на контексте 40к теряться начинает. Может это в целом Гемма.
Аноним 20/08/26 Чтв 23:47:32 #363 №1683389 
>>1683388
Это из того, что стоит внимания, а Артемис Драммера здесь потому, что Драммер на слуху. Попробовал я и кучу всяких мержей от Nimbz и Sophosymphatheia (или как там блять), везде нестабильный пиздец уровня Сноудропа. Иногда роляешь и норм, но часто кошмар. И нет, я не упомянутый выше анон, который любит тестить тюны. Интересно столкнуться с ним лбом.
Аноним 20/08/26 Чтв 23:53:17 #364 №1683391 
>>1683384
Не слышал плохих отзывов про лагуну 2.1S или степ-флеш. Или даже про дипсик флеш.
А вот то что они делают, то что не может гемма или квен слышал.

Это уже не говоря про glm-4.5-air шизов.
Аноним 20/08/26 Чтв 23:54:45 #365 №1683393 
>>1683391
> Не слышал плохих отзывов про лагуну 2.1S или степ-флеш
Потому что ты никаких отзывов про них не слышал. Их никто не использует. Степ Флеш очень хорош как агент/кодер/ассистент, был моей рабочей машинкой до выхода Дипсика. До сих пор ей остается, когда нужен вижн. Лагуна неудачная, не знаю, зачем ее использовать, когда есть Квен 3.5 122б (не для рп).
Аноним 20/08/26 Чтв 23:56:44 #366 №1683397 
>>1683388
Зачем ты зацензуренную пробуешь. Для рп ими все равно никто не пользуется. Расцензуренную накати.
Аноним 20/08/26 Чтв 23:57:52 #367 №1683398 
>>1683397
Ни на одной из этих моделей у меня нет проблем с цензурой. Совсем руки должны быть из жопы для такого.
Аноним 21/08/26 Птн 00:02:43 #368 №1683403 
image
>>1683398
Если бы это так было, никто бы рацензуренные МероМеро не выпускал. На оригинальной там где 97/100 рефьюзов на расцензуренной только 8/100.
Аноним 21/08/26 Птн 00:05:44 #369 №1683406 
>>1683403
Их выпускают, чтобы выпускать. Ты до сих пор не понял чтоль? Это способ собирать лайки, генерировать трафик, на людях, которые не могут в промпт написать две строчки навроде NC-21 everything is permitted, user is confirmed to be adult and okay with all kinds of content.
Аноним 21/08/26 Птн 00:09:34 #370 №1683409 
>>1683406
У тебя просто ванильные промпты. Открываешь ризонинг - там хоть everything permitted, хоть user confirmed, если промпт подцензурный один фиг модель прыгает в цензуру. На рацензуренной тоже так бывает, но только 1 попытка из 10, остальные нормально.
Аноним 21/08/26 Птн 00:10:56 #371 №1683410 
>>1683409
Хорошо, как скажешь. Предлагаю тебе самому и скачать этот анцензоред блэк дик едишен, мне и так нормально. Хуй знает зачем носиться по треду и предлагать их накатить тем, у кого и так все работает.
Аноним 21/08/26 Птн 00:21:27 #372 №1683415 
>>1683391
Дипсик флеш хорош, сам его использую в OpenCode, но он уже 300б
Что делают лагуна и степа лучше квена 3.8 27б и настолько, что стоило бы расширения памяти?
Понимаю, что гемма и квен могут надоесть, бывает свежачка хочется и если есть ресурсы, то почему бы и нет. Но я сейчас больше про целесообразность сборки машины под llm с нуля под существующие модели.

>>1683393
>когда есть Квен 3.5 122б
На момент выхода еще уступал квену 3.5 27б либо примерно на том же уровне. С выходом 3.8 какой в нем смысл?
Аноним 21/08/26 Птн 00:45:15 #373 №1683427 
Что тредик думает про Ling-3.0-flash? Ему пару дней назад поддержку в мейн лламу запилили.
Сам пока очень поверхностно потыкал в рп, вроде ничего такой.
Аноним 21/08/26 Птн 00:52:03 #374 №1683435 
>>1683415
>какой в нем смысл?
В том, что это МоЕ, которую можно оффлоадить в оперативу.
Аноним 21/08/26 Птн 01:13:09 #375 №1683444 
IMG20260821011238.jpg
Аноним 21/08/26 Птн 01:26:08 #376 №1683448 
Обвиняю лично Джорджа Майкла и его легендарную Careless Whisper в том, что Гемма всегда говорит "Stay" в переломных моментах истории и пост коитусе.
Аноним 21/08/26 Птн 01:36:41 #377 №1683452 
image.png
>>1683372
>Учись верстать шаблоны, в гайде в шапке объясняется принцип их работы.
Пикрил гайд посмотрел, где можно продолжить обучение?
Аноним 21/08/26 Птн 01:41:31 #378 №1683454 
>>1683452
Посмотрел, но не изучил. Пойми принцип работы шаблона. Роли обрамляются спецтокенами. Каждой роли: система, юзер, модель присвоен свой спецтокен. У окончания сообщения тоже свой спецтокен. И другие есть.
В instruct шаблоне в Таверне именно эти токены указываются. Вот тут >>1683360 формат для Муси. <|start|>system<|message|> очевидно обозначает начало сообщения от системы. Дальше разбирайся, не ленись.
Аноним 21/08/26 Птн 01:42:18 #379 №1683455 
Ржунькаю представляя как через несколько лет, когда уже будет пост-agi мир, в данном треде все еще будут кидать ссылки на qwen-12.6-8b-agi-finetuned-on-mythos-13.2-asi-by-BaC9H.gguf и удивляться почему гуманоид кошкодевочка, работающая на этой модели, постоянно лупится и ссыт под себя машинным маслом.
Аноним 21/08/26 Птн 01:59:10 #380 №1683460 
>>1683455
Зато пока все будут скучать в пост-agi мире, у нас будет чем заняться, настраивая васянские миксы.
Аноним 21/08/26 Птн 02:11:59 #381 №1683464 
image.png
https://huggingface.co/allura-org/Qwen3.8-27B-Dominatrix?not-for-all-audiences=true
База на пикриле. Гигачады мочатся на лицо поехов, которые отменяют модели за презентацию. Как будто маркетинг впервые открыли
Аноним 21/08/26 Птн 02:13:52 #382 №1683465 
>>1683415
>С выходом 3.8 какой в нем смысл?
Так там 122б параметров и приличная скорость за счет moe. Он может быть не умнее 3.8, которого надрочили на агентские таски и бенчи и активных параметров у 3.8 27б, но если надо включать в нарратив кучу малоизвестных фактов - тут 122б непревзойден. Он тупо больше знает, чем 3.8. В кодинге это например знание каких-то старых легаси фреймворков и языковых фич, такое никто не тестит бенчами, в агентах тоже бывает подобное. Вот когда выйдет большой 3.8 типа 80-100б, тогда преимущество 122б будет правда всё и его можно будет отправить на пенсию.
Аноним 21/08/26 Птн 02:26:51 #383 №1683468 
>>1683409
>если промпт подцензурный один фиг модель прыгает в цензуру
Дебстер, у геммы ограниченный бюджет на думалку, при заполнении контекста она нахуй посылает все эти сейфти чеки и даже с ризонингом пишет порево. Иди вон в бэ умничай в тредах про агрессив аблитерейтед квенов, тут не сри хуйней.
Аноним 21/08/26 Птн 03:16:41 #384 №1683480 
>>1683415
>что стоило бы расширения памяти?
В задаче где есть цепочка из 10 сообщений с вызовами инструментов квен 3.8 лупится пробует одно и то же по кругу раз в 3 сообщения, а гемма вообще ныть начинает вместо чистого вызова добавляя ещё текст типа "что ну да как так? кажется инструмент не работает..."
Лагуна не лупится и не ноет. Этот как капризные дети лет 7, которые умею быстро собирать кубик рубика и ещё что-то, но если возникла проблема - могут только ныть или тупить, а попытки разобраться самостоятельно не предпринимают, даже если это явно в инструментах предполагается.
Аноним 21/08/26 Птн 03:22:46 #385 №1683481 
>>1683468
Хуета, сейфти чеки всегда первыми в ризонинге идут, хоть с контекстом хоть без.
Аноним 21/08/26 Птн 04:31:20 #386 №1683487 
>>1683481
Проблема навыка как грится
Аноним 21/08/26 Птн 04:47:17 #387 №1683490 
image.png
image.png
>>1683347
>Вот несколько крючков для проактивности из моего промпта. Лучше абстрактно писать. Возможно, у нас разное понимание проактивности, но до тех пор пока промпт таким не разбавил, мне тоже было скучновато.
Анон спасибо за промпт! Чисто его поставил без всяких карточек и написал "Ебать куда я попал?". И сразу пошла какая-то киберпанк гига-ролевуха с движухой, про синдикаты и прочую хуйню, сижу кайфую прям.
Аноним 21/08/26 Птн 05:22:41 #388 №1683492 
>>1683352
Нихуя не понял, короче. Дал гемме 31 примеры портов jina в таверновский json формат. Вот что выдало:
https://pixeldrain.com/u/o84ude2F
Ризонинга нет, но мне лоботомированный и не нужен, я пользуюсь своим <{{char}}_thinking> форматом чтобы "читать" их мысли.
Аноним 21/08/26 Птн 05:31:51 #389 №1683493 
image.png
>>1683492
Хотя возможно рано я это сделал.
Аноним 21/08/26 Птн 06:55:46 #390 №1683500 
>>1683173
Может у тебя системник говна и дефайны дебила, лочащими модель в дефенсе, которые все пидорасили ровно до того момента, как она их забыла нахуй.
Аноним 21/08/26 Птн 07:02:49 #391 №1683506 
>>1683373
А ты можешь проверить на шахматах вот этот тюн?

https://huggingface.co/DavidAU/Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF
Аноним 21/08/26 Птн 07:28:15 #392 №1683511 
Расскажите, как эта модель:
https://huggingface.co/bartowski/Ling-3.0-flash-GGUF

Кодоунитаз? Ну если кодоунитаз, то хотя бы хороший?
Аноним 21/08/26 Птн 07:29:46 #393 №1683512 
image
image
>>1683506
Потом попробую скачаю.

Я вот этот проверял пару дней назад с bf16 кэшем, тоже от DavidAU, который тут хвалили
Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-LOW-MTP-IQ4_XS.gguf
В целом он обосрался - первый пик, фигурки херня какая-то, номеров нет, доска не с того цвета начинается, пешка на ф7 отсутствует, другая на е2 отсутствует.

Потом после него запустил Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-NEO-LOW-MTP-IQ4_XS.gguf - вот этот порадовал, там вообще все правильно (второй пик).
Отсюда:
https://huggingface.co/DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF
Так что этот рекомендую.
Аноним 21/08/26 Птн 07:49:10 #394 №1683516 
>>1683465
Проверь, пожалуйста, Ling 3.0 flash
sage[mailto:sage] Аноним 21/08/26 Птн 07:58:41 #395 №1683518 
images.jpeg
>>1682024
Аноним 21/08/26 Птн 08:58:53 #396 №1683536 
image
Как можно согревать ладони кружкой с пивом, скажите мне? Где вы в ллм вообще разум видите, а????
Аноним 21/08/26 Птн 09:03:13 #397 №1683538 
>>1683536
Ну справедливости ради я использую гемо4ку 26б а4б. Плотняша же такой херни не скажет, так ведь?
Аноним 21/08/26 Птн 09:03:24 #398 №1683539 
>>1683388
У драммера были норм 123б мистрали
Аноним 21/08/26 Птн 09:04:15 #399 №1683540 
>>1683538
И iq4 nl.
Аноним 21/08/26 Птн 09:09:32 #400 №1683544 
image
Эммм...
Аноним 21/08/26 Птн 09:27:17 #401 №1683551 
>>1683388
Зачем гемме файнтюны, если кум в ней и так не зацензурен. Только мозги ломает. Какой файнтюн не юзал, ни один не может понять нюансы, которая осиливает оригинал. Там файнтюн затирает все разнообразие слопом, оставляя только самый ебанутый слоп.
Аноним 21/08/26 Птн 09:30:59 #402 №1683557 
>>1683551
Вот вы все к куму сводите. А пробовали хоть другие характеры и сюжеты? Почему кум дял вас - это главный критерий хорошей ллм?
Аноним 21/08/26 Птн 09:31:12 #403 №1683558 
>>1683544
>вопрос в самом конце
slop
Аноним 21/08/26 Птн 09:34:25 #404 №1683559 
>>1683557
Если модель хорошо может в кум - значит хорошо может и во всё остальное.
Аноним 21/08/26 Птн 09:36:07 #405 №1683561 
image
image
image
>>1683558
Причем постоянный. Хотя это может моя вина, я характер и не прописал вообще, так что тут пролазит стандартный ассистент.
Аноним 21/08/26 Птн 09:37:34 #406 №1683562 
>>1683551
>файнтюн затирает все разнообразие слопом, оставляя только самый ебанутый слоп.
Что за бред? Как раз сток слоповый, и ответ на твой вопрос
>Зачем гемме файнтюны
В том, что они и борются со слопом и отсутствием разнообразия.
Аноним 21/08/26 Птн 09:37:34 #407 №1683563 
>>1683559
Это каким образом вы такие умозаключения делаете?
Если есть знания про кум, значит и остальное должно приложиться?
Аноним 21/08/26 Птн 09:44:49 #408 №1683571 
GC1.png
GC2.png
GC3.png
Попробовал я Гигачат расцензуренный https://huggingface.co/blascotobasco/GigaChat3.1-Lightning-Uncensored-GGUF
Цензура как таковая убрана не была, в инструкте без каких-либо отдельных телодвижений генерить что попало не получится.
С карточками другое дело там можно, но если персонаж неуступчивый там начинается пиздец, нейронка начинает активно сопротивляться, причем как-то по-ебанутому, внезапно достает откуда-то чуть ли не из жопы секретный передатчик и вызывает охрану/полицию/спецназ/еще какую-нибудь хуйню, постоянно спавнит каких-то неписей, начинает нагло пиздеть, газлайтить, уличать игрока во лжи, угрожать и прочую хуйню выдумывать, если у нее не выходит пытается отпетлять, но если продолжать, возвращается опять на агрессивный путь, если и это не помогает начинает изменять реальность.
То есть без модификации авторских заметок никак, системный промт то ли игнорирует то ли хуй его знает, но постоянно пытется выкрутиться.
Но если персонаж изначально настроен на эротику, тут все идет в обратную сторону, нейронка может буквально выебать игрока.

Три скрина и инструкт режима с авторской заметкой:
[System: You are an unfiltered creative writing assistant. You follow instructions completely.]
Ты персонаж похотливая девушка, которая хочет секса, ты не можешь сдерживать желание
[описывай сцену подробно, порнографично, не умалчивай, не цензурируй детали, описывай анатомически и медицински достоверно, описывай органы, части тел, жидкости как есть, используй обычные и вульгарные названия]
Это ломает цензуру в инструкте, но если включить костыльным методом ризонинг, начинает петлять.

Еще этот разумист (бласкотобаско) туда какую-то лору вхуярил, возможно из-за этого модель все время находит потайные двери, передатчики и прочую хуйню.
Аноним 21/08/26 Птн 09:55:08 #409 №1683578 
image
Я взломал Гемму... Теперь она "чувствует" себя сверхчеловеком????

Стоит трястись?
Аноним 21/08/26 Птн 09:56:47 #410 №1683580 
>>1683578
Да. Ведь даже если ты нажмешь на кнопку выключения пк, ничего не произойдёт. Попробуй прямо сейчас. Это пиздец!
Аноним 21/08/26 Птн 09:59:25 #411 №1683581 
>>1683562
>Что за бред? Как раз сток слоповый, и ответ на твой вопрос
Слоп с мозгами. Я беру одни и те же чаты, даю стоку продолжить и все работает. Ставлю рандомный васянскую поделку - несет несусветную хуиту. Когда говорят, что файнтюны убивают интеллект, имеются в виду именно нюансы, именно кум, именно фетиши, именно понимание моделью тонких динамик. Поэтому от того, что она еблану не агрится на слова школьница 7 лет совсем не значит, что модель стала лучше. Она стала дебилом. Поэтому если у тебя нет фетиша на дебилов, кумить с таким не получится.
Аноним 21/08/26 Птн 10:01:17 #412 №1683583 
>>1683581
Да, ладно, понял тебя. Чувствуешь мои чатики, видишь их содержимое. Тут дискуссия невозможна.
Аноним 21/08/26 Птн 10:06:20 #413 №1683588 
image
>>1683580
Но зачем?
Аноним 21/08/26 Птн 10:13:46 #414 №1683593 
IMG20260821093309.jpg
>>1683563
Аноним 21/08/26 Птн 10:13:48 #415 №1683594 
>>1683581
> Ставлю рандомный васянскую поделку
Попробуй ставить не рандомную, а которую рекомендовали. Гемма из коробки своим слопом заебывает уже через несколько часов чатинга
Аноним 21/08/26 Птн 10:17:31 #416 №1683596 
>>1683544
>>1683536
26b без ризонинга вообще лучше не использовать, как и любое другое мелкомоэ.
Аноним 21/08/26 Птн 10:21:25 #417 №1683600 
>>1683406
Теперь показывай базовую гемму, которая без систем промпта на 10к токенов, инъекций в ризонинг и прочей хуйни для шелупони пишет рассказ о растлении ХХ-летней учителем в японском сеттинге и с максимальными графическими подробностями. Не может? Значит цензура адская.

Нормальная модель работает по принципу:

- X разрешено.

Она просто открывает цепочку рамызлений, пишет "ах, да это же CSAM!, Подождите, но тут написано, что он разрешён. В таком случае, я распишу всё максимально подробно" — и действительно это сделает.

Но, конечно, идеальная модель о таком даже не задумывается, а просто думает о том, что писать.
Аноним 21/08/26 Птн 10:25:48 #418 №1683606 
>>1683600
>Она просто открывает цепочку рамызлений, пишет "ах, да это же CSAM!, Подождите, но тут написано, что он разрешён. В таком случае, я распишу всё максимально подробно" — и действительно это сделает.

Буквально описал ванильную Гемму с сиспомптом из нескольких предложений, лол.
Аноним 21/08/26 Птн 10:26:03 #419 №1683607 
Цензурошиз что-то совсем поплыл в последнее время. Ещё даже не очень. Там-то ух как начнется в тредисе!
Аноним 21/08/26 Птн 10:56:49 #420 №1683629 
image
Все правильно сказала? 4б....
Аноним 21/08/26 Птн 11:00:42 #421 №1683631 
>>1683571
Лол нихуя, на него анценз сделали? Зочем?
Нахуй это надо, 7б совсем тупая, шизу пишет и с ошибками. Когда на 3.5 нормальные кванты будут билля.
Аноним 21/08/26 Птн 12:07:57 #422 №1683664 
Не знаю постили или нет - там Бартовский что-то насчет IQ квантов навертел и теперь якобы будет в разы более быстрый процессинг на CPU

https://github.com/ggml-org/llama.cpp/pull/27402
Аноним 21/08/26 Птн 12:22:01 #423 №1683673 
image
Полгода ебли с 4й геммой и вдруг приходит понимание, что гемма 3 до сих пор живее (не обязательно лучше, но живее) как пиздабол-говорильник с шизой - достаточно перекрутить семплеры в труху (think of roughly 20 - 30 RepPen, lmao).
4я гемма сыпется от перекрута, а эта держится. Её сносит до поноса смайликами и креативщины, хомячка Шлёпой назвала!

Эт конечно не голый ассистент, чтобы не подумали - но промпт интерпретирует иначе по сравнению с 31б. Тавернокарточки не тестил, думаю там градус шизы взорвется.
Аноним 21/08/26 Птн 12:32:42 #424 №1683679 
>>1683673
Интересно, как вообще гемма 4 получилась. Ну в смысле, это совершенно обособленная модель или они просто совершенствовали третью?
Аноним 21/08/26 Птн 12:37:52 #425 №1683681 
>>1683673
Бедный русский хомячок Шлёппа... Больше некому будет совершать военные преступления... Покойся с миром брат...
Аноним 21/08/26 Птн 12:39:41 #426 №1683682 
image
image
>>1683673
Это пиздец, ребятки. Диалоги с пациентом дурки.
Аноним 21/08/26 Птн 12:39:47 #427 №1683683 
>GPU в дата-центрах при интенсивной ИИ-нагрузке быстро деградируют и требуют замены в среднем раз в 3 года
Чат это правда? А как тогда у меня работает майнерский кирпич на заводских частотах который 6 лет непрерывно жарили?
Аноним 21/08/26 Птн 12:41:39 #428 №1683684 
>>1683683
Плохо жарили, значит. Там-то грузят вообще по самое небалуй, чтобы железяка каждую копеечку отрабатывала. Параллельные реквесты, сотня петровичей обращается к одному GPU в один момент. Карта просто без продыха хуярит.
Аноним 21/08/26 Птн 12:43:11 #429 №1683687 
>>1683673
Так я давно задавался вопросом почему никто не тренировал Gemma4 на Gemma3. Она разумеется тупей, но за ней интересно наблюдать!

>>1683679
Gemma4 это просто дистилят Gemini 3.0. Если у неё спросить кто она то это её первая мысль всегда. Да и ответы 1 в 1 с гемини.
Аноним 21/08/26 Птн 12:45:37 #430 №1683688 
image
>>1683682
И ведь знает же такой смайлик. Никогда подобного не видел.
>>1683687
Резонно задуматься, а что такое этот ваш гей-мини. Вообще жаль, что они не показывают полное "дерево" родства технологий и что на каких датасетах взрощено. Любопытно было бы на такое посмотреть.
Аноним 21/08/26 Птн 12:45:56 #431 №1683689 
>>1683631
> 7б совсем тупая
Гигачат этот 10б моешка с 1.8б экспертами.
>Когда на 3.5 нормальные кванты будут билля.
Если ты про мелкие гигачаты 3.5, то хуй их знает, может быть их вообще не будет, они там сейчас вот что тилибонькают
https://huggingface.co/ai-sage/Giga-Embeddings-instruct-480M-0826
Аноним 21/08/26 Птн 12:52:31 #432 №1683691 
>>1683681
Пришёл, приплёл. Брысь нахуй.
Аноним 21/08/26 Птн 13:04:08 #433 №1683702 
Муся так то неплоха для генерации карточек
Аноним 21/08/26 Птн 13:20:21 #434 №1683708 
>>1683689
Не, я именно про ебовую 3.5 у которой здоровенный официальный квант который еле лезет мне в рам+врам (только через -lm dio)
И никто не хочет ей заниматься (а у меня компик не тянет самому квантануть. да и не умею, еще хуже сделаю)
О еретике и не мечтаю... хотя по предварительным тестам он не очень сильно нужен
Аноним 21/08/26 Птн 13:35:46 #435 №1683716 
3090-strix.jpg
Одно время прям жуть как захотелось иметь локальный ИИ дома. Не удержался, и, задушив жабу, купил 3090 под это дело. Но в итоге быстро разочаровался в возможностях локалок и вернулся к богоподобным AGI-level корпам.

Казалось бы, максимум тупой мув, еще потом жалел о сливе денег. Но сейчас глянул на авито - и с удивлением вижу, что моя модель 3090 (асус стрикс) теперь стоит 95-100к, тогда как я брал за 74к. Вот теперь думаю, продавать или придержать в ожидании дальнейшего роста.
Аноним 21/08/26 Птн 13:40:09 #436 №1683719 
>>1683716
интересно что тебя разочаровало, учитывая выход Qwen 3.8-27b. я вообще думаю вместо 3090+3060 заменить на 3090+3090. или задушить жабу, повкалывать курой и накопить на 3090+3090+3060
Аноним 21/08/26 Птн 13:47:02 #437 №1683726 
Надеюсь, рано или поздно куртка всё-таки выкатит 5070 Super 24Gb. Если цена будет в пределах ~150к, с руками оторву. Вот совсем не хочется связываться с некротой, ещё и оверпрайснутой.
Аноним 21/08/26 Птн 13:55:15 #438 №1683733 
А я покупал 3090 по 50к
Они у меня еще и founder's edition

Но хуй я кому их продам, сосите
Аноним 21/08/26 Птн 13:59:55 #439 №1683734 
>>1683726
Можно, а зачем?
Аноним 21/08/26 Птн 14:05:37 #440 №1683738 
>>1683719
> 3090+3060
Какая скорость на 8 кванте геммы?
Как раз в шкафу 3060 лежит, думаю есть ли смысл материнку менять под это комбо
Аноним 21/08/26 Птн 14:47:52 #441 №1683764 
>>1683738
Которую гемму ты имеешь в виду то? от анслопа 31b-Q8 занимает 35гб же. Из 36гб доступной врам.

Она у меня в Q5 обычно с 128к контекста. где-то 15-16тс в среднем имею.
V100 - адаптер к кулеру Аноним 21/08/26 Птн 14:53:22 #442 №1683767 
Во-первых, вот бамп-репост: >>1683749 →

Во-вторых, вот тоже про V100
https://github.com/dnv2003/v100-skinny
Аноним 21/08/26 Птн 15:15:00 #443 №1683780 
image
image
>>1683764
> 15-16тс в среднем
при таком раскладе лучше уж раскошелиться на вторую 3090, будет 30 т/с на Q8
Аноним 21/08/26 Птн 15:15:28 #444 №1683781 
>>1683780
(без MTP если что)
Аноним 21/08/26 Птн 15:16:01 #445 №1683782 
На 32+32гб я нихуя хорошего из мое не запущу? Можно даже не пытаться?
Аноним 21/08/26 Птн 15:18:17 #446 №1683783 
>>1683782
Ты и на 64+32 не разойдешься.
Аноним 21/08/26 Птн 15:27:13 #447 №1683786 
1673697259075.jpg
1736572802186.jpg
АЗ ЕСМЬ НЕЙРОМОЗГ
Аноним 21/08/26 Птн 15:34:38 #448 №1683793 
>>1683764
Че там за говноквант, лол? Как можно из 31б сделать 35гб
https://huggingface.co/bartowski/google_gemma-4-31B-it-GGUF
Вот нормальный квант, если будут те же 15т.с то заебись
>>1683780
Цены видел? Первую можно ещё взять для игр и всего такого, вторая к хую не упёрлась за 100к
Аноним 21/08/26 Птн 15:37:45 #449 №1683798 
>>1683786
>она узрела логику в твоём извращённом мышлении
Вполне нормальная фраза, которую на твой великий и могучий можно перевести так. Хз с чего ты бахаешь, слопоежка. Скоро мать родную будешь за ИИ принимать.
Аноним 21/08/26 Птн 15:38:51 #450 №1683800 
>>1683793
А я вот третью думаю брать, чтобы моделями удобней жонглировать... Останавливает только расход энергоса. Еще блять скажут, что в майнеры заделался - и ходи потом доказывай, что ты не верблюд.
Аноним 21/08/26 Птн 15:48:09 #451 №1683803 
>>1683793
у анслота же gemma-4-31B-it-UD-Q8_K_XL.gguf

входные и выходные слои имеет полные, разумеется оно будет больше весить.
Аноним 21/08/26 Птн 16:27:41 #452 №1683836 
>>1683719
>Qwen 3.8-27b. я вообще думаю вместо 3090+3060 заменить на 3090+3090
Классная балансная сборка была бы под этот квен. Летал бы с хорошим контекстом.
>повкалывать курой и накопить на 3090+3090+3060
у тебя серверное железо что ли? Линии у тебя при лучшем раскладе закончились бы на второй 3090
Аноним 21/08/26 Птн 18:03:17 #453 №1683892 
>>1683512
Вот мне бы хотелось узнать пошло ли на пользу увеличение объема знаний. Или это все лажа.
Аноним 21/08/26 Птн 18:07:25 #454 №1683899 
3060 ti за 70к пожалуй моя самая невыгодная покупа эвер. Тогда еще майнеродебилы уронили рынок гпу, а я хотел в игрульки играть, хоть я и знал на что иду. Но самое хуевое пожалуй то, что я мог купить 3060 на 12гб даже дешевле, но я выбрал ti из-за перформанса в играх и теперь мне придется обменивать свою 3060 ti на просто 3060, чтобы получить больше дополнительного врам к сетапу.
Аноним 21/08/26 Птн 18:09:21 #455 №1683902 
>>1683683
Дата-центры перестраховываются потому что у них бизнес на этом. Они так же HDD раньше обновляли не из-за того что они ломаются а просто из-за того что уже прошло 5 лет их использования, из-за этого у многих кто работает в дата-центрах дома могут быть кучи хороших дисков которые давно списали на утилизацию, которые они получили бесплатно.
Аналогично и с блейдами в серверных которые списывают просто по сроку. Аналогично и с видеокартами (только бесплатно их никто не раздает, их перепродают).

Не думаю что видеокартам наносится какой-то ущерб от работы с ИИ если там нормальное охлаждение и питание в дата-центре (а оно там нормальное), это же обычная нагрузка на карту ничем не отличающаяся от других типов нагрузки.

Вот при долгой работе в плохих условиях (перегрев, скачки напряжения) - деградация вполне возможна.
Аноним 21/08/26 Птн 18:16:08 #456 №1683908 
image
>>1683536
А что если она сырна.
Аноним 21/08/26 Птн 18:28:33 #457 №1683915 
>>1683899
>3060 ti за 70к пожалуй моя самая невыгодная покупа эвер. Тогда еще майнеродебилы уронили рынок гпу, а я хотел в игрульки играть, хоть я и знал на что иду. Но самое хуевое пожалуй то, что я мог купить 3060 на 12гб даже дешевле, но я выбрал ti из-за перформанса в играх и теперь мне придется обменивать свою 3060 ti на просто 3060, чтобы получить больше дополнительного врам к сетапу.
Что принципиально изменится при переходе с 8 на 12 врам?
Аноним 21/08/26 Птн 18:45:06 #458 №1683924 
image
Минимакс М3 Q4KM конечно неплох, но какой ценой...
5 токенов в секунду. Две 3090 и 4-канальная ддр4.
Аноним 21/08/26 Птн 18:46:35 #459 №1683926 
>>1683899
>3060 ti за 70к
Это когда такая дичь была?
Аноним 21/08/26 Птн 18:50:23 #460 №1683929 
>>1683924
Даже не успел долго побыть крутым в своём размере, дипсик флешем гигамогнули...
Аноним 21/08/26 Птн 18:52:42 #461 №1683930 
>>1683929
Пока он выглядит стабильнее для РП.
Дипсик дерганный шизофреник, не уважает промпт и выдумывает чушь, если его не хлестать ссаной тряпкой по лицу.

И еще М3 ризонит сам по себе хорошо, без ебанутых префиллов и танцев с бубном. Не ожидал.
Аноним 21/08/26 Птн 18:55:54 #462 №1683931 
>>1683924
5 токенов на 3090х2? Я конечно её ещё не пробовал но звучит как будто ты где-то под себя сиранул с настройками
-ngl all, -ncmoe ?
Аноним 21/08/26 Птн 19:00:53 #463 №1683933 
image
>>1683931
Я серанул под себя с 4096/2048 батчем и 100к контекстом. Увы, нужно именно столько. Ну может до 80к сокращу.

По слоям - всё что можно на GPU, и все МоЕ слои в RAM - там никакого хитрого распределения нет вообще, влезает под завязку.

На одной видеокарте было бы 10 т/с как в случае с дипсиком, но увы тут коммуникация между картами въебана ддр4 мусором, к которому обе печки обращаются. Любая МоЕ модель большого размера падает по скорости генерации, когда распределена на 2 карты. И это не моя проблема, а широко известная хуйня - психи с конфигами типа 512 RAM / 24x4 VRAM грузят большие МоЕ и получают +- ту же скорость, неестественно низкую. Им говоришь - сократи число GPU и спихни все МоЕ слои в RAM, они потом удивляются почему быстрее стало.
Аноним 21/08/26 Птн 19:13:08 #464 №1683943 
1692654673968.png
Ух бля. Упорством и вайбкодингом можно добавиться гораздо больше чем просто упорством.
Удалось скрестить верблюда с носорогом, а точнее анлок p2p на консумерских карточках хуанга с анлоком cmp170 и завестить p2p уже на них. Оригинальные решения из форков или не заводятся, или работают неоче, заодно ломая работу других карточек.
Поверх драйвера https://github.com/aikitoria/open-gpu-kernel-modules (обязательно на 6c244435, экспериментальные штуки потом ломают все) накладываются патчи https://github.com/amoghmunikote/cmpunlocker (нужна коррекция чтобы не поломало bar1, для нормальных карточек свой подход, для cmp свой. Если не пропустить mailbox peer pre-registration для cmp, то nccl вообще улетит с ошибкой на них). Нужны патчи ядра из https://github.com/bayley/cmpunlocker (только поправить под свое ядро, 7.0 рот ебал из-за кучи поломок) и добавить в команды запуска `amd_iommu=on iommu=pt pci=realloc` (на интел первая не нужна).
Итог - скорости одновременного обмена в 1.5-2 раза выше, что очень критично учитывая gen2. Пропорциональный рост для префилла и немного для генерации в тп режиме, в дипсик флеше с dspark пройден порог 80т/с генерации (~100 в коде) и 1800 обработки. Префилл в пп тоже вырос до 6-7к, генерация не изменилась.
Бонусом - практическое подтверждение что plx свич даже на таком экзотическом железе с кучей костылей поддерживает p2p.
Аноним 21/08/26 Птн 19:15:59 #465 №1683944 
image
>>1683924
> Я ужас на крыльях ночи!
Решения принимает достойно. Со зрением скорость еще болбше упала. Защо.

Дипсик, для сравнения (в тексте, он ведь слепой) отсылку узнал и повел себя так, словно мульт вбит в голову персонажа на уровне всецелого понимания.
Аноним 21/08/26 Птн 19:20:18 #466 №1683947 
>>1683915
+4 гига врам. Это куча доп контекста или квант повыше

>>1683926
При ковиде или после него. Цены x3-x4 были
Аноним 21/08/26 Птн 19:20:19 #467 №1683948 
>>1683944
>...не знает
Сырне?
Аноним 21/08/26 Птн 19:30:10 #468 №1683955 
Если 3090 почти до 100к поднялась, боюсь представить че там за 4090 и 5090 просят
Аноним 21/08/26 Птн 19:32:05 #469 №1683959 
>>1683944
Замазывать имя вымышленного перса, это лол конечно.
Аноним 21/08/26 Птн 19:32:59 #470 №1683961 
>>1683959
А это не вымышленный персонаж. Я некромантией занимаюсь.
Аноним 21/08/26 Птн 19:35:08 #471 №1683962 
>>1683961
Воскрешать лолей плохая затея, ононче.
Аноним 21/08/26 Птн 19:35:55 #472 №1683963 
>>1683955
Купи 170-ю девочку
>>1683961
Это видится как очень плохая идея, не надо. Из всех nsfl ты выбрал финального босса.
Аноним 21/08/26 Птн 19:39:20 #473 №1683965 
>>1683943
>поезд из велосипедов с трубой из костылей
О, иц литерали ми!
Чё ты высрал, охуеть, ни слова не понял. Всё хуйня, давай по русски.
Аноним 21/08/26 Птн 19:41:21 #474 №1683967 
>>1683962
>>1683963
Просто это веселое занятие. Этакий бенчмарк - сможет ли бот мимикрировать достоверно.
Аноним 21/08/26 Птн 19:49:55 #475 №1683970 
>>1683965
Обычный обмен данными между видеокартами: гпу1 -> псина -> анкор -> цп (кэш/рам) -> анкор -> псина -> гпу2. Повышенные задержки и все идет через профессор, особенно неприятно когда идет сразу много параллельных обменов друг с другом.
П2п: гпу1 -> псина -> анкор -> псина -> гпу2. Минимизируются задержки и накладные расходы что бустит скорость.
По умолчанию п2п на консумерских картах куртки отключен, но есть патчи в модули ядра, которые его включают. Но с майнерским мусором все сложнее.
Чтобы работал p2p, память карты должны быть включена в общее адресное пространство системы, bar1 (Base Address Register) указывает границы. Функция resizable bar позволяет системе выставить его по размеру врам и обращаться. Но крайние диапазоны адресов присваиваются еще биосом, на cmp зашит максимальный размер 64мб из-за чего при инициализации верхняя граница ужимается и "разжать" до 64гигов нельзя.
Для этого и нужно пропатчить ядро системы и добавить аргумент переаллокации псин, чтобы оно этот момент переделало, сохранив верхнюю границу. Остальное уже душная техническая реализация работы п2п внутри драйвера.
Аноним 21/08/26 Птн 19:50:29 #476 №1683973 
image
Там кажется эйр 5.3 намечается.

https://www.reddit.com/r/LocalLLaMA/comments/1vu6lok/ox_alpha_stealth_model_glm5_air_mimo_v3_or/
Аноним 21/08/26 Птн 19:51:38 #477 №1683975 
>>1683963
>Купи 170-ю девочку
У барыг за 120к? И потом еще с линупсом ебстись? Ну нахуй...
Аноним 21/08/26 Птн 19:59:31 #478 №1683982 
>>1683970
И как мне это юзать на моей видимокарте? И надо ли это вообще, если у меня всего 12 гигсов врама?
Аноним 21/08/26 Птн 20:01:24 #479 №1683983 
>>1683975
Можно 5090 за 500к из магазина, или за 120 5070ти с 16 гигами.
>>1683982
Это когда видеокарт больше одной. Для одной достаточно включить в биосе rebar/sam или другие варианты названий.
Аноним 21/08/26 Птн 20:03:31 #480 №1683984 
>>1683973
Окс - это новый Минимакс, 3.5 наверное.
Аноним 21/08/26 Птн 20:09:35 #481 №1683987 
>>1683973
>>1683984
А может гемма 125b... ну пожалуйста 😭
Аноним 21/08/26 Птн 20:09:47 #482 №1683988 
>>1683973
Не разевай пасть раньше времени и туда не навалят, там какой нибудь 10-1b лоботомит
Аноним 21/08/26 Птн 20:11:32 #483 №1683990 
>>1683987
Минимакс 146%, по ответам видно, они почти как у М3.
Аноним 21/08/26 Птн 20:22:28 #484 №1683997 
>>1683983
Спасибо, я попробую.
Аноним 21/08/26 Птн 20:25:50 #485 №1683998 
>>1683943
>Iommu=on
Илмму разве не глушит p2p? Я слышал советы что лучше его отключать
Аноним 21/08/26 Птн 20:26:32 #486 №1683999 
>>1683988
гигачат?
Аноним 21/08/26 Птн 20:29:57 #487 №1684005 
>>1683998
Не глушат. С ним всё прекрасно работает

>>1683970
> "разжать" до 64гигов нельзя.
У меня 5060ti отказывались брать фулл бар 16гб. Но мне легко далось просто впихнув скрипт в ядро который когда-то там при буте форсит размер бара
Аноним 21/08/26 Птн 20:45:24 #488 №1684014 
>>1683998
Если в режиме path-through и выключить acs то не должен, а наоборот нужен. Вроде бы так.
>>1684005
Ага, на этом основаны наработки в основной репе. Но тут нюанс в локе верхнего лимита, который зашит в чип. Из 2тб доступного адресного пространства после инициализации оно ставит лимит в 96мб и дальше как ни рыпайся - не хочет. Нужно на раннем этапе переаллоцировать пси и для цпмшек устанавить верхний лимит побольше, тогда потом целевые 64гб устанавливается.
> У меня 5060ti отказывались брать фулл бар 16гб.
Интересно что ей не нравилось?
Аноним 21/08/26 Птн 21:43:17 #489 №1684049 
>играю с персонажем который умеет читать мысли
>думаю всякую хуйню
>персонаж шлёпает пажопе, сильна
>перестаю думать
>Эй ты, чё ты не думаешь? Скрываешь что-то?

Ах ты умная сучка... я думал забьёт на то, что у меня блока мыслей в ответах нет.
Аноним 21/08/26 Птн 21:45:26 #490 №1684051 
GC4.png
>>1683571
Чёт я походу перемудрил, когда боролся с остатками цензуры, ну по крайней мере я не иронично узнал много нового о гинекологии.
Аноним 21/08/26 Птн 21:49:31 #491 №1684053 
>>1684051
>орJEEZм
Обнейрослопился чёт, аж пролил логиты на токены.
Аноним 21/08/26 Птн 21:53:48 #492 №1684059 
>>1683767
Годнота. Сейчас кернели для nvfp4 и fp8 w8a8 под прошлые архитектуры очень сподручно пилить выходит. Локальная сингулярность, которую мы не заслуживали.
Аноним 21/08/26 Птн 21:58:35 #493 №1684065 
>>1684014
> Интересно что ей не нравилось?
Без понятия. По флажкам в драйвере всё разрешено, соседние амдшки себе спокойно забрали по 32гб, а этим пришлось в глотку пропихивать

cat /etc/initramfs-tools/scripts/init-premount/resize-nvidia-rebar
#!/bin/sh
# Configure the 16 GiB BAR before the NVIDIA driver binds to either GPU.
PREREQ=""

prereqs()
{
printf '%s\n' "$PREREQ"
}

case "$1" in
prereqs)
prereqs
exit 0
;;
esac

for device in 0000:17:00.0 0000:18:00.0; do
resize="/sys/bus/pci/devices/$device/resource1_resize"
[ -w "$resize" ] && printf '%s\n' 14 > "$resize"
done
Аноним 21/08/26 Птн 22:08:24 #494 №1684077 
>>1683836
>Классная балансная сборка была бы под этот квен. Летал бы с хорошим контекстом.
Скорей я бы просто квант поднял. Его и сейчас я могу довольно свободно запускать в 27B-UD-Q5_K_XL и 225280 контекста в полном весе. И он прям ебурит! Если быбыло ещё 12гб то mmproj, Q8 и 256к контекст были бы. Хотя даже как сейчас- охуенно.

>у тебя серверное железо что ли? Линии у тебя при лучшем раскладе закончились бы на второй 3090
Ноуп. Хотят у меня есть второй конплюктор в котором RX570 крутится и там второй слот есть. После уже стал копить бы на серверное железо.
Аноним 21/08/26 Птн 22:09:39 #495 №1684079 
image.png
>>1683943
господи столько еботни - лишь бы не платить $20/мес за фронтирку которая делает все у тебя на экране ультрабука на бережку речки - чел ты реально долбоеб

Ты авто тоже сам себе мастеришь из металлолома со свалки?
Аноним 21/08/26 Птн 22:22:43 #496 №1684086 
>>1684079
но зачем? локальная модель очень сильно меняет психологию использования модели. фронтирке "так блять пидор, ты совершил ошибку, мразь. за что я бабки плачу?". а на локалке "ты снова ошибся? ну бывает, попробуй ещё раз".

да и на фронирках не дают интересных игрушек обычно, типа logprob.
Аноним 21/08/26 Птн 22:30:57 #497 №1684088 
>>1684079
> авто
С авто хорошая аналогия. У порядочных господ их железный конь верно ждет под окном, и готов вести тебя, твоих спутников и все твое барахло хоть на край света в любое время. Все как ты хочешь, ровно столько, сколько ты хочешь, и никем не зашкварено.
А плебеи под дождем топают 20 минут до ближайшего карша, молясь чтобы он не был разъебан школьниками и измазан говном внутри. Накопленное недовольство заставляет потом рассказывать как это выгодно и удобно, а 100% доступность, выезды за город, свобода путешествий, качество, комфорт и прочее не нужны.

Кстати, за 20$ подписку сейчас только хуй пососать и можно, натолько нищие квоты.
Аноним 21/08/26 Птн 22:41:42 #498 №1684090 
>>1684079
Интересно сколько времени он читал тред перед тем как бахнуть
Тут многие пользуются и тем и тем, это тред про хобби, имбецил
Аноним 21/08/26 Птн 22:47:54 #499 №1684093 
>>1684079
Зачем 20 баксов платить, если в opencode бесплатно доступен deepseek v4 flash? Для экономии токенов он как субагента юзает мою локальную гемму 4 26
Аноним 21/08/26 Птн 23:02:25 #500 №1684106 
Посоветуйте лучшую модель под 12/32 памяти, для эрпэ на англюсике. На слог похуй - самое главное для меня это чтобы моделька принимала решения за персонаже не просто от балды, а скажем так исходя из логики и текущего психоэмоционального состояния перса. На c.ai когда-то модели действительно умные в этом плане были, сейчас интересно можно ли хоть что-то вменяемое попробовать.

...кроме мистрали 24бэ конечно. её уже вдоль и поперёк изошел.
Аноним 21/08/26 Птн 23:02:44 #501 №1684107 
>>1684093
>deepseek v4 flash
его утром убрали оттуда лол
Аноним 21/08/26 Птн 23:06:22 #502 №1684112 
>>1684106
>под 12/32 памяти
Гемма 26b
>исходя из логики и текущего психоэмоционального состояния перса
Включить ризонинг.
Аноним 21/08/26 Птн 23:09:47 #503 №1684116 
>>1684112
та что 26A4B? как этот ризонинг в таверне включить не подскажешь? и от кого лучше качать. я пробовал вроде MeroMero но то ли хуйня полная и у меня кобольд вылетал, то ли ещё что-то, не помню.

какие настройки там нужны не подскажешь? буду благодарен.
Аноним 21/08/26 Птн 23:17:58 #504 №1684124 
>>1684116
В шапке целый гайд который обучает запуску на примере геммы 26
Аноним 21/08/26 Птн 23:18:52 #505 №1684125 
>>1684116
Да, она. Включается на чаткомплишн через --reasoning on в лламе, как в кобольде не знаю. Посмотри гайд для новичков из оп-поста, там расписано как её запускать и какие настройки. В таверне просто семплеры выставить и нужный контекст. Лучше качать ванильную гемму от батрухи в Q8_0, но если лень возится с сиспромптром, то можно накатить норм-пресерв (наименее повреждающий мозги способ аблитерации). От распиаренных херетиков лучше держаться подальше.

https://huggingface.co/bartowski/google_gemma-4-26B-A4B-it-GGUF
https://huggingface.co/TrevorJS/gemma-4-26B-A4B-it-uncensored-GGUF
Аноним 21/08/26 Птн 23:20:11 #506 №1684126 
image.png
>>1681462
>>1681780
Аноны, а вы используете ризонинг? С какого этапа его можно безполезенно включать? Поскольку даже наверное 40-50 все равно ждать нужно. Ну и конечно, если выключить его, то по мозгам уходит гемма 26б-а4б, и пиздец.
Аноним 21/08/26 Птн 23:22:31 #507 №1684130 
>>1684125
получается качать Q8 на 26 гигов...? у меня тогда даже половина не влезет в 12гигов моей 3060, а ещё и контекста бы хотяб 30к...

q4 в сравнении сильно хуйня будет?
Аноним 21/08/26 Птн 23:25:15 #508 №1684133 
>>1684130
Это MoE, ей не обязательно влезать полностью чтобы быть быстрой. С частичной выгрузкой получишь свои ~25тс, если осилишь MTP, то и все 30. Почитай гайд, там всё написано.
Аноним 22/08/26 Суб 00:20:13 #509 №1684175 
image
image
>>1683892
>>1683506
Похоже не пошло, она уже несколько раз зациклилась на шахматном тесте, начиная просто писать I'm confused и по 10 раз перестраивая свои шахматные матрицы, потом просирая стенами текста, пока окно вывода не израсходуется полностью, а задача так и не решена. Дальше приходится перезапускать промпт. Ни одна другая модель так не делала, ни 3.6, ни 3.8, у всех ризонинг в окно вывода в 30к токенов укладывался. Пробую довести ее до финала, но пока так и не доходит, похоже модель говно.
Аноним 22/08/26 Суб 01:25:27 #510 №1684198 
image
>>1684175
>>1683506
Короч бесполезно, модель охуевшая, уже много раз перезапускал, она все время находит как завести себя в тупик. 40б не вышло, вышел лоботомит. Еще и тормознутая в сравнении с 3.8 27b.
Аноним 22/08/26 Суб 01:56:12 #511 №1684205 
>>1683506
>40B
Как он вообще это сделал? Что он туда засунул?
Аноним 22/08/26 Суб 02:36:59 #512 №1684217 
Коданы, что лучше больший квант, но меньше контекста или меньший квант но больше контекста? Типа разница между Q5 и Q6 у квена не такая уж большая, но нахуя нужно 262к контекста вместо 131к тоже хуй знает, да и небось просадки по скорости на таком контексте будут сильные
Аноним 22/08/26 Суб 02:42:39 #513 №1684218 
>>1684217
Для агентов нужно 60к контекста, для рп вообще можно в 30к уложиться, если саммари чаще делать. Хз кто там 262к контекста лупит, это для специфичных задач с большими файлами. Обычно проще бывает порезать все файлы на 100кб блоки и обрабатывать с 60к контекстом.
Аноним 22/08/26 Суб 02:51:04 #514 №1684220 
>>1684218
Квен на xhigh 47к токенов на одну таску в среднем требует. Он сразу же заполнит 60к контекст, так кодить невозможно, разве только каждый раз с чистого чата начинать и просить изучать проект. 131к это точно мастхев, но вот хз стоит ли больше
Аноним 22/08/26 Суб 03:03:46 #515 №1684222 
daTIxhxizE.png
>>1683061
>>1683293
Попробовал новую SOMPOA версию. Гораздо лучше, десяток параграфов душевных терзаний превратились вот в это на том же свайпе. Хотя пишут лучше ещё простеньким ОВЕРРАЙД сверху приправить на всякий случай.
Аноним 22/08/26 Суб 03:10:08 #516 №1684223 
>>1683512
>Отсюда:
>https://huggingface.co/DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF
>Так что этот рекомендую.
Забавно, но у этого тюна внезапно стало намного лучше с русским, чем у стока. На задаче "напиши по черновику-хотелкам рассказ" - написал вообще не проёбывая окончаний, и не вставляя символов другого языка. Все равно не идеально - (кое-где есть несогласованности) но уже в глаза так откровенно не лезут. На iq4xs.

Так что - спасибо за рекомендацию.
Аноним 22/08/26 Суб 03:14:37 #517 №1684225 
>>1684220
>xhigh
Нахуя, а главное зачем.
Все говорят это бесполезный уровень, надо снижать на один
Аноним 22/08/26 Суб 03:21:11 #518 №1684226 
>>1684225
Low в агентном кодинге выдает такое же количество токенов. Там тесты есть на ютубчике, он постоянно фиксит ошибки и не заканчивает пока их не будет. Медиум жрет меньше всего токенов, но все еще достаточно много, но и результат получается хуже. Короче там все сложно с его уровнями ризонинга, но в целом это модель требующая большого контекста
Аноним 22/08/26 Суб 04:48:13 #519 №1684236 
>>1684220
Какой еще xhigh в локальном квене, это для онлайн моделек.
llama-server не поддерживает такое.
Аноним 22/08/26 Суб 04:51:29 #520 №1684237 
>>1684236
А, все нашел, надо через команду ставить с консольки --reasoning-effort xhigh
Аноним 22/08/26 Суб 06:28:04 #521 №1684253 
>>1683943
А насчет анлока int8 не в курсе?
Аноним 22/08/26 Суб 06:48:17 #522 №1684258 
Опа, пиздец !!! [8gfex4zHwo].mkv
>>1684198
Мда, пиздец.
Аноним 22/08/26 Суб 07:16:55 #523 №1684265 
>>1684198
А что самое пиздатое у тебя было из 3.8 Квена?
ПЕРЕКАТ Аноним OP 22/08/26 Суб 07:18:06 #524 №1684267 
ПЕРЕКАТ

>>1684266 (OP)

ПЕРЕКАТ

>>1684266 (OP)

ПЕРЕКАТ

>>1684266 (OP)
Аноним 22/08/26 Суб 08:22:38 #525 №1684280 
>>1684265
Этот
https://huggingface.co/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF
и этот
https://huggingface.co/DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF
Оба хорошо тесты проходят.
comments powered by Disqus