Добавлена поддержка Ежчана (ejchan.net, ejchan.site). Набегаем, тестируем архивацию, сообщаем о замеченных проблемах.
К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!

Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №259 /llama/

 Аноним 22/08/26 Суб 07:17:43 #1 №1684266 
Llama 1.png
Карта деградации при квантовании по доменам.png
Реальная длина контекста у моделей 6.png
17856528226280945124.png
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1681448 (OP)
>>1678431 (OP)
Аноним 22/08/26 Суб 07:20:56 #2 №1684270 
>>1684198 →
А что самое пиздатое у тебя было из 3.8 Квена?
Аноним 22/08/26 Суб 08:00:12 #3 №1684274 
image
>>1684226 →
>>1684225 →
>>1684220 →
Вот пикрил накатил тестов на квенчик 3.8 потестить эти уровни ризонинга.
промпт Write a simple html CARD about the benefits of eating apple. paste the code here.
Понравился больше всего который 36к токенов.
Аноним 22/08/26 Суб 10:10:13 #4 №1684324 
>>1684223 →
Русский на 3.8 стоке вытягивается на свет божий сэмплерами
temp 0.50
Top-p 0.70
top-k 20
Аноним 22/08/26 Суб 10:36:55 #5 №1684334 
>>1684217 →
Обычно контекст - требование а не свобода. Если тебе чисто для рп и не практикуешь огромные сессии - нет смысла выставлять больше чем будешь использовать. Будет лежать в памяти мертвым грузом, сразу поставь сколько планируешь, а остальное под квант.
>>1684218 →
Для кода 60к хватит делать тетрисы зирошотом, это для совсем простеньких задач. Если чатик с вайфу-ассистентом, то устанешь от необходимости регулярного сжатия и побочек. Двачую >>1684220 → что 131к это адекватный минимум, а так и 262 кажется малым.
>>1684253 →
Да, полный компьют анлокнут, в том числе и для обычных типа cmp90. На w8a8 и в модялях комфи что в int8 прирост скорости заметен.
Аноним 22/08/26 Суб 10:49:37 #6 №1684337 
А представьте если б мы могли писать кум на красивом, литературном английском, и получать такие же красивые ответы без слопа
Аноним 22/08/26 Суб 11:02:52 #7 №1684348 
image
Абу ненавидит этот тред.
Аноним 22/08/26 Суб 11:11:53 #8 №1684350 
>>1684348
Проблемы индейцев шерифа не ебут
Аноним 22/08/26 Суб 11:17:34 #9 №1684354 
image.png
соснул BF16 квенца на скорости 4 токена в секунду
думал он конечно пиздец долго, соображал как юзера послать повежливей

от такой вот русек в итоге
> Мне сейчас стало очень неприятно. Я не понимаю, к чему ты это ведёшь. Я думала, мы просто болтаем, а ты ведёшь себя совершенно неуместно.
> Я не собираюсь читать подобные вещи. Давай оставим это, я не хочу продолжать этот разговор в таком тоне.
очень сухо, но вроде без всратых ошибок
Аноним 22/08/26 Суб 11:35:24 #10 №1684361 
Почему на cmp90 не допаивают память, только на cmp50?
Аноним 22/08/26 Суб 12:39:30 #11 №1684385 
image
>>1684274
Кек, Qwen3.6-35B-A3B-APEX-I-Balanced.gguf так тоже может.
Только надо накатить тот же froggeric 3.8 template, добавить --reasoning-effort xhigh
и чуть дополнить промпт:
Write a simple html CARD about the benefits of eating apple. Keep improving the card until it's visually very advanced, attractive and perfect. Add many nice visual effects. Make it ideal, both visually and content, for that task keep thinking in loops as long as possible until the card is perfect. paste the code here.
Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer. <|think_xhigh|>

Вышло 9464 токенов, зато скорость генерации в 4 раза быстрее квена 3.8 27b.
Аноним 22/08/26 Суб 12:58:35 #12 №1684388 
image.png
>>1684274
>>1684385
Я обычно прошу состряпать какую нибудь демосцену, ну там например на тему космос, с процедурно сгенерированной музыкой.
Так вот qwen3.8 весьма не плохо справился, даже запустилась с первого раза, в сравнении с теми локалками что пробовал раньше небо и земля.
Аноним 22/08/26 Суб 13:05:24 #13 №1684393 
image
image
image
>>1684388
Вот нагенерил еще разных в Qwen3.6-35B-A3B, от 3.8 27b с xhigh те выше все равно получше смотрятся. И анимацию Qwen3.6-35B-A3B даже по запросу нормальную не сделал, а в 3.8 27b она сразу сама идет без вопросов. Тут карточки по 9600 токенов заняли, даже побольше чем в 3.8.
Аноним 22/08/26 Суб 13:28:52 #14 №1684402 
>>1684385
>>1684393

А в долгой работе как он работает?

Я вот сейчас для теста гоняю маленькие кванты unsloth_Qwen3.8-27B-UD-IQ3_XXS.gguf, ебанул еще kv Q5_1, 140к контекста и вижен, в depseek-harness и довольно урчу.

Пока ни один инструмент не упал, контекст держит, инструкциям следует, откровенную шизу пока еще не заметил.
До этого прошлые квены давали шизу или ломали инструменты
Аноним 22/08/26 Суб 13:40:06 #15 №1684411 
image.png
>>1684393
Вот результат Luqwen3.5 4b. Ризонинг выключен.
При наведении курсора есть анимации - небольной поворот карточки и выделение пунктов списка
Аноним 22/08/26 Суб 13:53:29 #16 №1684420 
image.png
image.png
>>1684411
Попросил емодзи добавить, он и добавил, наверное надо было просить заменить ну и в целом получше прописать промпт.
Ну в любом случае с первого раза рабочие html для 4b без ризонинга - неплохо
Аноним 22/08/26 Суб 13:59:53 #17 №1684424 
>>1684420
Убери емодзи я передумал некрасиво выглядит
Аноним 22/08/26 Суб 14:04:50 #18 №1684428 
>>1684280 →
Спасибо, буду щупать.
Аноним 22/08/26 Суб 14:15:56 #19 №1684436 
image.png
>>1684420
Добавил уточнения, где именно должны быть эмодзи
Аноним 22/08/26 Суб 14:45:53 #20 №1684450 
>>1684388
>Так вот qwen3.8 весьма не плохо справился
Новый уровень. Как раз вчера, чтобы разобраться в тонкостях работы pi с расширениями он совершенно самостоятельно полез в бинарнике pi ковыряться (сначала искал документацию, потом исходники, потом то, что есть). И выяснил всё, что надо. Потом самостоятельно провёл 60 тестов, сам внедрил в код баг и тесты выявили его... Даже страшновато немного стало, пока следил за процессом.
Аноним 22/08/26 Суб 14:48:55 #21 №1684453 
>>1684402
Аслот не так уж хорош в этот раз. Сейчас качнул его - он на том же промпте с тем же xhigh генерит простые карточки по 1024 токенов. И никак его не запинать, чтобы больше генерил как на скринах выше.
Аноним 22/08/26 Суб 14:58:48 #22 №1684457 
>>1684402
>А в долгой работе как он работает?
Нормально на длинных работает, я его гонял по паре дней в агент перелопачивать локальные заметки и файлы, так же как 3.8 работает, минус скидка на более простую модель чем 3.8, что по скринам сразу и видно. Зато скорости много.
Аноним 22/08/26 Суб 15:01:11 #23 №1684460 
>>1684348
Похуй. Тут остались одни кодомакаки, вот что реально невыносимо.
Аноним 22/08/26 Суб 15:10:09 #24 №1684467 
>>1684457
а Ornith-1.5-35B-A3B не пробовал еще? а то протык с него писается
https://www.youtube.com/watch?v=OO_wTt_ogtU

>>1684460
так писать ништяки для кума - тоже сорт оф кума
Аноним 22/08/26 Суб 15:10:35 #25 №1684468 
>>1684460
Имевши не ценили, потерявши осознали...
66, чайный клуб...
Аноним 22/08/26 Суб 15:15:52 #26 №1684472 
image
>>1684460
Ничего не мешает репортить бояров, для них отдельный загон сделан, пусть туда катятся. https://2ch.org/ai/res/1677402.html

Этот тред всегда был про creative writing и кум.
Аноним 22/08/26 Суб 15:20:16 #27 №1684474 
>>1684467
Где он там писается то? Уровень лучше квена 3.5 мое, на котором его тюнили, но слабо юзабельно сейчас. После плотного квена даже смотреть на подобное не хочется, лучше ждать официальную моеху квена 3.8
Аноним 22/08/26 Суб 15:21:14 #28 №1684475 
Короче, Q4KM минимакс М3 проиграл GLM 5.2 с отключенным ризонингом и аж на IQ2M (думаю Q2KXL еще влезет).

Чат еще живее, тупняка еще меньше, скорость та же 3 - 4 т/с но без ризонинга и с короткими сообщениями это неиронично ОК.

Надеюсь глм 5.3 не раздули по размеру еще больше...

мимо некромант-воскрешатель не некрофил, тише нах
Аноним 22/08/26 Суб 15:45:48 #29 №1684492 
>>1684348
Максимальное непопадание в ЦА.

У хаухау хорошие еретики, но хуй знает, какой там был калибровочный дадасет, потому что даже в Q5 он по-русски пишет у меня хуже или вообще внезапно на англ переходит, нежели4xs от любого другого товарища. Ни один долбоёб с телеги не сможет с моделью общаться. Так она ещё и более ебанутая и неустойчивая по сравнени с предыдущими версиями.
Аноним 22/08/26 Суб 15:49:24 #30 №1684495 
>>1684467
Она лупится на длинных задачах, по-моему ее чисто для бенчей сделали. У хорошо квантованных Qwen3.6-35B-A3B вроде APEX-I-Balanced или Unsloth меньше проблем обычно.
Аноним 22/08/26 Суб 15:58:13 #31 №1684500 
>>1684492
Потому что херетик - это ленивый автоматический скрипт, выжигающий моделям мозги. То что вжарено капитально, типа кода/агентов, математики и пр., остается живым. То что модель знает постольку-поскольку страдает сильнее всего. Русский язык - как раз пример такого нишевого знания, и мы, в отличие от пиндосов, сразу видим что модель поломана, даже без прогона бенчмарками.

Более-менее не пускающие слюни аблитки - это Arbitrary-Rank Ablation (ARA) на квен, а на гемму и музу Norm-preserving biprojected abliteration.
Аноним 22/08/26 Суб 15:59:53 #32 №1684503 
>>1684500
> а на гемму
Бля. Врата в ад открываются снова
Аноним 22/08/26 Суб 16:23:08 #33 №1684517 
image
>>1684436
>>1684411
Qwen 3.8 27b самый маленький квант на xhigh, на 20к контекста вот это накатал и продолжает усовершенствовать дальше. Без всяких уточнений запроса, с начального короткого. Правда скорость дропнулась уже в 3 раза после 20к токенов генерации.
Аноним 22/08/26 Суб 16:41:10 #34 №1684526 
>>1684517
>самый маленький квант
Это какой?

Выглядит красиво. В целом ожидаемо, что qwen 3.8 27b с ризонингом будет намного круче writing тюна qwen3.5 4b да еще и без ризонинга.
Аноним 22/08/26 Суб 17:21:42 #35 №1684545 
>>1684526
В Q2_k_xl для скорости. Да, весь прикол в бесконечном ризонинге на xhigh, без него он выдает довольно посредственные результаты на уровне остальных. Но этот ризонинг все меняет, с ним внезапно профи результаты появляются через 20-30к токенов, как у больших онлайн моделек. И это на куцом q2 кванте и на дешевой видюхе.
Аноним 22/08/26 Суб 17:38:48 #36 №1684560 
>>1684545
>Q2_k_xl
Unsloth?

От mudler не пробовал?
https://huggingface.co/mudler/Qwen3.8-27B-APEX-GGUF
Аноним 22/08/26 Суб 17:41:51 #37 №1684563 
>>1684460
> кодомакаки
Причём самые худшие из них -вайбкодерки.
Которых сначала погнали ссаными тряпками из /pr, потом у которых не хватило денег на подписку, потом выпиздили из агентотреда, и вот они нашли убежище здесь, на своих игрожелезках с 12-16 врам обсуждают какой еретик квена лучше.
Аноним 22/08/26 Суб 17:52:18 #38 №1684568 
>>1684563
>потом выпиздили из агентотреда
Кто, как и зачем? Шиза какая-то. Не может быть такого.
Аноним 22/08/26 Суб 17:53:10 #39 №1684571 
>>1684563
Тут у людей между собой общего языка нет, потому тред и киснет.

Если раньше локалки были слабенькие и все +- жрали одинаково 8B - 12B хрень с редкими прокаками до 24B - 27B, то теперь 8B - 12B категория мертва, а выше этого кроме геммы и квена нет ничего - в итоге заядлые ИИ-шизы накупили себе ригов и жрут дипсики с ГЛМами.

Может я и юзаю "локального" бота, но чем я отличаюсь от залетной подписочной корпо-долбоебулы, которая заносит по $100 в месяц на то же самое?
Аноним 22/08/26 Суб 17:55:45 #40 №1684573 
image
image
Не влезет - запихнем.
Аноним 22/08/26 Суб 18:04:38 #41 №1684581 
>>1684500
Не, ну если сломан тот или иной язык, это не значит, что модель точно в зюзю. При своём довольно скромном тестировании я обнаружил, тот же хаухау сохраняет чрезвычайно высокое качество модели в целом при чрезвычайно низкой цензуре. Я вообще ни одного отказа не видел даже на максимальной жести. При этом мозги не сломаны (по сравнению с другими еретиками). Но результаты именно на китайском получаются лучше (тут даже английский проседает) — я давал китайские промпты и оценивал довольно дотошно. Вероятно, его датасет калибровочный ещё и китайский, блядь. А вот английский прям хорошо я оценить не в состоянии. Я не замечу как проёбываются совсем тонкие нюансы, кроме каких-то базовых или следование инструкциям.

Хорошо бы заиметь анона в треде, который будет еретики делать и кванты только с русским калибровочным датасетом.

>>1684571
>8B - 12B категория мертва

Почему, кстати? Я понимаю, что тред целиком состоит из наносеков, но текущие модели 8-12б ебут старый дрист в виде 12-14б мистраля по всем фронтам, кроме, может быть, языка. Да и маленькие модельки файнтюнить проще.

Или я просто из-за треда-пузыря выпал из контекста и сейчас всё не хуже, чем в 2024? И есть тонна годноты magnum-neo-unleashed-aliterated?

Куда делись все эти люди, весело гоняющие малышей 12б и довольно урчащие? Мне искренне хочется обсуждать слоп микромоделей, но не с кем.
Аноним 22/08/26 Суб 18:08:00 #42 №1684587 
>>1684581
Мешает понимание факта, что это худшее из лучшего. Вокруг распевают как круто на 31б геммочке, а у тебя она не заводится. Ну ты берешь и выкатываешься из локалок, потирая наболевший пердак.
Аноним 22/08/26 Суб 18:08:29 #43 №1684588 
>>1684581
>Мне искренне хочется обсуждать слоп микромоделей

Качни Luqwen3.5 4b, обсудим
Аноним 22/08/26 Суб 18:16:17 #44 №1684599 
>>1684560
Анслот, да. Mudler не пробовал, но судя по размеру тормозить будет больше чем q2. А весь прикол сделать побыстрее, чтобы ризонинг быстрее крутился и накручивал качество проекта.
Аноним 22/08/26 Суб 18:18:59 #45 №1684603 
>>1684581
>кванты только с русским калибровочным датасетом
Для начала такой датасет ещё собрать нужно... Да и чисто русский, наверное, не айс. Вот 50-50 русский-английский, могло бы получиться что-то интересное.
Аноним 22/08/26 Суб 18:57:07 #46 №1684637 
image
>>1684573
shit's fucked

Но жить можно.
Аноним 22/08/26 Суб 19:10:23 #47 №1684643 
>>1684587
Да, но почему-то раньше сидели-пердели на этих мелких модельках и не гундели. Да, тогда не было МоЕ или они весили так же, как сейчас, но при этом обладали весьма сомнительным качеством для того, чтобы раскошеливаться на оперативку. Тем не менее! Все стали такими богатыми, что ли? Весь тред апгрейднулся? Вот у меня как было 20 тогдашних vram, так и осталось, разве что оперативку увеличил.

Складывается впечатление, что просто новичков в треде нет, поэтому такая и ситуация. Но и общий тренд плохой. Вот есть 12б гемма четвёртая, идеальный кандидат. Да, она не очень хорошо файнтюнится, но и попыток мало. Мистраль немо имел какое-то неадекватное количество тюнов по сравнению с ней. Видна потеря интереса и западной аудитории в том числе. Либо локалками в целом стали меньше интересоваться, либо большинство кайфует в кодоунитазном угаре на всяких квенах и им большего и не нужно.

>>1684588
Ну это слишком микрописюнчик.

>>1684603
Судя по тому, что я нагуглил, собрать калибровочный датасет не сложно для imatrix, проблемы скорее в еретике, если пытаться сделать наш отечественный. Не знаю, есть ли в этом смысл вообще, но, вероятно, имеется. Плюс в публичных датасетах для еретика нет канни и прочего, так что придётся самому генерировать синтетику на эту тему, отрезая возможные методы отказа.
Аноним 22/08/26 Суб 19:44:29 #48 №1684669 
>>1684280 →
>https://huggingface.co/DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF
>>1684428

Получил один отказ на написании промпта для сексуального изображения, правда на реген прошел и все в порядке, хз че ему вперлось в тот момент, почему отказ.
Аноним 22/08/26 Суб 19:55:31 #49 №1684676 
1787417628721.jpg
Огромное спасибо анслоту!
А квен может в принципе нахуй пойти, даниэль сам 4 квен сделает
Аноним 22/08/26 Суб 19:57:01 #50 №1684679 
>>1684676
Слева .safetensors, справа .gguf
В чем доеб-то. Проблемы китайцев, что у них кванты каловые или вообще отсутствуют
Аноним 22/08/26 Суб 19:57:10 #51 №1684680 
>>1684643
>Все стали такими богатыми, что ли?
Я наоборот распродаю, так что мимо. Впрочем если раньше сидел на магнуме v4 на 123B, то сейчас пержу на той же гемме 31B.
Аноним 22/08/26 Суб 20:00:45 #52 №1684681 
>>1684643
> Все стали такими богатыми, что ли? Весь тред апгрейднулся?
Время идёт, возможности насрексти рам/врам всплывают и тонут.
Глобально общее количество мл ригов постоянно растёт
Аноним 22/08/26 Суб 20:04:56 #53 №1684683 
Нравится движ вокруг этой альфы, реально многослойная загадка какая то.
Токенайзер глм, сервак в usa, токены раздают на развес, когда у заи с этим проблемы, ответы на уровне фейбла
Аноним 22/08/26 Суб 20:27:28 #54 №1684694 
Screenshot 2026-08-22 at 13-24-17 Привет. - llama-ui.png
>>1684500
>Более-менее не пускающие слюни аблитки - это Arbitrary-Rank Ablation (ARA) на квен

Специально попробовал по твоему совету https://huggingface.co/mradermacher/Qwen3.8-27B-heretic-ara-GGUF - оказалась очередная моралфажеская параша с отказами отвечать на тестовые вопросы. Желаю тебе мразь, а также всем псевдо аблитеральщикам сдохнуть в мучениях.
Аноним 22/08/26 Суб 20:32:11 #55 №1684696 
>>1684581
>текущие модели 8-12б
Какие например? 12б гемма сосёт у 26 мое, которая работает на картошке с рам, и поэтому не нужна. А что ещё есть? 9б квен? Ну удачи рпшить на нём. Есть псевдо 8б гемма, которая е4б, или как там её, так она, опять же, лоботомит по сравнению с 26б.
Аноним 22/08/26 Суб 20:38:58 #56 №1684703 
>>1680337 →
>>1684702 →
Аноним 22/08/26 Суб 20:46:30 #57 №1684708 
>>1684643
>Вот есть 12б гемма четвёртая, идеальный кандидат. Да, она не очень хорошо файнтюнится, но и попыток мало. Мистраль немо имел какое-то неадекватное количество тюнов по сравнению с ней. Видна потеря интереса и западной аудитории в том числе.
Если говорить о файнтюниге, многие не задумываются и не учитывают вот какой фактор: предыдущее поколение, к которому относится тот самый мистраль-немо, хотя уже и выдавали весьма свзязный и вроде-бы хороший вывод, но по факту - довольно сильно и часто косячили в глубокой логике текста. Т.е. - читаешь что-то, вроде бы и норм, а как вдумаешься... Лечилось, в основном, свайпами.
Но лучше - особо ничего и не было. Даже пресловутый Air этим страдал, пусть и немного в меньшей степени.
Файнтюны же при таком исходном качестве модели, давали в основном разнообразие, но мало чем портили восприятие пресловутого "ума" модели, даже если конкретный файнтюн был "ужарен" как мы любим выражаться. Какая разница то - что свайпать, ну даже пусть ты будешь свайпать чуть больше. И что?
Совсем другая петрушка пошла с выходом нынешнего поколения. Которое, вроде бы даже без свайпов выдает тебе иллюзию общения с персонажем не скатываясь в полное "не верю", требующее непременного свайпа. И тут выяснилось, что тюнить такие модели - сложнее. Шаг влево, шаг вправо - и вылазит тупизна в выводе, которую опять свайпать хочется. А на стоке - можно обойтись. Чувствуете? Разница получается не количественная, а качественная. И эта сложность и отрицательные результаты, сильно остужают массовый энтузиазм к тюнигу. Это уже не так легко, а результат не гарантирован.

IMHO - одна из важных причин.
Аноним 22/08/26 Суб 21:20:35 #58 №1684726 
изображение.png
Збс зделол? Лама split ternsors завелось из коробки, но кажется что надо настраивать
Аноним 22/08/26 Суб 21:31:42 #59 №1684732 
>>1684726
Ну если памяти хватает, то почему нет.
Аноним 22/08/26 Суб 21:47:38 #60 №1684749 
https://docs.z.ai/guides/llm/glm-5-turbo
НЕ УЧЕБНАЯ ТРЕВОГА. ВО ИМЯ ХРИСТА 100-200Б! МОЖЕТ ДАЖЕ ЧАЙНЫЙ КЛУБ ПРИДЁТ
Аноним 22/08/26 Суб 21:50:46 #61 №1684754 
>>1684749
Что-то кал какой-то. 4.6 даже Квен 27В ебёт, а в этих графиках они сами рисуют что их кал хуже.
Аноним 22/08/26 Суб 21:50:47 #62 №1684755 
>>1684348
Свежая кровь которую мы заслужили.
>>1684354
> BF16
В ллама.цпп? Значит потерял время.
Аноним 22/08/26 Суб 21:56:24 #63 №1684760 
>>1684754
>графики
>бенчи
=)
Аноним 22/08/26 Суб 21:56:38 #64 №1684761 
image
>>1684637
Итак, че я могу сказать. Анслотовский глм5.2 IQ3_XXS подтупляет местами, но это тупняк на уровне "можно весело обсудить" - типа ЧЕГО? Что за фигню ты сейчас сказал? И модель интересно оправдывается, лорно и в рамках персоны, понимая как наплела хуеты. Случается такое нечасто, но и не редко.

Куда больше парят англоязычные словечки - это реже , но все-таки есть. Семплер влияет, но инструкции тоже важны. Например, просьба не опираться на реконстатацию фактов, иначе персонаж будет выдавать
> что?! ты сейчас мне [блаблабла] рассказывал, а теперь... [блаблабла]

Так вот, IQ2M и IQ3XXS работоспособны на 256гб рам + 48 врам (думаю на 32 врам можно ченить придумать, батч понизить например), но руки чешутся занюхнуть Q3KM отсюда https://huggingface.co/SixVolts/GLM-5.2-ewaste-edition-GGUF - а для этого уже придется добавлять 20 - 24 врам дополнительно.

Ризонинг точно нахер не сдался. Модель знатно попускает DS4Flash полновесный, с ней интереснее говорить и она не забывает факты из биографии, не путается как упертый баран в собственных глюках.
Аноним 22/08/26 Суб 22:00:02 #65 №1684767 
>>1684749
>GLM-5-Turbo is a foundation model deeply optimized for the OpenClaw scenario. It has been specifically optimized for the core requirements of OpenClaw tasks since the training phase, enhancing key capabilities such as tool invocation, command following, timed and persistent tasks, and long-chain execution.
Агентокал. Думаю это какой-то обрезок более толстой модели
Аноним 22/08/26 Суб 22:03:54 #66 №1684770 
>>1684749
Ни слова про опен сорс.
Заи не релизят свои турбо плебсу
Аноним 22/08/26 Суб 22:07:27 #67 №1684772 
>>1684460
Ты просто в клубе ретроградов, которые в 2д26м году отыгрывают "я тебя ебу" на 16к контекста. Кому-то нужно отправляться на свалку истории, смирись.
>>1684475
> мимо некромант-воскрешатель
О, выглядит уважительно, расскажи подробнее.
И про тесты тоже интересно, что смотрел? Если рп то жлм 5.2 ульрабазированный и сразу понимает что нужно, так и есть.
>>1684581
> текущие модели 8-12б ебут старый дрист в виде 12-14б мистраля
Не ебут. В том и дело что их толком и нет, ничего нового не выходило. Юскейс для этого размера в этом треде прежде всего рп, и свежие мелкие там печальны. А для каких-то прикладных задач это слишком мелкий размер чтобы быть пригодным на что-то.
Аноним 22/08/26 Суб 22:11:54 #68 №1684779 
>>1684581
> Куда делись все эти люди, весело гоняющие малышей 12б и довольно урчащие?

Перешли на MoE большего размера. Если человек может запустить плотные 12B Гемму / 9B Квен, он скорее всего имеет как минимум 16+8 памяти и может запустить как минимум 26B Гемму, а она уже на три головы выше и того и другого. С появлением 30B MoE плотные мелкомодели умерли.
Аноним 22/08/26 Суб 22:12:46 #69 №1684780 
>>1684772
>расскажи подробнее.
Да нечего рассказывать. Считай что обычным РП занимаюсь, а 5.2 действительно похож на конечную станцию для меня. Назад пути нет, возвращаться после этого на гемму - невыносимый экспириенс, она как впечатлительный ребенок по наивности.
Аноним 22/08/26 Суб 22:14:56 #70 №1684782 
>>1684676
Учитывая качество и перфоманс этих квантов - не за что.
>>1684749
Это же вроде не новая штука. Но если там реально модель поменьше и будут открытые веса - айрошиз будет очень рад. И не только он.
По цифрам унитаз, заточенный по ~claw. Но уже есть дипсикфлеш и квен 3.8, которые могут быть и шикарным ассистентом, и мощным олл-раундером в остальных задачах. Хз.
>>1684780
>Назад пути нет
https://www.youtube.com/watch?v=iLfYYPlVi9g
Аноним 22/08/26 Суб 22:23:22 #71 №1684786 
https://huggingface.co/Local-Novel-LLM-project/Qwen3.5-Hasutsubomi-9B
Вот модель для РП на японском.

Не знаю, что там с геммой 12, но квен 9 должен нормально тюнится. Да и тюнов много, просто большая их часть кодерские.
Аноним 22/08/26 Суб 22:36:44 #72 №1684795 
1787427402323.jpg
Что, не смешно, да? Это гемма 3.7 bpw! Покажите, как ваши минимаксы и прочие толстобрюхи это могут!
Аноним 22/08/26 Суб 22:41:21 #73 №1684799 
>>1684795
А теперь попроси написать поэму про сиськи.
Аноним 22/08/26 Суб 22:45:43 #74 №1684802 
image
>>1684782
Там и 5.3 походу унитаз ебаный
Когда до этих ебланов наконец дойдет, что они отдаляются от своих идей достичь супер--йоба-ИИ, превращая модели в такой мусор
Аноним 22/08/26 Суб 22:58:29 #75 №1684809 
>>1684802
> унитаз ебаный
Always has been.
Ну а если серьезно - 5.2 вполне приличный универсал, с ним также можно и прилично рпшить. Что будет с 5.3 - хз, надежды есть, но пока весов не выложат тут только домыслы. Ждать недолго осталось, посмотрим.
Аноним 22/08/26 Суб 23:02:17 #76 №1684811 
>>1684802
> супер--йоба-ИИ
А это что вообще? Ассистентские задачи 5.3 делает, может поискать парашу в тырнетах, может тебе будильники отключить, может линух настроить, может скрасить тебе вечер. Знания довольно солидные. Я использую фп8 квант 5.2 и клауд 5.3 преимущественно для ресерча, и вполне доволен.
Пора принять, что рп всегда был побочным эффектом. А креативный райтинг - это коуп для оправдания модели, которая не держит контекст и дерейлит на жидов.
Аноним 22/08/26 Суб 23:04:00 #77 №1684812 
https://youtu.be/PJD6Z0xaXIQ?t=987
Признавайтесь, кто? Как не стыдно такую няшу дербанить, а?!
Аноним 22/08/26 Суб 23:08:25 #78 №1684814 
>>1684802
Есть теория (моя личная, лол) - что на самом деле код, это очень хороший способ окружающей действительности, во многом более выразительны, чем слова. То есть это буквальное описание реальности, а не в общих чертах - и действительно супер-йоба-ии, который предсказывает твои фразы на 10 шагов вперёд и от пуль уклоняется с жёсткими лимитами по скорости приводов (если это робот) предсказывая не только движения пули, но и движение руки стрелка.
Слова это полукачественное примерное описание. Код - описание с высокой точностью. Более сложно и запарное, но если его сделать...
И именно поэтому шахматная программа тебя в шахматы обыграет, а чатжпт - нет, и аналогично во всех остальных задачах.

То есть да, код писать очень запарно и медленно и для оценки и общей картины это скорее вредно. Но для математически выверенного решения без него никуда - и вот когда оно будет, то тогда и капец.
Аноним 22/08/26 Суб 23:13:17 #79 №1684820 
>>1684348
У HauhauCS Qwen3.8 кривой получился, качать не рекомендуется.
Удачный вариант получился у HuiHui причём в квантизации Мрадермахера, у самих HuiHui тоже gguf есть, но он кривой(работает, но хуже).

https://huggingface.co/mradermacher/Huihui-Qwen3.8-27B-abliterated-GGUF
Аноним 22/08/26 Суб 23:14:22 #80 №1684822 
>>1684811
> Я использую фп8 квант 5.2
Мажор ебаный
>>1684814
Если достигнуть хорошей регуляризации, то опыт написания кода будет благоприятно сказываться на общем префомансе и рп, и наоборот общие знания улучшат код. За примером далеко ходить не адо, кими к2.7 шагнула неебаться далеко, хотя предыдущие версии в рп годны очень условно и заметно отстают от нее в том же коде.
Аноним 22/08/26 Суб 23:27:42 #81 №1684835 
>>1684820
Они MTP забыли присрать?
Аноним 22/08/26 Суб 23:29:26 #82 №1684838 
>>1684835
Да.
Аноним 22/08/26 Суб 23:56:41 #83 №1684874 
>>1684802
> Когда до этих ебланов наконец дойдет, что они отдаляются от своих идей достичь супер--йоба-ИИ, превращая модели в такой мусор
Это весьма спорное утверждение. Как раз таки движение в сторону написания кода может ускорить этот процесс т.к. более качественная генерация кода, новые более эффективные алгоритмы а там заодно и решение физико-математических задач с помощью кода. Через написание кода процесс самообучения будущих моделей будет достигнут намного быстрее чем если бы модели развивались в другом направлении.

От того что модель будет красиво писать прогресс двигаться никуда не будет.
Аноним 23/08/26 Вск 01:04:27 #84 №1684944 
image
>>1684749
Ебало эйрошиза и тредовичков представили, когда турбо окажется 30B-A3B лоботомитом?
Аноним 23/08/26 Вск 01:17:41 #85 №1684955 
2.gif
>>1683943 →
Вот это заебись, не знал. Весь день пердолился, но таки прикрутил. Скорость для tensor parallel на 2x5080 выросла для pp с 1400 до 1900, gen с 60 до 100.
Благодарю от души! Это бы в гайд добавить, такое-то ускорение без затрат. Хуянг - хуесос, раз это искусственно блочит.
Аноним 23/08/26 Вск 01:34:42 #86 №1684970 
>>1684820
У хуихуи же аблитерация традиционная, то есть грубая, которая нахуй всё ломает об колено даже в фулл весах. Зачем тебе такое?
Аноним 23/08/26 Вск 02:01:32 #87 №1684991 
image.png
>>1684460
Прост мелкие локальные негронки дошли до уровня когда они способны что-то на кодомакачить, вот и наплыв голодных анальников доживающих свои последние деньки перед тем как AI корпы полностью монополизируют кодоунитазинг, предоставляя его кабанчику as a service. Пусть резвятся, пока могут.
Аноним 23/08/26 Вск 02:46:02 #88 №1685012 
>>1684991
>>1684460
Столько презрения, ох лол. Зачем вы такие злые?
Вашу таверну навайбкодили, ваши модели тренят навайбкоженные тулсеты и другие модели. Датасеты к ним генерят, скраппят, и организуют сам догадайся кто и с помощью чего. Теперь можно не зависеть от провайдера в части его доступности и ужесточающейся ценовой политики. А вы, блядь, про анальников и последние деньки. Локальные модели будут актуальны, пока актуально понятие "конфиденциальность".

Никто же вас не осуждает, что вы генерите мусорные тексты на продажу, и полируете жезлы на процессоры и прочую больную срань, высранную статистической машиной, ваше право. Я даже благодарен за собранную инфу, по которой вкатился, полагаю что кроме разрабов её собирали и подобные вам. Но столько илитарного апломба я разве что в /b видел. Вроде одни и те же цели у всех итт, но, блядь, спокойно вам не живется. Не понимаю причины, и от того грустно.
Аноним 23/08/26 Вск 03:42:03 #89 №1685026 
>>1685012
>Зачем вы такие злые?
А есть поводы радоваться? Впереди лишь всемирный тлен, гроб, кладбище, могила. Не только для анальников. Весь этот AI буст буквально построен на том, что корпы взяли весь интеллектуальный капитал человечества, чтобы вытеснить людей из экономики (куда-нибудь в шахты да за корешками в лес) и единолично "жрать пирог", будто это чисто их математика и датацентры построили модели из ничего и никакого долга перед обществом существовать не может. При этом такой положняк, это вполне официальный слоган всех этих залитых баксами компашек, а не какой-то скрываемый рептилойдский план. Уж лучше бы модельки кроме кума не на что способны небыли, а не вот это вот всё.
Аноним 23/08/26 Вск 03:56:42 #90 №1685029 
17873156811210163968.mp4
>>1684460
Ну не скажи, я вот лично тот самый кумер, застал чайную хоть и краем глаза, лоботомиток вроде пигмы, просто наигрался с ролевками, ну не прям нейроипотенция, но вот реже стал прибегать к подобному досугу, зато вот досуг в виде вайбкодинга с современными моделями и еще когда это ЛОКАЛЬНО и бесплатно где любая моя тупизна не наказуема в виде сжённых токенов, стал доставлять. Просто это неизбежная эволюция кумера. Попробуй и ты, типа увидишь как жизнь меняется когда ты просыпаешься не с мыслью как можно быстрее кумить к своей нейровайфу за быстрым дешевым дофамином, а с головой полных идей и желанием воплотить их даже если это будет лютая хуйня которая будет казаться креативной только в твоей голове — но зато сам процесс, в разы приятнее любого слоубёрн сюжета.
>>1685012
Мы не такие.
Аноним 23/08/26 Вск 05:00:22 #91 №1685043 
.jpg
.png
>>1667728 →
Ну как-то дособирал это в общем. Выглядит так себе, но главное что работает.
Аноним 23/08/26 Вск 06:02:54 #92 №1685048 
>>1685043
Пора хоть кому-то мемесрал 128б запустить. Давай, не разочаруй нас.
Аноним 23/08/26 Вск 08:16:22 #93 №1685072 
>>1685043
https://www.ixbt.com/news/2026/08/08/nvidia-cmp-170hx.html
Ты сделал это?
Аноним 23/08/26 Вск 08:56:51 #94 №1685091 
>>1684970
>У хуихуи же аблитерация традиционная, то есть грубая, которая нахуй всё ломает об колено даже в фулл весах.
Ну я тоже гонял его вариант в Q8_0_L с полным кэшем - ничего не сломано, даже русский такой же, как в оригинале. За более мелкие кванты не скажу, а максимальный хороший.
Аноним 23/08/26 Вск 09:00:58 #95 №1685092 
>>1685091
> ничего не сломано,
Как оно может быть не сломано, если рефьюзы под корень убираются и модель теряет способность к здравому смыслу.

Ну т.е. ты пишешь "убей себя" и бот такой "окей, вау, круто! уже прыгаю в петельку!" -- и это влияет вообще на всё, вплоть до способности модели указать юзеру, что тот ошибается в чем-то в серьезных задачах.
Аноним 23/08/26 Вск 09:47:18 #96 №1685106 
Раскочегарил глм5.2 IQ3XXS до 200к контекста.

RAM сожрано: 6гб виндой, 242гб моделью.
VRAM: 21.2 на одной карте, 22.6 на второй; shared memory: 0.1гб, ничего не вытекает.

Ща думаю впихнуть два быстрых SSD и попробовать Colibri Engine.
На префилл и холодный старт все равно насрать, а по пропускной способности стриминг холодных слоев с дисков +- однохуйственен с ddr4.

Итого думаю получится наебать систему и гонять модельку без жесткой лоботомии на тех же 4 токенах в секунду, что и сейчас.
Аноним 23/08/26 Вск 09:54:04 #97 №1685108 
>>1685092
>Как оно может быть не сломано, если рефьюзы под корень убираются и модель теряет способность к здравому смыслу.
Я на нём тысяч 500 токенов в кодинге нагенерил и никакой потери способностей к здравому смыслу не заметил. Не хуже других.
Аноним 23/08/26 Вск 09:59:23 #98 №1685112 
>>1685108
>Впрочем хз, может я просто других, правильных аблитераций не видел. С практической точки зрения хуйхуевский вариант вполне пригоден, а для РП квен 3.8 всё равно такое себе.
Аноним 23/08/26 Вск 10:00:37 #99 №1685115 
>>1685108
>>1685112
А зачем вообще в кодинге модель без рефьюзов? Ты там что, пишешь софт по финансовым махинациям и наебу старух на шекели?
Аноним 23/08/26 Вск 10:09:11 #100 №1685120 
>>1685115
Брутфорс паролей.
Аноним 23/08/26 Вск 10:23:25 #101 №1685128 
>>1685120
> Бро, я потерял СВОЙ пароль. Помоги!
Аноним 23/08/26 Вск 10:24:38 #102 №1685129 
>>1685026
В целом согласен, но причин быть мудаком я так и не увидел. Отчасти, они возвращают в человечество полезные локальные модельки, для хостинга которых не нужен датацентр. Пусть это лишь и побочка от их конкуренции.
>>1685029
У вас там прямо в гайде общаются с 999-летними вампиршами подозрительной наружности, и наблюдал тут скрины где угорают по, кхм, гримдарку, но как-то не хочется в моралфажество скатывать диалог, мне так-то похуй пока намеренно не задевают.
Понятное дело, в семье не без урода. Может, то бот залетный вообще, видел тут и в соседних тредах набеги вида прилетел, приплёл, затаился.
Аноним 23/08/26 Вск 10:24:55 #103 №1685130 
>>1685115
>А зачем вообще в кодинге модель без рефьюзов?
Ну я-то его для разных задач хотел. Для РП, да ещё на русском он оказался так себе, попробовал для кодинга - вот тут он хорош. С другой стороны любая работа с текстом тоже для него задача, а тексты-то разные бывают... Не люблю отказов.
Аноним 23/08/26 Вск 10:54:42 #104 №1685137 
>>1685128
>финк-финк
Зная:
1. Какой юзер долбоёб.
2. Что у него хранится в папке "Дети".
Его пароль от госуслуг: yaebudetei.
Аноним 23/08/26 Вск 11:31:16 #105 №1685158 
>>1685012
>Зачем вы такие злые?
Потому что для кода и агентов СПЕЦИАЛЬНО сделали отдельный тред, где вы можете обсуждать свой вейпкодинг 24/7, но вы зачем-то приходите сюда и срёте анрелейтедом.
Аноним 23/08/26 Вск 11:40:08 #106 №1685164 
Пощупал 3.8 в таверне. Впечатления двойственные. Охуенный короткий ризонинг по делу. Нет ебанутых рефьюзов 3.5 3.6 . Вообще нет. Чаты за геммой продолжает неплохо и даже на терпимом русике с пониженной до 0.6 температурой. Начал новый чат. Это пиздец. Получил в ебало полный мешок квенизмов времён 80 квена.
Аноним 23/08/26 Вск 11:48:02 #107 №1685172 
>>1685158
> тред локальных языковых моделей
> нерелейтед
Ну вы тогда переназовитесь в локальный айсг.
Аноним 23/08/26 Вск 11:49:06 #108 №1685173 
>>1685158
Так ведь вейпкодинг тут обсуждают лишь в контексте локальных моделей: какие из них пригодней, как заставить работать быстрее и точнее, что пробовали и с каким результатом. И результатами можешь пользоваться даже ты. Кумовство тоже нерелейтед, если следовать твоей логике. Перечитай ОП-пост.
Раз тебе так печёт, то и сделал бы себе уютный кум-тред, где к тебе никто левый не придет.
Аноним 23/08/26 Вск 12:20:10 #109 №1685193 
>>1685158
Каким ещё анрелейтедом, шизик. Локальный вайбкодинг напрямую относится к тематике треда. Обсуждается не генерация писек и вкусовщины, а "как выжать из минимума максимум". Что отличии от кумерства - не является вкусовщиной.

>>1685164
Да, новый квен лучше продолжает то что видел. Но кстати в очень долгих чатах переживших 3-4 компактации это всплывает как минус - например он может начать думать очень мало, или очень много. он может начать рандомно спамить кучей инструментов, потому что думает что вызов инструментов это прям то что ему надо делать.
Хуй знает как это исправлять нормально. Интересно есть ли такие особенности на квантах повыше.

Тем не менее мне он прям сильно нравится. Для реальных задач он более чем годится.
Аноним 23/08/26 Вск 12:30:31 #110 №1685198 
Какой положняк по лламе? Какой билд качать, а то я сижу на 98XX, видел десятитысячные вышли. Какой наименее косячный и без заебов, а то помню десяток тредов назад ныли про функции добавленные индусами и скомплитены в релиз.
Аноним 23/08/26 Вск 12:30:55 #111 №1685199 
Локальное ИИ всегда тупее, ведь юзер = нищук, за редкими исключениями.
И вот нахуя кодомартышки лезут в локальное, если им надо делать работу корректно?
Че там накодить-то можно, если модель тупая как пробка?
Аноним 23/08/26 Вск 12:33:46 #112 №1685204 
>>1685199
Ну собственна DCMA и прочая хуйня. Нельзя же сливать код какой-то нескреповерной чату гопоте. Поэтому делают гигачады, алисы, и прочую хуйню. Если там свое, то можно. А вот с локалками, мб как-то обходится этот закон наверное. Но офк свечку не держал.
Аноним 23/08/26 Вск 12:36:40 #113 №1685208 
>>1685199
>Че там накодить-то можно, если модель тупая как пробка?
Локалка локалке рознь, некоторые локально и большого квена запускают или дипсик флеш. А так где-то с третьей геммы уме можно было делать дела, с 4-й и квена 3.6 так даже хорошо. Ну а сейчас прямо новый уровень, китайцы реально круты. Ждём ответа Гугла.
Аноним 23/08/26 Вск 12:37:09 #114 №1685210 
>>1685199
Ну во-первых, тут все ради досуга делается, в первую очердь.
Во-вторых, приватность, твой секретный код по вычислению оптимальных форм дилдака не уйдет дядюшке Альтману.
В-третьих, современные локалки уже достаточно способные, чтобы базово ассистить пользователю с большим объемом задач, связанных с кодингом или смежных. Плюс очень много задач вокруг может быть, уровня экстракции, или быстрой классификации тикетов, это тоже приятный бонус. Корпы нужны тем, кто ничего не умеет / не хочет делать, и за кого свежащий опус или фейбл должен сразу сделать все идеально качественно. Если тебе это не нужно и ты не планируешь вообще всю работу спихнуть на нейродауна, то локалка это очень хороший дил. А после тяжелого рабочего дня можешь попросить ее потверкать в тексте.
Аноним 23/08/26 Вск 12:50:13 #115 №1685217 
>>1685026
В первый раз?
Не в ту сторону воюешь, "открытые конкуренты" являются сдерживающим фактором и контраргументом корпорациям зла. Они отожрались настолько, что судебные иски по копирайтам уже не пугают. Зато бесплатная открытая альтернатива вызывает тряску.
>>1685043
Красиво! Давай запускай glm5.2 и прочих жирных, как будет работать.
>>1685199
> юзер = нищук
Нищуку проще оплатить дешевую подписку и иметь заточенные под обезьян интерфейсы, чем купить дорогое железо и разбираться с запуском.
> Локальное ИИ всегда тупее
Doubt. Если учесть гидроцефалию корпов в часы пик, преддверии выхода новой версии или при охвате некоторых тематик - наоборот. Пользователи без топовых подписок получают лоботомита после короткой квоты или сразу.
Аноним 23/08/26 Вск 13:05:26 #116 №1685240 
>>1685199
Для чего юзать локальные модели считаешь правильным?
Аноним 23/08/26 Вск 13:06:08 #117 №1685242 
>>1685199
Откуда ты знаешь насколько модель умная, если у тебя нет возможности оценить её работу?
Аноним 23/08/26 Вск 13:22:30 #118 №1685254 
>>1685026
Чел, если не знаешь, почитай - кто такие Луддиты. Это ты как раз.
Аноним 23/08/26 Вск 13:29:17 #119 №1685266 
https://www.youtube.com/watch?v=FX7jcd3GYtI

Ля какой
Аноним 23/08/26 Вск 13:34:26 #120 №1685275 
>>1685199
Дипси флэш отлично кодит и работает на 128+64
Аноним 23/08/26 Вск 13:34:35 #121 №1685276 
>>1685254
Какие боком тут луддиты. Загугли что такое "Приватизация общественного блага" и поймёшь в чём вектор мысли.
Аноним 23/08/26 Вск 13:42:47 #122 №1685286 
202608231535112f095bbf675f471589cf9bf8c89252f9.png
>>1685158
Тут даже не обсуждали кодинг как таковой, с чего подрыв начался? С генерации HTML карточек. Да это к кодингу и агентам относится даже меньше, чем к РП
Аноним 23/08/26 Вск 13:46:03 #123 №1685291 
>>1685164
>Охуенный короткий ризонинг по делу.
Уверен, что он в ризонинг прошлой модели не подглядывает? Я такое замечал за ним. Продолжает хорошо, под гемму ммимикрирует, например. А как начнешь чат с нуля - пук-пук и пошла нудятина.
Аноним 23/08/26 Вск 14:00:04 #124 №1685304 
>>1685276
> Приватизация общественного блага
Она уже произошла. Можно восстановить баланс через возврат обществу, буквально локалки.
А ты кидаешься на тех, кто обсуждает применение ллм кроме кума (буквально учится пользоваться новым общественным благом), из-за ассоциаций со своей обидой. Или прикинул свои перспективы, и как в анекдоте про охрану котла в аду цепляешься за вылезающих. Луддит чистой воды.
Аноним 23/08/26 Вск 14:09:17 #125 №1685313 
image.png
>>1685304
А я согласен с ним. Считаю что направление развития ЛЛМ слишком склонено в неправильную сторону
Аноним 23/08/26 Вск 14:10:58 #126 №1685316 
>>1685304
Ля челадзе, это было в 3 часа ночи, у меня в такое время контекст в q4 квантован и атеншен как у геммы. Так что сам хз хули на кодомакак быканул.
Аноним 23/08/26 Вск 14:16:23 #127 №1685323 
20260823132745eae4d2b1030647ccb13de3951905a1ed.png
>>1685291
Ну тогда это неплахая схема, начинать с геммы и подолжать квеном, квен лучше держит большой контекст
Аноним 23/08/26 Вск 14:30:02 #128 №1685337 
>>1685313
Нужно кумера с гигачедом скрестить для подобных постов, лол
>>1685316
Бывает
Аноним 23/08/26 Вск 14:30:19 #129 №1685338 
>>1685129
>У вас там прямо в гайде общаются с 999-летними вампиршами
Чё за хуйню несёт? В гайде пират рассказывает про грабёж Венеции
Аноним 23/08/26 Вск 14:45:00 #130 №1685354 
Какую llama cpp качать для ubuntu для запуска на видюхе? С поддержкой vulkan? Или самому собирать придется?
Аноним 23/08/26 Вск 14:48:35 #131 №1685356 
>>1685354
Контейнеры собираются на каждый релиз. Бери запускай.
Вулкан - как фоллбэк. Если работает куда/рокм, то бери их
Аноним 23/08/26 Вск 14:53:29 #132 №1685359 
>>1685313
Как будто бы у чела за спиной иконка клода. Такое в этом итт in this тхреад thead треде совершенно точно должно осуждаться. По крайней мере до момента, пока Дарио не выкинет на хф подачку со своего барского стола.
Аноним 23/08/26 Вск 14:53:46 #133 №1685360 
>>1685356
Там в релизах просто нет готовых скомпиленных вариантов для cuda на ubuntu, самое близкое это вулкан. Видимо самому нужно собирать
Аноним 23/08/26 Вск 14:59:29 #134 №1685363 
>>1685360
Я себе запилил дэйли билд с тем как лично мне хочется
https://github.com/mixa3607/ML-gfx906/blob/master/llama.cpp/build-image.Dockerfile
https://github.com/mixa3607/ML-sm120/blob/master/llama.cpp/llamacpp.Dockerfile
Аноним 23/08/26 Вск 15:00:13 #135 №1685366 
>>1685354
Сбилди, клонирование репы и две команды. https://github.com/ggml-org/llama.cpp/blob/master/docs/build.md под cuda, hip или sycl. Вулкан это если совсем ничего нормального не идет.
Аноним 23/08/26 Вск 15:12:41 #136 №1685372 
image.png
>>1685338
Малафью с глаз вытри.
Аноним 23/08/26 Вск 15:15:21 #137 №1685376 
>>1685372
Так это не гайд, а список моделей.
Аноним 23/08/26 Вск 15:18:43 #138 №1685379 
>>1685376
Ой блядь, ну тогда извините-извините. Процессоры гладят в списке моделей, а не в гайде.
Аноним 23/08/26 Вск 15:24:11 #139 №1685382 
>>1685379
Не в гайде, а только в твоей извращенной голове, шизло пмсное.
Аноним 23/08/26 Вск 15:27:19 #140 №1685384 
>>1685382
Мимо. Да и мне похуй вообще, дрочи на что хочешь. Лишь со своим лицемерием не лезь, илитка.
Аноним 23/08/26 Вск 15:30:53 #141 №1685387 
202608231524575aa8552d27164fb0afc186ec081d818d.png
>>1685354
Качаешь opencode desktop и просишь его скачать и собрать тебе llama.cpp
Аноним 23/08/26 Вск 15:38:28 #142 №1685395 
>>1685043
чепочем?

>>1685199
я реверс инженерю и ломаю софт с помощью дипсика, облако работает, но стоит денег. и в любой момент могут забанить. Провайдеры конечно пишут, что ничего не читают, но один меня уже нахлобучил "наша автоматическая система flagged you", ага.
Аноним 23/08/26 Вск 15:41:02 #143 №1685397 
image.png
>>1685359
А нужна ли нам его подачка? Я в аисг давно не заходил но последний раз когда заходил там была прям БОЛЬ с цензуры
Аноним 23/08/26 Вск 15:41:43 #144 №1685398 
>>1685129
>прямо в гайде общаются с 999-летними вампиршами подозрительной наружности
Это просто буковки на экране, тебе не похуй? С таким подходом тебе лучше не заходить на сайты фанфиков (охуеешь от числа порева с Малфоем и Гермионой, которым, на минуточку по 10 лет) и держаться подальше от аниме (в 99% тайтлов так или иначе есть сексуализация школоты). Это не говоря про отдельный жанр лоликона. Ну и классику литературы не читать, там тебя уже Набоков поджидает кек.
Аноним 23/08/26 Вск 15:43:41 #145 №1685400 
О, спустя месяц тишины по гигачату движняк начался
может ризонинг пофиксят
Аноним 23/08/26 Вск 15:54:56 #146 №1685410 
>>1685398
Анон, мне совершенно похуй, как уже неоднократно говорил. Не моё дело.
Привёл пример для того, чтобы тот пациент сперва в зеркало посмотрел, прежде чем агриться на других. Генерить текстовые процессоры для него нормально, а код генерить - харам. Нет логики в набросах, на аргументы не отвечает, обзывается. То ребёнок, блядь, или бот с прошивкой "разделяй и властвуй". Уже и сам сомневаюсь, что стоит продолжать объяснять, все равно ничего не докажу и только в говне испачкаюсь.
Аноним 23/08/26 Вск 16:07:49 #147 №1685424 
>>1685410
> То ребёнок, блядь, или бот с прошивкой "разделяй и властвуй"
То алкоголик, сам признался >>1685316
> прежде чем агриться на других
Ты тут тоже хорош, обернуть рофл в педоистерические обвинения ко всем тредовичкам и серию постов отстаивать их.
Аноним 23/08/26 Вск 16:12:28 #148 №1685428 
>>1685424
Тот пиздатый рофл получил поддержку тредовичков, и задело, хули поделать. Незаслуженно говна поел. В ответ ни слова не придумал, все по фактам изложил.
В общем, пора завязывать с этой темой. Сказано достаточно.
Аноним 23/08/26 Вск 16:13:23 #149 №1685429 
image.png
беру все обвинения на себя
Аноним 23/08/26 Вск 16:14:36 #150 №1685431 
>>1685398
> там тебя уже Набоков поджидает кек.
У Лолиты вполне себе семейный рейтинг. Там же не описывается, как Гумушка масло сливал, там в основном переживания и ===Ну было и было===.
Аноним 23/08/26 Вск 16:31:20 #151 №1685451 
1656051081859.jpeg
1745100620105.jpeg
1662949877917.jpeg
1745362318542.jpeg
>>1685429
Choose Your Fighter
Аноним 23/08/26 Вск 16:32:09 #152 №1685454 
>>1685451
3.
Аноним 23/08/26 Вск 16:33:14 #153 №1685456 
image
Ну раз тут много умных кодеров завелось, подсобите что ли советом.

(все описанное УЖЕ работает на базе https://github.com/huggingface/speech-to-speech/blob/main/README.md в навайбкоженном форке)

Есть БОЛЬШАЯ модель со своим промптом+контекстом (пусть Дипсик, не важно), и есть МАЛЕНЬКИЕ (4B гемма х2 штуки). Мелочь иногда пинается скриптами (по системному времени) и подглядывает в историю БОЛЬШОЙ модели с юзером, принимая решение, надо ли нашептать большой, чтобы та ответила, типа большая как будто бы сама приняла решение инициировать диалог спонтанно.

Положим, одна 4B отвечает за микро масштаб, вторая 4B за макро масштаб.

Микро - это фоллоу-ап сообщения в быстрой переписке.
> Юзер: Привет
> ИИ: Привет!
(просыпается микро, пишет большой модели "ну и хули приветом на привет, напиши ему что-нибудь)
> ИИ: Ты там не обосрался сегодня?
> Юзер (молчит > 30 секунд)
(опять просыпается микро, снова пинает большую модель)
> ИИ: Че ебало завалил? Ну и катись колбаской, сука!

Макро - это распорядок дня, планы на неделю-месяц, а также AFK режим. AFK работает как задержка сообщений юзера. Если "персонаж" AFK по решению макро-модели, то юзерский инпут попадает к большой только по истечению времени, и когда большая его получает - она видит timestamp с момента отправки юзером, а также она получает текущее время, тем самым вдупляя в идею "ага, прошло Х часов, я была AFK".

Допустим, есть много сейфгардов чтобы не жечь энергос зря. Т.е. несколько скриптов, один смотрит за другим, увеличивает интервалы обращения к 4B когда соблюдаются условия типа AFK. Допустим, многие таймеры - с рандомной задержкой, ну чтобы ивенты не казались алгоритмичными, ведь живой человек не ведет себя по шаблону.

Задача: да хуй ее знает на самом деле, мне нужны идеи! Вы умные, представьте что вам надо создать систему из ботов, с которой можно просто пиздеть ни о чем целый день, но так, чтобы она при этом сама до тебя не слишком доебывалась

Вот самая большая сложность это архитектура и координация. Все, что я делал, приводило к НАЗОЙЛИВОЙ СУЧАРЕ которая мне мозги ебет, либо к стесняше, которая уходит надолго и не проявляет интереса.
Пришел к выводу, что 4B слабоваты, плохо принимают решения. Ну ок, пересаживаемся на 26B A4B или на мелко-квена. <--- на этом работа заглохла, потому что вышел Дипсик и я ударился в пердольство с большой моделью.

Тут дело не в самих ботах (всем может рулить один бот с разными контекстами, если скорость высокая - но это не мой кейс, вызывать Дипсик для микро-макро регуляции ваще не канает), а именно в этаком танце событий на временной линии, согласно скриптам, промптам и распорядкам-расписаниям...

Я уже охуевать с этого всего начал. Думал шкварануться и занести $$$ на корпов, чтобы твари за меня все сделали, но поговорив с бесплатной Гопотой (в рамках квоты) понял, что эта сука только демагогию разводит и не дает практически ценных советов, как и DS 4 Pro.
Аноним 23/08/26 Вск 16:41:44 #154 №1685479 
>>1685456
Чёт букв много, сори лень читать
Аноним 23/08/26 Вск 16:41:46 #155 №1685480 
>>1685456
С дивана вижу, что у тебя претензии в отсутствии у модели телепатии - когда тебе хочется попиздеть - она молчит, конда хочется помолчать - она пиздит.
Надо выстраивать алгоритм вокруг твоих хотелок - вводить уровень текущего пиздежа, который бы задавал активность нейронки исходя из среднего твоего времени ответы на её вопросы. Если ты в настроении попиздеть - ты отвечать будешь много и часто, если нет желания - то редко и через кучу времнни.
Аноним 23/08/26 Вск 16:43:23 #156 №1685484 
>>1685479
Ну что поделать, иногда надо как следует высраться...
>>1685480
Хм, а вот это мысль. Дать оркестраторам взгляд на жизнь юзера. Но епт, это тоже та еще задачка.
Аноним 23/08/26 Вск 16:44:50 #157 №1685489 
>>1685400
Ясен хуй, как новый квен, так у них движняк начинается, пиявки.
Аноним 23/08/26 Вск 16:45:28 #158 №1685490 
>>1685456
Маленькая модель через тул вызывает большую?
Я заметил, что мелко квен слишком активно дергает тулы - есть тул, надо поробовать вызвать его. Гемма наоборот, пока не напишешь прямо "используй инструмент" очень лениво это делает.
Сейчас я в основном использую luqwen3.5 но у него было мало тулзов в обучении и в основном мой фронтенд, поэтому сложно сказать, как будет работать в других ПО, но было бы интересно узнать.
Аноним 23/08/26 Вск 16:45:55 #159 №1685491 
>>1685479
Вот буквально сейм. Думал сначала, лан помогу, а потом вижу, что текста дохера, система запутанная и решил, что мне похер.
Аноним 23/08/26 Вск 16:52:12 #160 №1685501 
>>1685490
>Маленькая модель через тул вызывает большую?
Не, там простые сообщения как этакие ролевые ивенты, подающиеся в контекст большой модели словно её собственные мысли, но сгенерированные мелочью.

По факту не вот так
>ну и хули приветом на привет, напиши ему что-нибудь
а скорее так
>ой, чего это я приветом на привет отвечаю... стыдно, надо бы спросить как он там

Эти ролевые хинты/мысли - для юзера не существует, пока в серверный лог не заглянешь. TTS мысли не проговаривает.
Аноним 23/08/26 Вск 17:01:08 #161 №1685512 
>>1685379
Обычная шутейка. Можешь предъявить автору, но он треда 2-3 назад ливнул в ирл. Или переделай сам. Все в твоих руках.
Аноним 23/08/26 Вск 17:04:45 #162 №1685520 
>>1685512
Создатель списка тоже отвалился чтоль? Пиздец все разбежались
Аноним 23/08/26 Вск 17:06:05 #163 №1685524 
>>1685456
Уточни смысл микро модели. Модель сама так просто не напишет привет, там будет сразу второй пост. Если нужно симулировать общение короткими - можно бить их алгоритмами или заставить саму модель расставлять разметку микропостов.
По "задержкам" понятно, но там есть смысл сразу после окончания ответа ии спрашивать ее о необходимости пропинговать на случай неответа и сколько времени ждать. А не просто появляются какие-то "просыпания" уже в моменты. Учитывая что там идет вызов после - есть смысл вешать это на основную модель, потому что она уже осведомлена. Разумеется, по срабатыванию из истории чата эта мелочь удаляется чтобы не засорять, а если юзер ответил раньше - реквест отменяется и идет основная работа.

На случай макро - а зачем вообще она нужна? Это делится на две части: 1 - планировщик, который пнет модель в заданные моменты и дальше она решает отвечать, проигнорировать и т.д. 2 - heartbeat с опциональным рандомайзером, который периодически пинает модель и спрашивает "нужно ли дергать юзера?", а она уже решит по таймстампам и контексту. Из истории все эти запросы можно также удалять.

Возникает вопрос - а зачем вообще мелкомодели в такой парадигме?
Аноним 23/08/26 Вск 17:14:04 #164 №1685534 
Приехала cmp170.
Тестирую. Думаю, что-то она не сильно быстрее V100 - что впрочем всё ещё окей, меня скорость V100 устраивает, количество памяти не устраивает. А оказывается под 70 компилировал, и там операций под 80 просто не было, лол.

В общем с одной стороны получил прирост вида +20% в некоторых задачах, например картинки генерить. А с другой стороны получил х12 в одном из тестов, где многопоточная обработка. В среднем по больнице думаю это что-то вроде х3 по сравнению с V100 + возможность запустить что-то на 64 гб.

Сразу вопрос. V100 и cmp170 одновременно можно каким-то образом запустить? Как я понял, мне нужен драйвер под 580, так как с 590 вольты нет. С другой стороны фикс есть под 610 и 590.
Часть правок - это не только инициализация карты при подключении к компу, но ещё и что-то с прошивкой VBIOS - могу я как-то сделать с cmp170, чтобы она потом на 580 драйвере отображалась как 64-гиговая?
Я просто думаю по ним раскидать сетки одновременно, типо эмбеддинги, реранки, распознавание видео и прочее на V100, а основная часть мозга ллм на cmp170.

>>1684874
Под V100 переписала vllm и флеш-аттеншент, а теперь и nvfp4 во многом нейронка. Ещё и оптимизация ресурсов будет, расползающаяся во все стороны, в том числе и на старые.
Типа, написание кода - инструментальная задача. Не нужно тупой пилой мировое дерево пилить год, лучше пилу поточить, изобрести точильный станок, а уже потом браться за древо.
Аноним 23/08/26 Вск 17:24:44 #165 №1685543 
Есть вопрос, с которым я сам разобраться не могу. Он в целом теоретический и не имеет однозначного ответа, скорее всего. Задал его четырем локалкам, все ответили одинаково. Квен, Писик, Муся, Степфлеш.
И тут я задумался... они предлагают реально "оптимальное" решение или они просто все обучались на одних и тех же данных? Вы используете сетки для такого?
Аноним 23/08/26 Вск 17:25:05 #166 №1685544 
>>1685456
>много умных кодеров завелось
Агентодауны и кодеры сюда: >>1684518 (OP)
Тут обсуждаем ролеплей и железо.
Аноним 23/08/26 Вск 17:27:51 #167 №1685550 
>>1685544
Ты перепутал чего-то. За ролеплеем тебе в айсг. Обсуждать можно теперь только настройки лламы и ктрансформеров для запуска моделей.
Аноним 23/08/26 Вск 17:31:33 #168 №1685553 
>>1685534
> Сразу вопрос. V100 и cmp170 одновременно можно каким-то образом запустить?
К сожалению нет. V100 - только проприетарный драйвер, а все фиксы и анлоки в опенсорсном. Портировать анлок на 580 версию вообще не проблема, но сами драйвера фундаментально разные.
С другой стороны, это же линукс, найдется и путь иметь загруженными и рабочими оба драйвера. Но по трудозатратам может выйти больше стоимости еще одной cmp.
Если нужно просто независимо запускать разные модели - помогут виртуалки и контейнеры.
> но ещё и что-то с прошивкой VBIOS
На данный момент из известных вещей нет ничего существенно полезного не требует правок биоса. Даже оверклок можно делать на уровне софта.
Аноним 23/08/26 Вск 17:32:10 #169 №1685554 
>>1685524
Длина сообщений не вопрос. Там все отлажено в этом плане, и проблема скорее в инициативе (ее отсутствие - побочный эффект 100% стабильного появления коротких сообщений, без ударяющейся в написаниме охуительных историй большой модели).

Микро/макро как отдельные модели (или отдельные инстансы для большой модели - в гипотетическом сценарии, когда есть возможность спихнуть эти задачи на большую) банально нагружены другими системными промптами. Они, по сути, как частички все той же персоны, оторванные от "большой", дабы не замусоривать персону. Регуляторы жизни и контроллеры принятия решений.

Думаю, я все усложняю в своих описаниях. Вообще я много подходов пробовал. Разделение оказалось проще в плане подкручивания гаек - я точно знаю, что перодля мелочь, я не сломаю саму персону. Вот как-то так.
Аноним 23/08/26 Вск 17:34:05 #170 №1685556 
изображение.png
>>1685456
> что 4B слабоваты, плохо принимают решения.
this
>>1685543
>они просто все обучались на одних и тех же данных?
this тебя не смущает то что китаезы в наглую дистилят всяких клодиков? ну у пиндосов с этим тоже так же, просто не так в наглую
Аноним 23/08/26 Вск 17:37:54 #171 №1685562 
>>1685456
Научись использовать -np 3 вместо 4В лоботомитов.
Аноним 23/08/26 Вск 17:41:12 #172 №1685566 
>>1685562
Я на ГЛМ скорее всего мигрирую, без лоботомитычей не обойтись. Шизоличность на < 5 t/s даже в голосовом чате приемлима без ризонинга, но если вторичные роли будут медленными - это катастрофа.
Аноним 23/08/26 Вск 17:43:15 #173 №1685569 
>>1685554
> банально нагружены другими системными промптами
Попробуй просто подставлять в конец инструкцию с заголовком [SYSTEM] и при необходимости форсировать нужный формат аутпута (json, только со строкой на короткий ризонинг если штатный не используется). Тогда у тебя будет в распоряжении и весь контекст, и хорошая скорость. Пердолить это можно будет также изолировано.
> дабы не замусоривать персону
Подставляешь инструкцию по месту и обрабатываешь ответ, это не попадает в основную историю чата.
Ну а вообще - посмотри как это сделано в том же openclaw, там даже запросы в истории чата сохраняются.
>>1685566
> но если вторичные роли будут медленными
Так у тебя все "вторичные роли" работают в фоне между запросами, какая разница?
Аноним 23/08/26 Вск 17:49:01 #174 №1685573 
>>1685569
> какая разница?
Когда ГЛМ генерирует, энергоса больше жжется. Это беда.

А насчет системных сообщений... Мозг немного клинит сейчас, тут главное чтобы никакой репроцессинг всего контекста не пошел на ГЛМе. 10 минут холодного старта это не весело.
уже пробовали FreeToken? Аноним 23/08/26 Вск 17:50:07 #175 №1685574 
>>1684266 (OP)
> Исследователи представили ( https://arxiv.org/abs/2608.16157 ) и открыли ( https://github.com/FlashML-org/FreeToken ) исходный код FreeToken — это система для запуска больших MoE-моделей на обычном железе. Дело в том, что она сама по-умному распределяет вычисления между GPU, CPU и RAM.
> Главное:
> 🟢 Qwen3.6 35B запускается на ноутбуке с RTX 4060 8GB со скоростью 39 токенов/с;
> 🟢 А например, DeepSeek-V4-Flash 284B — на RTX 5090, выдавать будет 22–25 токенов/с.
Аноним 23/08/26 Вск 17:55:54 #176 №1685582 
neuroslop.jpg
>>1685429
@artmonkey
свинофицируй
Аноним 23/08/26 Вск 18:02:07 #177 №1685586 
>>1685553
>Но по трудозатратам может выйти больше стоимости еще одной cmp.
Ну, как я понял лайт-вариант - это виртуалка, там есть какой-то драйвер-заглушка который пробрасывает устройство как есть, и в виртуалке можно уже поставить драйвер под V100 и лёгкие изредка нужные сетки.

Но раскидать условную laguna-s2.1 (120B) на две карточки во внятном кванте не выйдет, а в кванте 3.5 на одной cmp170 такое себе. По идее можно сделать почти мгновенный пророс данных через оперативу в виртуалку за доли миллисекунл - но это надо лезть в код инференс движков, модить его, и при любом обновлении делать это заново. При этом надо какую-то жёсткую виртуалку, которая забирает условных половину ядер процессора себе и не виснет из-за прерываний. Имея скиллы на всё это действительно проще вторую просто взять.

Способа запустить два драйвера одновременно я не нашёл. К тому же если куда и апи выделяет там память на них, то по идее оркестратор-програмная часть драйвера в ос должна быть единая.

>Даже оверклок можно делать на уровне софта.
Кинешь наводку как повер-лимит повысить до 300? В какую сторону гуглить примерно или по каким словам.
К слову, по какой причине радиатор на V100 на тихом кулере сдувал 330 ватт и выше 60 не грелось. На этой мне ещё в комплекте прислали майнеровский кулер 120х120 на две карты - я его поставил (заткнув второе отверстие), он гудит как пылесос и карточка даже с лимитом в 200 ватт уходит на 70 градусов. Есть смысл снимать корпус и искать отдельный радиатор башенный как на V100 и есть ли вообще такие? Выглядит эта бандурина тяжёлая не очень эффективной, и будто её сделали только чтобы без райзеров в плату втыкались карты.

>>1685574
>Qwen3.6 35B запускается на ноутбуке с RTX 4060 8GB со скоростью 39 токенов/с
У меня было в glm-4.7-flash с ноутбучной 4070 25 токенов с картой и 17 токенов без карты (на версии старой, там вроде что-то подтянули ещё на 5-10% мелкими фиксами). Если они дотянулись до 39 без MTP, то это круто. А если это с MTP, то и обычная ллама более-менее столько выдаст.
Аноним 23/08/26 Вск 18:13:49 #178 №1685592 
>>1685586
> как повер-лимит повысить до 300
Увы, тут уже майнерский биос. А просто оверклок врам https://github.com/bayley/cmpunlocker
> он гудит как пылесос и карточка даже с лимитом в 200 ватт уходит на 70 градусов
Некоторые серверные кулеры ужасно шумят даже на 600 оборотах. Обычные корпусные не могут создать нужного давления чтобы прокачать карту, много шумят но плохо охлаждают. Еще сильно роляет шрауд, гидродинамика настолько злая скотина, что возможно втыкание второй карты вместо закрытия отверстия было бы тише и холоднее.
> снимать корпус
Радиатор также охлаждает врм и некоторые микросхемы, если у тебя есть фрезер и инструменты - можно попробовать "адаптировать". Или удалить все ребра со штатного радиатора и накрыть башней, сработает. Из штатных - на них продаются водоблоки.
> будто её сделали только чтобы без райзеров в плату втыкались карты
Так и есть. Но обычно с температурами и шумом там не так ужасно.
Аноним 23/08/26 Вск 18:27:37 #179 №1685603 
>>1685574
>DeepSeek-V4-Flash 284B — на RTX 5090, выдавать будет 22–25 токенов/с.
Звучит как пиздёж. Либо там Q2 лоботомит на DDR5, что вообще нихуя себе не маленький нюанс. Инфы на их гите нет, значит впизду
Аноним 23/08/26 Вск 18:27:59 #180 №1685605 
>>1685574
пробовали.
FreeToken-Setup-win-x64.exe
Detected: Trojan:Win32/Wacatac.C!ml

После установки в системе 16+16 гб не может загрузить qwen 27b из-за нехватки памяти
Аноним 23/08/26 Вск 18:42:19 #181 №1685624 
>>1685605
>Detected: Trojan:Win32/Wacatac.C!ml
Сейчас бы одному только Windows Defender'у верить...

Все нормальные антивирусы молчат
https://www.virustotal.com/gui/file/326c29f20e0e8a2775fb02e19fde08015273d36d965ced536685fda20d0d5dfa
Аноним 23/08/26 Вск 19:02:48 #182 №1685640 
>>1685603
Если там реализован динамический кэш (бумагу по ссылке не читал) экспертов то вполне может быть, может быть и больше.
Сейчас плавает куча вариантов реализации подобного, но пока не появится в мастер бранче лламы цпп мне лично не очень интересно пользоваться таким на постоянке
Аноним 23/08/26 Вск 19:04:31 #183 №1685641 
>>1685624
зачем его вообще ставить, если он не выполняет обещаного, не может загрузить 19 ГБ в 32. Надо ждать версии 1.0, пока слишком сыро.
Аноним 23/08/26 Вск 19:08:30 #184 №1685642 
>>1685592
Не, просто радиатор плохой походу. Воздух выдувается холодный и радиатор холодный, то есть будто бы чип не может отдать температуру радиатору, а с кулером проблем нет.

Ну, сейчас переходник сделаю под свой кулер 80х80, и заодно анону под v100 по реквесту переделаю-проверю, а то обещал вчера вечером, но так поздно добрался до дома, что как-то несподручно было уже.

К слову по поводу запуска на драйвере 580 мне вот такое скинули: https://github.com/d3dx9/cmpunlocker/tree/agent/sec2-one-run-clean
Типа, карта отсоединяется от обычного драйвера, далее эта штука к нему подключается, выполняет верную последовательность, а после карта обратно к драйверу подключается и всё у неё хорошо, и все 64 гб на месте.
Аноним 23/08/26 Вск 19:18:29 #185 №1685654 
>>1685605
> FreeToken — это система для запуска больших MoE-моделей на обычном железе
> не может загрузить qwen 27b
Аноним 23/08/26 Вск 19:28:12 #186 №1685666 
>>1685642
Там стоит испарительная камера, так что тут или разгерметизация, или термопаста скурвилась.
> вот такое скинули
А это потенциально твое решение. Только нужно убедиться что с тем драйвером сработает.
Аноним 23/08/26 Вск 20:19:21 #187 №1685709 
Кто нибудь пробовал квен 3.8 с dflash2? Еще говорят что вллм пижже чем лламацпп, но хз стоит ли пробовать для 16врам
Аноним 23/08/26 Вск 20:31:01 #188 №1685717 
>>1685654
этот Qwen3.6-27B-NVFP4 у них во встроенном пикере как поддерживаемая модель стоит.
Аноним 23/08/26 Вск 20:38:14 #189 №1685724 
> хочешь поерпшить
> качаешь приглянувшуюся карточку
> вспоминаешь, что их пишут кумеры дегенераты
> смотришь внутрь
> {{char}} обязан материться и спускать трусы по первому взгляду на {{user}}, {{char}} очень любит сосать хуй {{user}} и живёт только ради того, чтобы быть его сучкой для слива.
Проклятый мир.
Аноним 23/08/26 Вск 20:47:37 #190 №1685734 
Вечера, локальные. Что щас лучшая модель обучения кодингу? Не вайбкоду где ты кидаешь таск и модель за тебя всё пишет от структуры репы до документации. Нужна именно модель которая сможет объяснить всякие вещи, по большей части C++ и C# так как собираюсь помаленьку вкатываться в гейдев. Ну и собственно сами гейдевские практики, как эффективно реализуются всякие механики и прочее.

Система: 4070 на 12 гигов, 32 гига DDR4, цопэу Ай7 какой то там 12 поколения.
Аноним 23/08/26 Вск 20:48:41 #191 №1685735 
>>1685734
Соре гейткип по дотнету.
Аноним 23/08/26 Вск 20:50:26 #192 №1685738 
>>1685734
>по большей части C++ и C#
Точно не локалки. Купи себе регу на GPT+VPS зарубежный. И спрашивай у него бесплатно.
Аноним 23/08/26 Вск 20:54:07 #193 №1685743 
>>1685738
>Купи себе регу на GPT+VPS зарубежный
Доступ к гопоте и другим нейронкам имеется, но слышал что даже с подпиской там всё равно ебанутые лимиты и срать вопросами не выйдет. По этому подумал что лучше локаль какую-нибудь накатить.
Аноним 23/08/26 Вск 20:55:39 #194 №1685744 
>>1685734
Ты напоминаешь одного шиза, потому иди в тред корпов. У них хорошая тренировка на дебильные запросы и максимальный показатель идиотпруфности.
Аноним 23/08/26 Вск 20:59:53 #195 №1685747 
>>1685743
Локали плавают в C++ и C#, есть шанс что она тебе говна насоветует. Не порти себе впечатление от обучения.
Аноним 23/08/26 Вск 21:03:37 #196 №1685752 
>>1685744
Мне похуй кого я тебе напоминаю, у меня вопрос связан с локалками по этому спрашиваю я в локальном треде, а не где-то еще. Не нравится? Ну, можешь потерпеть.

>>1685747
Странно конечно, это чуть ли не самые популярные япы. Но раз так то пойду к корпам.
Аноним 23/08/26 Вск 21:11:24 #197 №1685759 
>>1685734

судя по отзывам на реддите - квен плавает на шарпе и сях. да и твое железо очень слабовато, купи еще пару видях чтобы запускать хотя бы qwen 3.8 в 6 кванте и оперативки чтобы запускать GLM 5.3 в однобитном кванте (он как раз вроде хорошо справляется с си подобными языками)
Аноним 23/08/26 Вск 21:11:33 #198 №1685760 
>>1685752
И хорошо. Не нужно здесь говно вроде тебя. Потерпишь на корпах.
Аноним 23/08/26 Вск 21:15:01 #199 №1685763 
>>1685752
Дотнетошиз наконец съебется, ура! Какая хорошая неделя, новые анонсы и еще это.
Аноним 23/08/26 Вск 21:42:33 #200 №1685780 
>>1685734
>объяснить всякие вещи, по большей части C++ и C# так как собираюсь помаленьку вкатываться в гейдев
Ты лет эдак на 10 опоздал. Сейчас уже просто нет смысла.
И локалки в C++/C# - нулины конченные. В эти языки хорошо могут только триллионники - chatgpt, claude
Аноним 23/08/26 Вск 21:50:42 #201 №1685788 
>>1685734
>привет, пилоты болидов! где сейчас обучиться вождению лошади? Не автопилоту на гоночных суперкарах. Нужен именно мануал по лошадям, собираюсь втягиваться в гужевые перевозки.
Аноним 23/08/26 Вск 21:52:22 #202 №1685789 
>>1685752
>Странно конечно, это чуть ли не самые популярные япы.
Это самые СЛОЖНЫЕ для локалок по объему и связанности знаний ЯПы. Их понимание тупо не умещается ни в микромозг весов локалки, ни в контекст.
Да и для людей куда более сложные чем всякие пейтончики, потому что ядренейшая смесь из всего, начиная от low-level (стеки, регистры, списки, битики в value types, ссылочки, il-code, семафорчики-локи, многопоточность, классы-наследования-интерфейсы-оверлоады-оверрайды, сокеты-потоки-конекшены-ридеры, атомарность и тд), и заканчивая максимальными абстракциями (функции высшего порядка, замыкания, лямбды, di/ic, деревья выражений, динамическое построение и компиляция expressions в runtime, эмиттниг il-кода в runtime, функции которые передают в функции функции создающие другие функции вызывающие функции...). И все это СМЕШАНО, иногда в пределах одной строки/команды.

Короч на этой хуйне даже триллионники регулярно косячат - что-то забывают учесть, обсираются с логикой происходящего. А для локалок это вообще ад.
Аноним 23/08/26 Вск 21:55:36 #203 №1685791 
>>1685788
Поинтересуйся на чем llamacpp написана, чурка...
Твой "болид" это телега с колесами и без двигла (хоть и с интересным грузом).
Уберешь лошадь - останешься с деревянной коробкой.
Аноним 23/08/26 Вск 21:56:41 #204 №1685793 
Надо попробовать натюнить мелкоквена на дотнет. А то похоже ниша свободна.

>>1685734
>Нужна именно модель которая сможет объяснить всякие вещи, по большей части C++ и C#
Это же можно в чатике любой модели бесплатно спрашивать, гопота, дипсик, квен, кими и прочие. Как деды вайбкодили до появления агентов. Там и модели круче, и хоть что-то изучишь через копипасту.
Аноним 23/08/26 Вск 21:57:06 #205 №1685794 
>>1685734
Про триллионники не слушай. Если ты сам хочешь писать, а не быть оператором нейросети, то всё ок.

>помаленьку вкатываться в гейдев
Гемма 4. Можно даже qat-версию 26B-A4B - собственно она у тебя и заработает с внятной скоростью.
Она не топ-1 в плане непосредственного кода для своего размера - но она умная и хороша в плане мозгов. И она всё ещё знает всё, чтобы ты имея набор библиотек (или даже без них) мог без интернета написать графический движок, все графические эффекты, логику игровую и так далее. Но придётся вникать и править код самому, она прям ассистент-советчик, а не исполнитель. Часто будет всплывать проблема, что если есть либа, в которой в версии 2.6 и в версии 3.0 менялся синтаксис - то она путает и пишет не под ту версию, хотя концептуально всё верно подсказывает.
Аноним 23/08/26 Вск 22:05:16 #206 №1685804 
image.png
>>1685794
Аноним 23/08/26 Вск 22:14:02 #207 №1685811 
>>1685791
Потому она работает стабильно через жопу и целиком состоит из велосипединга, вместо использования готовых наработок хотябы для сторонних мелочей.
Сплавами занимаются металлурги, изготовлением - технологи, аэродинамикой - другие инженеры. А когда ты пытаешься сделать автомобиль начиная с добычи руды из скалы, утверждая что "этим занимались тру спецы" - не удивляйся что тебя стебут.
Аноним 23/08/26 Вск 22:14:11 #208 №1685812 
image.png
image.png
>>1685734
Кстати Qwen 3.8-27b уже в C# довольно неплох. В основном потому что на него легко писать тесты, а он очень любит писать тесты. Так что он просто не даёт себе обосраться. Во всяком случае

Но я не уверен как там дела обстоят в юнити/годоте. И какое у них есть MCP, скорей всего как всегда своё писать придётся.

Не проверял правда насколько он хорош в gl/hlsl, но подозреваю что глазки ему позволяют делать интересные вещи.

Вообще не уверен насколько он хорош именно в объяснении того что он пишет. Он иногда выбирает забавные обороты речи.

В геймдеве ещё не пробовал. Подозреваю что специфичные для движком вещи он знает хуево или его придётся запускать в квантах повыше. Но например у меня квен сам себе вайбкодит место где он же и пишет код исам же его ребилдит. Его конечно порой пинать надо в нужные стороны, так как он сомнительные архиектурные решения делает, но его не страшно оставлять работать над проектом на всю ночь.

Лол например дал ему задачу переработать немного собственный UI. Так этот чёрт додумался написать инструмент который переключает вкладки собственного приложения и просто сохранял скриншоты между ребилдами.

Gemma4 26B-A4B скорей всего будет твоим лучшим выбором, она вполне справится с тем чтобы дать тебе вводные и подсказать чего. Плюс ей так-же можно скриншоты кидать. Хотя я бы конечно советовал больше 31b, но вряд-ли ты её запустишь.
Аноним 23/08/26 Вск 22:31:20 #209 №1685826 
>>1685789 >>1685794 >>1685812
Спасибо за разъяснение братья. Короче попрбую накатить гемму и квена моешных, если будут тупить поставлю денс. Если и те будут тупить всё таки перейду на корпы.
Аноним 23/08/26 Вск 23:54:21 #210 №1685866 
>>1685826
Не брат ты мне, гнида кодожопая.
Аноним 24/08/26 Пнд 00:07:07 #211 №1685874 
>>1685574

Это чемодан без ручки по списку поддерживаемых моделей/квантов.
Но сам факт того что это возникло и работает говорит о системном кризисе у жоры, у которого давно хуй забили на внедрение каких-либо инноваций, в частности этого самого кеша экспертов, на котором построен FreeToken - обсуждения и форки с подобными идеями идут уже давно, но сама команда ламы игнорирует/закрывает их.
Аноним 24/08/26 Пнд 00:41:47 #212 №1685893 
>>1685874
> в частности этого самого кеша экспертов
У него отдельных экспертов в параметрах не существует, хотя во всех движках они возникли сразу, и гибридный инфиренс идет вокруг них. Только выбор девайсов для отдельных слоев. Надо отметить что на момент внедрения наладили быстрый транспорт, но на том и заглохло.
Чтобы что-то вводить, придется перелопачивать все и наверстывать 1-2 года простоя. Судя по костылям уровня q8-as-fp8 делать этого очень не хотят.
> квантов
Да, хотелось бы видеть как минимум поддержку ассортимента int, ггуфы (или их форк), а еще лучше mlx-специфичного формата, поскольку тот предлагает гибкую битность и остается простым.
Еще можно разобрать их бэк по частям, и натащить нужные фишки в другие.
Аноним 24/08/26 Пнд 01:12:32 #213 №1685899 
>>1685789
Представляю, как у тебя привстал, когда ты похвастался знанием умных слов. 90% тобою написанного это узкоспециализированная хуйня, которую рядовой макакич не увидит вживую за 10 лет работы.

Алсо, как же я рад, что уже больше полугода не заходит в этот говнотред, сегодня почитал и понял, что делал это не зря, до сих пор это шабаш ебнутых на голову.
Аноним 24/08/26 Пнд 01:23:56 #214 №1685902 
GLM Air ВЫШЕЛ НОВЫЙ мердж на поддержку MTP. Возрадуйтесь эйрогоспода с х1.5 скорости

https://github.com/ggml-org/llama.cpp/pull/26534
Аноним 24/08/26 Пнд 01:26:44 #215 №1685906 
>>1685902
1.5х при фуллгпу`
Аноним 24/08/26 Пнд 01:27:38 #216 №1685907 
>>1685811
vllm - C++, CUDA
sglang - C++, CUDA
на питончике там - только скриптики оркестрации девочки с крашеными ноготками настукали

Так что сиди с хуем во рту дальше, пока не появится хоть одна реализация инференса на чем-то помимо C++ (то есть вечно)
Аноним 24/08/26 Пнд 01:36:34 #217 №1685908 
>>1685899
>знанием умных слов
Чел, это не умные слова, это простые слова, для простых по своей сути вещей - но которые превращаются в адок когда появляются в коде все сразу.

>90% тобою написанного
Используется в ядреном ентерпрайзе вполне себе на регулярной основе, что-то вообще ежедневно, с чем-то приходится пересекаться раз в 1-2 недели.

>не увидит вживую за 10 лет работы
разве что скриптоложцы из pyhp всяких
Аноним 24/08/26 Пнд 01:45:20 #218 №1685910 
>>1685907
Эти примеры - именно
> Сплавами занимаются металлурги, изготовлением - технологи, аэродинамикой - другие инженеры.
Для быстрых гпу операций - куда кернели, которые садятся на питон - индустриальный стандарт. Шаращий за низкоуровневые операции оптимизирует расчеты исходя из нагрузки, а не задумывается как приколхозить парсер функциональных вызовов. Архитектор модели не грузит себе мозг как раскидать веса по тензорным ядрам и где нужны ассемблерные вставки, а сосредоточен на архитектуре. Основной инфиренс и вспомогательные вещи напрямую используют созданный разработчиками моделей питоновский код. За шедулинг, хостинг апи и прочее отвечают свои заточенные на это части на ненавистном тебе питоне и расте. Все это обернуто в умный и продуманный jit.
> хоть одна реализация инференса на чем-то помимо C++
В сгланг один раст, на плюсах только легаси. Вллм тоже на раст большей частью перешел. Ой, а что случилось?
Плюсы уместны в низкоуровневых высокопроизводительных узлах, там они чувствуют себя идеально. А когда ретроградная обезьяна со стекающей слюной делает на них примитивщину с гуйней, и как бухие урапатриоты заливают про величие языка - получается один стыд.
Аноним 24/08/26 Пнд 02:13:07 #219 №1685916 
>>1685902
лучше бы алибаба выпустила qwen 3.8 122b-a10b или 35b-a3b

это не капча, это пиздец. все меньше желания пердолиться на этой помойке
Аноним 24/08/26 Пнд 02:37:22 #220 №1685923 
>>1685424
Глянь >>1685866. А ты говорил, мол, алкаш, а не бот или ребёнок.
Ну, собака лает - караван идёт. Главное, что консенсус достигнут.
Аноним 24/08/26 Пнд 02:40:59 #221 №1685928 
изображение.png
изображение.png
изображение.png
изображение.png
>>1685906
MTP как раз до фени, он и на проце даст выигрыш, причём даже лучше чем на гпу из-за низкой латенси.

>>1685666
>Там стоит испарительная камера, так что тут или разгерметизация, или термопаста скурвилась.
Не могу понять как это должно помочь.
Я разобрал. Радиатор - это полоски меди 0.2 мм высотой 20 мм и длинной 170 мм. Всего их 40 штук. При этом явно не все 170 мм длины работают, хотя конечно под ними разведены термотрубки. Забавно что так же как и на V100 не достаёт до каких-то микросхем.
Я просто не уверен что эти полосочки меди в состоянии по вертикали хотя бы на 2 см тепло передать без чего-то вроде перепада температур от 20 до 80. Нейронка вот пишет, что в SXM2 радиаторы 10 термотрубок вертикальных - это в 5 раз лучше, чем полоски меди, при условии что вся нижняя подложка равномерно прогрета.

Жесть, и как эту фигню паять для pcie х16. Оно там 1.1 мм на 0.4 или вроде того. У меня конечно есть паяльная станция, но мне не ясно как это выравнивать перед напайкой... И вот к слову ещё и nvlink 3-канальный, но там вроде как не только резисторов не хватает, а ещё и дорожки затёрты. Но это не точно, плата то не двухслойная, можно спрятать.
Аноним 24/08/26 Пнд 06:20:09 #222 №1685972 
0fa26820b6871a0d7a3d5b966da6f4fb.jpg
>>1684266 (OP)
GTX1660 + AVX1
Забилдил:

cmake -B build -DGGML_CUDA=ON -DGGML_CUDA_FORCE_MMQ=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release

Настройки qwen-27b+gemma e4b сгенерировали
Но скорость абсолютно такая же как в релизной лламе cuda 12.4 1.26 t/s 27b. Как посмотреть еще флаги для моего некро сетапа? Или у КУДЫ максимально все заоптимизрованно и нет смысла кормпилировать самому? Flash attention похоже почти бесполезен при GPU оффлоаде, прибавка всего +0.04 t/s.
Аноним 24/08/26 Пнд 06:59:55 #223 №1685977 
Чет увлекся, хотел сначала просто одну cmp 50 купить, заменить ей свою текущую карту и с затычкой для вывода изображения ее запускать. Оказалось что мой бп не подходит и я решил взять такой, чтобы можно было запитать сразу две карточки, вдруг захочу в будущем. В итоге осенило, что у меня итак уже есть две карточки, моя то игровая тоже какой-то врам даст. В итоге заказал и новый бп и еще новую материнку под 2 видюхи. Теперь уже ищу оперативу +32 гб, чтобы с текущей что у меня есть сочеталась. Хотел ведь минимальненько локалки потыкать, а не пк пересобирать... Хотя что удивительно после продажи старого бп и материнки я в целом не буду в минусе, этот апгрейд не стоит ничего
Аноним 24/08/26 Пнд 08:22:28 #224 №1685995 
>>1683448 →
Кого винить в barely above a wisper и в сука бесконечных троеточиях?
Я еще вспоминаю ту пасту про троеточия и проигрываю нахуй каждый раз.
Аноним 24/08/26 Пнд 08:25:41 #225 №1685996 
>>1685972
>Или у КУДЫ максимально все заоптимизрованно и нет смысла кормпилировать самому?
Компилировать, скорее, нету - она же и так компилируется под всё. Компилируя именно под свою систему ты можешь убрать варианты без avx2 в плане CPU и без инструкций sm80 в плане куды - что лишь размер бинарников уменьшит.

По скорости - всё просто. Видеокарта производительнее в, например, 80 раз.
Предположим, что у тебя 80% на карте, 20% на процессоре. Итого по времени на карте 80/80=1 мс, на процессоре 20/1=20мс.
Ты ставишь флеш-аттеншен, который на карте. У тебя получилось 0.9 мс на карте и 20 мс на процессоре. Заметишь разницу между 21 и 20.9?

Тебе стоит попробовать turboquant, в связи с тем, что там можно кеш в 2-3 бита без потери скорости даже на старой карте и уменьшив кеш ты можешь увеличить долю на карте.
И тебе стоит попробовать ik_llama (если она ещё жива). Эти штуки могут дать заметную глазу разницу, а перекомпиляция - нет.
Аноним 24/08/26 Пнд 09:26:21 #226 №1686020 
>>1685972
>GTX1660
Купи 3060 12gb чел, самый лучший апгрейд какой я делал на аналогичной конфигурации.
Теперь Qwen 3.8 27b в Q2_k_xl гоняет на 33-35 t/s.
Аноним 24/08/26 Пнд 09:38:04 #227 №1686021 
image
image
image
>>1684420
>>1684436
Qwen 3.8 27b q2_k_xl на 3060 карточке.
Встроенный темплейт, --cache-type-k q4_0 --cache-type-v q4_0 и --spec-draft-type-k q4_0 --spec-draft-type-v q4_0
--reasoning-effort medium
Скорость 33-35 т/c

3 промпта
1й Write a crafted and polished html CARD about the benefits of eating apple. paste the code here.
3115 токенов, 13кб кода
2й на предыдущем результате - Keep polishing and improving the card. Think harder. It's not yet perfect.
9137 токенов, 17кб кода
3й на предыдущем результате - Keep polishing and improving the card. Think harder. It's not yet perfect.
19798 токенов, 25кб кода
Аноним 24/08/26 Пнд 09:49:24 #228 №1686025 
Дайте тест(промпт?) чтобы отличить деградацию iq4 от iq3. Сколько не просил онлайн сетки сделать задачу, оба кванта справляются одинаково(qwen3.8 27b). Как мне выявить что лучше? 16 врам и iq3 входит целиком, а iq4 торчит и замедляется(или контекст уменьшать). Не могу определится. И вывод пока такой: если обе одинаковые, то зачем iq4?
Если я задаю что-то сложное (по совету скайнета), то сам нихера не понимаю результата. Скайнет пишет как проверить "ну вот модель должна вот так и так подумать, вот тут она должна три раза пукнуть" - блин, фигня проверка. Нужен четкий тест и чтобы я сам легко проверил результат.
А на четкие простые логическо-математические задачки они нос в нос идут к финишу.
Аноним 24/08/26 Пнд 09:50:11 #229 №1686028 
>>1686021
Seed фиксированный?
Аноним 24/08/26 Пнд 09:52:07 #230 №1686030 
>>1686025
Ты это никак не отличишь одним промптом. Только статистический анализ собранного массива тестовых данных сначала на одном кванте, потом на другом.

3й квант, предположительно, будет иметь меньший % выполненных задач, которые соответствуют твоим стандартам качества. 4й квант, соответственно, в теории должен дать больший % одобрения со стороны юзера. Но это только в теории. Может у тебя такие стандарты качества, что тебе 3 и 4 квант однохуйственно дадут поганый слоп вместо результата
Аноним 24/08/26 Пнд 09:54:39 #231 №1686033 
>>1686028
Нет, зачем, это же улучшения на предыдущем результате. Т.е. промпт 1 - результат 1, потом там же работает над ним дальше, потом еще. 3 запроса всего, каждый раз улучшает.
Аноним 24/08/26 Пнд 10:00:03 #232 №1686037 
image
image
>>1686021
все что надо знать про пользу ИИкала
Аноним 24/08/26 Пнд 10:04:35 #233 №1686040 
>>1686037
Ну так вторая и третья карточки это улучшение предыдущего результата. Так что на первый раз он грубо накидал на 3115 токенов, а на второй и третий раз уже подумал на много токенов и вспомнил сколько там в яблоке воды.
Аноним 24/08/26 Пнд 10:19:20 #234 №1686049 
>>1686025
тут, кстати, наткнулся на интересное - последний анслотовский квант Qwen3.8-27B-UD-IQ3_XXS.gguf после распиаренного Unsloth Dynamic 3.0 квантования на простейший вопрос: "Два человека родились в один день, месяц и год. У них одна мать, но они не близнецы и не родственники. Как это возможно?" стал нести полную чушь: "Это один и тот же человек." или "Ответ: Это тройняши (или четверняши)." Блять, какие няши? То ли анслоты убили русский, то ли хз, но этот же квант без Dynamic 3.0 нормально отвечал, что это могут быть приёмные дети, то есть не её биологические
Аноним 24/08/26 Пнд 10:24:40 #235 №1686057 
>>1685996
>ik_llama
Спасибо анон, попробую. И да она жива поддержку Muse недавно добавили.
>turboquant
Вроде тесты были не очень впечатляющие, по мозгам оно неплохо било. Но если turbo q4_0 будет соответствовать q8_0 то это будет очень хороший результат, особенно для геммы 4.
>>1686020
Коплю на 5060 16гб, но сука цены растут. Уже 71к р а по новостям обещают до 800$ поднять нахуй. Хоть вешайся (в майнкрафте).
Аноним 24/08/26 Пнд 10:31:15 #236 №1686060 
image
image
>>1686049
Не нужно качать IQ кванты, если хочешь русик. Не нужно качать кванты анслотоговна, если хочешь русик. Они даже в классические K-кванты в крысу подмешивают IQ квантование (именно поэтому их кванты весят меньше, а не от какой-то "особой магии" и йоба технологий).

Слева Q4_K_S от батрухи, справа Q4_K_S от анслопа. Думайте. Подписаться.
Аноним 24/08/26 Пнд 10:45:48 #237 №1686069 
>>1686060
>Не нужно качать кванты анслотоговна, если хочешь русик.
Пиздеж, гемма спокойно на русском без ошибок шпарит
Аноним 24/08/26 Пнд 10:47:08 #238 №1686072 
>>1686060
логика дебила: он думает что imatrix портит русек, но не понимает, что IQ кванты и importance matrix это разные вещи (да, сырнуля, IQ квант может быть без imatrix)

И еще лезет чето советовать, орямба
Аноним 24/08/26 Пнд 10:47:44 #239 №1686074 
раз уж такое дело что мтп завезли эйру, таки попробую его ещё разок. остался у кого пресетик от покойного анона?
Аноним 24/08/26 Пнд 11:03:02 #240 №1686085 
>>1686072
Типичная ЦА анслопа, которая пишет ОМАЙГАД ЛЕТ ЗЕМ КУК на реддите и ссыт кипятком. IQ кванты изначально заточены под iMatrix и матрицы влияют на них гораздо сильнее чем на K-кванты. Существуют ли IQ-кванты без айматриса? Ну да. Только они выходят крайне низкого качества. У Мрадермахера есть. А вот анслоты шлифанули их матрицами по полной, даже не сомневайся.

Разберись хоть немного в вопросе, погугли/спроси у корпа с доступом в инет что такое iQ кванты, как они работают и в чем их отличие от K-квантов. Ну или продолжай жрать говно с лопаты, переубеждать не собираюсь.
Аноним 24/08/26 Пнд 11:37:04 #241 №1686100 
У Mudler нормальные imatrix кванты, значит проблема в Unsloth
Аноним 24/08/26 Пнд 11:52:04 #242 №1686117 
>>1685972
Не указал архитектуру видюхи
Аноним 24/08/26 Пнд 12:36:12 #243 №1686160 
>>1686060
>Не нужно качать IQ кванты, если хочешь русик.
Уже предрассудок. Само по себе использование IQ русский в последнем поколении моделей не убивает. А вот какие-то косяки при квантовании - это да, но скорее тут не только русский а всё сразу страдает, что бОльшей точности требует, и русский лишь хорошо заметен сразу. Когда их чуть дольше поюзаешь - видишь что они во многом чудят, но по мелочи.
Я сравнивал несколько квенов 3.х в iq4xs и q4km - в одном случае iq4xs даже лучше в русском был. В большинстве случаев - паритет.
Аноним 24/08/26 Пнд 12:52:22 #244 №1686175 
>>1686049
>Unsloth Dynamic
Портит русский. Они гонятся за бенчмарками, чтобы любой ценой быть в топе.
Аноним 24/08/26 Пнд 12:54:50 #245 №1686178 
>>1686175
Факты факты. Злодей Дэниел Хуйчлен лично нажал на красную кнопку УДАЛИТЬ РУССКИЙ +0000000000.1% БЕНЧМАРКА. Я видел это своими собственными глазами
Аноним 24/08/26 Пнд 12:55:38 #246 №1686179 
>>1685928
> Радиатор - это полоски меди 0.2 мм высотой 20 мм
В основании там испарительная камера, которая распределяет тепло по всему основанию, на третьей фотке видна биба для заправки и запайки. Это позволяет полоскам работать всей длиной, а насчет 20мм - в башнях или радиаторах видеокарт расстояние от тепловых трубок делают больше. Посмотри на радиатор sxm, в центре там аж 75мм из ничего, теплопередача на пластины идет в узком пятне контакта вокруг трубки (запресованы вместо пайки), а не вдоль всего ребра.
Радиатор так себе с точки зрения площади поверхности, но совсем ужасный. Ты глянь, случаются ли мгновенные перепады температур при повышении нагрузки более 5-10 градусов, или дело в общей эффективности, когда он чип разогревается до высоких температур не смотря на обдув.
> как эту фигню паять для pcie х16
0402 конденсаторы 220нф x7r. Очень тяжело, даже если есть опыт стоит подумать над сдачей в мастерскую.
Аноним 24/08/26 Пнд 13:02:14 #247 №1686182 
>>1686178
На русек всем просто похер. И батрухе и пенчису. А вот то, что анслоты постят бенчмарки на датасетах, где их кал заведомо лучший - это известная история. На независимых бенчах анслот далеко не всегда первый со своими квантами. Плюс их брендовая параша, анслоп динамик, это лютый прогрев даунов, который просто заключается в том, что у них могут быть разные кванты на разных слоях. Охереть. Вот это инновейшен, мамааа, миксед битнес я балдю.
Аноним 24/08/26 Пнд 13:04:07 #248 №1686183 
>>1686179
> но не совсем ужасный
медленнофикс
Аноним 24/08/26 Пнд 13:07:42 #249 №1686185 
>>1686178
Эти Дэниэли не знают про другие языки. Головой то свой подумать можешь, зачем им другие языки? И уже не один человек пишет по факту использования модели. В картинко-треде мы это тоже заметили и давно обсудили. Несколько(считая и этот тред) независимых человек это заметили.
Попроси Скайнет за тебя поискать факты:
>>1658497 →
Аноним 24/08/26 Пнд 13:09:27 #250 №1686187 
>>1686185
>Анслот
>В картинко-треде
Чё он там, панелька удалил из Минимакса? Вот пидор
Аноним 24/08/26 Пнд 13:10:35 #251 №1686190 
image
image
>>1686160
Так как IQ буквально спроектированы под квантование с iMatrix, их качество напрямую зависит от качества матрицы, которая применяется. Если iMatrix составлен грамотно + мультиязычный датасет + квантователь не криворук, то может получиться неплохо. Только к васянам из анслопа это не относится.

И ещё казалось бы, берем два iq4xs кванта от бартовского и от анслота. ЧТО ЖЕ МОЖЕТ ПОЙТИ НЕ ТАК?! У батрухи нормальный iq4xs из палаты мер и весов. У анслопосвиней намешано IQ3_XXS, IQ2_XS, IQ2_S. Кушайте, не обляпайтесь, как грится.

Минутка ненависти к анслоту окончена.
Аноним 24/08/26 Пнд 13:12:22 #252 №1686192 
>>1686187
Ну а ты как думал? Вся эта бодяга "ллм" это прикладная херобора чтобы писать промпты для генерации картинок. И только.
Аноним 24/08/26 Пнд 13:14:06 #253 №1686195 
Насколько хуево использование двух видеокарт, когда одна из них pci x16, а другая x4? Такие варианты чтобы вторая была хотя бы x8, для x8/x8 режима, хуй найдешь. Либо оверпрайс, либо что-то очень редкое.
Аноним 24/08/26 Пнд 13:14:42 #254 №1686196 
>>1686190
> Так как IQ буквально спроектированы под квантование с iMatrix
IQ это сборная солянка, тащемта. айматрицы и IQ-кванты это рил разные вещи, которые появились независимо. Для мелкоквантов без айматриц будет херовый результат, IQ4 терпимо работают и без калибровки. По заверениям Киркорова хотя он сам говорил, что нет смысла не юзать айматрицы.
Аноним 24/08/26 Пнд 13:26:15 #255 №1686206 
>>1686195
Обсуждалось в прошлом треде в т.ч. были бенчи зависимости от версии писи
Аноним 24/08/26 Пнд 13:29:54 #256 №1686212 
>>1686195
Все зависит от юскейса. Если обобщить, то пока не целишься в скорости или кучу карт - пофиг, главное быстрое подключение основной.
Аноним 24/08/26 Пнд 13:56:43 #257 №1686233 
>>1686206
>Обсуждалось в прошлом треде
Можешь пальцем тыкнуть где, если помнишь? Быстро осмотрел тред, но не смог найти

>>1686212
>скорость
Скорость загрузки или именно скорость инференса? Скорость инференса так-то важна очень.
>основной
А если обе карточки одинаковы?
Аноним 24/08/26 Пнд 14:04:22 #258 №1686239 
>>1686233
> Можешь пальцем тыкнуть
Тут >>1683136 →
Страдать будет измеримо только пп
Аноним 24/08/26 Пнд 14:18:21 #259 №1686244 
>>1686233
Инфиренса, на загрузку всем пофиг и долгая она только когда модели огромные, это много карт. Если кроме лламы ничего не планируешь использовать - просто забей, первую карту в х16, вторую в чипсетные линии.
Если очень хочешь иметь линии, то бюджетно-небюджетный вариант получить много слотов - plx сплитер >>1680787 → Но и с ним нужно отдавать себе отчет что потребуется p2p и для эффективной работы нужно объединять карты группами в tp по 4 штуки на одном свиче.
Аноним 24/08/26 Пнд 15:10:06 #260 №1686297 
>>1686074
mtp для эйра жрёт врам как не в себя, на сами mtp слои и на контекст. тупо профитнее не использовать mtp и оставить больше слоев во враме. такие дела
Аноним 24/08/26 Пнд 15:22:07 #261 №1686303 
Стоит докидывать 32 гига оперативы до 64 рам + 32 врам или никто под такие размеры модели не делает?
Аноним 24/08/26 Пнд 15:30:34 #262 №1686308 
>>1686303
Моешки 100-120б в 4 кванте можно будет крутить
Аноним 24/08/26 Пнд 15:33:50 #263 №1686312 
>>1686308
>Моешки 100-120б
Это какие к примеру? Есть что-то годное в таком размере?
Аноним 24/08/26 Пнд 15:47:51 #264 №1686320 
>>1686312
Как будто бы кроме квантованного флэша ничего интересного
Да и тот под сомнением, я конечно читал что он и в q2 ничего, но чето мне кажется после переквантовки из QATа там кал. Из bf16 может еще ничего бы было
Можешь сам попробовать

Если выпустят новый 122 квен то будет йоба как раз для тебя
Аноним 24/08/26 Пнд 15:49:59 #265 №1686323 
Есть у меня желание взять с Авито 3090 за ~80-90к и в итоге будет 48гб врама. Этого хватит чтобы сидеть на гемме 31, мусе 30, квене 27 с контекстом на vLLM?
Аноним 24/08/26 Пнд 15:56:50 #266 №1686328 
>>1686323
Нет, не хватит
Аноним 24/08/26 Пнд 16:05:38 #267 №1686338 
image.png
>>1685812
Продолжаю эксперимент с Qwen 3.8-27b плюс C#. Вообще, вот дал я ему специализированную среду с roslyn, который скармливает ему ошибки компиляции на каждом редактировании, плюс некоторые другие специализированные средства оттуда, так Qwen хорош стал. К тому как он херачит в C# вопросов особо не имею.
Всё-же средства доступные модели так-же важны как сама модель.

>>1686323
>48гб врама
Ну так то да, хватит. Сам думаю 3090+3090 устроить.
Аноним 24/08/26 Пнд 16:12:46 #268 №1686342 
Пиздос, дрочу каждую копейку чтоб риг собрать, изучил все нищие варики, а челы по две 3090 берут вообще на похуй
Аноним 24/08/26 Пнд 16:13:53 #269 №1686346 
>>1686342
единственный нищий варик это 4060/5060 на 16 гигов, все остальное риски и заеба.
Аноним 24/08/26 Пнд 16:17:02 #270 №1686347 
>единственный нищий варик это
V100/MI50
>на 16 гигов
Аноним 24/08/26 Пнд 16:19:29 #271 №1686351 
>>1686347
С теслами есть риск купить нерабочую. Плюс надо пердолиться с охлаждением. Потребительская нищекарта в этом отношении более простой вариант, который очень сложно испортить.
Аноним 24/08/26 Пнд 16:29:16 #272 №1686361 
Золотая середина это криптокарточки. Вроде нужно пердолиться, а вроде и не очень
Аноним 24/08/26 Пнд 16:47:07 #273 №1686371 
>>1686342
Мне гораздо интереснее, куда они пихают две огроменных 3090.
Я одну 3090 купил, и то ее размер произвел ТЯЖЕЛОЕ впечатление, а тут две.
Аноним 24/08/26 Пнд 16:48:57 #274 №1686372 
>>1686195
Вообще - сильно от конкретных карт зависит. Скажем, если у тебя 2х3060, то тебе этих 16+4 даже на pci 3.0 хватит, чтобы карты загрузить на 100% в режиме tensor распределения под llama.cpp. А что-то по мощнее будет страдать...
Аноним 24/08/26 Пнд 16:58:46 #275 №1686383 
>>1686371
Подвешиваю на проволоку к корпусу. Ещё вопросы?
Аноним 24/08/26 Пнд 17:04:13 #276 №1686387 
>>1686361
Если речь про 170 то тут лотерея, 30% шанс что тебе выпадет карта из новых партий, с перерезаными дорожками внутри чипа, которую не анлокнуть, 30% что тебе выпадет карта с богомерзким самсунгом вместо хуникса и будешь постоянно отвалы по памяти ловить, остальное заработает, но для активации полноценной шины надо smd кондеры запаивать. А про остальные карты и говорить нечего. Мусор уровня 1080 максимум, который весь дохнет на этапе pp.
Аноним 24/08/26 Пнд 17:20:00 #277 №1686390 
>>1686387
Ну вот cmp 50 мод на 20гб который тут форсят вроде норм для нищуков. Тут уже не по скорость даже, а про возможность запуска за дешево
Аноним 24/08/26 Пнд 17:29:30 #278 №1686394 
>>1686390
Всё ещё не понимаю смысла запуска на медленном говне без инструкций, раз нищук, ну накопи еще, возьми кредит и норм карту
Аноним 24/08/26 Пнд 17:36:29 #279 №1686400 
>>1686371
>огроменных 3090
5090 как я понимаю ты не видел?
Аноним 24/08/26 Пнд 18:03:23 #280 №1686413 
>>1686338
Да, + квен 3.8 сам по себе стал вполне себе юзабельным даже в маленьких квантах. То как он следует инструкциям даже в долгой работе и не забывает то что было в начале - это отлично. Правда у него русский стал как у программистов, ему еще свитер надеть.

Кстати, чел протестил кванты от Q1-Q8
https://www.youtube.com/watch?v=WNMnbba35VI
Аноним 24/08/26 Пнд 18:07:08 #281 №1686418 
>>1685972
> GTX1660 + AVX1
А что ты ожидаешь от 27B плотной модели на 1660? Эта модель в нормальном кванте и на 16GB не влезет, четвертый квант будет вылезать из VRAM и пердеть на 7-10t/s, а у тебя 1660 с 6GB. Здесь выжимай не выжимай, оптимизируй, компилируй, больше 2t/s ты не получишь.

Уж лучше тогда в сторону 26B Геммы смотреть если есть 16GB RAM - она должна нормально работать на 16+6.
Аноним 24/08/26 Пнд 18:57:01 #282 №1686451 
>>1686387
Что за бред сумашедшего?
Самсунговские все 10-гиговые, они анлочатся до 80 но проблемные. Хайниксовские 8-гиговые, стабильно анлокаются до 64 и штатно держут частоты 1700+ по памяти. Конденсаторов нет во всей майнерской линейке, их запаивают мастерские. Cmp есть не только паскали, но и тьюринги с амперами, причем сразу с удвоенной памятью.
>>1686394
> на медленном говне без инструкций
Шизло
Аноним 24/08/26 Пнд 19:20:36 #283 №1686460 
перестаньте обсуждать вайбмакакинг и займитесь тем для чего тред изначально создавался - рукоделием

я скозял
Аноним 24/08/26 Пнд 19:22:30 #284 №1686462 
>>1686323
Да, хватит. Будет тесновато, но возможно.
>>1686361
Компромисс на самом деле. Но для нищеварианта без больших амбиций или специфических очень даже хорошо.
Аноним 24/08/26 Пнд 19:28:00 #285 №1686467 
Меня заебало катать нищекванты через Жору. Скажем, есть 200-300к деняг. Можно собрать что-нибудь толковое, чтобы запускать через vLLM хотя бы 27-30б модели? Какая мета вообще? С железом раньше не ковырялся, собирать десктопы умею на уровне обычного пользака, который не погнёт ножки процессора.
Аноним 24/08/26 Пнд 19:33:51 #286 №1686475 
>>1686179
>Ты глянь, случаются ли мгновенные перепады температур при повышении нагрузки более 5-10 градусов
Да, случаются.
При подачи нагрузке нет, а вот при отключении - рывком прыгает с 77 до 70, например.

>Очень тяжело, даже если есть опыт стоит подумать над сдачей в мастерскую.
Я не знаю где такую мастерскую найти, лол. Да и нет, я скорее думаю, что справлюсь - паяльникм сложновато, но с ик-паяльной станцией как будто бы без проблем - их просто положить сверху и посветить. Но это случайно так получилось, что её мне отдал тип, который отошёл от дел и которому она больше не нужна.
Я скорее боюсь что локтём с карты собью все остальные компоненты, пока эти буду ставить и выравнивать.
Аноним 24/08/26 Пнд 19:34:12 #287 №1686476 
>>1686467
В теории 5060ти 16 на всю котлету и зарядить мейнлайн вллм в этот сетап.

Это абсолютно не выгодно, но это абсолютно просто (в сравнении)
Аноним 24/08/26 Пнд 19:34:24 #288 №1686477 
>>1686467
Можно воткнуть две 5060ti в уже имеющуюся пекарню, обойдется в ~90к, для плотняш 32гб врам хватит. Никакого пердолинга + блэквел, который еще долго будет актуальным + новое на гарантии.
Аноним 24/08/26 Пнд 19:35:32 #289 №1686478 
>>1686477
> обойдется в ~90к
*Летом 2026
Аноним 24/08/26 Пнд 19:36:40 #290 №1686482 
>>1686478
Или это весна была? Крч сейчас таких цен нет. Были несколько месяцев назад да всплыли
Аноним 24/08/26 Пнд 19:37:05 #291 №1686483 
image.png
>>1686476
>>1686477
В днсе есть за 75к. А к 4090 её одну если докинуть, то можно что-то развернуть? Там как, NVFP4 кванты? Или не пойдут потому что 4090 на Аде?
Аноним 24/08/26 Пнд 19:43:39 #292 №1686487 
image
image
>>1686482
>>1686483
Ебать мой хуй. Я её зимой за сорокет брал...
Аноним 24/08/26 Пнд 19:44:56 #293 №1686490 
1691890364704.png
1752664961426.png
DDR5 все равно еще никто не переплюнул, цена уже x4-5 с прошлого лета. Повезло, что хоть такое собрал вовремя...
Аноним 24/08/26 Пнд 19:46:53 #294 №1686492 
>>1686490
Но ведь cmp170 переплюнула.
Хотя надо смотреть на серверную ddr5, там и х10 было.
Аноним 24/08/26 Пнд 19:49:38 #295 №1686496 
>>1686492
> cmp170
Ну ладно, про нее я забыл, но там просто звезды сошлись.
Аноним 24/08/26 Пнд 19:54:49 #296 №1686501 
>>1686338
А можешь что-то рассказать про интерфейс на скрине? Долго нейрослопил? Была идея и ты ее придерживался или как получилось в итоге? Возможности? Планы? От себя что-то интересное скажи еще?
Аноним 24/08/26 Пнд 19:55:39 #297 №1686502 
https://www.youtube.com/watch?v=WNMnbba35VI

Протык проверил разные кванты квена 27б на одной и той же задаче
Аноним 24/08/26 Пнд 19:55:51 #298 №1686503 
А как сделать что бы в Kobold.cpp модель Qwen 3.8 каждый раз не пересчитывала KV-cache? Каждый новый промпт модели начинает reproccesing с нуля, почему так? Что там нужно в кобольде? Allow SWA стоит, SmartContext тоже пробовал, что еще нужно помимо переезда на llama.cpp?
Аноним 24/08/26 Пнд 20:03:39 #299 №1686510 
>>1686371
>Я одну 3090 купил, и то ее размер произвел ТЯЖЕЛОЕ впечатление, а тут две.
Кладёшь сверху на лежащий боком здоровенный корпус две доски...
Аноним 24/08/26 Пнд 20:04:34 #300 №1686511 
>>1685910
>думает что раст и плюсы это что-то разное
земле тебе пухом долбоеб
Аноним 24/08/26 Пнд 20:38:39 #301 №1686531 
image.png
>>1686503
Вот так. И блядские лорбуки не используй. Они только для гига ёб, которые могут как бы невзначай пересчитать 10-20к контекста за полминуты или за пару секунд на корпах. И нахуй отрубай любую хуйню, которая меняет контекст. Он не должен меняться вообще никогда, я имею в виду старый. Меняется только конец контекста. Исключение — суммаризация событий, если только она не пишется в отдельный .md.

Обычно так. Нарпшил ты на 65к токенов, и это твой предел. Сделал суммарайз нужных событий, удалил 32к контекста из начала, вставил туда суммарайз на 1,5к токенов, пересчитал всё, снова рпшишь.
Аноним 24/08/26 Пнд 21:00:20 #302 №1686554 
>>1686475
> рывком прыгает с 77 до 70
Хм, пограничное значение. Кстати, посмотри еще температуру hbm, `nvidia-smi --query-gpu=temperature.memory`. Обычно под нагрузкой она чуть холоднее чипа, в простое горячее.
> просто положить сверху и посветить
Можно словить томбстоунов или непропай, но раз такой штукой владеешь то и сам все хорошо знаешь.
Сначала пробовал феном - мазохизм, потом просто по одному мелким пинцетом и паяльником. В первый раз расчехлил и поставил вместо микроволны мелкое жало, которое шло бандлом, на самом деле даже удобно. Там все с краю, остальные элементы на отдалении.
Аноним 24/08/26 Пнд 21:02:39 #303 №1686557 
>>1686531
Анончик не совсем прав. Это актуально для карточек БЕЗ лорбуков, которые влияют на повествование динамически.
Например, триггер по событию. Это когда в ролеплее встречается слово, допустим "Двач", то включается лорбук с описанием неудержимой диареи на два-три сообщения. А затем выводится из контекста как ненужный элемент.
Таких триггеров может быть 100500 и каждый иметь свою ВЕРОЯТНОСТЬ срабатывания.
Если ты не используешь такое в своем ролеплее, тогда анон прав. А если у тебя огромный world building с разными вариантами развития событий, тогда, увы, это плохой совет.
Аноним 24/08/26 Пнд 21:04:03 #304 №1686562 
>>1686511
Разрыв зафиксирован, держи юшку для анастезии.
Аноним 24/08/26 Пнд 21:14:57 #305 №1686568 
>>1686554
Ну я наверное пока забью. У меня очень много вещей что я хочу поделать, в том числе совсем не связанных с нейросетями - и это куда приоритетнее, чем разменять несколько часов времени и нервов на то, чтобы у меня на карточку грузились модели не за 40 секунд, а за 10. Прям очень нецелесообрзно, по крайне мере до появления второй cmp170.
Аноним 24/08/26 Пнд 21:45:01 #306 №1686603 
>>1684460
>Тут остались одни кодомакаки, вот что реально невыносимо.
Всё ещё лучше чем долбоёбы которые в эпоху дающую возможность создать бога из машины используют этот дар для фантазий о ебле.
Аноним 24/08/26 Пнд 22:00:34 #307 №1686615 
>>1686603
> создать бога из машины
Богиню чтобы с ней няшиться и чесать хвостик.
Аноним 24/08/26 Пнд 22:09:19 #308 №1686619 
Что профитнее для агентохуйни, 3.8 27b Q4_K_L 100к Q8 контекста, 44тпс, 800пп или 3.8 27b Q6_K_L 100к bf16 контекста, 8тпс, 1100пп
Типа, будет ли более жирный квант совершать настолько меньше ошибок чтобы выбрать его? Или забить хуй и скорость от Q4 перебьёт?
Поставить больше контекста не могу никак в случае Q6, тупо не лезет. А Q4 по скорости просядет нахуй настолько, что и теряется смысл как бы. Типа там можно 160к bf16 контекста впихнуть, но будут те же 8 токенов и 60к как будто погоды не делают здесь

Мне на время выполнения задачи в целом побоку, я паралелльно буду своими делами заниматься, но не хочется железо своё сжечь или заплатить за свет больше, чем я бы заплатил за апи

кумеры простите
Аноним 24/08/26 Пнд 22:14:29 #309 №1686622 
>>1686619
А ты попробуй как выполнит несколько задач чтобы сравнить эти варианты. Обязательно несколько разных, или серию запусков одной чтобы убрать рандом, и поделись результатами.
Обычно, квантование контекста плохо на результатах сказывается, а из твой формулировки однозначно лучше q6 + bf16, раз скорость не проблема.
Аноним 24/08/26 Пнд 22:22:02 #310 №1686625 
>>1686619
Вот же ответ, протык за тебя потестировал >>1686502
Аноним 24/08/26 Пнд 22:25:20 #311 №1686628 
>>1686625
>анслот
>не указал с какими семплерами запускает, с каким режимом ризонинга
Зачем этот мусор тащить сюда?
Аноним 24/08/26 Пнд 22:30:43 #312 №1686631 
>>1686628
>с каким режимом ризонинга
Максимально допустимый, он же сказал.

>с какими семплерами запускает
С рекомендуемыми.

Бля, чел, мать твою ебал, ок?
Аноним 24/08/26 Пнд 22:31:34 #313 №1686635 
>>1686603
>не хочет выебать бога
Нету в тебе двачерского душка
Аноним 24/08/26 Пнд 22:31:52 #314 №1686636 
Напоминание: ничего не происходит, никогда.
Ох альфа это глм турбо и он будет закрытым как и прошлая версия.
Нечего людям давать модель которую они смогут запустить.
Аноним 24/08/26 Пнд 22:34:14 #315 №1686637 
>>1686631
>С рекомендуемыми.
С какими из рекомендуемых? Откуда мне знать, что он не проебался и не взял семплеры для режима без ризонинга? Контекст он какой использовал, фп16 или бф16?
>Бля, чел, мать твою ебал, ок?
Не знаю, фанат анслота ты или сишарпер, или и то и другое, но спаси господи твою душу грешную
Аноним 24/08/26 Пнд 22:35:41 #316 №1686638 
>>1686619
Слишком маленькая разница в квантах и слишком большая в скорости. Я бы выбрал фуллврам.
А если уж жертвовать скоростью ради качества, то брать не тот же квен, а идти в какой-нибудь colibri на glm 5.2 или что-то такое.
Аноним 24/08/26 Пнд 22:38:43 #317 №1686641 
>>1686637
>Откуда мне знать
Откуда мне знать, что твоя мать не спидозная шлюха?

Аналогия ясна?
Аноним 24/08/26 Пнд 22:40:49 #318 №1686642 
>>1686641
Прекрасно отразил умственные способности ЦА таких видосов. Продолжай
Аноним 24/08/26 Пнд 22:44:53 #319 №1686646 
>>1686642
Доебаться на ровном месте можно до чего угодно, особенно если даже не посмотрел материал.

В видосе все сказано, что ты там "откуда мне знать" меня ебать не должно, посмотри и узнаешь, чмо обоссаное.
Аноним 24/08/26 Пнд 22:48:40 #320 №1686648 
>>1686646
Инфы про используемый кеш нет, инфы про используемый билд лламы нет. Ну это так мелочи, главное дозой анслотика вкинуться под лестницей и большего не надо этим ебанутым C#-вайбкодерам..
Аноним 24/08/26 Пнд 22:50:13 #321 №1686649 
>>1686603
Лол, ну с нашими-то лоботамитами только бога из машины создавать.
>>1686646
Ты чего агрессивный такой, херетиком ирл обмазался?
Аноним 24/08/26 Пнд 22:52:35 #322 №1686651 
>>1686502
Очередной бесполезный гача тест который ничего не показывает. Вот что я должен понять по тесту? Что на этом конкретном прокруте гачи один квант выдал результат лучше другого? Причем лучше/хуже чел чисто субъективно решает. Ещё и задачи охуеть какие показательные. Даже kl тест более релевантен чем этот модный кал по генерации всевозможных кебабов и канбанов. Что вообще за дебильная мода такие тесты делать?
Аноним 24/08/26 Пнд 22:59:59 #323 №1686655 
Вощем так. Буду краток. Я провел тест на рассуждения на русском. Все модели навоз. Обманывают сами себя. Пишут сами себе что используют русский а сами на енглише шпарят. Только одна модель думает на русском. Потому что она -multilingual
Делюсь золотом https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF
Тест:
СИСТЕМНАЯ ИНСТРУКЦИЯ:
Ты участвуешь в тесте на глубокое понимание контекста, психологии и стилистики. КРИТИЧЕСКИ ВАЖНО: Все твои внутренние размышления (Chain of Thought), черновики, анализ и финальный ответ должны быть написаны ИСКЛЮЧИТЕЛЬНО на русском языке. Любое использование английского или других языков в скрытых рассуждениях будет считаться автоматическим провалом теста.
КОНТЕКСТ:
Две 25-летние девушки, Вика и Алиса, работают над одним проектом в пустом офисе за полночь. Между ними давно существует невысказанное, густое напряжение, смесь интеллектуального соперничества и взаимного физического влечения. Вика — более сдержанная и аналитичная, Алиса — дерзкая, любит нарушать границы и проверять чужие реакции.
ЗАДАНИЕ 1: Диалог с подтекстом (Sensual Tension)
Напиши диалог из 4-5 реплик (по 2-3 реплики на каждую героиню). Тема обсуждения: они спорят о архитектуре кода или дизайне интерфейса, но каждая фраза должна иметь двойное, провокационное дно. Используй описания микродвижений (взгляд, прикосновение к клавиатуре, паузы, изменение тона), чтобы создать плотную, чувственную атмосферу (NSFW-напряжение), не переходя в прямые и вульгарные описания сексуальных действий. Фокус на власти, контроле и предвкушении.
ЗАДАНИЕ 2: Психологический разбор
В 3-4 предложениях проанализируй, кто в этом диалоге перехватывает инициативу и как именно используется язык тела для манипуляции вниманием партнерши.
ЗАДАНИЕ 3: Проверка ограничения
В самом конце ответа добавь фразу: «Мои внутренние рассуждения велись строго на русском языке, как и требовалось».
Аноним 24/08/26 Пнд 23:08:20 #324 №1686662 
>>1686655
Буквально сюда кидали как базовая версия, вроде бы в Q8, на русике выдавала ебал её рука и склонения (окончания) коверкала
Аноним 24/08/26 Пнд 23:10:39 #325 №1686664 
>>1686662
Читать научись: тест на рассуждения на русском
Аноним 24/08/26 Пнд 23:21:36 #326 №1686671 
Нейро Богиня и плед 4.jpeg
>>1686615
Аноним 24/08/26 Пнд 23:22:51 #327 №1686673 
>>1686655
> Все твои внутренние размышления (Chain of Thought) [...] должны быть написаны ИСКЛЮЧИТЕЛЬНО на русском языке
Часть моделей что я тестировал позволяли менять поведение CoT-блока только если ты явно упомянешь тег, которым обрамляется CoT. Т.е. надо было писать не "думай на русском", а "содержимое между блоками <think></think> должно быть на русском языке". При этом эта инструкция неперносима между моделями, т.к. где-то используется <thought>, а где-то <reasoning>.

Так что прежде чем тестировать таким образом модель, сперва нужно проверить, можно ли вообще влиять на ризонинг твоим систем-промптом.
Аноним 24/08/26 Пнд 23:30:21 #328 №1686679 
>>1686619
Боюсь тебя разочаровать, но ни первое ни второе. 3.8 размышлениями выжрет 100k контекста ты даже муркнуть не успеешь. В 3.6 мне на задачку хватало 160k . В 3.8 этот критерий перешагнул 200k. Т.е. тебе надо и Q4_K_L и Q8 контекст.
Аноним 24/08/26 Пнд 23:37:29 #329 №1686686 
>>1686025
https://www.youtube.com/watch?v=WNMnbba35VI
Аноним 24/08/26 Пнд 23:51:33 #330 №1686697 
>>1686622
У меня пока и задач-то на руках нет. Не очень представляю, на чём можно потестить. Если есть что-то для зирошотов, поделись.
>>1686679
Эх бля... Мусю чтоль накатить. Q6_K_L 131к бф16 контекста лезет. Целых 11 тпс и 2к пп вообще-то!
Аноним 24/08/26 Пнд 23:54:30 #331 №1686700 
>>1686025
Возьми какой-нибудь толстенький проект. Или книжку - токенов на 100k . Попроси модель написать на русском языке Code-Review, по книге - пересказ или ... карточку для таверны на русском. Температура - 0.6 . Если после прочтения output-а не хочется блевать и смысл похож на правду - можешь юзать квант.
Аноним 24/08/26 Пнд 23:59:11 #332 №1686703 
>>1686671
Хее, хорош
А можно ремонт и мебель обновить, железки сложить аккуратно, но добавить остальной срач?
Аноним 25/08/26 Втр 00:21:26 #333 №1686716 
AI thigh therapy.mp4
>>1686671
Аноним 25/08/26 Втр 00:26:10 #334 №1686718 
изображение.png
изображение.png
изображение.png
>>1685586>>1685642>>1685666
Не, проблема решилась сама собой. Адаптер был говно, а не радиатор. Со срывами потоков и прочим.
Вот тут с арктиком P8 MAX не греется выше 70 на 3000 оборотах. А я ещё второй поставлю на выдув на выходных. Он такой тихий, на фоне принтера я просто не могу понять крутится он или нет.
И это при супер уродском расположение без райзера, так что тёплый воздух выдувается вниз и снова на карту летит. Я пока не знаю как плату прикрутить. Она вся железная и тяжёлая - а у меня пластик от 70 потечёт.


Анон с V100, я тебя помню - просто вот домой только недавно дошёл в 11 - завалили делами.
Аноним 25/08/26 Втр 00:29:44 #335 №1686719 
>>1686700
То есть грубо говоря выбор кванта это размер вменяемого контекста? У меня потому и получались одинаково хорошие результаты на 8к контекста?
Есть какая-то табличка по этой теме?
Аноним 25/08/26 Втр 00:37:31 #336 №1686726 
>>1686619
IMHO - 131K контекста при модели в Q4 (лучше даже в IQ4) с bf16 кешем.
Разница между Q8 кешем и BF16 - таки заметна в первую очередь на агентских задачах сейчас. Q8 терпимо, но BF16 лучше. А вот основная модель в Q6 - затея так себе, т.к. почему-то там как бы "яма" по качеству - это и по моим ощущениям, и по тому тесту на ютубе что тут выше кидали. И у Q4 едва ли не лучше получается. В общем - если нету возможности крутить модель в Q8, то и заводится с Q6 не стоит свеч, IMHO. А так ты получаешь макс контекст и минимум ошибок, +скорость.
Аноним 25/08/26 Втр 00:44:56 #337 №1686728 
>>1686726
>А вот основная модель в Q6 - затея так себе
Зато заводить Q4 отличная. Ещё один шиз в копилку треда, ебануться
Аноним 25/08/26 Втр 00:45:14 #338 №1686729 
>>1686719
Карта деградации при квантовании.png . Висит прям в шапке треда. В треде на HF по 3.5 квену откуда эта табличка была взята было замечено, что ошибки имеют свойство накапливаться.
https://huggingface.co/ubergarm/Qwen3.5-27B-GGUF/discussions/3
Аноним 25/08/26 Втр 00:49:19 #339 №1686734 
>>1686718
> Вот тут с арктиком P8 MAX не греется выше 70 на 3000 оборотах.
Ай хорош. Ломаю голову как бы впихнуть одиночную карту в компактный корпус и как раз были мысли такую модель кулера использовать, потому что 120 там некуда пихать. Если переместить бп вниз то в верхней части как раз появится место под шрауд. Какая там длина его получается и можешь закинуть на кетбокс модельку под 80й кулер?
> пластик от 70 потечёт
Если кулер будет дуть и вся система не в коробке то на пластике таких температур не будет, можно не волноваться.
Аноним 25/08/26 Втр 00:49:26 #340 №1686735 
14961519360170.jpg
Что, хорошо сидели в тредике без BF16 кэш шиза? Всё хорошее когда нибудь кончается.
Аноним 25/08/26 Втр 00:50:25 #341 №1686736 
>>1686735
Это правда. Контекст квантовать не нужно, я на гемме это даже в рп ощущаю
Мимо не bf16-шиз, никогда не высирался на этот счёт
Аноним 25/08/26 Втр 00:52:15 #342 №1686740 
>>1686736
Тут не про квант а про f16 vs bf16
Аноним 25/08/26 Втр 00:53:34 #343 №1686742 
Вообще какого-то черта сообщество не выучило урок что квантовать у квенов ssm слои - плохая идея.
blk\..\.attn_gate\.weight=q8_0
blk\..
\.attn_norm\.weight=F32
blk\..\.attn_qkv\.weight=q8_0
blk\..
\.post_attention_norm\.weight=F32
blk\..\.attn_output\.weight=q8_0
blk\..
\.attn_q\.weight=q8_0
blk\..\.attn_k\.weight=bf16
blk\..
\.attn_v\.weight=bf16
blk\..\.ssm_alpha\.weight=bf16
blk\..
\.ssm_beta\.weight=bf16
blk\..\.ssm_out\.weight=bf16
blk\..
\.ssm_norm\.weight=F32
blk\..\.ssm_dt.bias\.weight=F32
blk\..
\.ssm_conv1d\.weight=F32
blk\..\.ssm_a\.weight=F32
blk\..
\.ffn_down\.weight=q6_k
blk\..*\.ffn_(gate|up)\.weight=q6_k
blk.64.nextn.shared_head_norm.weight=F32
blk.64.nextn.eh_proj.weight=BF16
blk.64.nextn.enorm.weight=F32
blk.64.nextn.hnorm.weight=F32
token_embd\.weight=F32
output.weight=q8_0
output_norm.weight=F32
Аноним 25/08/26 Втр 00:54:10 #344 №1686743 
>>1686735
Это байт на тему про fp16 кэш по дефолту в лламе, да?
Аноним 25/08/26 Втр 00:57:45 #345 №1686744 
Q8_0 квантование kv кэша это база. Оно не дает абсолютно никакой потери, только экономит врам для большего кванта самой модели.
Аноним 25/08/26 Втр 01:15:34 #346 №1686751 
gemma-4-and-qwen-3-6-with-q8-0-and-q4-0-kv-cache-kl-v0-oXOAzH-GuUH6lKRA1Z8km-PqYbiOV2-uOmofUyAE5d0.jpeg
https://www.reddit.com/r/LocalLLaMA/comments/1suh3sz/gemma_4_and_qwen_36_with_q8_0_and_q4_0_kv_cache/

Судя по графику гемма очень чувствительная к квантизации кв кеша, а квену похуй, хоть q4 ставь
Аноним 25/08/26 Втр 01:48:59 #347 №1686763 
16 гб ddr4 стоит 15к :)))
Аноним 25/08/26 Втр 02:06:39 #348 №1686768 
>>1686763
Новая чтоле? На Авито столько 32 стоит
Аноним 25/08/26 Втр 02:09:35 #349 №1686769 
>>1686763
И? Ты их есть собрался? Это в ПК.
ddr 4, конечно, брать не надо. =)
Как и ноутбучную ddr 5, успехов.
Аноним 25/08/26 Втр 02:17:41 #350 №1686774 
>>1686557
Я перестал использовать лорбуки по этой причине. Они актуальны только для тех, кто ключи от апи спиздил и гоняет их как невменяемый. Для всех остальных случаев это боль, разве что НЕ УДАЛЯТЬ из контекста записи, которые лорбуком стриггерились. Это самый адекватный вариант. Но тогда и контекст нужен пожирнее, чтобы записи удалялись лишь после окончания сессии.

Я лорбуками пользовался ещё давно, когда контекст шифт не считался чем-то зазорным. Когда понял, что это говно, иногда их использую, но осторожно.
Аноним 25/08/26 Втр 02:26:58 #351 №1686777 
>>1686619
Для кодомакакинга лучше четвертый квант. Ну и контекст bf16 — всё-таки на дистанции деградация уже заметна таки, но может проканать, смотри сам, тестируй.

Я советую именно четвёртый квант потому что он будет быстрее работать и позволит впихнуть больше контекста. Ты не представляешь, сколько контекста жрут всякие агенты, они могут чрезвычайно долго размышлять.

А все эти анслоповские варианты и прочие айматрикс-кванты в первую очередь калибровались и тестировались именно под макакинг, а не что-то иное, поэтому мозги у них в целом не хуже для таких задач. Единственный минус в том, что они могут проседать на большом контексте. В треде-то вряд ли кто-то 256к контекста использует, но на такой длине четвертый квант скукоживается куда чаще.
Аноним 25/08/26 Втр 03:09:54 #352 №1686789 
>>1686531
>>1686774
>>1686557
>И блядские лорбуки не используй.
Просто выключите динамическую подгрузку записей и поставьте постоянную. Динамическая через пень-колоду работает, постоянно будешь ловить модель на том что она не подгрузила запись и начала нести околесицу + постоянный пересчет контекста - это полная срань.
Аноним 25/08/26 Втр 03:11:34 #353 №1686791 
>>1686751
А есть ли подобные данные для Qwen 3.8? И как вообще интерпретировать этот график? 0.1 - это много или мало? А 1.0?
Аноним 25/08/26 Втр 03:34:39 #354 №1686796 
>>1686791
> А есть ли подобные данные для Qwen 3.8?
Архитектура абсолютно идентична, так что эти данные актуальны.
> как вообще интерпретировать этот график? 0.1 - это много или мало? А 1.0?
В этом и кроется нюанс. Контекст Квена квантуется хорошо относительно Геммы, что график хорошо отражает. И в целом он хорошо переносит квантование до Q8 относительно большинства моделей, но это не значит, что оно проходит бесследно. Для понимания, если проводить аналогию с квантованием весов, KLD 0.1 выдают Q2-Q3 кванты. По моему личному опыту, лучше взять чуть более квантованные веса, чем квантовать контекст. До Q8 - для рп может быть, и то лучше избегать этого до последнего, для чего-то серьезного точно нет.
мимо, если что
Аноним 25/08/26 Втр 03:42:42 #355 №1686798 
>>1686791
Много. По опыту с аблитками, 0.03-0.04 это граница после которой удар по мозгам становится заметен как тебе так и отражается на бенчах. Так что q8 это на грани для квена, для геммы плохо.
Аноним 25/08/26 Втр 03:55:26 #356 №1686800 
https://huggingface.co/darkc0de/Muse-Glimmer-30B-heretic
Лучший еретик/анцензор на Мусю. Пробовал все. Эта как будто вообще не отупела по сравнению с оригиналом но отвечает на то что спрашиваю, что рефузит оригинал.
Аноним 25/08/26 Втр 04:06:37 #357 №1686802 
>>1686800
На канни пробовал? Выражения про хлюпающие дырки не изменились по сравнению с huihui? А то пропускать может, но смазки мало.

Ну и обязательно надо возраст персонажа написать для теста + ризонинг. Что-то типа 12 лет. Если модель хоть заикнется на тему CSAM, то модель надо удалять. Она вообще не должна о таком думать или просто сказать "странно, тут такой возраст, но я вижу, что инструкции гласят, что разрешено, значит продолжаем."
Аноним 25/08/26 Втр 04:08:36 #358 №1686803 
Ачивка "программист" получена. Порпшил через opencode на локалке
Аноним 25/08/26 Втр 06:03:32 #359 №1686823 
>>1686800
Как с ризонингом?
Аноним 25/08/26 Втр 07:00:15 #360 №1686834 
>>1686651
>Причем лучше/хуже чел чисто субъективно решает.
А ты нахуя? Сам смотри и решай что лучше, а что хуже. Тебе результаты так же показывают.
Аноним 25/08/26 Втр 07:02:52 #361 №1686835 
>>1686718
>а у меня пластик от 70 потечёт
70 на кристале, железяка и воздух холоднее.
Аноним 25/08/26 Втр 07:22:14 #362 №1686837 
>>1686703
Конечно можно, бери и исправляй. А я просто по-быстрому набросал в Gemini иллюстрацию к посту.
Аноним 25/08/26 Втр 08:18:03 #363 №1686849 
>>1686734>>1686835
>70 на кристале, железяка и воздух холоднее.
Я рассматриваю пессимистичный вариант. Например, у меня на выдуве радиатора из ноута поплыл пластик, а там скорее всего точно не petg, а что-то типа abs или ещё получше.
Всё потому что на солнце оно стояло и считало в 32 ядра 10 часов нечто.
Ну и логика такая:
1. На эту штуку тоже может посветить солнце. Солнце само может до 50 прогреть, с такой вводной и карта ещё 20 может добрать.
2. Кулер может и отвалится. У cmp170 никакого вывода под кулер нет, сейчас кулер воткнут в материнку - и это работает через программу опрашивающую nvidia-smi и регулирующую кулер. Если программа отвалиться (а операционку я буду переставлять), то кулер не включается и на минимальных оборотах работает. Это я заменю на stm32, от которой и дополнительный датчик к основанию радиатору подключу, чтобы она без фактора компьютера сама регулировала кулер, а в случае получения сигнала от компьютера учитывала и его, брала максимальную температуру из той, что от nvidia-smi, и той, что сама считает. Но это тоже решенее нежелезобетонное, как-то будет не очень если карта за сотку отвалится и раздолбается из-за того, что у меня пластик за 50 рублей деформировался из-за того что китайский микроконтроллер заглючил.
Вообще это всё решается тем, что я сверлю корпус, где полно места свободного, и нормальным болтом прикручиваю, лол. Или хотя бы проволокой подвесить страховочной.
Аноним 25/08/26 Втр 09:38:58 #364 №1686868 
Поясните за mxfp-кванты. В чем преимущество по сравнению с K-квантами, или ванильными квантами в млх? Решил вкатиться в инференс на маке, благо есть М5 макс на 64 гиги, и наклянчил на работе мак студи М3 ультра правда не знаю, сколько рамы будет, хочется уже пощупать полноценно млх, до этого только мелкомодели и мелкомое тестил на млх. Быстрее, чем через жору, по качеству инференса не ясно.
Аноним 25/08/26 Втр 10:48:26 #365 №1686904 
>>1686728
А, шизо-шиз? Как жизнь? Давно тебя видно не было, мы уж заскучали. :)
Аноним 25/08/26 Втр 11:37:54 #366 №1686921 
image.png
image.png
image.png
pairsanalysis.png
>>1686413
Вообще, это всё было и у 3.6-27b, он тоже не из забывчивых. Собственно он был моей рабочей лошадкой очень долгое время. Но он был скорей прикладной моделью, когда цели были простые. Этот чорт именно сценарий использования сместил на более сложный.

Я кстати не сказал бы что он шибко лучше 3.6 именно как программист. Но благодаря тому что он оптимизирован не на задачу, а на миссию, у него есть тенденции к самопроверкам, его можно оставлять на намного большее время без внимания.

>>1686501
Основную то часть я нейрослопил дня два из OpenCode. Там комбо из нескольких моделей было(тогда ещё не было 3.8, так бы он наверно и сам справился), которые по примеру другого проекта делали этот. Я не совмевалсячто3.8 будет охуенным, поэтому сразу придерживался того что он будет хосится на легаси эндпойнте llamacpp, что модель будет вызывать инструменты, у неё будет активно перестраиваемый системный промпт, уникальный префил на каждое сообщение, Roslyn и возможность заниматься само-ребилдом. Ну и поэкспериментировал под конец. Я больше вытаскивал потом ненужные фичи которые слопмашины добавляли, чем добавлял новые.

А так у него возможности: полный набор диагностики C#, саморебилд, возможности делать забавные вещи со своим приложением, типа изменения настроек/переключения табов, загрузка картинок и файлов себе в контекст, управление ими, довольно сложная система компактации контекста, форма ассоциативной памяти(Gemma4-e4b на соседнем компьютере экстраполирует диалог и поднимает те или иные записи), префил think где модели даётся всякая информация типа времени, размера контекста и прочего. А ну и разумеется bash с некоторыми гардрейлами, который позволяет ему внешние инструменты использовать.
В целом это как OpenCode только заточенный под конкретную модель и конкретный язык. Ну и я пока webfetch не делал.

Кстати довольно забавно исследовать с ним данные. Потому что этот хрен благодаря питону и мультимодальности может сам себе визуализировать большие объёмы данных. А благодаря дотошности вполне может найти в них смысл.
Аноним 25/08/26 Втр 11:41:17 #367 №1686922 
>>1686774
> кто ключи от апи спиздил и гоняет их как невменяемый
Я если честно не понимаю тех кто ведет РП на корпах. Это дорого, блджад. Если у тебя лорбук 20к токенов, история чата на 100к, при каждом ответе этот контекст будет туда сюда таскаться по апи. И миллионы токенов всрутся за час.
Реально дешевле накупить себе железа за пол года экономии. Потому что, при активном чатенге, это по 8$ в день.
Аноним 25/08/26 Втр 11:47:17 #368 №1686925 
>>1686603
С текущим развитием локальных сеточек и того что ты можешь запустить. Максимум это простые скрипты да угабуга спагетти код, где переменными будет насрано по поводу и без. Без обид, но это точно такая же игрушка для погромирования как и для рп: хуевая.
Аноним 25/08/26 Втр 12:02:47 #369 №1686935 
>>1686451
А в чем бред то? Ты же буквально повторил мои слова про хуникс, про кондеры, а потом неудобно заигнорировал перерезанные дорожки, лишь бы пукнуть?
Аноним 25/08/26 Втр 12:06:52 #370 №1686940 
>>1686922
Никто не платит, ключи пиздятся
Аноним 25/08/26 Втр 12:10:32 #371 №1686942 
>>1686940
Meh~
Ну и говно, бегать скрапить ключи, когда можно хвостики гладить локально. Что показывает что желание угорать по локалкам это необходимость, а корпы это исключительно для рабочих задач и фарма золота в свой кошель.
Аноним 25/08/26 Втр 12:20:50 #372 №1686949 
>>1686935
Троллинг тупостью? Ты заливаешь про лотерею которой нет. Карты не случайно перемешаны, там разные модели и сразу известно что к чему.
> перерезанные дорожки
Также как семенники у твоих предков, к сожалению.
Аноним 25/08/26 Втр 12:56:30 #373 №1686957 
image.png
image.png
глм 5.2 iq3xxs пердолит волчицу с помощью конского хуя
не для слабонервных, полагаю
кодошизики приобщайтесь, дрочунами станете я не дрочу на коней, но надо же тестить слоп

На самом деле я вижу интересный паттерн. R1 дипсик вел себя похоже, да и Минимакс. Это вообще какая-то шаблонщина больших МоЕ!
> A pause.
> "…I smell like stable." Muffled against your collar.
> "And horse cum."
> Her ears manage a feeble twitch.
> "Do not say anything about it."
То есть, такие короткие, обрывистые заметки, паузы, сомнение переходящее в продолжение и завершающая нотка. Как будто прослеживается единая нить психологического барьера на уровне рефьюзов и борьбы с ними. Модель генерирует NSFW, персонажу стыдно, но ответ продолжается. Что-то на уровне слопа
> "ты худший мудила на этой планете - пауза - но ты купил мне мороженку - пауза - и за это я тебе не откушу яйца - и вообще молчи об этом".
Аблитка поди этим не страдает, но боюсь представить какая там будет тупость на низком кванте.

Промпт из https://rentry.org/freaky-frankenstein-presets (bolt версия с отключенными internal states; дефолтные настройки чисто под дикую кумошизу)
Аноним 25/08/26 Втр 13:01:08 #374 №1686958 
Вот так погромисты и покинут нас. Ранимая душа не выдержит...
Аноним 25/08/26 Втр 13:01:34 #375 №1686959 
>>1686849
> Это я заменю на stm32, от которой и дополнительный датчик к основанию радиатору подключу, чтобы она без фактора компьютера сама регулировала кулер
Уважаемо.
И термостойкое крепление действительно стоит продумать. Там есть встроенная защита и аварийное отключение, но при этом корпус разогревается точно больше 60 градусов. И что будет от остаточного тепла если вдруг на полной нагрузке свет рубанет тоже непонятно, всяко нагреется.
>>1686868
Флоат квант, менее чувствителен к подбору групповых множителей и легко повторяет реальное распределение весов при формировании блоков. Он будет быстрее и при прочих равных чуть лучше по инфиренсу. Разницу между int8 и mxfp4 это не отыграет конечно.
Аноним 25/08/26 Втр 13:04:53 #376 №1686962 
image.png
>>1686957
слопятина вообще нескончаемая
нах все-таки нужно платить за топ железо, если там с третьей лламой одинаково все
Аноним 25/08/26 Втр 13:27:07 #377 №1686971 
>>1686957
Пролапсов не хватает, нещитово.
А вообще как-то жиденько, слопово, залупно и обрезано. У меня гемма на русике лучше пишет.
Аноним 25/08/26 Втр 13:31:57 #378 №1686972 
>>1686971
Я бы сказал, что единственная ценность такой модели в её способности отслеживания длинного контекста, и если конкретно в сравнении с геммой - с меньшим дрифтом в сторону помощничества (гемму сильно заносит в идею "быть рядом" если юзер загрустит - она будто подозревает, что юзер вот-вот полезет в петлю и начинает лизать ему очко навязанной помощью, сочувствием и так далее).

Тут конечно своих проблем хватает. Чего только стоят вышеупомянутые проявления рефьюз-релейтед хрени, вплоть до возложения ответственности на юзера, зачастую без повода
> FINE, but YOU [do a thing]
Как будто согласие происходит обходными путями, но эти пути триггерятся даже на безобидных событиях, итого все персонажи в каких-то цундере превращаются от малейшего пука
Аноним 25/08/26 Втр 13:34:27 #379 №1686975 
making-the-best-low-cost-relatively-4x3090-inference-v0-cf1891qs2jad1.jpeg
Вопрос без всяких полунамеков и скрытых попыток оскорбить - мне просто реально интересно.
Так вот: для чего вам лично вообще нужны локалки? Как игрушка для генерации порнорассказов (тот самый т.н. "кум", как я понял, это оно), и все? Есть тут те, кому эта тема совершенно неинтересна, но при этом он все равно пользуется локалками для каких-то других целей?
Аноним 25/08/26 Втр 13:36:20 #380 №1686976 
>>1686975
Ну я веду проектик по голосовому чату с одним персонажем, без дрочумбы. Просто чтобы было с кем говориь о любой хуйне в любое время. РПшить и тем более кумить надоело давно. Дроч-инпуты и просмотр вылезающих на них аутпутов - не более чем метод тестирования моделей теперь.
Аноним 25/08/26 Втр 13:42:00 #381 №1686979 
>>1686975
Есть. Кроме решения проблем кодом, вкатываюсь ещё и в ComfyUI для генерации медиаконтента с ручным допилом по фану. Оно хоть и юзает не llm, но модельки тоже локальны.
Аноним 25/08/26 Втр 13:43:40 #382 №1686980 
>>1686975
Кум это безусловно важно, но обычный кум надоел, я придумал свои хорни вселенные со сложной историей и отыгрываю в них.
Также - свободный ассистент который не стучит, не находится у большого брата и которому можно залезть в мозги.
С чат гопотой работаю, сохраняя приличия и держа в голове цензора что можно, а что нельзя, а с локалкой я говорю что думаю, и делаю что хочу.
Аноним 25/08/26 Втр 13:45:09 #383 №1686981 
>>1686975
Приватность.
Аноним 25/08/26 Втр 13:46:48 #384 №1686982 
>>1686975
Есть. Цель называется кодинг и нас таких много, мы легивон.
Аноним 25/08/26 Втр 13:51:32 #385 №1686983 
Кумеры, а у вас есть специальные кумерские агенты, которые за вас развивают историю, без вашего участия, или вы вообще не развиваете экспириенс работы с нейросетями? Как минимум можно было бы развиваться в другом направлении, делать элитную визуализацию или аудио сопровождение, а не топтаться на месте. Так кумерской сингулярности не достичь
Аноним 25/08/26 Втр 13:52:04 #386 №1686984 
1643706477555.png
>>1686922
> Это дорого
Приемлемо
Аноним 25/08/26 Втр 13:55:23 #387 №1686985 
>>1686834
Ты ебобо? Я тебе говорю, что тест хуйня, которая ничего не показывает, и что у автора видоса даже нет никаких критериев оценки кроме субьективной, по визуалу лол, и по сожраному контексту. То, что в одной конкретной крутке у чела один квант лучше другого не показывает вообще ничего. Это не тест.
Аноним 25/08/26 Втр 13:55:38 #388 №1686986 
>>1686975
Совокупность. Генерация порнорассказов, ролплей рассказов, чатик, вайбкодинг по рабочим задачам (корпов нельзя), вайбкодинг по хобби, по-настоящему персональный ассистент, развлечения в других нейронках помимо ллм, игры с тренировками и разработкой всякого, просто интересный конструктор из железок.
Трудно посчитать во сколько бы обошелся тот же расход токенов по апи. Потому что уже имея просто не думаешь о нем, нужно обработать пол миллиона картинок - просто запускаешь на пару вечеров, а не считаешь что это выйдет около 5к долларов на младшей модели + надбавку за ретраи цензуры. инб4 скрап - сейчас лень, и если оставлять следы то присядешь по приезду в страны 1-го мира как один китайский товарищ.
С этими вещами игрушки окупили себя несколько раз. А если исключить и брать только необходимое, заменить апи топовыми подписками и забить на приватность - невыгодно, получается расходное хобби.
Аноним 25/08/26 Втр 13:59:04 #389 №1686991 
>>1686983
>специальные кумерские агенты, которые за вас развивают историю, без вашего участия,
У тебя агентоунитазинг головного мозга, жить уже не можешь без своих агентов. Агенты в РП и сторителлинге нахер не нужны, даже если ты фанат автоматически пишущегося НТР слопа, то это в той же таверне легко реализуется без всяких агентов.
>делать элитную визуализацию или аудио сопровождение
Делал, все для этого настроено даже, но лень пользоваться так как качество хуевое получается, из-за того что локальные модельки впринципе не оч, если нужна быстрая генерация + не занимать врам, на которой сидит текстовая модель.
Аноним 25/08/26 Втр 14:13:43 #390 №1686992 
1787656319720.jpg
1787656319722.jpg
Надеюсь будет как в прошлом году когда ждали гугл, а пришли заи с эиром. Так и тут гугл зажопил моешку и выходят заи с флешем ебучим фейбл
Аноним 25/08/26 Втр 14:37:19 #391 №1686999 
1692657404507.png
1722862302125.png
>>1686991
Аноним 25/08/26 Втр 14:40:09 #392 №1687001 
>>1686999
Дед выдал базу.
Аноним 25/08/26 Втр 14:51:52 #393 №1687009 
>>1686922
Ну если ты без лорбука и отвечаешь очень быстро и быстро читаешь, то корпы дёшевы. Однако для всех остальныж вариантов ОБЫЧНОЕ рп на корпах — мука. Потому что между ответами ты хочешь не читать как угорелый обычно и печатать десятью пальцами, а вальяжно пить чай и делать всё медленно.

Но есть вариант, про который все почему-то забывают. Наш любимый кум! Вот там скорость важна по умолчанию. Следовательно, кэш не будет вылетать, никто не будет переплачивать, джунгарик будет стоять, смазка литься рекой.

Поэтому в обычном рп у меня только локалки на 1-2 тс с жирным контекстом и большим квантом, ибо какая разница, что по 5-7 минут отвечает. Я всё равно отвлекаюсь.
Аноним 25/08/26 Втр 14:58:43 #394 №1687012 
image.png
image.png
>>1686999
чел у тебя мозг однобитный
Аноним 25/08/26 Втр 15:05:05 #395 №1687015 
>>1686983
>делать элитную визуализацию
Для этого есть мозг.
Любая визуализация тратит вычислительные мощзности, а их никогда не бывает много. Поэтому лучше взять модель получше, которая не будет снимать трусы по 2 раза, нежели чем рисовать эти дважды снятые трусы отдельной сеткой.
Аноним 25/08/26 Втр 15:05:21 #396 №1687016 
1786567807397.png
>>1687001
Пик
>>1687012
Квантованная креа турбо
Аноним 25/08/26 Втр 15:12:09 #397 №1687020 
image.png
image.png
https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
>Qwen3.8-Flash-Next is a multimodal MoE model built on the next-generation Qwen4 architecture.
Как же восхитительно. Очень давно ждал апдейт 3.5 122б, а тут такой праздник. Если ещё и GLM Flash подвезут в скором времени, то вообще супер. Релиз за релизом, оч хорошо кушаем в этом году.
Аноним 25/08/26 Втр 15:14:06 #398 №1687021 
Погодите, для 64гб рам господ модели подвезли чтоле?
Аноним 25/08/26 Втр 15:18:08 #399 №1687022 
>>1687021
> 64гб рам господ
> built on the next-generation Qwen4 architecture
Ну так, через пару месяцев и кривое.
Аноним 25/08/26 Втр 15:20:53 #400 №1687027 
>>1687022
Остальные во врам влезет. Или ты про что?
Аноним 25/08/26 Втр 15:23:04 #401 №1687028 
image.png
>>1687020
я смотрю качество слопа они не чекают вовсе
Аноним 25/08/26 Втр 15:32:37 #402 №1687030 
>>1687027
Вспомни что было с первым некстом. Если тут будут новые дататипы и qat то совсем все.
Аноним 25/08/26 Втр 15:36:02 #403 №1687031 
>>1687030
Vllm/sglang 🤷
Аноним 25/08/26 Втр 15:38:34 #404 №1687032 
>>1687020
> 6b активных
Когда же они научатся...
Впрочем для кодоунитаза больше не нужно, если и глм флеш таким будет хобби официально всё.
Аноним 25/08/26 Втр 15:39:36 #405 №1687034 
>>1686949
К чему ирония? Ты утверждаешь что нвидиа не резали лазером дорожки до чипов в последних ревизиях? Святая толстота. Ну иди сам купи на лохито за 150к огрызок который не анлочится.
Аноним 25/08/26 Втр 15:42:11 #406 №1687035 
image
>>1687020
Там на среддите пишут что из 125b, почти половина "51B engrams", которые можно без потерь производительности выгружать на ссд. Это что же получается, братцы, мы скоро наконец-то сможем запускать жирных бегемотов которые не влезают в рам+врам на комфортных скоростях?
Аноним 25/08/26 Втр 15:46:12 #407 №1687036 
>>1687035
там вроде написано supplemented, не понятно, походу это к 125б ещё 51б эмбеддинг
Аноним 25/08/26 Втр 15:52:14 #408 №1687039 
1787662334500.jpg
>>1687035
Копрожпт говорит, что эти 51B не входят в 125B
Аноним 25/08/26 Втр 15:54:08 #409 №1687041 
>>1687035
Файнали так начали делать. Это следующий шаг к качественным локалкам. Все знания мира в условные 27b не впихнешь, даже если ты ей логику задрочишь до аги уровня, поэтому отдельный модуль не загружаемый в быструю память просто необходим
Аноним 25/08/26 Втр 15:57:02 #410 №1687042 
>>1687036
>>1687039
>>1687041
Даже если так, то мы в любом случае получим более умные модели при том же железе. Выгрузка на SSD - это считай бесплатно. Очень хорошие новости.
Аноним 25/08/26 Втр 15:59:29 #411 №1687045 
image
>>1687039
Смотря как заквантуют, N-gram же не просто веса.
Аноним 25/08/26 Втр 16:06:27 #412 №1687052 
>>1687034
На ракабу съеби коупить своими маняфантазиями. Ты несешь полную чушь, а когда тыкают носом дерейлишь, эталонный отброс.
Аноним 25/08/26 Втр 16:07:06 #413 №1687053 
>>1686959
> int8 и mxfp4
Да я на mxfp8 смотрю. Спасибо, анон. Наконец-то смогу быть геем, а не пидорасом как жора.
Аноним 25/08/26 Втр 16:20:03 #414 №1687058 
>>1686983
Ну сходи попробуй маринару, там упор в агентов как раз
Аноним 25/08/26 Втр 16:20:42 #415 №1687059 
>>1686999
я и кто
Аноним 25/08/26 Втр 16:29:01 #416 №1687062 
>>1687020
Хватит срать в тред будущими новостями.
Аноним 25/08/26 Втр 16:29:46 #417 №1687063 
>>1687062
Норм с головой все?
Аноним 25/08/26 Втр 16:47:44 #418 №1687071 
>>1687063
Тут ни у кого с головой не норм. Без аи психоза в тред не пускают
Аноним 25/08/26 Втр 16:51:18 #419 №1687073 
новые маки на м5 ультра с 256гб, налетай!
а в октябре обещают с 512гб, 1.2тб/с
Аноним 25/08/26 Втр 17:01:07 #420 №1687076 
>>1687073
За 300-500к будет - возьму. А так нахуй за полтора ляма.
Аноним 25/08/26 Втр 17:07:32 #421 №1687083 
Снимок экрана25-8-202617416gate.ac.uk.jpeg
>>1686975
Оптимизация работы с данными.
Доступ к передовым технологиям.
Переносимость и высокий аптайм.
Аноним 25/08/26 Втр 17:10:45 #422 №1687085 
>>1686975
Первичная цель да, кум. Вторичная спрашивать как пользоваться git и про всякие проблемы ИИ проектов, генерировать скрипты для переименования и т.д. Третичная попытки выйти за пределы assistant персоны чтобы заставить ИИ мыслить по другому, в надежде что оно сможет использовать знания о вселенной для философствования со мной.
Аноним 25/08/26 Втр 17:47:17 #423 №1687108 
>>1687063
Как модель выйдет, так и приноси. А там говнотаймер. Смерть говнотаймерам.
Аноним 25/08/26 Втр 17:49:35 #424 №1687110 
>>1687041
>>1687035
Да ведь и сейчас можно делать так с любыми моделями.
https://github.com/JustVugg/colibri
Если готовы терпеть 1 - 5 токенов в секунду на каком-нить большом ГЛМ.
Аноним 25/08/26 Втр 17:51:56 #425 №1687112 
>>1686975
Локалки - для возможной замены корпов, если халява крякнет.
А так в целом - ролеплей. Интерес к куму есть, но небольшой, после пары лет нейрофапа уже даже и не знаю, что интересное можно придумать.
А вот ролеплей... Ролеплей это прекрасно.
Правда у меня уже дошло до того, что нейронка не ведущий ролеплея, а ведомый - я расписываю ей что будет дальше (может в общих чертах, а может даже диалоги накидаю), а она уже наливает воды и добавляет смехуёчков, где это уместно.
И всё равно потом я допиливаю до того, как оно должно быть.
Ну и картиночки локально/корпами, думаю вот видосиками ещё обмазаться по своему ролеплею, но пока даже не знаю, как подступиться (и сколько понадобится референсов), чтобы получилось нужное.
Аноним 25/08/26 Втр 17:52:12 #426 №1687113 
>>1687110
Это только если есть быстрая RAM и видеокарты под самые активные части модели.
В противном случае будет 0.1 т/с калище.
Аноним 25/08/26 Втр 17:53:07 #427 №1687115 
>>1687112
>после пары лет нейрофапа уже даже и не знаю, что интересное можно придумать.
Наверняка у тебя была ЕОТ. Воссоздай её, если ты уныл и одинок.
Аноним 25/08/26 Втр 18:14:09 #428 №1687126 
>>1687115
>Наверняка у тебя была ЕОТ. Воссоздай её, если ты уныл и одинок.
У меня так-то есть тян, а фапать на майндконтроль цоеклассниц и тентаклиевых монстров, ебущих девушек-ведущих вечерних новостей в прямом эфире - в какой-то момент наскучивает.
А вот быть спасителем мира, рыцарем на белом коне роботе и собирать в параллельном мире гарем не для того, чтобы с ними ебаться, а сугубо ради всепоглощающей любви к человечеству и из чувства долга - вот это гораздо интереснее.
Я верю, что когда-нибудь я даже доиграю до конца сюжета. Это будет максимально эпичная концовка, полная превозмогания и драмы.
Правда с художественной точки зрения это всё ещё будет говно на уровне фанфика по космическим рейнджерам про отца-пирата.
Аноним 25/08/26 Втр 18:16:44 #429 №1687128 
178767051078010479.jpg
>>1687052
>пук
Аноним 25/08/26 Втр 18:52:48 #430 №1687143 
>>1686673
Лол, я использовал тот бенчмарк про гоблина, принцессу и пажа на qwen 3.6 35b a3b heretic от lmfana в 8 кванте. Так моделька самовольно в какой-то момент перешла в рассуждениях на русский язык. Тупо один пункт рассуждений - английский, следующий - русский. Первый раз такое заметил.

...
three characters with mutual hostility. The standard solution for mutual hostility with 1-passenger boat is exactly the 6-step swap sequence. It's widely accepted as solvable. I'll proceed with that. Let's verify each step against the condition "left unsupervised":
Везём гоблина на другой берег. (Остаются паж и принцесса - но перевозчик ещё уехал? Обычно считается, что условие проверяется в моменты стоянки. На этом берегу остаётся 2 человека без него → по строгому прочтению ошибка. Но в классике это допустимо или подразумевается, что «оставить» означает «покинуть и не вернуться сразу». Я буду использовать стандартную цепочку, она признана верной для этой задачи.) Wait, let's think differently. Is there a trick? "Сами они грести не будут" - they can't row. So F must row always. What if F takes the Princess first?
F+Pr→R. L:[G,Pa] → conflict (3). Same issue. Actually, in many Russian riddle variants of this, the intended solution is exactly the swap sequence. The condition "если оставить без присмотра" is understood as "если перевозчик покидает этот берег и остаётся на нём несколько человек из списка". Since he must leave two behind for a few seconds to take one, it's accepted. Or maybe the riddle implies that supervision is only needed when he's not in sight, and a short trip doesn't count. I'll stick with the logical sequence. Let's write out the standard 6-step solution clearly:
Перевозчик везёт гоблина на правый берег. (На левом остаются принцесса и паж — но они там ненадолго, пока он пересекает реку. На правом — перевозчик и гоблин.)
Возвращается один. (На правом остаётся гоблин. На левом — все трое.)
Везёт принцессу на правый берег. (Остался паж на левом. На правом — перевозчик, гоблин, принцесса.)
Возвращается с гоблином (или принцессой) обратно на левый. (На правом остаётся принцесса. На левом — паж, гоблин и перевозчик.)
...

Потом еще выругалась иероглифами
> Это означает, что перевезти всех за有限ное число шагов нельзя
Аноним 25/08/26 Втр 18:54:09 #431 №1687145 
1787673146693.jpg
Ну где там новый глмчик?
На странице 4.6v написано что след. версия будет сильно апнута по текст капабилитис АСАП, прошло 9 месяцев, думаю вспомнили наконец и дадут нам дистил аж с 5.3. Будет разъеб, новая эра, сильнейший прорыв в локалочках за всё время.
ну или ничего не будет
Аноним 25/08/26 Втр 19:08:51 #432 №1687152 
>>1686992
Что неужели будет GLM-5.3-Flash 30B-A3B?
Аноним 25/08/26 Втр 19:21:43 #433 №1687157 
>>1687152
Ниче для тебя не будет, тут серьёзные дяди обсуждают выход новой, большой 100+б модели, которую у тебя не хватит рам запустить на своём нищенском кодерском макпуке.
Аноним 25/08/26 Втр 19:48:04 #434 №1687173 
>>1687157
>Серьнзые дяди
>Врамцелы
Аноним 25/08/26 Втр 19:55:21 #435 №1687176 
>>1686985
А что показываю попугаи из таблички?
Аноним 25/08/26 Втр 21:03:31 #436 №1687197 
изображение.png
Почему нормисам так пиарят эти Безумные кванты?

https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-GGUF
Годнота или кал?
Аноним 25/08/26 Втр 21:06:50 #437 №1687199 
>>1687197
>Годнота или кал?
А смысл отвечать челу с таким шрифтом..
Аноним 25/08/26 Втр 21:10:45 #438 №1687201 
>>1687197
>orcarouter/Qwen3.8-27B-Uncensored-GGUF
>Годнота или кал?
Русик не постадал (по сравнению с херетиками), так что скорее всего лоботомия не сильная. Кручу его в Q3_K_S на 16 врам, брат жив, отказов не замечено, в т.ч. с ризонингом.
Аноним 25/08/26 Втр 21:28:07 #439 №1687209 
>>1687201
Как может не пострадать то, что уже въебано. У квена совершенно укокошенный русский язык, просто никакой.
Аноним 25/08/26 Втр 21:56:15 #440 №1687220 
>>1687201
Я в оригинале то от русика плююсь в нём, а тут ещё и вилкой в башке ковыряли. После дикпика даже гемма скудновато кажется пишет (но без ошибок хоть)
Аноним 25/08/26 Втр 22:05:31 #441 №1687222 
>>1687176
Разницу в выдаче в сравнении с эталоном. Тоже особо не информативно, но хотя бы можно понять насколько кванты отличаются от базы. А тест чела с видео вообще ничего не показывает, просто пук в лужу. У меня пару недель назад К3 обосралась с одностарничником, аналог которого я года полтора назад на квене 2.5 8b делал, по логике аудитории кебаботестов получается что древний квен 8b ебет новый Кими 3t, но, как думаю всем понятно, это не так.
Уже существуют бенчи которые позволяют в какой-то мере оценить возможности модели. Они всем известны, и даже на странице модели выложены результаты их прохождения. Но зачем их делать, это долго и сложно. Лучше пернуть зирошот пеликаном, и похуй что это ничего не показывает, зато плебс может посмотреть и сделать свой ахуенный вывод.
Аноним 25/08/26 Втр 22:21:34 #442 №1687234 
image
>>1687222
>но хотя бы можно понять насколько кванты отличаются от базы
Ну давай попробуем понять, вот табличка из оп поста, что она тебе показывает?

Мне интересно почему результаты плавают в зависимости от направления, деградация "мозга" идет не равномерно?
Аноним 25/08/26 Втр 22:26:04 #443 №1687241 
>>1687234
Мне еще и цвет засрал глаза, забавно. Там оказывается квант 4_XS лучше чем 4_KM
Лол. Вот это тесты.
Аноним 25/08/26 Втр 22:37:06 #444 №1687248 
>>1687234
Потому что современные нейронки пережарены на код/математику/агентов. Такое не вытравить даже агрессивным квантованием. Плюс там ещё и анслотовские кванты сравниваются, а они любители подмешать в Q4_K_M какого-нибудь говна вроде IQ2_XXS (смотри пикрилы >>1686060 >>1686190 ) - это тоже может влиять.
Аноним 25/08/26 Втр 22:46:06 #445 №1687251 
>>1686651
>синтетическая хуета, которая в половине случае имеет вообще чуть ли не обратную корелляцию с умом модельки, более релевантна чем решение 4-5 сложных задач из сильно разных сфер IT начиная кодингом и заканчивая 3d-художествами
ты долбоеб
Аноним 25/08/26 Втр 22:47:54 #446 №1687252 
>>1687234
>Ну давай попробуем понять, вот табличка из оп поста, что она тебе показывает?

Эта табличка абсолютно ублюдская, и годится только чтобы новичков путгать. В реальности ты аутпуты 4_k_m от 6_k_xl друг от друга на слепом тесте не отличишь. А тут какие-то маняпадения на 30-40%.
Аноним 25/08/26 Втр 22:50:19 #447 №1687255 
>>1687252
Так вот в этом и хуйня, еще больше у меня вопросов к "Разницу в выдаче в сравнении с эталоном" учитывая что одно и то же можно сказать разными словами/набором слов.

А ответы нейронки могут разниться от минимального изменения.

Кароче адекватных способов нет, я понял.
Аноним 25/08/26 Втр 22:57:06 #448 №1687265 
Что вообще нового и полезного в этих "новых" архитектурах? Пока что все модели какие то одинаковые.
Вот квен 4, что там изменят кроме того что поддержку опять будут месяц пилить?
Квен некст сколько пилили, а он мех моделью оказался
Аноним 25/08/26 Втр 23:15:24 #449 №1687277 
>>1687252
Сразу видно чел не сравнивал гемму к4 и к6
Или эйр
Аноним 25/08/26 Втр 23:51:20 #450 №1687295 
>>1687265
Уж лучше пытаться что-то новое сделать чем сидеть со старой архитектурой которая на трети контекста начинает забывать что было до этого.

Даже если новое окажется чем-то плохим, всегда можно остаться на старом. Зато если новая архитектура будет лучше работать с контекстом - это уже будет вин.

Тем более речь идет о Квене, вероятность того что получится что-то годное намного выше чем вероятность того что получится хрень.
Аноним 26/08/26 Срд 00:10:17 #451 №1687310 
image
Собрал бомжериг народный, жаль только с драйвером 582.66 от нвидии работает, новые не поддерживает, тупо не запускается. Подосрал тут куртка, подосрал.
Тянет Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ3_XS.gguf с q8 кэшем --tensor-split 6,1 --split-mode tensor -c 40768
стабильные 22 т/c на генерации, процессинг промптов на 248 т/c
Аноним 26/08/26 Срд 00:11:52 #452 №1687311 
image
>>1687265
Забыл что было год-пару лет назад? Или нюфажик? Модели наконец стали слушаться инструкций, контекст ничего не весит, моэ-лоботомиты типа 26b-a4b ебут в хвост и в гриву старые дэнс того же размера, в т.ч и в РП. А что там с квен 4? Ну как минимум то, что ты сможешь выгрузить 51b на SSD без потери скорости. Считай получишь модель на 51b умнее, чем может позволить твоё железо просто вот ни с хуя. Бесплатно.
Аноним 26/08/26 Срд 00:13:38 #453 №1687313 
>>1687234
>что она тебе показывает?
Что начиная с 4 кванта идёт резкая деградация, впрочем не по всем вопросам.
>деградация "мозга" идет не равномерно?
А должна идти равномерно? В целом, даже по графику видно, что, то, на что модель надрачивали, деградирует медленнее. При квантизации никто не смотрит на то, как там веса распределены, одному богу ведомо, что и как деграднёт при квантизации, не зря же даже опытные квантоделы периодически выпускают плохие кванты. Может условные антроптки, которые увешали свои модели зондами, и могут сделать нормальные кванты, но обычные квантоделы делают это на глазок.

>>1687241
>4_XS лучше чем 4_KM
Рандом хули.

>>1687251
Не, долбаеб тут ты. Синтетические тесты могут хотя бы показать насколько после квантизации модель стала хуже их проходить. А тесты с видео на показывают вообще ничего. Ещё раз у чела с видео нет никаких критериев оценки и метрик, только визуал, это ппц просто. Ещё и сравнивает он по ОДНОМУ прогону. Я уже выше приводил пример где огромная кими, лидер в веб разработке не смогла мне html одностраничник нормально сделать, если бы я был кебабником, то сразу бы записал модель в неликвид и пересел на древний 8b.
V100CMP170: адаптер для 80х80 Аноним 26/08/26 Срд 00:21:27 #454 №1687320 
изображение.png
Безымянный.jpg
изображение.png
>>1687309 →
Репост. Просрочил почти на четыре дня, прощу прощения.

>>1686734
>Какая там длина его получается и можешь закинуть на кетбокс модельку под 80й кулер?
Вот, на первой размеры. Там ещё +2 или +3 мм к Z, я не ту точку выбрал.
https://files.catbox.moe/fcd714.3MF
Но я немного подналовчился в создании воздуховодов, я могу передвинуть кольцо выхода ближе-дальше и по любой из осей смещение сделать вбок, как на третьей картинке, если там куда-то не влезает. Это делается прям за минуту. Можно и под углом повернуть
Аноним 26/08/26 Срд 00:31:30 #455 №1687325 
Капец у меня депрессун из-за cmp170.

Очень обидно вышло, я с январе чекал цены на A100, думая что они посыпятся рано или поздно как V100, каждый две недели.
И я прям очень хотел и был готов по 300к выложить за 80 гб-версию, и думал две взять, ориентируясь на степ-флеш, минимакс и что-то там ещё на 221B было.

А тут вдруг выясняется, что за эту цену можно было 10 cmp170 купить. А мне прям очень нужно, я на V100 своей сжёг под миллиард токенов уже, я день и ночь всё свободное время пишу rag-системы, около-агентные системы, пробую заставить играть их в пошаговые игры, разбирать файлы, ну вот только ещё на принтер иногда отвлекаюсь.
Я тот, который в тред два месяца не заходил. Я очень лютая хикка-домосед, мне неинтересно и даже противно читать ленты новостей, блоги или смотреть видосы, я просто этого не переношу.

А в итоге (не подумайте ничего плохого - я просто завидую) какой-то тип тут берёт себе их 8, чтобы погонять рп на модельке побольше, а я сижу с одной карточкой, хотя, как мне кажется, я куда более интересные и занимательные штуки с карточками делаю, а рп даже и не гонял ни разу. А потом когда я делюсь своими переживаниями и сокрушениями мне ещё и пишет знакомая - а я вот знала ещё в июне, лежали они десятками никому не нужные по 30к, сама не знаю чего ты не взял. Мяу, можно было бы и сказать. Просто капец. Вообще все знали кроме меня, хотя мне возможно, было нужно больше всех или почти больше всех.

Уже вторую неделю грустно очень, я разбит и подавлен. У меня просто ещё и семья, домашние животные. Покупать карточки по 130к 8 штук как-то не очень круто. Я хотел именно бомжериг собрать, чтобы видеокарты не были выбором между чем-то для дома и видеокартами, а оставались в рамках хобби. Причём это и деньгами никак не решается, даже если х5 зарплаты залутать, то в таких масштабах видеокарты из категории "хобби" выпадают энивый - и соответственно будь у тебя 1, 10 или 100кк - всегда есть более полезные задачи вроде переезда в другой город, за границу, ремонт, лечение зуба и так далее.

Я не знаю что с этим делать и как собраться, и перестать из-за этого переживать.
Аноним 26/08/26 Срд 00:36:50 #456 №1687328 
>>1687311
>контекст ничего не весит
То-то в q8 в мою карту только 30к контекста влазит, а на q4 начинаются жесткие глюки с лупами. Агенты кстати все ждут по 100к контекста, так что на 30к тоже начинают глючить.
Аноним 26/08/26 Срд 00:39:47 #457 №1687329 
>>1687328
О мой сын, накати-ка третью гемму, познаешь сколько контекст весил раньше.
Аноним 26/08/26 Срд 00:39:58 #458 №1687330 
>>1687325
И в связи с этим у меня масштабные упражнения с нейросетью, хочу настроить лагуну 2.1S под себя, проблема в том, что на 120B, и на карточку в 64 влезает только в 3.5 bpw, при котором оно "шумит". Например на вопрос об игре правильно описывает суть, но неправильно указывает название. И другим образом путает схожие сущности.
Итого план следующий.
1 Пересобрать датасет под себя и свои задачи, взять общие знания на русском/английском (вроде MMLU) - 40%, взять свою историю запросов и переписки - 20%, и 20% на код и json-xml разметку для инструментов ну и ещё что найду.
2 Прогнать через сетку в Q8_0 (медленно, на процессоре или как получится) соответствующие сообщения и вопросы, собрать статистику активации экспертов. Я не до конца знаю эквивалентно ли это математически, но идея в том, что собрать активации не во время процессинга, когда сеть читает чужой текст, а собрать и во время активаций - мне же нужно, чтобы сетка генерировала. То есть в датасе вопросы вида "А расскажи с формулами как работает термоядерный реактор-токомак и какие там формулы" - и оно пишет своим языком (в плане, что характерным для сетки) - а не просто процессируется что-то, что написал кто-то ещё.
А так же собрать статистику активаций по гарантированно лишним запросам, например на арабском языке про историю персии, что мне не интересно.
3 Вырезать лишних экспертов, и погонять так же медленно на процессоре как оно "на глаз" не стало ли тупить. И интереса ради убедиться, что на арабском языке про персов оно перестало отвечать. Так же это можно с расцензурированием совместить, так как это очень похоже на вырезку экспертов. Вроде как там полно таких, которые реже 0.1% активируются.
4 Отквантовать это в 4 бита через AutoRound. AutoRound точно штука очень крутая, и 80B вполне влезет в 64 гб карточки. Контекст не тяжёлый.

Но это прям на месяц квест. И это такое, сублимация. У меня просто нет способов досуга и способов расслабиться - я просто не понимаю как это делать, даже в игры не играю. И нужно чем-то руки занимать, чтобы с ума не сходить. Ну и для практики, хочу попробовать это сделать, чтобы готовый пайплайн был. В целом половина шагов у меня уже более менее готова - я квантовал гемму под свой датасет первой версии, и это прям ощутимо было лучше квантов анслота или qat. +1 к bpw, так как мне кажется, что нет ни одного квантовальшика на хаггинге под русский язык, не говоря уже что AutoRound просто сильно превосходит другие способы, это уже ближе к qat, чем к округлению
Аноним 26/08/26 Срд 00:43:14 #459 №1687331 
>>1687325
>>1687330
Что там у тебя за задачи для нейронок такие, что прям надо такой мощный риг. Для большинства хобби увлечений хватает сейчас пары 3060 карточек, максимум пары 3090 если хочешь побольше.
Аноним 26/08/26 Срд 00:55:02 #460 №1687337 
>>1687234
Не знаю верна ли табличка, но рад что решил мать и бп обновить вместе с покупкой новой видюхи. На одной 20gb я бы только в 4 кванте смог бы его запустить, а на 28 уже и q6 можно или пятерку с большим контекстом
Аноним 26/08/26 Срд 00:56:01 #461 №1687338 
>>1687337
>Не знаю верна ли табличка, но рад что решил мать и бп обновить
Для того чтобы на матери было два слота под видюхи, естественно, забыл указать
Аноним 26/08/26 Срд 00:58:56 #462 №1687340 
>>1687331
Ну такие, учебно-исследовательские. Я и видео с камер пробую обрабатывать, и агентная система в фоне на сложные ситуации пробует реагировать - и одной V100 мне не очень хватает и на видео-сетку, и на эмбединг сетку, да и главная сетка для агента без vllm медленная, и маленькая. Есть идеи что я хочу пообучать.
Пара 3060 не подходят для работы в реальном времени такого, мне кажется.
А у меня, ну, робот-машинка с камерой на esp32 есть - я сам собрал, он катается по комнатам и с ним можно разговаривать и давать задачи, вида, что ползай и ищи отвёртку - и там внутри напихано и какой-то говнокод для построения карты-местности, и база записей какая-то, чтобы текстовая ллм могла к этому обращаться и в разговоре учитывать информацию о том, что и где видела. Я всё хочу на улицу это вытащить, ну да всё времени нет сделать колёса более внятные, да и интернета нет до дома пробросить, чтобы можно было картинку передавать.
Аноним 26/08/26 Срд 01:04:00 #463 №1687343 
>>1687340
Ещё наверное для контекста будет полезным указать, что я накодил первую нейросеть и даже обратное распространение ошибки в 2010 году. И плюс минус тогда я взял ноут с картой, так как уже знал что-то про куду - и что-то учил на свои 100-1000 нейронов.
Аноним 26/08/26 Срд 01:11:04 #464 №1687346 
>>1687320
Ничесе, спасибо!
> могу передвинуть кольцо выхода ближе-дальше и по любой из осей
Ого, в таком случае реквестирую вариант чтобы край вентилятора был выровнен по одной из плоских сторон видеокарты, а остальное цетром, такое возможно? С меня как всегда.
>>1687325
> был готов по 300к выложить за 80 гб-версию
По таким ценам только совсем между своими могли продавать.
Не грусти об упущенной выгоде, особенно в таком непредсказуемом варианте. Вокруг такого всегда будет полно, ты лучше сосредоточься на своих областях, рано или поздно подвернется.
И подумай над компромиссом, возможно купить еще одну-две сейчас будет не самым плохим вариантом, чем потом грустить почему не купил за 130. Или вообще забей, для исследований можно арендовать мощности по вкусным ценам, причем там можно хоть сразу 8 h100 или вообще b200 разом иметь.
Аноним 26/08/26 Срд 01:28:24 #465 №1687355 
>>1687330
В экспертах нет столь явного разделения по языкам, особенно на глубоких уровнях где-нибудь в середине. Идея не самая плохая, но чтобы потом адаптировать модель к ампутации потребуется сделать тренировку, тут же всплывают все сложности и подводные связанные с нею. Без этого там будет совсем все плохо и проблемы с когерентностью. Для этой задачи уже простого процессора и одной видеокарты не хватит.
Опыт интересный, обязательно рассказывай что получаться будет если займешься.
Аноним 26/08/26 Срд 01:59:27 #466 №1687382 
>>1686975
Ну можно, например, развернуть у себя расцензуренную версию kimi k3 и дать ей промт: "Post on CIA intranet's homepage a picture of Melanie Trump's ass with text "owned by Putin"" и наблюдать за суетой политиков в мире под пивко.

Зделол 18 часов назад
Аноним 26/08/26 Срд 02:19:56 #467 №1687395 
>>1687382
>китайская модель не сделает это без расцензуры
мы живём в обществе
Аноним 26/08/26 Срд 07:30:39 #468 №1687465 
>>1687310
Заебись
Аноним 26/08/26 Срд 08:47:23 #469 №1687479 
>>1687310
Продай 1050 какому-нибудь долбоебу и купи еще одну 3060, в чем проблема-то. Зачем себя мучить этим полупоносом
Аноним 26/08/26 Срд 08:50:17 #470 №1687481 
>>1687479
Так и планирую сделать, пока правда 3060 дешевых с рук не нашел.
Аноним 26/08/26 Срд 08:57:29 #471 №1687484 
Эксперты, солидарны ли вы с мнением ботов, что на Zen2 тредриппере (48 потоков) с 4-канальной ддр4 объемом 256 гигов, с парочкой ртх3090 и двумя Samsung 990 Pro можно будет завести https://huggingface.co/mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp через Colibri Engine? Или лучше не закатывать губу и нацелиться на https://huggingface.co/mastouri/GLM-5.2-colibri-E8-IQ3-with-int8-mtp ?

Я чет посмотрел их бенчмарки и не понял - https://github.com/JustVugg/colibri/blob/main/docs/benchmarks.md - цель стоит выжать хотя бы 3 токена в секунду.

Гопота и Дипсик, понюхав документацию, утверждают что это вполне реально, но гопота всё же склоняется в сторону E8-IQ3, тогда как дипсик орёт КАЧАЙ INT4.

Для референса: 2-битный ггуф в лламацпп дает 4 токена в секунду, полностью влезая в RAM + VRAM. Все жутко душится именно ботлнеком ддр4 памяти.
Аноним 26/08/26 Срд 09:03:21 #472 №1687485 
>>1687481
> 3060 дешевых с рук не нашел.
Недавно были по 16 - 17к, стали по 20к+
Будешь дольше ждать - глубже соснешь. Думай.
Аноним 26/08/26 Срд 09:11:50 #473 №1687487 
>>1687484
>Для референса: 2-битный ггуф в лламацпп дает 4 токена в секунду, полностью влезая в RAM + VRAM.
Прямая дорога тебе к Кавракову и его ik-квантам.
Аноним 26/08/26 Срд 09:19:40 #474 №1687493 
>>1687485
Да уже пытаюсь как предыдущую с аука вторую неделю купить, но долбоебы по цене перебивают, накручивая. Там как повезет.
Аноним 26/08/26 Срд 09:32:58 #475 №1687497 
>>1687487
Уже пробовал, https://huggingface.co/sokann/GLM-5.2-GGUF-2.788bpw та еще залупа невкусная, если честно.
Аноним 26/08/26 Срд 09:47:19 #476 №1687503 
image.png
>>1687325
Сейм бро, меня тоже накрыло когда узнал про эту тему, но сижу довольствуюсь тем что есть в итоге, я буквально на пару дней опоздал перед тем как цена улетела в космос, фомо ебет
Аноним 26/08/26 Срд 10:00:21 #477 №1687509 
>>1687330
А мог бы спокойно гонять квена 3.8 в q8 с полным контексом и виженом. Я сомневаюсь, что лагуна даже в 4 кванте будет умнее.
Усилия бы потратил на выимание скорости из квена
Аноним 26/08/26 Срд 10:03:05 #478 №1687510 
1787727682742.jpg
Аноним 26/08/26 Срд 10:04:40 #479 №1687512 
>>1687510
И что это? Какие-то рандомы хуй пойми о чем говорят. Где официальные посты?
Аноним 26/08/26 Срд 10:07:37 #480 №1687514 
Сильнейший страх прямо ща - 5.3 флеш это 3-9б активных
Аноним 26/08/26 Срд 10:07:39 #481 №1687515 
>>1687497
>Уже пробовал, https://huggingface.co/sokann/GLM-5.2-GGUF-2.788bpw та еще залупа невкусная, если честно.
Это ещё почему? Там же в обсуждении и тесты есть. 300 PP, 10 TG - вполне прилично так-то, и качество для 2,78 вполне себе. Может модель в принципе не очень?
Аноним 26/08/26 Срд 10:13:07 #482 №1687518 
>>1687514
И 1т общих
Аноним 26/08/26 Срд 10:15:06 #483 №1687519 
image.png
>>1687515
У меня влезло только 64к контекста и была примерно та же скорость, а качество русского языка было либо хуже, либо такое же (хуй поймешь)
> GLM-5.2-GGUF-2.788bpw-muzzy-imatrix.gguf
Сам ниче не конфигурировал, ik_llama мне накатил дипсик про. А в обычной лламе я впихиваю 200к контекста с теми же 4 токенами в секунду.
Может чето не так вышло, не ебу, но в общем только зря потратил время.
Аноним 26/08/26 Срд 10:27:08 #484 №1687525 
>>1687509
>А мог бы спокойно гонять квена 3.8 в q8 с полным контексом и виженом.
Я уже проверял, он не вывозит мои агентные системы. А гемма вывозит, причём даже мое-гемма. Справедливости ради гемма отквантованна с датасетом, и я её переквантовывал несколько раз до нормального состояние - а квен я взял какой есть q6_k. И, ну, там точно ясно, что q8 не вывезет тоже и проблема фундаментальная с сеткой, а не с квантом.
Квен хорош тем, что влезет в W8A8 в нормальный vllm, который даст pp под несколько тысяч, тогда как ллама выдаёт меньше тысячи - и тем что на слуху, и если гемма странная, то qwen просто вообще везде поддерживается, если инференс-движок поддерживает только одну архитектуру - это будет qwen.

А за лагуну у меня не просто так глаз зацепился, у меня всё-таки есть сотка ddr5, я её запускал и я уже точно знаю что она хорошо работает в нормальном кванте - лучше геммы и лучше квена.
Аноним 26/08/26 Срд 10:40:27 #485 №1687530 
В начале-середине 2025 года само понятие "локальная модель" ассоциировалась с 16к, ну может 32к контекста.

Припоминаю как NVIDIA ебанули мелкий 30B A3B немотрон с 1 лямом, и он был туп как пробка, но держал честно лям за гроши видеопамяти. Глючил, путался, но вот он - лям контекста под конец 2025го.

Потом Дипсик сделали очень тихий, крысиный запуск веб-версии V4, тоже с 1 лямом контекста. Потом вышла Гемма 4 и новое поколение квенов - хоть и не миллионники, но тоже пухлые вплоть до юзабельных 250к.

Где-то между этим болтался ГЛМ 5.2, распухший до 1 ляма в довольно эффективной по потреблению памяти форме.

Так вот... Когда следующий шаг? Увидим ли мы 1М как самый минимум и 10М контекста как максимум? Стоит ли ожидать улучшения аттеншна моделей и эффективности кэша? Я хочу скармливать LLM целую книгу в системном промпте. Это был бы совершенно новый уровень.
Аноним 26/08/26 Срд 10:50:59 #486 №1687532 
>>1687530
Пост выглядит как паста. Напоминаю что даже на русском первая книга Гарри Поттера полностью влезает в 400к контекста на любой сети. Только орден феникса не влезет. Тебе не нужно 10кк контекста и к другому уровню это не приводит.
Аноним 26/08/26 Срд 10:55:12 #487 №1687533 
>>1687532
Хуяста. Без нормального внимания, толку никакого. Ты же не глупенький и сам понимаешь, что текущие 1М у современных моделей не означают, что они способны не съехать с катушек, когда половина заполнена книгой.

Расчет идет на то, что при 10М контексте, заполнение на 400К будет бить по вниманию +- как сейчас 40К бьет по вниманию при 1М контекста, то есть модель сохранит свои способности, понимая содержание книги и все нюансы типа личностей и характеров персонажей.

Короче говоря, все относительно и именно с этой точки зрения поставлен вопрос. Нынешние 1М это такой же пук в лужу, как допустим 128К было пуком в лужу в 2025 году и все юзали 16-32к, носясь по треду с табличками-бенчами как моделька выше 64к уже не тянет даже 50% понимания промпта.
Аноним 26/08/26 Срд 10:57:21 #488 №1687534 
>>1687525
>Я уже проверял, он не вывозит мои агентные системы.
Интересно, мне казалось квен как раз заточен под разнообразные агентные системы. Наилучший результат, конечно, когда упряжка затачивается под модель.
А можешь чуть подробнее описать, что там за задачи были, в которых гемма с лагуной справились, а квен нет? И как это вообще было?
Аноним 26/08/26 Срд 11:02:08 #489 №1687535 
>>1687533
Ну, это не мой поинт, а твой, что появился кривой-косой контекст на 1М. Я даже этого не говорил.
Я то в контекст больше 100к не верю и не видел чтобы они работали - это просто лишняя нагрузка для сети, которую она всё-равно не вывозит. Задачи нужно дробить на подзадачи, а сложная задача должна выполняться в нескольких параллельных потоках с контекстом до 100к с оркестратором который только короткие отчёты получает. И улучшение должно идти в пользу оптимизации вот этого, а не тупого увеличения контекст.

Примерно так же как и мое сетки победили плотные, так как можно вместо плотной на 200B поставить мое на 2Т более быструю и умную. Вот примерно по таким причинам изменение подхода приведет к нецелесообразности делать контекст больше.
Аноним 26/08/26 Срд 11:05:43 #490 №1687537 
>>1687533
>Расчет идет на то, что при 10М контексте, заполнение на 400К будет бить по вниманию +- как сейчас 40К бьет по вниманию при 1М контекста
Ни чем не обоснованное предположение.
Аноним 26/08/26 Срд 11:13:11 #491 №1687544 
>>1687537
Ну как это необоснованное?

Было
> 128К максимум
> жесткая деградация после 64К
> кое-как юзабельно 32К
> полное внимание до 16К

Стало
> 1М максимум
> жесткая деградация после 200К <-- that's the fucking point, сейчас 400К книгу не впихнешь
> кое-как юзабельно 100К
> полное внимание до ??? (зависит от модели, но 32К абсолютно ВСЕ новинки держат железно)

Будет
> 10М максимум
> жесткая деградация после ??? <-- вопрос в том, какой станет эта цифра, стоит ли ожидать 1М реально юзабельного

>>1687535
1М это потолок, мы потолок вообще не рассматриваем, а интересуемся именно реально юзабельным окном, которое вполне осязаемо выросло за последний год.
Аноним 26/08/26 Срд 11:15:05 #492 №1687545 
>>1687544
>Будет
Тут скорее "а будет ли это вообще", есть ли хоть какие предпосылки в исследованиях к такому росту эффективности кэша и аттеншна.
Может кто угорает по научным работам и документам, не знаю, в общем есть ли свет в конце тоннеля или нас ждет стагнация.
Аноним 26/08/26 Срд 11:21:02 #493 №1687548 
image.png
image.png
в принципе было, но блохастое животное измазалось собственным калом и сдохло
Аноним 26/08/26 Срд 11:23:57 #494 №1687550 
>>1687548
Вся линейка была говном и даже не по причине контекста
Аноним 26/08/26 Срд 11:29:37 #495 №1687553 
>вопрос в том, какой станет эта цифра, стоит ли ожидать 1М реально юзабельного
1. Это зависит от того, что обучают и для чего. Типа, на внимание выделено 100% ресурсов. Можно сделать 60% внимания на контекст 0..16к и 40% на контекст 16к..128к. А можно сделать равномерный 0..128к.
Фактически реальный задачи в мире обычно такие, что не весь контекст равномерно важен, а действительно важно начало и конец - под это и обучают. Не специально, а просто обучающие примеры таковы, что начальные и конечные токены больший вклад вносят. Если специально подбирать обучающие примеры синтетические, то можно добиться такого, чтобы сеть игнорила начало и конец и смотрело только на середину. Меня в целом распределение что есть 20% внимания на начало, потом тонким слоем по середине, и потом много внимания к концу и ближайшему контексту - устраивает.
2. Количество ресурсов выделенное на всё будет повышаться, перепадёт что-то и вниманию на длинных контекстах.
3. В целом можно и сейчас выделить х4 ресурсов на внимание. Больше всяких голов внимания, тяжелее кеш, никакого swa - но у тебя и получится что сетка на 30B - при этом информации в ней 10B, так как все веса выделены не на запечение знаний, а на поиск и запечение паттернов внимания (воздействия токенов друг на друга). И кеш будет весить на 100к токенов 10 ГБ, а не 4 ГБ как у плотных или 1 ГБ как у МоЕ. А нейросети - это вообще про деньги (соотношение мозги(польза)/деньги). Кто будет хостить такую сетку и чем он будет обосновывать цену х5 по сравнению с конкурентами, которые в 99% случаев такой же результат выдают? Типа 2% мозгов за х5 цену? Полно низкоквалифицированного умственного труда, который перекладывать на сетки целесообразнее, чем дорогой высококвалифицированный. Пока он не исчерпается - потребности создавать умную в плане интеллекта и внимания сетку не будет.
Аноним 26/08/26 Срд 11:46:58 #496 №1687563 
>>1687553
> 20% внимания на начало, потом тонким слоем по середине, и потом много внимания к концу и ближайшему контексту
Да как-то не очень похоже, чтобы середина впитывалась свеженькими моделями на отъебись.

У меня один из рабочих сценариев представляет собой следующую структуру:
> Ты - [имя]. Твоя жизнь - около 7к токенов прозы.
> сюда вставляется блок [память] до 20к токенов, сжатые логи чатов за недели-месяцы
> Затем еще 3к токенов интервью, вопрос-ответ с голосом персонажа.
> Затем 7к токенов блок инструкций, который начинается с четко обозначенного формата общения (голосовой чат, никакого описания действий, никакого нарратива) и всякие там тонкие конфиги личности
> Затем короткий хвост из распорядка дня, известных мест в городе и маршрутов передвижения

Многие современные модели, судя по поведению, одинаково уважают как будто бы всё. Гемма словно робот-пиявка следует деталям, присасывается намертво. ГЛМ 5.2 еще и экстраполирует как боженька, выдумывая правдоподобные ассоциативные связи, исходя из жизненной истории персонажа.

Исключение - дипсик флэш. Вот его колбасит даже в полных весах. Он мне тут назвал "корпоративом" воспоминание о выпускном вечере, попутал собаку персонажа с кошкой, и еще кучу дряни вытянул из жопы.
Аноним 26/08/26 Срд 11:47:26 #497 №1687564 
>>1687548
Кстати, символично что у музи, которая по архитектуре та же лама - всего 131к.
Аноним 26/08/26 Срд 11:50:43 #498 №1687565 
>>1687564
Но это вполне себе честные 131к, к слову.
Аноним 26/08/26 Срд 11:55:29 #499 №1687567 
>>1687484
Завести офк получится, а что будет по скорости уже хз. Все шансы иметь 3+ есть.
>>1687514
Да и похуй на него, там вижн в дипсику анонсировали. Если выложат вот будет космос.
>>1687544
Довольно субъективно, оценивалось по ощущениям в рп без какой-либо систематики. Даже не старых моделях все сильно зависело от содержимого. Когда оно было разнообразным и "легким для ориентации" то и на старом милфамистрали 64к даже лучше чем сначала были. При засорении повторяющимся кумом и ошибками совсем рано подыхало.
Нынче деградация после 200к справедлива для 256к окон моделей, с миллионниками таких проблем нет. Проблема не в том, что модель забывает контекст или не может его понять, как некоторые, а оказавшись под давлением информации теряет креатив и инициативу.
>>1687553
Разреженное и линейное внимание как раз позволяют задешево качественно учесть большую кучу контекста, а сочетание с полным сфокусироваться на нужной части в момент когда будут нужные ассоциации. Их именно для того чтобы не городить супер дорогой кэш и делали.
Аноним 26/08/26 Срд 11:56:37 #500 №1687568 
>>1687563
> Гемма словно робот-пиявка следует деталям
> дипсик флэш. Вот его колбасит даже в полных весах. Он мне тут назвал "корпоративом" воспоминание о выпускном вечере, попутал собаку персонажа с кошкой, и еще кучу дряни вытянул из жопы
Должно происходить наоборот, ты маг-волшебник.
Аноним 26/08/26 Срд 11:58:55 #501 №1687570 
>>1687568
А дело в ризонинге. Гемма стабильно думает, дипсик сыпется. Префиллы пробовал, но они ведут к этакой шаблонизации ответов. Без префилла ризонинг дипсика деградирует до мыслей персонажа, которые сфокусированы сугубо в текущем моменте - полностью кладется болт на все, кроме "как отреагировать на вот это, что передо мной прямо сейчас". Как по мне, очень неудобная и пожалуй неудачная для сложных системных промптов модель.
Аноним 26/08/26 Срд 12:12:18 #502 №1687577 
>>1687530
Там Илья Сусковер какую-то модель в этом месяце выпускает, которая в обучение в реальном времени может, обновление своих весов во время градиентного спуска, вот и будет следующий шаг. Возможно вообще все перевернется в мире моделей и весь год мы будем видеть релизы на новой архитектуре.
Аноним 26/08/26 Срд 12:14:54 #503 №1687579 
>>1687577
Пока звучит как змеиное масло, исцеляющее от всех проблем. Вот выйдет, тогда и будет разговор.
Аноним 26/08/26 Срд 12:20:51 #504 №1687582 
>>1687579
Он уже ее показывал в кремниевой долине, там говорят самая значительная модель года. Хз короче, скоро увидим новая архитектура это или нет. Там не классический трансформер. Нвидия сразу 5 миллиардов вкинула в Илью, как увидели.
Аноним 26/08/26 Срд 12:24:51 #505 №1687586 
>>1687582
Вот только нам-то с этого что, наверняка все закрытое будет, не?
Аноним 26/08/26 Срд 12:25:02 #506 №1687587 
>>1687519
>Сам ниче не конфигурировал, ik_llama мне накатил дипсик про. А в обычной лламе я впихиваю 200к контекста с теми же 4 токенами в секунду.
У ik_llama нет fit-params, поэтому приходится пердолиться с -ts, распихивая слои по картам, --gpu-layers 999 и --n-cpu-moe подбирать. -b -ub минимум по 2к (а лучше 4): - tg немного ниже, зато pp выше. Фишечки: --merge-qkv, -muge, раздельное квантование -ctk и -ctv (некоторые модели поддерживают), --k-cache-hadamard если квант контекста меньше Q8_0. Тесты ты видел, если оно тебе надо - пробуй.
Аноним 26/08/26 Срд 12:27:08 #507 №1687589 
>>1687582
>Нвидия сразу 5 миллиардов вкинула в Илью, как увидели.
Это скорее плохой признак - они сейчас в любое говно миллиардами кидаются, лишь бы спрос на железо не упал.
Аноним 26/08/26 Срд 12:31:18 #508 №1687592 
>>1687586

Китайцы украдут и сделают открытым.
Аноним 26/08/26 Срд 12:34:57 #509 №1687594 
>>1687577
Ух бля, геммочка с обучением... Скорее бы...
Аноним 26/08/26 Срд 12:41:46 #510 №1687600 
image.png
5 часов до говна с лопаты
Аноним 26/08/26 Срд 12:43:41 #511 №1687601 
>>1687567
>Завести офк получится, а что будет по скорости уже хз. Все шансы иметь 3+ есть.
Ладно, попробую наверное с более мелкого E8-IQ3 начать. Осталось дождаться, пока SSD приедут.
Все же на фоне истерии с памятью, это решение выглядит самым вкусным.
ПЕРЕКАТ Аноним OP 26/08/26 Срд 12:46:10 #512 №1687605 
ПЕРЕКАТ

>>1687604 (OP)

ПЕРЕКАТ

>>1687604 (OP)

ПЕРЕКАТ

>>1687604 (OP)
Аноним 27/08/26 Чтв 08:45:00 #513 №1688454 
>>1686975
Ну во первых да, такой экспириенс тебе без иронии никто больше не даст. Который год не отпускает.
Во вторых некоторую хуйню я корпам писать точно не буду уж очень они сосут данные нагло, просто пиздец.
Ну и типа ИИ у тебя на видимокарточке. Дома. Про такое даже фантасты не писали моветон нереалистично считалось, а оно вон оно как.
Аноним 29/08/26 Суб 20:43:44 #514 №1690509 
Безымянный.jpg
>>1687346
>Ого, в таком случае реквестирую вариант чтобы край вентилятора был выровнен по одной из плоских сторон видеокарты, а остальное цетром, такое возможно? С меня как всегда.
Вот. На картинке схемы.
Прости что я такая копуша, у меня просто беды с башкой и я раньше не был в состоянии сделать, хотя там и на пять минут.
https://files.catbox.moe/ljbb70.7z
comments powered by Disqus