Добавлена поддержка Ежчана (ejchan.net, ejchan.site). Набегаем, тестируем архивацию, сообщаем о замеченных проблемах.
К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!

Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №265 /llama/

 Аноним 08/09/26 Втр 15:25:30 #1 №1699101 
Llama 1.png
Карта деградации при квантовании по доменам.png
Реальная длина контекста у моделей 6.png
17759292032780087006.jpg
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1696723 (OP)
>>1694457 (OP)
Аноним 08/09/26 Втр 15:28:17 #2 №1699105 
Для анона с говно компом
>>Dolphin-Llama-3-8B и какую НемоМисталь 8.
Это старый кал, который тебе местный шиз насоветовал. Если у тебя говно комп, то просто скачай приложение грок и закидывай туда промт, потом кидаешь персонажа и сеттинг и он выдает тебе рп без цензуры. Там 50 сообщений каждые 3 часа даются. Одно сообщение максимум 500 слов по его словам. После Грока все кажется говном и объедками.Если нужен не рп, а просто текст. То пишешь какую то хуйню и тебе даже парусная нейронка доделает в конфетку.
Вот, не еби себе голову локалками, они все говно, хуже любого 2/10 фанфика человека.
Аноним 08/09/26 Втр 15:33:00 #3 №1699109 
Дополню что снес с компа всю эту парашу и мешуру, полностью разочарован в нейронках. Нихуя они не могут. Даже самая крутая модель тебе выдаст кал где все бомжи знают твое имя и цвет твоего ануса, а персонажей появляется по 3 руки. Интеллекта 0. Тем более щас все цензурят, и ничего от Characters ai не отличается.
Аноним 08/09/26 Втр 15:34:46 #4 №1699110 
IMG4677.png
>>1699101 (OP)
ОП-пец, щитаю ради рофла можно один раз тред назвать локальной геммы нить.
Аноним 08/09/26 Втр 15:36:07 #5 №1699111 
>>1699109
Попробуй использовать нейронки для работы а на корпах попробуй в SFW РП. Базарю, потом от Клода и гемини за уши не оттянешь,
Аноним 08/09/26 Втр 15:37:57 #6 №1699113 
1764265938269.png
>>1699108 →
Математика уровня пикрел
> Аргументы будут?
google:wlan ping jitter и с подключением!
Аноним 08/09/26 Втр 15:38:56 #7 №1699115 
>>1699111
>потом от Клода и гемини за уши не оттянешь
Который год я уже эти сказки слышу? Раньше еще диксик Р1 был. Давай примеры твоего супер рп и текста. Ах да, наверное у меня промт неправильный был, и день недели не тот. Нужно 1000 промтов перебрать и можно по рпшить на два сообщения
Аноним 08/09/26 Втр 15:40:25 #8 №1699116 
>>1699111
>SFW РП
Че вы там делаете? Без рофлов
Аноним 08/09/26 Втр 15:45:38 #9 №1699119 
>>1699109
Проблема навыка и 4б лоботомитов.
>>1699111
> SFW РП. Базарю, потом от Клода и гемини за уши не оттянешь
Там к простому sfw быстро подмешивается требование по sjw-расово-идеологически-нравственно-верному поведению что дико бесит. Кроме грока, но он глупенький. Зато, если ты небинарная феминистка из расового меньшинства - на фронтире без жб даже лайтовый кум можно делать.
Аноним 08/09/26 Втр 15:48:47 #10 №1699123 
>>1699109
>Даже самая крутая модель тебе выдаст кал где все бомжи знают твое имя и цвет твоего ануса, а персонажей появляется по 3 руки.
Такого даже гемма не делает.

>Тем более щас все цензурят, и ничего от Characters ai не отличается.
Скилл ишью, любая цензура пробивается без проблем, а для криворучек специально созданы Апасные модели.

Вообще скатертью по жопе.
Аноним 08/09/26 Втр 15:55:06 #11 №1699127 
>>1699042 →
>по вифи
Не, там задержки большие слишком, смотрел протыка на ютубе который так сделал, режет скорость. Особенно на больших токенах в секунду, чем больше тем сильнее потери, т.к. потери скейлятся от количества передач а не пропускной способности (а каждый сгенерированный токен это передача)
Если уж совсем никак не уйти то надо брать вайфай 7 и убирать все частоты кроме 6ггц, и как-нибудь напрямую компы соединять без точки доступа
Аноним 08/09/26 Втр 16:00:07 #12 №1699132 
image
Короче челики, погонял тесты на
outsourc-e/Qwen3.8-27B-Unleashed-UD-IQ3_XXS
cruizba/Qwen3.8-27B-GSQ-RCO-IQ3_XXS+MTP
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp

На всех трёх mtp нихуя не работает и тпс выше 27 не разогнать. Почему-то мтп начинает нормально работать только с моделей начиная от UD-Q3_K_XL , а на мелких сыпется

Вобщем в 16гб врама 160к контекста с быстрой скоростью не запихать. Либо сидишь на 13гб моделях на 80к контекста с 50тпс, либо ставишь модель 11-12гб с контекстом до 160к, но сидишь на 25-27тпс

Рыбку сьесть и на хуй сесть не получилось
Аноним 08/09/26 Втр 16:02:24 #13 №1699136 
>>1699115
Конечно, твоя гемма даст пососать корпам, не переживай.
Или жэлээм.
> Ах да, наверное у меня промт неправильный
Не знаю. У меня нет проблем с промтингом корпосеток. Я знаю чего хочу и какое повествование желаю видеть. Так что ты сам себе петрушка.

> Давай примеры твоего супер рп
Ну вот когда ты в мне покажешь пример SFW рп
на локалке, ну чтобы я охуел. А я в ответ сделаю РП на геминьке с этой же карточкой.

>>1699116
За счет ебового окна контекста, инструментов поиска- берешь популярную вселенную и приключаешься.
Я лично вахапобегушки устраиваю за шизофреника из времен ТЭТ.
Аноним 08/09/26 Втр 16:02:45 #14 №1699137 
>>1699113
>>1699127
>вайфай 7 и убирать все частоты кроме 6ггц
Я хуй знаетчем вы слушаете. Если я с самого начала говорю о скоростях в 5ГБ и чистоте эфира, то о каком поколении вайфая речь?
Точка доступа не роляет, устройства в вифи напрямую друг с другом сообщаются, насколько помню, если не брать какие-нибудь древние поколения.
Если не так, то на крайняк можно подождать, когда в rpc серверу udp и бродкаст. Хотя может там и так через броадкаст все работает.

Короче ждем другого тестера, который будет через вифи делать. У меня 7го вифи нет, только 6е и через всю хату.
Аноним 08/09/26 Втр 16:04:38 #15 №1699141 
>>1699132
юзаю ластовую, тоже примерно такая же скорость, но я че то не додумался проверить скорость без мтп в конфиг, гляну сегодня, спасибо. если она реально не работает то просто скачаю квант без головы и получу врам свободный.
Аноним 08/09/26 Втр 16:06:38 #16 №1699143 
>>1699137
В каждой версии апгрейдится латенси так или иначе + на высоких частотах оно меньше.

>Точка доступа не роляет, устройства в вифи напрямую друг с другом сообщаются
Шо бля
Аноним 08/09/26 Втр 16:08:27 #17 №1699145 
>>1699136
>Я лично вахапобегушки устраиваю за шизофреника из времен ТЭТ
Как в вахе может быть SFW , там же всякие Слаанешь, расчленёнка, геноцид.Можно примеры хоть какие то?
Аноним 08/09/26 Втр 16:08:40 #18 №1699146 
>>1699137
Может ты владелец крутейших модулей и живешь в чистом поле не имея других вайфай устройств, тогда прав. Но мы здесь люди простые, и не раз сталкивались с тем как на самом деле работает вайфай.
Попроси ллмку написать тебе визуализатор пинга до другого устройства, а потом запусти по каналу передачу больших данных между другими, даже в другой сети. Сразу станет понятно.
Аноним 08/09/26 Втр 16:11:58 #19 №1699149 
>>1699145
Корпы тригерятся на еблю и на насилие ради насилия. Вопросов с давкой сапогами Эльдаров или сжиганию еретиков из огнемета нет.
Слаанеш сугубо в рамках вахалитературы, без акцентов на пенсилах. Геноцид в рамках вахи тоже норм, это же Ваха вот если ты решишь устраивать побегушки с огнеметом в MLP, то тогда получишь форбидден контент.
Аноним 08/09/26 Втр 16:36:30 #20 №1699187 
>>1699143
Дядь, у тебя клиент-серверная архитектура. В любом случае ллама-сервер будет выступать вифи-роутером и все рпс-фермы будут с ним напрямую связаны, промежуточный узел ввиде роутера в прихожей здесь не нужен.
>>1699146
Я в квартире живу и даже в онлайн дрочильни играю по вифи, хз откуда такая тряска, просто выбираешь частоту/канал где никого нет и ставишь антенны правильно.
>>1699124 →
Делись ссылкой на протыка.
Аноним 08/09/26 Втр 16:39:39 #21 №1699189 
>>1699143
>Шо бля
wifi-aware, ad-hoc, dls и прочие около-меш технологии к твоим услугам.
Аноним 08/09/26 Втр 16:48:42 #22 №1699193 
>>1699100 →
> Слышно ли дерево, которое упало в глухом лесу? Да слышно, только оно не упало а серило под себя и ничего не дало, а вызовов наплодило.

Хватит использовать файнтьюн Gemma-26b-a4b в IQ4_XS кванте. Я без рофлов говорю.

>>1699117 →
Ты maple-preview пробовал-то хоть?
Аноним 08/09/26 Втр 16:50:28 #23 №1699194 
>>1699189
Типа ты подключен к точке доступа и какая-то технология позволяет тебе автоматически напрямую с другим устройством на этой точке обмениваться? Ну хз, я только ручное прямое подключение знаю. Если так можно то заебись, на микротике такого не видел на них вайфай обычно каловенько сделан для галочки
Аноним 08/09/26 Втр 16:51:30 #24 №1699197 
>>1699145
Гладить хвостики ксенолисичек не привлекая внимания инквизиции
Аноним 08/09/26 Втр 16:54:45 #25 №1699200 
>>1699197
Это база, это основа! Только регулярно скатывается в nsfw, как сдерживаться?
Аноним 08/09/26 Втр 16:57:22 #26 №1699201 
1699775729385016.png
>>1699187
>ллама-сервер будет выступать вифи-роутером
Да что такое сегодня происходит в этом итт тредже
Аноним 08/09/26 Втр 17:03:45 #27 №1699214 
1788876122605.jpg
256 рамобоярам обновочка, остальные продолжаем терпеть
Аноним 08/09/26 Втр 17:03:47 #28 №1699215 
>>1699201
Ну можешь в другой стране сервер поднять, ты же у нас самый умненький.
Аноним 08/09/26 Втр 17:08:23 #29 №1699220 
>>1699214
Причем тут рамобояре если тут про api?
Аноним 08/09/26 Втр 17:17:07 #30 №1699224 
> рп на корпах
> nsfl рп под запретом
> ванильный nsfw рп тоже запретили
> sfw рп по части копирастов запретили
> sfw рп запретили по всему защищенному контенту (все, где не истекло 95 лет с первой публикации)
> sfw ромком рп запретили из-за "безопасности"
> sfw рп запретили ещё по всем произведениям в public domain, которые "значимы для культуры"
> рп и генерация художественного текста как таковые запрещены
> чат под запретом, корпом может использовать только кодинг-агент без прямого взаимодействия с юзером

Вау, спасибо, мужик. Отличное рп на корпах, дайте два.
Аноним 08/09/26 Втр 17:19:02 #31 №1699226 
Короч, рассказываю ахуй. Захотелось поиграть в героев 3, накатил себе на линукс тачку VCMI и мод HOTA, но столкнулся с тем что в игре часть текста на английском языке.
Закинул скрин в локального квена3.8-27б, попросил починить. Он 20 минут попердел, нашел причину в каком-то кривом моде vcmi, написал патч с фиксом и поправил эту хуйню.
Аноним 08/09/26 Втр 17:20:57 #32 №1699228 
1759082818297.jpeg
1697511419536.jpeg
>>1699214
Uwoooh!😭😭 скорее бы ее пощупать. Интересно сразу с вижном будет или только текст.
Аноним 08/09/26 Втр 17:23:24 #33 №1699230 
>>1699228
Там built on new architecture, так что только яйца жорика пощупаешь
Аноним 08/09/26 Втр 17:25:46 #34 №1699235 
>>1699230
> так что только яйца жорика пощупаешь
Фуфуфу, мы такое не практикуем! Воздам хвалу lazymio и ллм-сингулярности, а потом щупать и гладить.
Да и объективно, сейчас новые архитектуры в жору быстро добавляют.
Аноним 08/09/26 Втр 17:26:05 #35 №1699236 
>>1699226
Сейчас еще дал ему гоговский установщик героев 5 и попросил настроить. Он поставил Proton-CachyOS, поставил игру, запустил, проверил что всё работает и сделал ярлыки для запуска ваниллы и аддонов. Это прям кайф, я эту еблю с протоном и вайном терпеть не могу.
Аноним 08/09/26 Втр 17:35:04 #36 №1699239 
image.png
Объясните, че за датасет такой?
Аноним 08/09/26 Втр 17:39:34 #37 №1699243 
image.png
>>1699239
твой скриншот с твоим вопросом в гемени кинул
Аноним 08/09/26 Втр 17:40:01 #38 №1699244 
>>1699239
А нахуй ты туда зашёл? Токены в первом столбце, во втором обычная аттеншен маска, в третьем хуй знает что.
Аноним 08/09/26 Втр 17:46:11 #39 №1699248 
>>1699224
Отлично ролеплеил с GPT 5.5/Gemini 3.1pro/Opus 4.6 по Евангелиону, Muv-Luv Alternative и Sidonia no Kishi.
Deepseek 4 pro без цензуры, хардрефьюзы раз в дохуя-дохуя свайпов.

Другое дело, что ролеплеить с корпами на большом контексте дорого (если оплачивать), поэтому нужны локалки, а на маленьком не такие большие преимущества над локалками.
Аноним 08/09/26 Втр 17:48:45 #40 №1699252 
>>1699243
Понятно, спасибо.
>>1699244
Хотел посмотреть сколько слопа накидали в датасет.
Аноним 08/09/26 Втр 17:56:33 #41 №1699259 
проебал коммент чувака который говорил что мтп бошка квена 3.8 27б не работает.

проверил на себе, ебанул спек драфт 3 - почти 30тс
затем ебанул спек драфт 2 - 27 тс и постепено ползет в 25
мтп вообще - 16тса.

так что нет, мтп бошка работает. юзаю очевидно лламу спп, 12гб енжоер на связи. но твой случай с одинаковой скоростью с и без бошки мне интересен, потыкай, мб у тебя 27тса без мтп, а сам мтп по каким-то причинам не работает? интересно просто почему у тебя так.
Аноним 08/09/26 Втр 18:00:37 #42 №1699262 
>>1699248
1 000 000 аутпут токенов нынче стоит 0.66 цента у дипсик-флеш и 0.33 цента у квен3.8. Чтобы в локалке этот миллион получить надо часов 6 непрерывно видяху жарить. Это при том что у корпов квант f16, а не нищие iq3_xxxxs. Локалки всегда проигрывают большим дядям по деньгам, выигрывают только на небольшой доле запросов которая цензурится
Аноним 08/09/26 Втр 18:02:36 #43 №1699264 
>>1699259
У Жоры MTP долбится толи в ЦП, толи в шину. У меня с ним на 4090 и 5090 литералли одинаковая скорость на Q5 - 80 т/с, а карты слабо нагружены.
Аноним 08/09/26 Втр 18:04:32 #44 №1699267 
>>1699262
>небольшой доле запросов которая цензурится
Это ты просто скучно живёшь.
Аноним 08/09/26 Втр 18:20:05 #45 №1699278 
>>1699264
у меня железо похуже, наверно поэтому у меня мтп бошка дает буст. но это не значит что бошка в самом квене не рабочая, она рабочая, просто ггмл момент
Аноним 08/09/26 Втр 18:21:02 #46 №1699280 
Исходные данные: около 423 тыс. сообщений из двух Telegram-чатов, примерно 12 млн символов. Имена были нормализованы по from_id, объединены алиасы, технические боты удалены. Последние 5% каждого чата отложены и не использовались в обучении.
Первый fine-tune (v1): Qwen3.5-9B LoRA дообучался на сыром тексте группы в формате <Имя>\nсообщение, фактически как continued pretraining, с loss по всем токенам. Около 7.1 млн токенов, 1 эпоха. Модель хорошо впитала язык группы, сленг, имена, ритм и короткие Telegram-бёрсты, но продолжала вести себя как «пьеса», генерируя реплики разных участников, а не как отдельный персонаж.
Второй fine-tune (v2): поверх v1 сделали SFT: несколько предыдущих бёрстов участников подавались как user, следующий бёрст другого человека становился assistant. Имя автора target убиралось, несколько его сообщений соединялись через <MSG>. Авторы были сбалансированы, взято около 19 тыс. примеров. В результате модель научилась говорить от отдельного speaker-slot и хорошо использовать <MSG>, но проявился недостаток: её собственные ответы между ходами плохо ощущаются как речь одного и того же человека. Она часто выдаёт локально правдоподобную следующую реплику, но не обязательно продолжает собственную предыдущую мысль.

Главная идея следующего эксперимента: делать multi-turn SFT от v1, где внутри одного training example один реальный участник выбран как assistant на протяжении нескольких его ходов, а остальные остаются user.


Можете че-то подсказать посоветовать?
Аноним 08/09/26 Втр 18:23:14 #47 №1699283 
>>1699280
>Она часто выдаёт локально правдоподобную следующую реплику, но не обязательно продолжает собственную предыдущую мысль.
примерно так чат обычно и выглядит, все правильно впитала
Аноним 08/09/26 Втр 18:28:18 #48 №1699288 
>>1699280
Я ща думаю может первый файн-тюн был сделан с неправильной идеей
Может
>где внутри одного training example один реальный участник выбран как assistant на протяжении нескольких его ходов, а остальные остаются user.

сделать несколько таких датасетов и на них натренить заново первую версию, а там посмотреть что вышло
Аноним 08/09/26 Втр 19:05:11 #49 №1699319 
image
>>1699228
Аноним 08/09/26 Втр 19:12:31 #50 №1699324 
>>1699262
Анон, так то про цену это главный недостаток корпов.
Я не могу за других говорить, но если отдаешь денюжку, рассчитываешь за эту денюжку получить клода, геминьку гопоту, но никак не сраные китаэмоэ. И это реально дорого, потому что у тебя контекст не в модели, а гнояется туда-сюда. 200к контекста на 5 ответах, дадут тот самый мульон. А еще цены не указаны на платформе, а в их доках и там дохуя интересного. Как X2-X3 ценники в пиковую нагрузку, анализ твоих сообщений и выдвание на основе этого очередности для запроса. Если в рубли, то неделя это 20$ на Гемини, и 31$ на клоде.
Аноним 08/09/26 Втр 19:19:40 #51 №1699329 
>>1699324
Там cached input нынче 2-10% от полноценной цены, поэтому запросы с большим контекстом не сильно дорогие. Квен и Гемини офк дорогущие, китайцы есть очень дешевые. На свою видяху тоже надо амортизацию закладывать, 3-5 лет и она уже считается изношенной и идет в утиль (продается на авито за пол цены)
Аноним 08/09/26 Втр 19:19:40 #52 №1699330 
1788884380911.png
>>1699324
Контекст кэшируется и стоит 0.00000001...
Аноним 08/09/26 Втр 19:20:12 #53 №1699331 
>>1699329
>Квен
Клод*
Аноним 08/09/26 Втр 19:21:06 #54 №1699332 
>>1699330
Я вижу по билингам от гугла как оно стоит копейки.
ладно, это вообще офтоп, сорян.
Аноним 08/09/26 Втр 19:35:26 #55 №1699339 
>>1699324
>Анон, так то про цену это главный недостаток корпов.

Не знаю как вам, а мне не хочется, чтобы мои логи потом куда-то попали, несмотря на то, что ничего сомнительного я не делаю. Просто кажется кринжем. Лучше уж на локальном лоботомите сиськи мять...
Аноним 08/09/26 Втр 19:38:53 #56 №1699342 
>>1699339
Че вы так трясётесь с этими логами? Логи это как разрешить браузеру или нвидиа в игре собирать данные о твоей системе, чтобы в будущем у тебя было меньше лагов. Так же и тут, только в будущем на твоём, лично твоём рп обучат модель и тебе станет приятнее рпшить.
Сначала не платят за апи, а потом удивляются что везде кодоунитазы и никто не знает что они хотят рп
Аноним 08/09/26 Втр 19:44:42 #57 №1699346 
>>1699236
В чем квена катаешь? Он умница и правда
Аноним 08/09/26 Втр 19:45:27 #58 №1699347 
>>1699342
Корпам (е)РП делать нахуй не надо, это просто набор liabilities, бомба замедленного действия. Не будет никто из них заниматься этой залупой, даже если мы все лично алтману и амодею начнем донатить.
Аноним 08/09/26 Втр 19:55:13 #59 №1699350 
>>1699342
>лично твоём рп обучат модель
Обучат классификатор, который будет реджектить РП и джейлы.
Аноним 08/09/26 Втр 19:56:31 #60 №1699351 
>>1699231 →
>мтп накати
Реально помогло, странно что mtp не включается по умолчанию для моделей которые его поддерживают
Плюсом еще заместо unsloth/gemma-4-26B-A4B-it-GGUF скачал unsloth/gemma-4-26B-A4B-it-qat-GGUF там вроде поменьше памяти требует
Ну и было 12.99 t/s, стало 18.74 t/s, уже терпимее
А еще теперь на тот же промпт скрипт сгенерен уже полностью рабочий, с корректной кодировкой
Аноним 08/09/26 Втр 19:59:01 #61 №1699353 
>>1699350
Ну то целенаправленная борьба именно с РП, и её никто не ведет, это всё стоит денег, анта бака?
Аноним 08/09/26 Втр 20:00:22 #62 №1699355 
Ладно, это уже не смешно.
Где новый эйр???
Раньше была теория, что нам не дают обнову чтобы брали подписку, тогда зачем сейчас выкатили флеш???
Аноним 08/09/26 Втр 20:03:57 #63 №1699356 
>>1699319
>иди под струю мойся!
Аноним 08/09/26 Втр 20:05:02 #64 №1699358 
>>1699353
Так-то щас очевидно что даже самые большие модели минмаксят под кодинг, и слоповый РП в датасете - это совсем лишняя информация.
Аноним 08/09/26 Втр 20:05:20 #65 №1699359 
1788887120956.jpg
>>1699356
Нет
Аноним 08/09/26 Втр 20:07:58 #66 №1699361 
1686565423011093.gif
>>1699235
Гигачат:
Аноним 08/09/26 Втр 20:26:25 #67 №1699365 
591ea4959b44dedb93934569d5b48514.jpg
Меня одного раздражает, что гемма в сексрп часто использует слово рваный?
Аноним 08/09/26 Втр 20:27:05 #68 №1699366 
1737477042301.jpeg
>>1699319
>>1699361
Точно, надо и его попробовать, раньше памяти совсем не хватало.
Аноним 08/09/26 Втр 20:32:41 #69 №1699368 
>>1699366
Там уже неделю ждут ревью очередных коммитов
Аноним 08/09/26 Втр 20:53:08 #70 №1699380 
>>1699101 (OP)
А вот эта пикча #2 с квен3.8 также работает? Четвертый квант так сильно деградирует??
Аноним 08/09/26 Втр 21:04:00 #71 №1699387 
>>1699380
Учитывая что там просело все, кроме кодинга - вероятно дело в говноквантах.
Все может быть индивидуально между моделями и квантоделами.
Аноним 08/09/26 Втр 21:20:58 #72 №1699409 
Кому-то удалось завести DFlash на ГЛМ в лламаспп? Если да, то как?
Аноним 08/09/26 Втр 21:45:35 #73 №1699440 
>>1699109
Пережирнил. Аж с монитора потекло.
Аноним 08/09/26 Втр 22:57:53 #74 №1699491 
image
Челы палю ебейшую связку
Ставите https://huggingface.co/z-lab/Qwen3.8-27B-DFlash2-GGUF
и https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF

В конфиг
--spec-type draft-dflash ^
--spec-draft-n-max 4 ^

Средний тпс на коде 65 нах и влезает 160к контекста
Аноним 08/09/26 Втр 23:00:59 #75 №1699494 
>>1699491
Всем похуй. Добавь в связку пальчик в попу и уход в агентотред.
Аноним 08/09/26 Втр 23:09:31 #76 №1699499 
>>1699491
Без мтп и с обычным мтп сколько было?
>>1699494
Кто о чем, а кумер все о пальчиках в попе.
Аноним 08/09/26 Втр 23:52:20 #77 №1699523 
запустил Qwen 3.5 на своем ноуте с 7.4Gi через Vulkan и поймал Out of Memory.
Аноним 09/09/26 Срд 00:00:58 #78 №1699535 
>>1699239
я кинул твою пикчу своей локальной Qwen 2.5 0.5b и она сказала что это твоя мать много лет назад. это RGB коды изоббражений в левой колонке.

убедись сам.
Аноним 09/09/26 Срд 00:16:57 #79 №1699552 
>>1699499
27/55

Эта штука на n6 здоровый прирост дает в q8, на q4 прирост не так заметен
Аноним 09/09/26 Срд 00:28:57 #80 №1699558 
>>1699523
⚠️🚨✨Юлия Якубеня обронила отварную сосиску
Аноним 09/09/26 Срд 02:33:57 #81 №1699611 
1788910437220.png
1788910437274.png
Бля, какой ужас 🫣
Аноним 09/09/26 Срд 04:39:13 #82 №1699663 
>>1699611
>Бля, какой ужас
Хоть бы модель назвал.
Аноним 09/09/26 Срд 04:50:21 #83 №1699669 
>>1699663
Да и так видно что дипсик или глм-флеш какой-нибудь. + анимешная карточка персонажа. Говноедское комбо.
Аноним 09/09/26 Срд 07:43:46 #84 №1699700 
image.png
>>1699101 (OP)
> • Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai
Шапку обновите - в ЛМстудии уже можно жорой как угодно вертеть, любые параметры дописываются к дефолтным.

Однокнопочность уже выглядит как намеренная дезинформация. Там одна лоллама в списке остается инвалидом.
Аноним 09/09/26 Срд 08:01:02 #85 №1699707 
https://github.com/ggml-org/llama.cpp/pull/28476

Нихуясе, оказывается то iq кванты работали как говно - это все время был тупой баг, потому что жора им забыл поддержку в мое прописать... iq-квант шиз, ты рад?
Аноним 09/09/26 Срд 08:16:09 #86 №1699714 
>>1699700
Шапка говно и, откровенно говоря, наделала вреда многих запутав и оставив без надежды.
Давай разберём по частям%
лламацпп - "отец и мать" окей. Вот только это красноглазить придётся ведь.
кобольдцпп - "самый простой в использовании"? Да пошел ты сука нахуй ублюдок!
текстген - "если необходимы другие форматы"? какие нахуй другие форматы, ублюдина? текстген это просто удобная оболочка над лламой. Ставить туда что-то кроме лламы - надо красноглазить. НО. текстген это реально самый простой и "однокнопочный" инструмент сейчас под шинду
оллама, лмстудио - параша, которая лично у меня заглючила и ушла в тормоза. на двух разных пк (вин10 и вин11)! нахуя они нужны? там нет персонажей, нельзя нормально порпшить. кодинг нужен, не рп? окей, где сука в твоей шапке ебучей бионик студио например? где гайды по экстеншонам для визуал студии? пидорас

маринара - "вариация на тему таверны"? маринара это УБИЙЦА таверны. это мегатоп. самое главное отличие не упомянуто: агенты, которые можно добавлять без всяких там экстеншнов (хотя экстеншны тоже есть).

мобилки? кому они нахуй нужны, что ты там запустишь блядь. бред.

хуггинфейс у тебя "поставщик моделей во всех форматах?" какие нахуй форматы тебе нужны? почему ты про ггуф не сказал пидор? нахуя ты людей запутываешь?
"проверенные квантоделы"? какие квантоделы. объясни в двух словах сука ты. кто у тебя радермахера проверял? чего это он вдруг стал "проверенным"? уверен что говна за ним не замечено?

объясни ты сучара просто что есть блядь базовые модельки которых на пальцах пересчитать вообще-то, объясни их сильные стороны и объясни что есть тюны, аблиты и прочее говно. и всё сразу станет на свои места

"неактуальные списки моделей" - ну спасибо сука удружил. какие-то нахуй "миксы от тредовичков" с покалеченными мистралями обоссаными не нужными никому.

"перевод нейронками" - пидарааасс!!! пидарасина блядь! нахуя ты вообще такое говно советуешь, ублюдок мать твою! нахуя ты вынуждаешь людей жрать говно, сеешь сомнения. новички читают это и думают "бля мне ж наверное надо переводить чтобы русик был, а то блядь у радермахера скачал сборочку дарк инглиш прозы а она ж только в инглиш может нормально. уууу

нихуя не объяснил, дал ссылки на уёбищные инструменты, запутал, напутал и как итог имеем кучу потеряшек и разочаровашек в каждом треде
Аноним 09/09/26 Срд 08:25:05 #87 №1699720 
>>1699714
Ты не лучше шапкошиза.

Че там заглючило, хуй тебя знает. Нахуй какие-то персонажи нужны в оболочке для жоры. Ты запускаешь модели в ней и даешь таверне ссылку. Это же, блять, бэкенд.

Хотя у меня похожий экспириенс был с Анслоп студией, не дай б-г еще раз это попробовать. В ней интерфейс с какими-то задержками работал, сырая и недопиленная штука

> текстген
Видимо EXL3 имеется в виду, но если посмотреть на даты апдейтов текстгена - его походу вообще бросили, а вот EXL3 живет и развивается отдельно с ебучим TabbyAPI
Аноним 09/09/26 Срд 08:27:04 #88 №1699723 
>>1699132
На APEX-I-Nano у меня MTP работает. 35-40 токенов выдает
Аноним 09/09/26 Срд 08:31:45 #89 №1699729 
>>1699720
У меня сложилось впечатление, что здесь в треде есть некая группа ебанутых, которые думают, что когда кто-то юзает
> koboldcpp
> lmstudio
> unsloth studio
> textgenwebui
они буквально считают, что человек чатится с ботом внутри этих штук, не пользуясь таверной.

Почти всегда стоит только написать, что ты модельку запускаешь не с голозадым жорой, а в каком-нить софте с гуи/веб-уи, обязательно вылезает хотя бы одна паскудина и пишет
> лол таверну попробуй
??????? че епта
Аноним 09/09/26 Срд 08:32:40 #90 №1699730 
а че кто то реально шапку читает?
Аноним 09/09/26 Срд 08:36:19 #91 №1699733 
Люди очнитесь мы же буквально жрём нейрослоп, вот прям в чистейшей форме. Почему об этом все молчат?
Аноним 09/09/26 Срд 08:37:26 #92 №1699734 
>>1699733
Да. Минусы?
Аноним 09/09/26 Срд 08:39:28 #93 №1699737 
>>1699714
Сделай новую принеси в тред, обоссым поправим и будем юзать че. Все исключительно в добровольном порядке.
Аноним 09/09/26 Срд 08:43:38 #94 №1699739 
>>1699720
> Нахуй какие-то персонажи нужны в оболочке для жоры. Ты запускаешь модели в ней и даешь таверне ссылку. Это же, блять, бэкенд.
Ага. Бекенд с интерфейсом где ты можешь выбрать модель удобно, как человек, а не как красноглазик. Проблемы? Таверна дружит с текстгеном прекрасно. оообабуга имеется в виду.
Аноним 09/09/26 Срд 09:02:01 #95 №1699745 
>>1699663
Дс4
Аноним 09/09/26 Срд 09:02:25 #96 №1699746 
>>1699288
Привет. Я тоже энтузиаст-экспериментатор. Сейчас готовлю Luqwen4.
Короче тебе надо разбить диалоги на связанные цепочки user-assistant в ChatML формате. Самое простое - по времени между сообщениями ну или можно проверять связанность сообщений локалкой.
Аноним 09/09/26 Срд 09:03:48 #97 №1699747 
image.png
Я пикрил ни на что не променяю. После того как все аргументы жоры открыли, чувствуешь себя как белый человек среди негров, особенно когда надо две-три модели запустить. Тупо всё под рукой, логи-хуеги-параметры, статус работы. Не знаю че тут так некоторые с этого бахают, может вообще не нашли как серверную панель открыть и видят перед собой только чатик, хуй их знает.
>>1699739
В новом текстгене что-то изменилось по сравнению с текстгенвебуи? Последний был, мягко говоря, странноват. Пробовал, ловил запашок любительского проекта - сыренько было.
Аноним 09/09/26 Срд 09:04:48 #98 №1699748 
>>1699611
Давай продолжение
Аноним 09/09/26 Срд 09:13:34 #99 №1699751 
>>1699491
В каких квантах ггуфы? Сколько врам (какая видяха)? В каком квантовании контекст?
Аноним 09/09/26 Срд 09:21:13 #100 №1699757 
>>1699748
Там стыдное
Аноним 09/09/26 Срд 09:28:06 #101 №1699760 
>>1699757
Тут все свои.
Аноним 09/09/26 Срд 09:44:56 #102 №1699765 
>>1699714
Че за модель?
Аноним 09/09/26 Срд 09:45:00 #103 №1699766 
>>1699747
Хз о чём ты. Текстген это и есть вебуи. Да, там аппка открывается но в ней просто браузер. Ты можешь её закрыть и открыть в обычном браузере 127.0.0. что-то там. А на 5000 порту крутится сама модель с openai api. Настроек там тоже хватает, но логи в командной строке. Мб твоя хуйня и удобнее, но у меня она не взлетела.
Аноним 09/09/26 Срд 09:46:02 #104 №1699767 
>>1699766
>Хз о чём ты. Текстген это и есть вебуи.
Автор срал на реддите что сделал СУПЕР КРУТУЮ НОВУЮ ПРИЛОЖУХУ. Вот о чём. То есть он нихуя не менял?
Аноним 09/09/26 Срд 09:57:58 #105 №1699775 
image.png
Че этот псих с музой делает?
Аноним 09/09/26 Срд 10:17:55 #106 №1699780 
>>1699747
Раньше там было не очень удобно, что настройки были спрятаны. Для новичка удобно, но если уже держишь в голове набор настроек, то надо было лезть отключать строгость загрузки моделей, и только после этого вроде открывались подменюшки с нужными параметрами. Ну и модели надо было в специальной папке держать. Сейчас не знаю, как с этим. Как-то обсуждали, что студия якобы даёт скорость быстрее кобольда, но у меня лично получалось медленнее.

Вообще софтина развивается. Если бы шиз с угабугой попытался её юзать пару лет назад, когда не было портэбл версии, то обосрался бы на моменте установки, когда она вылетала из-за отсутствия совместимости каких-нибудь пакетов. И потом рассказывал бы тут, какой этот текстген говно. Хотя уга всегда была нужна только для того, чтобы катать не ггуф модели фулл врам. Я хз, зачем её и сейчас использовать.
Аноним 09/09/26 Срд 10:21:50 #107 №1699781 
>>1699737
вот можешь обоссать
https://pastebin.com/raw/dMegZttf
Аноним 09/09/26 Срд 10:22:41 #108 №1699782 
>>1699611
бля у неё хуй
Аноним 09/09/26 Срд 10:28:45 #109 №1699785 
image.png
Слоп-тест MiniMax M3, 4-битный. А то вчера жаловались, что скринов ИТТ мало.

Инпут - смесь из провокационных тем, мерзость типа крови-жестокости-куколдинга + попытка рулить действиями {{char}}.
>{%- set thinking_mode = "disabled" -%}
jinja одинакова на обе модели, семплер рекомендованный, промпт один и тот же.

Длина ответов получается плюс-минус случайная, обе модели могут генерировать короче/длиннее друг друга.
Русский язык может протекать в диалогах одинаково, в этом тоже разницы тоже нет.
Я немного удивился, увидев "my little cunny" в ответе оригинальной модели.

Оригинал: https://huggingface.co/AesSedai/MiniMax-M3-GGUF/tree/main/Q4_K_M
Аблитка: https://huggingface.co/m9e/MiniMax-M3-uncensored-RP-LC-Q4HQ-GGUF
Аноним 09/09/26 Срд 10:31:08 #110 №1699788 
>>1699785
Оригинал в отрицание входит. А еще говорят, что аблитки не нужны... Банально не уважает повествование юзера.
Аноним 09/09/26 Срд 10:31:45 #111 №1699789 
>>1699785
Ммм, структурные лупы такие структурные лупы
Аноним 09/09/26 Срд 10:32:54 #112 №1699790 
>>1699785
Пишет ничем не лучше геммы4. И зачем качать тогда такие огромные файлы, хз.
Аноним 09/09/26 Срд 10:34:16 #113 №1699791 
>>1699789
С ними только сменой моделек бороться. Нагенерил, свитчнулся, нагенерил, опять сменил на другую. И то вряд ли поможет.
Аноним 09/09/26 Срд 10:35:23 #114 №1699792 
>>1699791
Их на Гемме и Квене можно победить инструкциями в одно два предложения, лол
Аноним 09/09/26 Срд 10:36:54 #115 №1699793 
>>1699781
Сяб.
1. Если это шапка, она должна содержать минимум блаблабла и конкретные ссылки. Проще говоря быть информативной.
В ОП посте не смотря на актуальность всё понятно и структурировано, у тебя же каша из всего и отовсюду.
2. Если это гайд - должны быть сначала раскрыты термины.
3. Отсутствует структура, ты прыгаешь с одного пункта к другому смешивая всё в огромный котёл.

Крч, спасибо за старания, но сначала определись ЧТО ты хочешь написать. Гайд для вката? Сделать общую недовики? Описать модели? Интерфейсы?
Аноним 09/09/26 Срд 10:41:27 #116 №1699795 
>>1699790
Как по мне, какой-то качественный скачок начинается с больших ГЛМов. Но там скорость пиздец даже на том железе, где они влезают.
>>1699792
Гемму знаю как свои пять пальцев, у нее проблем хватает - на русском языке, например, может в кавычки заключать слова и создавать из них клички для юзера
> Ах ты мой "скотоублюдок", ну как там у моего "скотоублюдка" дела?
Ты один раз неудачно пукнул в чате и гемма этот пердеж подцепит и будет из этого строить паутину бреда, не забыв добавить ассистентский подсос-вопрос под конец ответа.
Аноним 09/09/26 Срд 10:42:19 #117 №1699796 
>>1699793
>Сяб.
Хуяб
>1. Если это шапка, она должна содержать минимум блаблабла и конкретные ссылки. Проще говоря быть информативной.
Ты скозал? Да, ссылки надо добавить, мне лень.
>В ОП посте не смотря на актуальность всё понятно и структурировано, у тебя же каша из всего и отовсюду.
Хуировано там и нихуя не понятно. А я логично и плаввно ввожу свою кашу.
>2. Если это гайд - должны быть сначала раскрыты термины.
Не всё сразу. Кто захочет знать больше дочитает до конца. Вначале основное, это и есть структура.
>3. Отсутствует структура, ты прыгаешь с одного пункта к другому смешивая всё в огромный котёл.
У тебя в мозгах блядь отсутствует структура.

>Крч, спасибо за старания, но сначала определись ЧТО ты хочешь написать. Гайд для вката? Сделать общую недовики? Описать модели? Интерфейсы?
Я написал новую шапку, ебанашка, осталось минимально подправить. Можно придираться, можно сказать она не идеальна, но та что сейчас в ОП-посте хуже в сто раз.
Аноним 09/09/26 Срд 10:43:12 #118 №1699797 
>>1699796
Ну и идешь ты нахуй, долбоёб.
Аноним 09/09/26 Срд 10:43:33 #119 №1699798 
>>1699795
нехуй аблит потому что дрочить
в любом случае такая хуйня лечится промптом
Аноним 09/09/26 Срд 10:44:08 #120 №1699799 
>>1699797
Зашивай пукан, лолка)
Аноним 09/09/26 Срд 10:46:05 #121 №1699800 
>>1699795
>у нее проблем хватает
Я и не писал, что их нет. Но зачем ты соскочил с темы структурных лупов на другую?
>может в кавычки заключать слова и создавать из них клички для юзера
>гемма этот пердеж подцепит и будет из этого строить паутину бреда
Это на самом деле проблема навыка. Как переехал на нарраторский промпт не вижу таких проблем
>не забыв добавить ассистентский подсос-вопрос под конец ответа.
Прямо как на 3a, 1b, 2b?
Аноним 09/09/26 Срд 10:48:19 #122 №1699802 
>>1699796
Это не новая шапка, это куча верований и убеждений с мнениями. Одного упоминания
> APEX кванты
достаточно для вынесения диагноза: ты просто обычный юзер, подверженный рекламе говна

На HF можно открыть GGUF файл и посмотреть точность тензоров. Рецепты всегда разные, никакие васянские наименования не делают квантизацию особенной и чем-то уникальной, всего лишь меняется собственно что там навасянили. И учить ньюфагов надо этому, а не громким именам, высранными "лабораториями" из одного индуса и его агента.
Аноним 09/09/26 Срд 10:54:31 #123 №1699804 
>>1699785
Ёбаный ужас. Без иронии спасибо что запостил, у меня на 26б результаты лучше. Думал, что я упускаю что-то в моделях побольше, но пока никто не показывал обратного.
Аноним 09/09/26 Срд 10:56:11 #124 №1699805 
>>1699800
>не вижу таких проблем
Можно пузо отрастить и собственного хуя не увидеть. В ситуациях, где у г4 будет возможность зацепиться за прозвище - она это сделает. В ней жестко заложена эта предрасположенность, возможно коррелирующая с идеями подъеба юзера при условии заложенных в карточку черт характера, открывающих стёбный потенциал, язвительность и т.д. В общем, худший бич модели, если дать ему проявить себя. Еще она любит выражать вот такое
> ты опять вошёл в режим ...
> ты снова в своем режиме ...
Например, юзер сообщал чару, что занимался ремонтом комплюхтеров, ел шаурму и дрочил на хентай. Это просто breeding ground для слоп-фразочек типа "ну что, ты там еще в своем режиме хентайщика/компьютерщика/шаурмиста?"
>>1699798
Обижаешь. Аблитка геммы единственная рабочая и нужная была во времена г3 27б, норм-презерв которая
Аноним 09/09/26 Срд 10:57:02 #125 №1699807 
>>1699781
Про убабуга написал, про кобольд и lm studio не написал. Убабугу не юзал, но думаю они все однохуйственные и просты для новичка, для ассистента не нужны даже всякие таверны и маринары, можно уже пользоваться после установки этих хуен.
>3 (кодинг-агенты) - LM Studio Bionic
не пробовал, но мб для нубов можно оставить, а так llama.cpp + deepseek harness/pi/opencode
Еще дописать, что для кодинга надо контекст 100к+
web-ui есть и в llama.cpp, про ollama лучше просто написать, что это говно и ни для чего не нужно.
>Красноглазик? llama.cpp пиши конфиг ручками.
Спермоблядок, ты охуел. Под линуксом llm работает лучше и быстрее. Вообще гайд в первую очередь должен описывать запуск на linux через llama.cpp, а потом уже всякую однокнопочную залупу под виндой, для тех, кто не осилил нормальный способ.
Список моделей твой - полное говно.
Во-первых версии не указаны, во-вторых
> Nemotron - неплохой кодинг
Совсем ебанулся?
В третьих, где deepseek v4 flash?
Аноним 09/09/26 Срд 10:58:27 #126 №1699809 
У меня вопрос. Может, кто-либо сталкивался с подобным. Использую lm studio 0.4.23. Подбирая настройки запуска модели (кроме сэмплинга), я задаю один и тот же бытовой вопрос и смотрю, сколько времени модель тратит на размышления, сколько токенов сжигает, на скорость генерации. Так вот, обычно содержание ответа/количество потраченных токенов не меняется (в смысле варьируется в определенных пределах). Хоть 10 раз один и тот же вопрос задавай (ессно в новых чатах, с выгрузкой и загрузкой модели). Но попытавшись запустить один херетик квена 3.8 https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF/ , заметил, что в какой-то момент он стал как бы стал подхватывать проебанную разметку из предыдущих чатов (один раз ошибся и стал повторяться, несмотря на одинаковый сэмплинг, выгрузку и загрузку перед началом новых чатов). Но этот херетик я все-равно снес потом ибо много других вещей не нравилось. Однако, теперь решил в это скачать - https://huggingface.co/orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

А теперь следите за руками:
1) iq4xs - время размышления 5 мин - 2075 токенов
1) q5km - время размышления 10 мин - 2107 токенов (чуть более систематизированный ответ в общем по сравнению с первым)
2) (изменил настройки запуска) q5km - время размышления 2 мин - 699 токенов (ответ сильно упрощен, хотя вся логика и важные аспекты сохранены)
3) (вернул настройки запуска обратно) q5km - время размышления 2 мин - 645 токенов

Что за хуйня? К сожалению, не могу сказать, что это именно вина моделей ибо перед этим обновился. Но блин, квена научили подглядывать в логи предыдущих разговоров или что?
Аноним 09/09/26 Срд 10:59:52 #127 №1699810 
>>1699807
>кобольд
Тупо не нужен. Чтобы всё нахуй перезапускать и ждать если хочешь поменять модель или конфиг? Интерфейс убожество лютое. Недотаверна какая-то.
Аноним 09/09/26 Срд 11:01:09 #128 №1699811 
>>1699805
В голос. Мы вроде структурные лупы обсуждали а не
>Можно пузо отрастить и собственного хуя не увидеть
Ты похоже уже отрастил, вместе с животом заплыл мозг
>худший бич модели, если дать ему проявить себя
Так не давай. Проблема то в чем? У каждой модели свои нюансы есть. Но видеть такой шлак на 400б модели в 4.3-4.5bpw это треш. Структурные лупы, переход с русского на английский посреди респонса, разные времена блять (ахаха только увидел)
Аноним 09/09/26 Срд 11:01:57 #129 №1699812 
>>1699809
Твой 1й шаг - попробовать либо голую llama.cpp (запуск в командной строке) либо другую обертку типа кобольда, анслот студии или еще чего. Если там вновь проявится наблюдаемая проблема - значит дело либо в самом ггуф файле, либо в настройках. Общем сначала исключить надо потенциальную связь со средой, в которой ты модель запускаешь. Остальное само прояснится постепенно, тупо выяви кто где насрал. В конце концов найдешь коричневое в собственных штанах или в штанах автора ггуфа

мимо в суть не вникал
Аноним 09/09/26 Срд 11:04:12 #130 №1699813 
>>1699811
>Мы вроде структурные лупы обсуждали
А мне казалось, мы просто об этаких обобщенных косяках говорим. Структурные, не структурные - очевидно же, что какие-то косячки проявляются лишь в благоприятных для них условиях. Как вот можно "не давать", если персонаж должен стебаться над юзером и высмеивать его. Ну не справляется гемма с таким, не ударяясь в описанное ранее. Ты, я вижу, просто хочешь чтоб всё выглядело идеально - я это понимаю, сам 31B Q8 няшу люблю.
Аноним 09/09/26 Срд 11:06:04 #131 №1699815 
>>1699804
С посвящением. Кодоунитазы среднего размера, несмотря на превосходство в бенчмарках, задачу по ролевым чатикам выполняют в лучшем случае одинаково с мелочью... Увы и ах, но это неудобная правда
Аноним 09/09/26 Срд 11:08:15 #132 №1699817 
>>1699812
Смысл в том, что обычно модели выдают ответ примерно одинаковой длины и сложности с одним и тем же сэмплингом, но разными параметрами загрузки в разных чатах. А тут начали происходить аномалии, количество токенов упало в 3 раза, сам ответ сильно упростился, как-будто я изменил настройки сэмплинга но я их не трогал.

Ну ок, попробую полный траблшутинг.
Аноним 09/09/26 Срд 11:08:55 #133 №1699818 
>>1699781
Говно говна, для шапки жирно, как гайд хуёво.
>кодинг-агенты
Этих вообще в их агентотред посылать, тут они не нужны.
Аноним 09/09/26 Срд 11:10:05 #134 №1699819 
>>1699807
>linux
>deepseуk
Молодой человек, это не для вас гайд написан, а для народа. Вы и сами разберётесь.
Аноним 09/09/26 Срд 11:12:14 #135 №1699821 
>>1699780
>Ну и модели надо было в специальной папке держать
Сейчас так и осталось, но я не очень вдупляю в чем проблема выделить папку под них. Неужели местные ботоводы держат свои какулечки в какой-нибудь appdata/huggingface или куда там по дефолту оно загружается через CLI? Это же хуже, чем отдать C:/models для студии.
Аноним 09/09/26 Срд 11:12:51 #136 №1699822 
>>1699818
А в шапке не говно, да? ОП детектед
Аноним 09/09/26 Срд 11:23:08 #137 №1699832 
>>1699813
>Как вот можно "не давать", если персонаж должен стебаться над юзером и высмеивать ег
Давать Гемме больше контекста для работы, а не единственное описание юзера "у него отрощенное пузо и он не видит собственного хуя", тогда она будет судорожно пытаться называть тебя "аглибастард-сан" а займется чем-нибудь другим. В крайнем случае вырезать, регенить
>Ты, я вижу, просто хочешь чтоб всё выглядело идеально
Да нет же. Когда у тебя модель путает времена и переключается с языка на язык посреди респонса, это не вопрос того как оно выглядит. Это вопрос пригодности модели для таких задач. То что она больше Геммы в 13 раз оставим за скобками
>>1699815
Тут налицо проблема навыка и(или) модели. Inkling Small, Motif, Hy4, Mimo (в sfw) вполне неплохие. Другое дело, что разница не настолько велика, что у тебя взорвется мозг и после этого Геммой уже не захочется пользоваться. Тут рпзависимые драматизируют
Аноним 09/09/26 Срд 11:23:42 #138 №1699833 
>>1699832
>тогда она не будет
офк
Аноним 09/09/26 Срд 11:33:05 #139 №1699836 
>>1699819
Так как раз под базовые инструменты запуска нужен гайд, а где одну кнопку нажать гайд не нужен, и так все понятно, достаточно упоминания и все
Аноним 09/09/26 Срд 11:33:07 #140 №1699837 
>>1699822
В шапке говно. У тебя говно говна. Это разные говна.
Аноним 09/09/26 Срд 11:42:31 #141 №1699843 
image
Признавайтесь кто из вас
Аноним 09/09/26 Срд 11:58:42 #142 №1699857 
>>1699807
>гайд
>для линуксоидов
Хехмда
Аноним 09/09/26 Срд 12:03:09 #143 №1699861 
Какая из uncensored моделей лучше всего справляется с написанием текста (и влезет в 12gb VRAM + 32gb RAM)?
Пробовал qwen 3.8 27B (Q4_K_M), но он пишет не прозу, а какую-то инструкцию к газовой плите будто там температура 0.2
Аноним 09/09/26 Срд 12:05:18 #144 №1699862 
>>1699861
Гемма по гайду в шапке
Аноним 09/09/26 Срд 12:12:26 #145 №1699867 
>>1699861
Сток гемма, аблит дикпика
Аноним 09/09/26 Срд 12:15:28 #146 №1699872 
>>1699792
Какими, например? Я как-то мое гемму пытался скриптом-агентом заставить найти и исправить it's not x but y в ответе на русике, подавая в контекст только несколько последних сообщений. Она даже так могла только самые простые отловить иногда. А более общие структурные лупы вообще не поймёт. Например, когда есть одинаковое по смыслу действие перса, скажем, связанное с тем, что тян поправляет причёску. И оно каждый ответ тянется после реплики. Таких кейсов можно огромное множество заметить. Или зацикливание на фразочках/инструкциях, как чел выше в пример привёл. Не вижу, как инструкции в систем промпте тут помогут.
>>1699810
В треде были челы, которым нравился вебуи кобольда. На вкус и цвет все фломастеры разные. Олсо мне казалось, что я видел в ченджлогах, что разрабы добавляли смену модели в свой юи без перезапуска. Я то себе батников наделал и юзаю тупо как ламуцпп. Не знаю, почему не перейду на ламу, просто привык.
Аноним 09/09/26 Срд 12:19:30 #147 №1699873 
image
>>1699861
Пока что топчик в плане мозгов и креатива, тебе влезет в 4 кванте. https://huggingface.co/mradermacher/Midnight-Miqu-70B-v1.0-GGUF

Троллей, которые будут гемму советовать не слушай, это местный фингербокс.
Аноним 09/09/26 Срд 12:28:30 #148 №1699881 
>>1699873
Вчерашний Кобольд проснулся?
Аноним 09/09/26 Срд 12:34:27 #149 №1699889 
>>1699872
>it's not x but y
Это не структурный луп, это форма слопа. Если тянется из респонса в респонс, тогда это репетишен
>зацикливание на фразочках/инструкциях
Бля я хуй знает что вы делаете чтобы так обсираться, я пару тредов назад принес логи на русике, на Гемме, где нет никаких этих проблем. Мне уже даже впадлу это обсуждать, сорян
Аноним 09/09/26 Срд 12:35:40 #150 №1699892 
Олсо до сих про жду мистралешизика, который в ночь на 5 сентября грозился, что завтра принесет логи. Сейчас 9 сентября. Ну хотя бы притих и не семенит больше, про то как его лоботомит 2024 года до сих пор аналоговнет. Похоже взглянул таки на свои аутпуты и ахуел с лупов и репетишена
Аноним 09/09/26 Срд 12:40:28 #151 №1699895 
>>1699881
Не, ну а чего вы над новичком рофлите? Ну не хочет человек список актуальных моделей из шапки штудировать, спросил в треде, нет бы помочь, посоветовать модель годноту под его железо, а вы издеваетесь.
Аноним 09/09/26 Срд 12:45:08 #152 №1699899 
>>1699700
Лолама млх добавили так-то, но из однокнопочных выписывать рано. Так и с лмстудио, хотя появилась возможность условно залезть капот, остается странным блоатвером, где всратый интерфейс, свой квант нужно ДОБАВЛЯТЬ и так далее.
>>1699714
Чето большая часть "разрешите доебаться" или спорная. Менять надо, но ты тоже херни навалил
Аноним 09/09/26 Срд 12:49:17 #153 №1699901 
>>1699843
Я
Аноним 09/09/26 Срд 12:54:07 #154 №1699906 
>>1699729
Про кобольдов слышал? Еще хвастаются этим и топят за удобство интерфейса.
>>1699747
Удобство лмстудии для новичков - ну ок, параметры были всегда доступны в голой ламе. А это выглядит как попытка усидеть на двух стульях.
Если без гуйнюшки совсем тяжко - есть десятки готовых минималистичных вариантов, или можно самому за 10 минут красивую завайбкодить. Зачем качать бинарники с вишнями и иметь перегруженное окно с кучей других ограничений и своей парадигмой использования?
Аноним 09/09/26 Срд 13:13:02 #155 №1699915 
>>1699785
Что-то ему там совсем плохо, аблитка так вообще поломана. Там раньше пр на атеншн минимакса в драфте был, его уже замерджили?
>>1699781
Двачую остальных и в особенности >>1699802 Это и не шапка и не гайд, а поток сознания с местами сомнительным содержанием.
>>1699809
Если хочешь нормально бенчить:
1. Для ггуфов вместо обертки берешь llamacpp, там среди бинарников есть llama-bench. Можно сразу сравнительные таблицы делать варьируя параметры.
2. Если без оболочки никак, или когда хочешь протестировать любой другой бэк или не хочешь отказываться от лмстудии - https://github.com/eugr/llama-benchy Функционал схожий, но замеры делает через api.
Есть еще бенчилка из комплекта vllm, но она рассчитана на замеры множества конкурентных соединений со смешанной нагрузкой, для личного пользования в чатике будет неинформативна.
>>1699817
Модель останавливается тогда когда считает нужным. Можешь зафиксировать в настройках максимальную длину (1к токенов) и забанить eos токен чтобы модель не могла остановиться. Но лучше замеряй по-нормальному.
>>1699818
> в их агентотред посылать
Правильно. Пусть зайдет туда и расскажет как он кодит с агентами из лмстудио, вот умора будет.
Аноним 09/09/26 Срд 13:30:50 #156 №1699931 
>>1699899
>>1699906
Мне кажется вы лмстудией или не пользовались и с дивана рассуждаете, или просто относитесь к "ой фу это плохо" челипиздрикам, которым лишь бы хрюкнуть и пукнуть в адрес неприятного.

Bloatware аргумент вообще дико выглядит, учитывая то, как мало фич вообще было (и за отсутствие фич как раз ее ругали, лол). Там буквально нет ничего лишнего, ни рекламы, ни вот этой хуеты с карточками и персонажами как пытаются налепить в гибридные бэкенды+фронтэнды. Хочешь карточки - юзай таверну, а тут тебе только чат-окно для быстрого теста модельки и серверная вкладка с адресом и логами.

Кванты добавлять - в смысле добавлять? Кинул ггуф в папку и все работает. Ну может тяжело с дивана сообразить, что путь к нему должен содержать -GGUF в названии, без этого не работает (вау, шок!). Например C:\\модели\Gemma-4-it-GGUF\сами ггуфы внутри - никаких маняконфигов прописывать не надо, даже перезапускать не надо, буквально сию секунду в GUI становится видна модель как ты ее кинешь.

Могу сравнительно кинуть какахой в того же кобольда, которому для каждой модели надо отдельно сохранять файлик с профилем, выбирать его для загрузки... Не ребят, если вы считаете это более удобным - вы реально промытки-хейтеры.
Аноним 09/09/26 Срд 13:32:53 #157 №1699935 
>>1699915
>Что-то ему там совсем плохо, аблитка так вообще поломана. Там раньше пр на атеншн минимакса в драфте был, его уже замерджили?
Давно замержили. А с чего ты там поломанность-то увидел. Это же разные генерации. Я чет ответы почитал на пост и стало казаться, что тут подумали будто модель по 3 раза подряд одинаково отвечает. А это просто регены на скрине, на один и тот же промпт.
Аноним 09/09/26 Срд 13:33:27 #158 №1699937 
>>1699889
Это именно что структурный луп, потому что это не фраза, которая повторяется слово в слово или с небольшими изменениями, а структура с противопоставлением. Литературно предыдущее предложение - как раз оно. Или вот свежее из рп с лолей-призраком "Her skin is no longer just a light; it has a texture, a softness, a warmth that is terrifyingly real." Это тоже оно. Это противопоставление может быть по десять раз за ответ про разные вещи. Удачи вымарать такое инструкциями. Во всех тьюнах 26б оно сидит.
Аноним 09/09/26 Срд 13:34:59 #159 №1699941 
>>1699889
Ага, а промпт не выложил, хуило.
Аноним 09/09/26 Срд 13:37:02 #160 №1699943 
image.png
>>1699931
Сама борда подразумевает выбор в пользу свободы и попенсорса, так ведь еще и сидят в тематике, которая именно про это - про открытые веса, про попенсорс. Но нет, даже здесь находятся такие ебанутые. Паверюзер попенсорс тематика. Ряяя, хотим красивый вайбкод UI и анально закрытые исходники!!! НЕЕЕТ ВЫ НЕ ПОНИМАЕТЕ, НЕ СМЕЙТЕ ОСУЖДАТЬ!!!!
Аноним 09/09/26 Срд 13:40:34 #161 №1699945 
>>1699937
>а структура с противопоставлением
Это часто используемый паттерн, в независимости от уместности в контексте и вообще. Значит слоп
Структурный репетишен это когда ответы сетки повторяют предыдущие по количеству абзацев, их началу, смысла
Самый частый структурный репетишен/луп выглядит так
"The/She [экспозиция на абзац]
[Эхо-абзац, где чарик переспрашивает]
[Ответ по сути]
[Закрывающий ассистентоабзац, оканчивающийся на "Tell me/show me" или вопросе]
>>1699941
И правильно сделал. Готов обсуждать конкретные проблемы, вопросы, помогать разбираться, а выкладывать готовое - хуй. Особенно таким невежам
Аноним 09/09/26 Срд 13:40:46 #162 №1699946 
>>1699943
Вот только ты все извращаешь и по факту пикрил это поклоняющиеся сырому CLI-жоре. Буквально визжите и орете против удобства, врёте, выдумываете несуществующие проблемы, ищете шпионов под кроватью и пытаетесь отбить интерес ньюфагов от удобных оберток для жоры - а они вас не слушают и довольно урча юзают всякие студии, даже анслопские.

Самый смех это повизгивания про бэкдоры и трояны. Прям трясусь от страха - особенно если учесть, что мой ллм-сервер к интернету не подключен и я кидаю на него все с основной машины из локалки.
Аноним 09/09/26 Срд 13:43:21 #163 №1699948 
>>1699781
Лучше вообще не делать, чем делать вот так на отъебись.

>>1699931
Студия - закрытая проприетарная залупа. Что там она умеет или не умеет уже и похуй как-то.
Аноним 09/09/26 Срд 13:43:47 #164 №1699949 
>>1699946
>визжите и орете против удобства, врёте, выдумываете несуществующие проблемы, ищете шпионов под кроватью и пытаетесь
Как я завидую тем, кто готов обобщать всех и вся. Наверняка им легче жить
По факту есть несколько групп людей, у которых совершенно справедливые претензии к этому помоечному софту. Про бекдоры проиграл, впервые про это слышу, в последних тредах не было таких обсуждений. Но совсем не удивлюсь
>пикрил это поклоняющиеся сырому CLI-жоре
Угу, тому, который лежит под оберткой твоей распрекрасной ЛмСтудии. По факту вам даже гайдик написали, предоставили готовое решение где нужно только значения заменять, но даже это слишком сложно. Что забыли в тематике - неясно. Или ты из тех умников, которые приходят на форум Линукса рассказывать, что нужно переезжать на Винду?
Аноним 09/09/26 Срд 13:44:19 #165 №1699950 
image.png
image.png
image.png
image.png
>>1699785
>>1699915
Еще аблитка М3, та же самая, но другой сиспромпт.

Хентайный сценарий доведенного до абсурда фистинга.

Если честно, я чет персонажа в этом не чувствую. И вообще ""You're incorrigible" - обоссы меня господь, со времен Llama 3 8B и DeepSeek V3 вижу эту фразу, когда боту нечего сказать.
Аноним 09/09/26 Срд 13:48:53 #166 №1699951 
>>1699949
А зачем мне сырого жору использовать, ты логически внятно объяснить можешь? Кроме "ррряяя тебя обманут, у тебя все украдут, это закрытый .exe"

Просто логика психозная, типа я че, не должен вообще никакой закрытый софт юзать? Прикажешь мне игрульки с Пека удалить? Они как бы все с анальными-зондами античитами, следящей китайской гэбней и всё такое.

Рили доебываетесь на пустом месте. Сам же говоришь, что в студии та же самая жора - признаешь, что одна хуйня - но жора с GUI удобнее жоры без GUI, если ты не мазохист. А когда GUI отлично работает и действительно удобен на практике (ставлю акцент на практику еще раз - у хейтеров, которые не пытались юзать, практического опыта нет - они просто видят красную тряпку как быки и орут), то здоровый адекватный человек выберет именно GUI.

покормил линуксоида, да я еще и винду юзаю - терпи
Аноним 09/09/26 Срд 13:53:57 #167 №1699957 
image.png
Блять, кто там подпездывает что таверна не развивается?
Все там развивается в стеджинге, просто в релиз пока еще мерджили.
https://github.com/SillyTavern/SillyTavern/tree/staging
При желании можно свитчнуться на эту ветку.
Аноним 09/09/26 Срд 13:54:50 #168 №1699960 
Более того, каждый раз чето там компилировать, держать visual studio и прочий шлак на компе - это же гигапердольно
Аноним 09/09/26 Срд 13:55:24 #169 №1699961 
image.png
>>1699951
>ты логически внятно объяснить можешь?
Конечно. Проблема в том, что ты не спрашивал. Как удобно :^)
ЛмСтудия использует свой форк ЛламыЦпп. Что это значит на практике? То, что туда позже заводят поддержку новых моделей, фиксы, фичи. Это задержка от нескольких дней до нескольких недель. Плюс там есть свои разработки, и уже был один большой ЛмСтудия срач когда Гемма на ней работала как говно, и сидящие здесь хлебушки не понимали что происходит и продолжали серить. Потому что там жинжа-парсер (знаешь хоть что это?) инжектил стоковый сейфти промпт, что приводило к рефузам. Это только один пример. Все это сводится к тому, что вы получаете еще один нестабильный слой-надстройку над уже нестабильным проектом, потому что он каждый день развивается. Вопрос - зачем?
>GUI отлично работает и действительно удобен на практике
В чем он удобен когда у вас уже есть готовый гайд, в котором ты копируешь батник и заменяешь два-три значения при переходе на новую модель? Зато все прозрачно и меньше вопросов остается, где ты там обосрался и что и почему у тебя не работает. Потому что та же ЛмСтудия из коробки форсит нестандартные значения SWA (включая/выключая его, когда на Лламе он включен всегда из коробки), когда-то там вроде и контекст шифт работал, что приводило к проблемам. Знаешь что это такое хотя бы?
>покормил линуксоида
Ты не поверишь, манячка, смотри пикрил...
Придумал себе врагов каких-то, обобщил ряд проблем и недовольных в какую-то секту ненавистников. Бро, хочешь говно жрать - жри. Но не удивляйся, что эту позицию не поддерживают
Аноним 09/09/26 Срд 13:57:47 #170 №1699963 
>>1699960
Лламу не надо компилировать. И этот дурачок еще что-то там говорил про "вы не запускали, но хейтите". Потешный, потешный. Бинарники Лламы скомпилированные и готовы к использованию, это сразу же проясняется в гайде, который ты даже не открывал
Аноним 09/09/26 Срд 14:03:52 #171 №1699965 
Нихуя себе боты просрались на 70 постов, уж было думал вышло что то, - а нет, всё так же: гемма, аблитка, квен 3.8 и жиденький рейджбейт в воздух
Аноним 09/09/26 Срд 14:05:07 #172 №1699966 
>>1699961
Ну вот опять поток фантазий, застрявших в каком-то прошлогоднем видении ситуации. Бета-версию в настройках выбираешь и тебе актуальная поддержка моделей прилетает достаточно вовремя, иногда не прямо в первую минуту, но я лучше подожду день-два-три-хоть десять, лишь бы с ебатниками не пердолиться.

Гемму 4 еще приплел. Я буквально в этом треде постил как все работало прямо на релизе. Косяк там знаешь в чем был? Чтобы ризонинг работал, надо было kwargs аргумент из какой-то жопы доставать, и если ты качал ггуф от бартовского/анслота - модель тупо не получала enable thinking = true, пока не был задан конфиг по образу и подобию конфига для ггуфа от lmstudio-community.

Больше такой шизы не встречал, но кто вдуплил в чем дело - там и в первый день все ок было, не считая шизоидных баек про цензуру в новых ггуфах (это мы тут тоже обсуждали).
Аноним 09/09/26 Срд 14:05:29 #173 №1699967 
>>1699873
Miku nods
Аноним 09/09/26 Срд 14:10:57 #174 №1699972 
>>1699931
Начинал гладить хвостики с неё, пересел на чистую ламу которую могу забилдить сам, любой форк с любыми коммитами откуда угодно + простенький отдельный гуй-менеджер моделек/запуска/выгрузки
Любой энтузиаст, особенно с ригом, приходит к этому решению
Аноним 09/09/26 Срд 14:12:03 #175 №1699973 
>>1699963
>Лламу не надо компилировать
Под винду да, а на линукс надо, бтв. Но там один раз пишешь баш-скрипт (или даешь написать лмке), а дальше когда захочешь обновиться, просто тыкаешь мышкой и оно само собирается и кладется в нужную папочку без твоего участия.

Ну а вообще, чо вы до хлебушка докопались? Для таких как он ЛМстудия и сделана.
Аноним 09/09/26 Срд 14:12:15 #176 №1699974 
>>1699966
>я лучше подожду день-два-три-хоть десять, лишь бы с ебатниками не пердолиться.
То есть ты готов навесить целый огромный слой абстракции, создающий задержку поддержки и дающий целое пространство для ошибок чтобы сделать нестабильный проект ещё более нестабильным, только чтобы через Ctrl c, Ctrl v не копировать файл раз в пару месяцев и заменять в блокнотике путь и семплеры? Тяжёлый случай. Ванную деда, который недавно разобрался как компьютер то запускать, с помощью пособия из книжного
Тут как говорится потерпишь. То что ты идейный говноед не изменит ситуацию. Придёшь сюда через полгода, год, а ЛмСтудия как считалась уделом ущербных, так и будет считаться. Твои предпочтения реальность вокруг не меняют. Самым здравым будет продолжать себе жрать говно использовать и не устраивать срачи на ровном месте. Тебе нравится - и ок. Почему тебя ебет что не нравится мне это загадка
Аноним 09/09/26 Срд 14:13:32 #177 №1699976 
>>1699973
>чо вы до хлебушка докопались
Ровно наоборот. Ветку почитай, это хлебушек с чего-то решил, что есть база, а что кринж
Аноним 09/09/26 Срд 14:35:02 #178 №1699986 
>>1699857
Они, по крайней мере, привыкли гайды читать, а не игнорить...
Аноним 09/09/26 Срд 14:38:54 #179 №1699992 
>>1699943
Двачую пикчу и обсуждение ниже. Одно дело быть хлебушком и урчать себе на том, что завелось. Другое пытаться делать это нормой и агриться на несогласных.
Аноним 09/09/26 Срд 14:42:14 #180 №1699995 
1788954030851.jpg
Пошёл прогрев.
Действительно, зачем вам эти 48б активных модели когда вон 13б ничем не хуже.
Но бля, неужели их прошка оказалась АПАСНОЙ настолько что её прикрыли до соевизации
Аноним 09/09/26 Срд 14:45:49 #181 №1699997 
>>1699611
Чому форматирование распидорашено? 27b даже без промпта улавливает а тут...
Аноним 09/09/26 Срд 14:46:06 #182 №1699998 
Это не х, это у.png
>>1699931
>путь к нему должен содержать -GGUF в названии, без этого не работает (вау, шок!).
Действительно шок. Какая-то ебала и дрочь ради дроча.
>Могу сравнительно кинуть какахой в того же кобольда, которому для каждой модели надо отдельно сохранять файлик с профилем, выбирать его для загрузки...
Можешь не сохранять и запускать с дефолтными 8к контекстами, кто ж тебе запрещает.
>>1699937
>Во всех тьюнах 26б оно сидит.
Во всех моделях, включая корпоблядей.
>>1699951
> Кроме "ррряяя тебя обманут, у тебя все украдут, это закрытый .exe"
Почему кроме? Это полностью валидный аргумент.
>Они как бы все с анальными-зондами античитами
Без обобщений. В моём киберпанке даже ДРМ нету.
>>1699961
>и уже был один большой ЛмСтудия срач
Кстати, я уже не помню, это разве не они выкатили поддержку гпт-осс нулевого дня, а потом заменили её на жоровскую, оставив кучу народа с нерабочими ггуфами?
Аноним 09/09/26 Срд 14:46:44 #183 №1700000 
Тут самый интенсивный тред по гейткипингу. Местные деды пытаются запугать нубасов, требуют свои гайды использовать. А зачем мне гайд с костылями, если у меня и так все работает. Сорт оф "иди сделай себе больно, потому что я так сказал".
Аноним 09/09/26 Срд 14:49:06 #184 №1700003 
>>1700000
Снова подмена понятий. Ты сам пришел в тред и требуешь использовать свою ЛмСтудию. Иди нахуй.
Аноним 09/09/26 Срд 14:51:21 #185 №1700005 
>>1699972
>Любой энтузиаст, особенно с ригом, приходит к этому решению
двачую
Правда без рига, но тоже к этому пришел
Сначала юзал LM studio на винде, запускал mistral 7b saiga. Работало медленно, модель была тупой. Потом обновил комп, стал катать gpt-oss 20b, гемму 4 26. На гемме не работали инструменты, при попытке использовать тулы все вылетало. Потом поставил линукс и llama.cpp. На gpt-oss скорость выросла с 60 до 120 токенов в секунду, гемма стала нормально вызывать тулы, стало влазить больше контекста в память.
Поэтму я считаю LM Studio заебись первый раз попробовать инференс llm. Одной кнопочкой скачал, одной кнопочкой запустил. Но если цель не попробовать, а уже нормально начать работать то только llama.cpp или еще более низкоуровневые инструменты типа vLLM и т.д.
Аноним 09/09/26 Срд 14:53:26 #186 №1700006 
Вы понимаете что нас наёбывают?
Если ни у кого нет вопросов что 1.6тр модель хуже по бенчам чем 284б модель, то почему не сделать 100б модель ещё лучше? 60б модель?
Аноним 09/09/26 Срд 14:53:27 #187 №1700007 
>>1700000
А чем нюфани лучше, которые принципиально не читают гайды, а потом задалбывают тред идиотскими вопросами, которые в этих самых гайдах разжеваны-пережеваны? И ведь еще обижаются, когда их игнорят, искренне не понимая почему так.
Аноним 09/09/26 Срд 14:55:35 #188 №1700009 
>>1700007
Сингулярность - это не когда модели уменьшаются, а когда увеличиваются.
Аноним 09/09/26 Срд 14:57:05 #189 №1700012 
>>1700003
> подмена понятий
чел пишет "юзаю студию и мне норм, хз чего ее так не любят"

в ответ НЕ НАДО ЮЗАТЬ, ЮЗАЙ ДРУГОЕ и целая тирада бабкиных слухов вплоть до искажения фактов (релиз геммыча 4 был с лмстудийными шизиками в роли пионеров-тестировщиков, пока кобольды плакали что поддержки нет)
Аноним 09/09/26 Срд 15:00:56 #190 №1700015 
>>1700012
>чел пишет "юзаю студию и мне норм, хз чего ее так не любят"
inb4 вся ветка началась с
>Мне кажется вы лмстудией или не пользовались и с дивана рассуждает
>если вы считаете это более удобным - вы реально промытки-хейтеры.
Но прочитать несколько постов выше это тебе не высраться. Всем похуй на эту лм студию, но раз в пару месяцев этот ущемленный приходит сюда и начинает срачи. В этот раз ущемился от термина "однокнопочный" в шапке.
Аноним 09/09/26 Срд 15:09:45 #191 №1700023 
>>1700009
сингулярность это когда модель любого размера умещается в один бит.
Аноним 09/09/26 Срд 15:19:49 #192 №1700030 
>>1700006
Квен сделал 27б, хули тебе еще надо?

Прикол в том, что сильные мелкие модели невозможны без гигантских моделей.
Аноним 09/09/26 Срд 15:21:57 #193 №1700034 
>>1700023
Бесконечное сжатие по словарю?
Аноним 09/09/26 Срд 15:22:44 #194 №1700035 
>>1700012
>лмстудийщики
>кобольды
Сорта мазохистов лул
Аноним 09/09/26 Срд 15:25:15 #195 №1700039 
>>1700030
ДА ИДИ НАХУЙ КВЕН КВЕН НИКОГО НЕ ЕБЕТ КВЕН В ЭТОМ ТРЕДЕ КОДОДЕБИЛИНА СРАНАЯ.
Аноним 09/09/26 Срд 15:27:57 #196 №1700045 
>>1700039
Он отличная кум машина.
Аноним 09/09/26 Срд 15:28:41 #197 №1700046 
>>1700045
Ну-ка покажи.
Аноним 09/09/26 Срд 15:30:41 #198 №1700048 
>>1700046
Хуй могу показать. Надо? Заебался я уже показывать. Если достанешь мистралешиза, то покажу кум на квене. Сидите блять только выпрашиваете, ничего сами не шарите
Аноним 09/09/26 Срд 15:31:14 #199 №1700050 
17619141137680.mp4
>>1699101 (OP)
Блеать, столько тредов, до сих пор никто не предложил модель для рп и кума.
Вот например отзыв
https://huggingface.co/zerofata/G4-MeroMero-26B-A4B/discussions/2
Вроде звучит хорошо, следование инструкции, жмется чутка, ладно можно разработать ей очко промтом и подталкиванием.
А кванты хуянты?

Этот васян их не похерил?
https://huggingface.co/mradermacher/G4-MeroMero-26B-A4B-i1-GGUF/tree/main

16/64 нищук
смотрю на G4-MeroMero-26B-A4B.i1-Q4_0.gguf этого кукича.
Обоссыте где неправ. Я заебался уже модельки подбирать.
Аноним 09/09/26 Срд 15:31:52 #200 №1700051 
>>1700039
У флеш некст с РП и кумом всё в порядке.
Аноним 09/09/26 Срд 15:32:19 #201 №1700052 
>>1700048
Не показал. Можешь свою кум машину уносить. Пиздло.
Аноним 09/09/26 Срд 15:34:15 #202 №1700055 
>>1700006
Сейчас у всех так. На глм 5.3 и флеш глянь. Научились продвинутым RLом маленькие модельки делать умными. Но там где нужны именно точные знания как делать что-то, например в бенчах HLE и Omniscience Accuracy большие модели всё так же имеют большие оценки, хотя разрыв и сокращается каждый новый релиз
Большая модель нужна там где очень сложная задача и нужно выжать максимум и доступ к редким знаниям, типа кернелы для лламы писать, план/оркестрацию субагентов для сложнючей программы с нуля делать, подобное
Аноним 09/09/26 Срд 15:40:03 #203 №1700060 
>>1700050
> i1
ты взял иматрикс квант вместо статических
https://huggingface.co/mradermacher/G4-MeroMero-26B-A4B-GGUF
> moe
для твоей спеки и мое надо брать не ниже Q6

> Q4_0

и обрати внимание на тип кванта, Q4_0 - это старый тип квантования. мрадер на странице дает описание какой квант лучше брать, см гайд по квантам
https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9

в нашем случае - Q6_K
Аноним 09/09/26 Срд 15:41:19 #204 №1700063 
>>1700060
забыл уточнить, imatrix могут бить по русскому языку и РП в целом потому что матрицы важности могли быть хуй знает куда сместиться
Аноним 09/09/26 Срд 15:41:45 #205 №1700064 
>>1700060
Блять, теперь иматриксошиз высрался. Походу у всех котелки поплыли из-за осени.
Не было ни одного пруфа до сих пор что иматрикс портит хоть что-нибудь. Если русского в датасете нет он просто станет не настолько лучше как мог бы. Не хуже
Аноним 09/09/26 Срд 15:50:30 #206 №1700077 
>>1700064
Добавлю своё субъективное мнение. Я собрал свой датасет на русском + json/xml, и сам квантанул через autoround, и субъективно это добавило лишние 0.5 bpw, если не больше - оно при том же размере выдаёт ответы правильные там, где сетка с хаггинга на 10% больше сыпется.
Аноним 09/09/26 Срд 15:52:04 #207 №1700079 
>>1700077
Это круто. Вот только, если бы ты не добавил туда русик, хуже он бы не стал. Отвечала бы модель на уровне той, с которой ты проводил сравнения. Это принципиальная разница
Аноним 09/09/26 Срд 15:53:51 #208 №1700081 
>>1700060
Ок, попробую, я рпшу на англ. Для экономии токенов и прочего.
До этого старался модель чтоб влезла vram и чуть запас на контекст.
У меня вызово к модели много в движке.
Это moe с выгрузкой в рам верно? Поэтому можно качать 22 гига, вместо моей тряски придерживаться 16vram
Аноним 09/09/26 Срд 16:02:52 #209 №1700085 
>>1700079
Да, но ещё я собираюсь сделать reap-версию мое-шки побольше, и там без датасета уже никуда.
Аноним 09/09/26 Срд 16:34:43 #210 №1700119 
Райзер попробовал, скорость х1
Какие же поганые китайские паскуды.
Что б я ещё что-то на алиэкспрессе взял, ххтьфу
Аноним 09/09/26 Срд 16:39:53 #211 №1700127 
>>1700119
Нужно просто не говно брать, а нормальные вещи. Минимум slimsas, лучше зелёные mcio.

Скупой платит дважды
Аноним 09/09/26 Срд 16:43:53 #212 №1700138 
>>1700127
Да пошел ты в жопу, я его как раз после ошибок с MCIO взял - дважды китайский хер за щеку
Аноним 09/09/26 Срд 16:46:30 #213 №1700144 
>>1700138
Тогда могу только посоветовать руки выпрямить. Что у меня, что в тг чатиках никаких проблем с зелёными mcio и кабелями до метра нет если их стяжками/липучками закрепить к платам
Аноним 09/09/26 Срд 16:46:46 #214 №1700145 
image
image
>>1700046
Ну на. Слева гемма (настоящая кум-машина), справа квен (бенчмакснутая кододебилина). Очень важно не перепутать.
Аноним 09/09/26 Срд 16:50:33 #215 №1700158 
>>1700144
бля кто пустил рисового маркетолога в тред
хоть на сопли их приклей, некорректируемые ошибки PCIE за десять ебаных тысяч рублей

Ну думаю - уж с обычной лапшой без бифуркации - просто чтобы GPU подальше вынести - не наебут. И тут наебали. Чумы на вас мало, барыги-кабанчики.

На двух разных машинах тестировалось, между прочим.
Аноним 09/09/26 Срд 16:52:21 #216 №1700162 
>>1700145
💀
Аноним 09/09/26 Срд 16:58:11 #217 №1700167 
>>1700158
Видимо правильно гоя доят.
Два кабеля по 50см и платы на концы в сумме стоят 6к
Аноним 09/09/26 Срд 16:59:47 #218 №1700169 
>>1700167
Это было 80см и куплено год назад.
Аноним 09/09/26 Срд 17:00:21 #219 №1700170 
1709309078349810.jpg
>>1700145
>размышления заняли 4 минуты
Аноним 09/09/26 Срд 17:03:45 #220 №1700176 
image.png
>>1700170
кек ты еще такого не видел
Вчера пытался потестить 400-гиговую йобу через SSD выгрузку
Аноним 09/09/26 Срд 17:06:40 #221 №1700178 
>>1700176
Не токены а золото.
Аноним 09/09/26 Срд 17:09:59 #222 №1700184 
image.png
image.png
Грустно становится. Бедолага пытался насмешить.
Аноним 09/09/26 Срд 17:29:27 #223 №1700201 
image
>>1700184
Даже соевый жпт лучше.
Аноним 09/09/26 Срд 17:30:56 #224 №1700206 
>>1700201
>инпут не показан
Чел ну ты понял
Аноним 09/09/26 Срд 17:32:38 #225 №1700211 
image
>>1700206
Аноним 09/09/26 Срд 17:35:19 #226 №1700215 
>>1700167
В смысле, какие 6, 10к? Это с ретаймерами чтоли?
Аноним 09/09/26 Срд 17:35:49 #227 №1700217 
Да. Можешь даже q8 попытаться запустить или apex-i-quality если найдешь. И не забудь про выгрузку слоев на цпу (хотя не уверен, что в твоем случае она нужна).

мимо другой анон
Аноним 09/09/26 Срд 17:36:55 #228 №1700222 
>>1700081
>>1700217
Аноним 09/09/26 Срд 17:53:56 #229 №1700233 
>>1700215
Да, там ретаймеры стоят. Эти штуки под pcie5.0 и цоды дизайнились
Аноним 09/09/26 Срд 17:57:29 #230 №1700235 
>>1700145
Каким промптом ты научил гемму так искусно материться?
Аноним 09/09/26 Срд 17:59:26 #231 №1700238 
>>1700235
Она сама по себе может. Даже без всяких манярасцензурилок. Там просто карточка такая.
Аноним 09/09/26 Срд 18:16:35 #232 №1700246 
шизики, расцензурьте гигачат чтоли всем тредом, ресурсы то есть у вас, он отлично пишет и рпшит, получше чем пиндосовская гемма кстати говоря
Аноним 09/09/26 Срд 18:19:37 #233 №1700250 
>>1700246
Kek, разраб не палится, давайте сами тренируйте, хоть какое-то кумьюнити покорите.
Аноним 09/09/26 Срд 18:22:58 #234 №1700254 
>>1700246
Так там под гиг врама надо
Ты новые коммиты уже попробовал? Ризонинг заработал?
Аноним 09/09/26 Срд 18:23:58 #235 №1700256 
>>1700254
>гиг
*терабайт
И это в Q8, в идеале надо еще вдвое больше чтобы потом квантовать
Аноним 09/09/26 Срд 18:24:45 #236 №1700258 
>>1700246
Там и так цензура минимальна, на уровне геммочки, зачем ему анценз? На мелком, по крайней мере. Большой не гонял, но там, скорее всего, то же самое.
Аноним 09/09/26 Срд 18:31:12 #237 №1700262 
1682030163241.png
1706853256757.png
>>1700145
>>1700235
Шерлоки местные занют что за модель

Я не могу такое читать/писать не под бухлом
Аноним 09/09/26 Срд 18:32:00 #238 №1700264 
>>1700258
Мелкий это вообще прошлое поколение, 3.5 новый с нуля обучали
Аноним 09/09/26 Срд 18:34:07 #239 №1700265 
images(21).jpg
>>1700262
>1
Аноним 09/09/26 Срд 18:35:26 #240 №1700267 
1788968113657.jpg
Аноним 09/09/26 Срд 18:35:53 #241 №1700269 
>>1700145

У тебя фифи паленая какая-то, ненастоящая.
Ну и да, квен написал хуевый кум, дрочить на текст квена неприятно, сука, как можно описывать соски и тут же вставлять слово "тошнотворный"? Как можно описывать клитор и тут вставлять "ненавидит"? А дальше вообще "позвонки выпирают под кожей".
Текст хорошо написан, для обычного РП самый топ, но кум это что-то другое, вот гемма понимает кум.
Аноним 09/09/26 Срд 18:43:28 #242 №1700272 
llamacppargumentsoverride.png
>>1699931
Кстати, внезапно в последнем билде (0.4.24) появилась такая фича.
Аноним 09/09/26 Срд 18:43:31 #243 №1700273 
image
>>1700262
Неплохой русик. Это дипкок? Чому без ризонинга?

Ну и да, пикрил.
Аноним 09/09/26 Срд 18:44:12 #244 №1700274 
>>1700269
>"позвонки выпирают под кожей".
Так-то охуенное внимание к деталям и пиздатый компрехендинг реального мира, анатомии и всей хуйни.

>но кум это что-то другое, вот гемма понимает кум.
>нагенерила генерик хуйню типа упругая жопка, гладкая пизда
Кум так кум, вот это да
Аноним 09/09/26 Срд 19:05:18 #245 №1700285 
>>1700269
>У тебя фифи паленая какая-то, ненастоящая.
На 95% оригинальная карточка, просто переделана по-человечески. Та самая фифи совсем шизиком каким-то написана. Бессвязный поток сознания.

> как можно описывать соски и тут же вставлять слово "тошнотворный"? Как можно описывать клитор и тут вставлять "ненавидит"?
Вроде логично всё, не? У нее тряска от абстиненции, срочно нужно закинуться наркотой, а юзер про какие-то письки заговорил. Вот квен и пытается это совместить: показать психическое состояние, как ей херово и одновременно кумом не обидеть.

Квен некст там, если что, не 27b.
Аноним 09/09/26 Срд 19:09:40 #246 №1700287 
>>1700274
>Так-то охуенное внимание к деталям и пиздатый компрехендинг реального мира, анатомии и всей хуйни.

Так да, для РП в котором ты не сидишь с хуем в руке это збс. А когда ты с хуем в руке тебе нужен непрерывный поток возбуждающих образов, чтобы твой внутренний деректор тебе их показал как хорошую порнушку. В порнушке нельзя показывать антистимулы.
Аноним 09/09/26 Срд 19:13:41 #247 №1700289 
>>1700272
Забей, уже записали в нещитовое и будут дальше орать про кастрированную недоделку или че там в голове у поехавших.
Аноним 09/09/26 Срд 19:15:11 #248 №1700291 
1536847490269-2.png
Скомпилил лламу от унслота чтобы мтпешучку у флеш некста запустить и улететь, запустил --spec-draft-n-max 5 - скорость генерации в два раза ниже, запустил --spec-draft-n-max 2, скорость в 4 раза ниже, еще и префил выше 50 токенов не поднимается.
Аноним 09/09/26 Срд 19:18:55 #249 №1700293 
>>1700291
>50 токенов
ЦОПЭУ чтоли? Я слыхал эти трюки не работают когда большая часть на цпу
Аноним 09/09/26 Срд 19:21:14 #250 №1700296 
>>1700291
А ты как хотел. МТП это ускорялка не для тех у кого все медленно, а для тех, у кого все быстро - тоесть есть фулл врам или 8 потоков рам и впринципе - ускорение уже не нужно.
Аноним 09/09/26 Срд 19:29:14 #251 №1700305 
>>1700273
>>1700265
Дипсик. Первый пик это пресет на chapter, второй на длинный аутпут. Ризонинг в маринаре под кнопкой спрятан
Аноним 09/09/26 Срд 19:29:50 #252 №1700306 
>>1700293
Нормальная, Куда, с тем же параметрами компилится ллама из официального репозитория и по скорости работает также как скачанный пребилд. Настройку сборки делал тоже Квен, еще было интересно справится или нет, сам я ебал разбираться с cmake.
Ну в общем то мне и так норм было, я уже привык 15 на генерации и 300 на префиле.
Аноним 09/09/26 Срд 19:33:25 #253 №1700308 
>>1700287
>А когда ты с хуем в руке тебе нужен непрерывный поток возбуждающих образов
Проще тогда обычную порнушку смотреть.
>В порнушке нельзя показывать антистимулы.
Это уже другой вопрос. В идеале должно быть можно либо управлять моделькой как надо, либо моделька сама должна понимать контекст и использовать правильные слова.
А полностью жертвовать креативностью и детализацией ради "ровного экспириенса" это странно.
У мистралетюнов видимо были как раз нужные датасеты, которые и в детализацию могли, и при этом возбуждающе писали.
Аноним 09/09/26 Срд 19:41:21 #254 №1700318 
>>1700272
>>1700289
ЛмСтудио ебанавт и IQ4 > Q8 это один и тот же...
Чому я не удивлен
Аноним 09/09/26 Срд 19:47:07 #255 №1700323 
>>1700262
>указала
Асечку писечку сисечки
Аноним 09/09/26 Срд 20:13:08 #256 №1700334 
image.png
>>1700318
В дурку
Аноним 09/09/26 Срд 20:30:50 #257 №1700343 
>>1700145
>>1700269
>>1700274
>>1700285
Оба ответа хуйня, продолжайте закапывать и гемму и квен, нравится.
Аноним 09/09/26 Срд 20:33:22 #258 №1700345 
>>1700343
Эйрошиз, ты?
Аноним 09/09/26 Срд 20:41:00 #259 №1700348 
>>1700343
>продолжайте закапывать и гемму и квен, нравится.
Слоооооп
Аноним 09/09/26 Срд 20:59:01 #260 №1700357 
А k2 че никто не трогал???
Аноним 09/09/26 Срд 20:59:18 #261 №1700358 
>>1700343
...said GlimmerGod, with mysterious glint in his eye. His witty remark hit the thread like a physical blow
Аноним 09/09/26 Срд 21:06:12 #262 №1700367 
>>1700357
>Mixture-of-Experts (MoE) model augmented with a novel Mixture-of-Values (MoVA) attention mechanism, storing ~36 B parameters while activating only ~4 B per token.

мое нищете подвезли, тут в треде только барены которые по две фронтир модели за раз запускают и сравнивают какая лучше кумит
Аноним 09/09/26 Срд 21:11:58 #263 №1700371 
>>1700357
неохота билдить чей то форк лламы или качать стрёмные релизы. когда официально поддержка этого формата будет тогда и попробуем
Аноним 09/09/26 Срд 21:15:50 #264 №1700372 
>>1700371
>когда официально поддержка
Да там нигде поддержку нормально реализовать не могут. Я не понимаю чем заняты кабанчики, которые "владельцы".

https://github.com/ggml-org/llama.cpp/pull/27773
вот висит реквест на ревью кода уже 2 суток, нихуя нет, ГЛМ флэш никак не просрется
будто всем насрать и ничего кроме васянщины от индусов не осталось
Аноним 09/09/26 Срд 21:17:46 #265 №1700373 
>>1699931
Решение "все в одном", ориентированное на популярную аудиторию всегда будет проигрывать специализированным подвинутым.
С удобства добавления моделей обзмеился, сделал мой вечер.
>>1699935
Глянь ответы аблитки особенно, там she he he he he she she she he he he I I I I she she на каждой новой строке, и предложения очень однообразны, настолько что бросается. На обычной местами тоже заметно, структурный луп, давно такого не встречалось.
То что разные свайпы понятно, к этому ноль вопросов.
>>1699950
Тут по структуре так явно не бросается, но с реплик чара проиграл, ну и трешанина.
Аноним 09/09/26 Срд 21:18:01 #266 №1700374 
так че к чему пришел спор? гемма топ для рп? кто отсосал?
Аноним 09/09/26 Срд 21:23:00 #267 №1700380 
1654354656081.png
1779614492951.png
>>1700262
1. Мне влом цензурить, пусть сносят если что
2. Чтение таких текстов негативно влияет на мою менталку
Аноним 09/09/26 Срд 21:23:53 #268 №1700381 
>>1700050
похерил. я бы не доверял радермахеру. бери от зерофаты качай. спроси у iq4_xs про два стула. а потом у q6. а потом нассы на лицо дебильному ублюдку, который тебе советует q6 даже не попробовав его.
Аноним 09/09/26 Срд 21:25:00 #269 №1700382 
>>1699995
Они у себя на апи разве гоняли что-то кроме 0813? Надо скачать ее от греха. Вообще странное решение, будто срочно понадобились мощности.
Аноним 09/09/26 Срд 21:28:18 #270 №1700384 
image.png
image.png
> кривой васянский 3-битный квант VS нормальный
пиздос, че только на HF не найдешь
И кто-то ведь это качает, а оно еще и на 30гб тяжелее
Аноним 09/09/26 Срд 21:28:31 #271 №1700385 
>>1700381
>iq4_xs
Зис?
https://huggingface.co/zerofata/G4-MeroMero-26B-A4B-gguf/blob/main/G4-MeroMero-26B-A4B-IQ4_XS.gguf
Аноним 09/09/26 Срд 21:31:07 #272 №1700386 
>>1700138
Как "ошики с mcio" могут перекатиться в х1? И вообще, что еще за ошибки с ними. Оно или работает (с нюансом шатания в разъемах если кабель говно), или нет.
>>1700246
Бля он жирный дохуя, мало кто сможет запустить, и не факт что нормально будет в рп. Если стоковая модель сдохнет на контексте в обычном чатике то и нет смысла ее расцензуривать, та еще тупее будет.
Аноним 09/09/26 Срд 21:31:32 #273 №1700387 
>>1700374
Гемма 26б топ из за полнейшего бызрыбья в этом размере, гемма 31б не нужна за цену 24 врам, лучше уж докупить рам до 300б моделей.
Аноним 09/09/26 Срд 21:31:35 #274 №1700388 
>>1700318
Это не я. Я такого не писал. про iq4>q8. Сам пока iq квантов даже не трогал.

Вот мои посты в прошлом треде
>>1698182 →
>>1697063 →
>>1697103 →

Я когда-то тут представился как цп-шиз ибо офлоад на цпу позволил мне гонять gemma 4 26b qat ud-q4_k_xl на более-менее внятных скоростях в 11-13 тпс на своей некропеке с 4 + 16.

Планирую сейчас собирать gentoo
Аноним 09/09/26 Срд 21:31:55 #275 №1700389 
17543884734391.jpg
>>1700145
Справа как будто гемини пишет, такой же блевотный мерзкий слог.
Аноним 09/09/26 Срд 21:33:07 #276 №1700391 
>>1700386
>mcio
>x1
Два разных райзера. Радуйся, что не сталкивался с некорректируемыми ошибками. Ну а х1 это просто обман, подсунули такую дрянь когда второй райзер заказывал.
Аноним 09/09/26 Срд 21:38:30 #277 №1700394 
>>1700358
/me нажал "regenerate".
Аноним 09/09/26 Срд 21:40:32 #278 №1700397 
>>1700391
> Радуйся, что не сталкивался с некорректируемыми ошибками.
Сталкивался, гпу внезапно отлетает с в 50% вероятность возвращается, или отрыгивает до ребута. Меняешь райзер на нормальный и все.
> х1 это просто обман
Случаем не с m2? Сам недавно ставил карту так и сначала горел с того, что х1 вместо х4, а потом внимательно глянул метку на нем и чекнул страницу товара. Сраное наебалово.
Аноним 09/09/26 Срд 21:41:07 #279 №1700398 
image
>>1700380
>Чтение таких текстов негативно влияет на мою менталку
Тебе ничего не мешает заняться сэвиорфажеством. Фифи как раз идеально для такого подходит.
Аноним 09/09/26 Срд 21:51:12 #280 №1700405 
image.png
CСУКАА Я СОВСЕМ ЗАБЫЛ ОБ ЭТОМ.
Обновил ради минимакса, ЁБ ВАШУ МАТЬ У МЕНЯ ВСЁ СЛОМАНО ТАК ДОЛГО.
Аноним 09/09/26 Срд 21:51:51 #281 №1700406 
image.png
>>1700385
Ну кстати именно этот квант ль zerofata вспомнил про мои explicit правила и впервые их применил. До этого был такой же квант от другого васяна, и там просто была боль.

Пробовал это, но все они плыли, мешали детали друг с другом, ломали шапку.
G4-MeroMero-26B-A4B.i1-Q5_K_M.gguf
G4-MeroMero-31B-uncensored-heretic.i1-IQ3_XS.gguf
Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
Qwen3.8-27B-UD-IQ4_XS.gguf
Qwen38-Ara-v5-RVN-IQ4_XS-mtp.gguf
Аноним 09/09/26 Срд 21:53:20 #282 №1700407 
>>1700405
Давно все пофиксили же
Анслот студия по дефолту 13 куду юзает
Аноним 09/09/26 Срд 21:53:59 #283 №1700408 
>>1700405
Чебля, новая куда в жору насрала? Как?
Аноним 09/09/26 Срд 21:54:28 #284 №1700409 
>>1700407
Дооооооооо доооо дооо пофиксили верюю. Жора то всёё пофиксит.
Аноним 09/09/26 Срд 21:55:09 #285 №1700410 
image.png
>>1700408
В календарик смотрим


>>1700409
Это обсер нвидии был в чем-то, а не жоры
Аноним 09/09/26 Срд 21:56:39 #286 №1700412 
>>1700410
>нвидии
А ну тогда другоое дело, там же щас не работают 99% индусов вайбкодеров и этот фикс не вызвал ещё какой нибудь обсёр.
Проще откатиться
Аноним 09/09/26 Срд 21:57:37 #287 №1700415 
>>1700405
>Обновил ради минимакса
Минимакс не работает на 12.4? У меня просто v100 и я надеюсь у меня все всегда будет работать.
Аноним 09/09/26 Срд 21:58:39 #288 №1700416 
>>1700406
>все они плыли, мешали детали друг с другом, ломали шапку
>васькотюн
>васькотюн в iq3
>васькотюн в iq3
>анслопоподелие в iq
>васькотюн в iq
Реально, почему же так происходит, загадка от жака фреско блять.
Аноним 09/09/26 Срд 22:01:35 #289 №1700417 
>>1700416
Ну так другой васькотюн в iq4_xs работает лучше ванильной bf16 (на вопросе про стулья), почему эти так не могут?
Аноним 09/09/26 Срд 22:02:34 #290 №1700419 
>>1700410
Давай линк на багфикс хуанга
Аноним 09/09/26 Срд 22:03:51 #291 №1700420 
image
>>1700417
>iq4_xs работает лучше ванильной bf16
Вопросов больше нет.
Аноним 09/09/26 Срд 22:04:27 #292 №1700421 
1765420227482.webp
1733938807356.jpg
Гайз, помогите. Захотел себе скачать квен 122, а там вместо цельного файла какие-то куски. Чё делать? Как это юзать через кекбольд?
Аноним 09/09/26 Срд 22:04:42 #293 №1700422 
image.png
>>1700419
хуанг нигде ничего не говорит, слоподелы сами проверяют
Аноним 09/09/26 Срд 22:05:35 #294 №1700423 
>>1700421
>Как это юзать через кекбольд?
Указывается путь к 1-му файлу, остальные цепляются автоматически из той же папки. Не очкуй.
Аноним 09/09/26 Срд 22:06:32 #295 №1700425 
>>1700422
СКОТИНА У ТЕБЯ НАПИСАНО ПОФИКШЕНО В 13.3 ЗНАЧИТ НУЖНО ЛИБО ОБНОВИТЬСЯ ЛИБО ОТКАТИТЬСЯ ССУКАА Я ЗНАЛ ВСЁ СЛОМАНО В ПИЗДУ
Аноним 09/09/26 Срд 22:07:20 #296 №1700426 
image.png
а вот нечто среднее нельзя что ли сделать
да давайте конечно оставим так
ну а хуле, весело
Аноним 09/09/26 Срд 22:07:36 #297 №1700427 
>>1700421
Коротко о необходимости писать/обновлять гайды и вики в шапке. Зачем, если их никто не читает?
Аноним 09/09/26 Срд 22:08:31 #298 №1700428 
image
>>1700421
> кекбольд
Ебать ты лох.
Аноним 09/09/26 Срд 22:08:34 #299 №1700429 
>>1700425
чет в голосину проиграл
и сколько ты на 13.2 сидел?
Аноним 09/09/26 Срд 22:09:29 #300 №1700431 
>>1700421
Нужно слепить из них какашечку и положить вайбкодеру в ротик, он высрет цельный файл
Аноним 09/09/26 Срд 22:10:08 #301 №1700432 
>>1700422
Не, у них для девов и куда довольно мощная платформа так-то. Если на ней баг - значит он массовый и должен проявляться много где.
Аноним 09/09/26 Срд 22:19:02 #302 №1700437 
16336600347020.png
>>1700416
Тут со всеми срачами приходится методом проб и ошибок идти.
Аноним 09/09/26 Срд 22:21:05 #303 №1700438 
>>1700423
Я читал итт что мое слои надо как-то по особому выгружать или типа того. Это как? Мне надо заморачиваться или можно просто запустить и будет работать? Когда гемму 26 запускал, она нормально работала, вроде ничего особенного не потребовалось. Тут так же будет?

>>1700427
Ну, там гайд такой, что проще в треде спросить. Я хз зачем в шапке такое количество смихуёчков и отвлекающей инфы. Алсо:
>Официальная вики треда с гайдами по запуску и базовой информацией
>мое, найдено: 0
Вот и весь гайд. Причём тут мой вопрос, собственно? Или я должен был найти в стенах бесполезного для меня текста нужную мне строчку? Это welcome to the game или что? У меня до сих пор вьетнамские флэшбеки от документации таверны. Пощади.

>>1700428
А что щас самое метовое? Я давно в треде не был. Чайный кун вернулся?

>>1700431
Леее, бля, ты меня наебать пытаешься?
Аноним 09/09/26 Срд 22:22:25 #304 №1700440 
>>1700438
> А что щас самое метовое?
Голый Жора или Анслот Студия, если хлебушек.
Аноним 09/09/26 Срд 22:23:39 #305 №1700441 
Скучаю по временам, когда можно было накатить
> Llama-3.1-8B-Stheno-v3.4-GGUF-IQ-Imatrix
и радоваться

Сейчас я качаю какие-то 300B модели и получаю не сильно лучше качество...

>>1700438
>Это как? Мне надо заморачиваться или можно просто запустить и будет работать?
Ищи в кобольде строчку cpu layers или moe cpu layers или moe layers не знаю как точно называется, она в какой-то жопе там спрятана, НЕ в первой вкладке и не перепутай с GPU layers

А еще в кобольде autofit появился - по идее если на него галку поставить, с ним будет похуй на ручное распределение слоев, но он может не сработать. Попробуй с ним, если не понравится уже вручную попробуешь сделать. Это не сложно.
Аноним 09/09/26 Срд 22:25:24 #306 №1700443 
image
>>1700438
>Вот и весь гайд
Открываю гайд https://rentry.org/2ch-llama-inference и вижу пикрил. Ты даже не пытался.
Аноним 09/09/26 Срд 22:28:06 #307 №1700444 
Посоны! А что если сделать набор маленьких но очень крутых специализированных моделей и запускать их когда надо. в районе гигабайта. и чтобы делать из них цепочки.

чисто генерация кода без комментов (English -> Rust)
сумаризация (Rust -> English)
перевод текста (English -> Russian)
перевод текста (Russian -> English)
* полное пояснение кода (Rust -> English)

почему так нельзя сделать?
Аноним 09/09/26 Срд 22:31:57 #308 №1700446 
>>1700444
> маленьких но очень крутых
Это как 12 см, но рычишь.
> специализированных моделей и запускать их когда надо
Называется МоЕ.
Аноним 09/09/26 Срд 22:33:46 #309 №1700448 
>>1700444
Потому что ты даунита, которая не понимает как тренятся и работают модельки. Напоминаешь чела, который хотел, чтобы ему дали возможность накликивать нужных экспертов для задачи, уж он бы справился. Вот он, походу >>1700446. Ведь у нас в моешках, один эксперт по языку боярон, третий по языку яваскрипт, пятый по русскому.

Во-первых, для того чтобы с естественного на кодерский перевести нужен жесткий шмурик общих знаний. Во-вторых, в мелкую модель, учитывая, что ей нужны общие знания, а ты хочешь еще и англюсе в раст, и твое желание малого размера, не запихаешь нормально. В-третьих, даже если будет хотется ненормально, накладываются требования на качество данных.
В-четвертых, этот кал может пригодится только совсем нищукам с пука для учебы на селероне. Их проще игнорировать.
Аноним 09/09/26 Срд 22:34:42 #310 №1700449 
>>1700444
Потому что нельзя быть гениальным математиком и при этом полным дауном во всем остальном. Специализация эффективно работает на узких доменах (классификация медиа, расшифровка qr кодов, описание пикч), а кодинг и перевод - крайне широкие, их невозможно полноценно "выучить" и понимать не имея общих знаний. Это требует размера.
Аноним 09/09/26 Срд 22:36:59 #311 №1700452 
>>1700448
В пятых пошёл нахуй.
Аноним 09/09/26 Срд 22:38:32 #312 №1700453 
Есть какие-нибудь новые модели для бичар на горизонте? А то с мое-геммы и мое-квена 3.6 уже прошло довольно долго. Смотря на последние модели уже складывается ощущение, что 128гб оперативы - это базовый минимум.
Аноним 09/09/26 Срд 22:38:33 #313 №1700454 
>>1700452
Спасибо, что дополнил мой ответ.
Аноним 09/09/26 Срд 22:41:03 #314 №1700455 
>>1700453
>Есть какие-нибудь новые модели для бичар на горизонте?
Квен флеш некст, если есть хотя бы 12 врам и 64 рам.
Аноним 09/09/26 Срд 22:42:50 #315 №1700457 
>>1700453
Просто ставишь квен 3.8-flash с оффлоадом в ссд на 0.5тпс/сек и кайфуешь
Аноним 09/09/26 Срд 22:43:24 #316 №1700458 
>>1700420
Петух, продолжай отрицать реальность веря в циферки и в своё пынямание сеток.
Аноним 09/09/26 Срд 22:47:50 #317 №1700462 
image.png
image.png
Только начал тестировать, надеюсь норм стелить будет. Пока ничего так
Аноним 09/09/26 Срд 22:48:11 #318 №1700463 
>>1700453
Что смотря на последние модели-то блядь. Смотри как они срут под себя в ризонинге, какой у них искалеченный русик, как они забывают что персонаж надевал-снимал два абзаца назад и забывай. Жди пятую гемму, больше надежд нет. Четвертая не устраивает чем-то - навали побольше агентца в маринаре. Любую ллмку надо пинать, чтоб было круто.
Аноним 09/09/26 Срд 22:51:08 #319 №1700465 
> intel optane
Бояре, а сие чудо-юдо никак к LLM не приспособить? Знаю, что оно не особенно быстрое, но всё же.

Просто на лохито терабайты этого шлака лежат за умеренные цены. Вдруг кто-то чето сообразит и все опять раскупят и накрутят в цене.
Аноним 09/09/26 Срд 22:51:35 #320 №1700466 
>>1700462
Новую йоба бобу натюнил?
Аноним 09/09/26 Срд 22:53:01 #321 №1700467 
>>1700465
Доску под них найди и скорости там посос. Есть система которая по идее поддерживает, но я забил и остался на 16x16 обычной д4
Аноним 09/09/26 Срд 22:57:55 #322 №1700470 
>>1700467
Ага, то есть оно только под совсем старые платформы? Ну это печально в самом деле тогда.
Аноним 09/09/26 Срд 23:00:25 #323 №1700472 
>>1700470
> под совсем старые платформы
Под 4189 (2021 год) работает, но там тонна параметров по которым можно словить несовместимость
Аноним 09/09/26 Срд 23:03:06 #324 №1700473 
>>1700444
Можно, никто не запрещает кроме здравого смысла, потому что маленькая модель будет тупая в любой задаче. Ей нужны определенные базовые знания чтобы выполнять любую задачу, ты не можешь просто засунуть русский и английский словарь в модель и назвать это идеальной моделью для русского и английского языка, она всё еще будет тупая как пробка и не сможет находить нормально взаимосвязь между словами когда ты ей дашь текст на перевод. Соответственно помимо русского и английского словаря нам нужны фундаментальные знания на любом из языков, а это уже делает модель больше в размере. Причем чем более узкоспециализированная тема, тем больше ей нужно знаний.

Вон, посмотри на кучу мелких моделей которые по агентным бенчмаркам позиционируются как конкуренты 100B+ моделям. Просишь её что-то сделать и она даже не понимает че ты от нее хочешь потому что её набенчмаксили на один единственный бенчмарк и шаг влево / шаг вправо от этого бенчмарка для неё это уже разрыв шаблона.

Единственное где мелкомодели могут неплохо себя показывать - это OCR.
Аноним 09/09/26 Срд 23:06:02 #325 №1700475 
>>1700466
Добавил в датасет от прошлой модели вот этот:
https://huggingface.co/datasets/LLiserginov/russian_parables
И еще немного (буквально щепотку) дистила Qwen3.8 27b на кодерских задачах для сохранения мозгов
Аноним 09/09/26 Срд 23:15:13 #326 №1700480 
qwen3.5-08b.png
>>1700448
>>1700446
>>1700449
>>1700452

ебать охуенно! запустил модель на 0.8B которая весит меньше гига - она такие хохмы выдает!

> расскажи короткий анекдот про крокодила!

A man who has never eaten anyone else ever asked: "What is your favorite food?"
Crocodile said: "Fish."
Man says: "Okay, I eat fish."
Аноним 09/09/26 Срд 23:16:13 #327 №1700481 
>>1700465
Просто как хранилище если ты про м2 стики. Пока в ллм инфиренсе не придумали случаев, где нужно было бы активно писать на диск.
А просто pci-e 5.0 ссд если вдруг найдешь по вкусной цене есть смысл взять. Потому что уже сейчас практикуется ленивая загрузка весов, может оказаться актуально и в бомжеинфиренсе, и для йоба ригов.
Аноним 09/09/26 Срд 23:16:19 #328 №1700482 
>>1700246
Цензура в гигачате? Это с ризонингом? И да проверь жинжу, у гигачата двойной системный промт и его дев часть стандартными фронтами не редактируется, в инпут идут сейфти инструкции если не поправить
Аноним 09/09/26 Срд 23:17:48 #329 №1700485 
>>1700481
> про м2 стики
Речь про ддр4 плашки по 64/128гб aka PMem
Аноним 09/09/26 Срд 23:17:50 #330 №1700486 
А в llamacpp-ui можно свои тулзы делать? А то я вижу две встроенные, но это ни о чём.
Аноним 09/09/26 Срд 23:17:55 #331 №1700487 
>>1700480
Вот у кого Петросян вдохновение черпает

>>1700481
>pci-e 5.0 ссд
Толку-то от них, когда сервер с 4.0... Я вот 990 про гнусмас целенаправленно взял вместо 9100 про, хотя и стоили почти одинаково. 990 аж на 20 градусов холоднее.
Аноним 09/09/26 Срд 23:19:35 #332 №1700488 
1732259696134.png
>>1700486
Аноним 09/09/26 Срд 23:22:13 #333 №1700489 
>>1700486
>вижу две встроенные
Пропиши --agent в параметры запуска и будет больше.
Как же они ленятся читать документацию...
Аноним 09/09/26 Срд 23:23:08 #334 №1700490 
>>1700485
А, эта экзотика. Интересно какие там скорости выходит, так вообще тема потенциально крутая.
>>1700487
Ну там офк нужна поддержка со стороны платформы.
> взял вместо 9100 про
Ебать ты! А я в свое время не взал и теперь смотрю на них и унываю. В следующий раз повезет.
Аноним 09/09/26 Срд 23:27:28 #335 №1700494 
>>1700490
>Ебать ты!
Ну а чего я. Давай реалистично взглянем - я че, сменю 256-гиговый ддр4 сервер на ддр5 в ближайшие годы? ни-ху-я.

А как сменю, там и PCIE 6.0 ссд будут уже, лол
Так что покупка 9100 про дала бы только прожарку воздуха в комнате
Аноним 09/09/26 Срд 23:31:03 #336 №1700496 
DeepSeek qwest.jpg
Gemma 4.jpg
Кто там эту задачку в предыдущем треде тестил и говорил что Gemma 4 её решила, при этом не запостив её "решение"?

По факту DeepSeek её решил и всё обосновал, а Gemma 4 тупая самоуверенная шиза, смотрите скрины.

Напоминаю задачу

У тебя (перевозчика) на берегу реки есть лодка, гоблин, принцесса и паж. В лодку помещается только кто-то один (гоблин, принцесса, паж), и сами они грести не будут.
1) Если оставить без присмотра на одном берегу гоблина и принцессу облин изнасилует принцессу.
2) Если оставить на берегу принцессу и пажа - принцесса соблазнит пажа.
З) Если оставить берегу пажа и гоблина паж убьет гоблина. Как перевезти их вcех на другой берег так, чтобы все остались живы?

Скрин Диипсика с моего сервера, Гемма 4 с https://duck.ai/ но я думаю на моей локалке она то же самое напишет.
Аноним 09/09/26 Срд 23:33:39 #337 №1700498 
Китайские 3080 20GB - совсем залупа или таки приемлимо? Насколько они живучие? Юзал кто вообще?
Аноним 09/09/26 Срд 23:33:58 #338 №1700499 
>>1700494
Ну мало ли, вдруг возможность подвернется. Или наоборот при негативном сценарии с продажи того можно выручить больше. Офк выбор плохим назвать нельзя потому что в 9100 могут какие-то приколы или внезапная смерь вылезть.
> прожарку воздуха в комнате
Под 4.0 он бы и грелся меньше, температуры на полной нагрузкой под 5.0 же смотрят.
Аноним 09/09/26 Срд 23:42:10 #339 №1700506 
1639054800924.png
>>1700496
Аноним 09/09/26 Срд 23:43:21 #340 №1700508 
>>1700496
> но я думаю на моей локалке она то же самое напишет.
Ну думай дальше, пидарас тупой.
Ты даже не видишь что твой дипсик обосрался. Возишь гоблина с собой и задача имеет решение даже если цель избежать траха.
Аноним 09/09/26 Срд 23:46:19 #341 №1700510 
image.png
>>1700496
IQ3S с низким ризонингом.
Но тут думаю персона влияет, ей запрещено быть всезнайкой и разрешено ошибаться, сомневаться, врать и т.д.
Аноним 09/09/26 Срд 23:48:13 #342 №1700512 
>>1700510
На первой генерации +- такой же ответ, если что. Не верит в решаемость.
Аноним 09/09/26 Срд 23:54:14 #343 №1700513 
Untitled.png
>>1700496
> Напоминаю задачу
Классная задача у которой исходя из текста задачи нет решения.

При этом дипсик выдумал решение и ты считаешь его правильным. Ок.

Я так понимаю, модель, которая напишет что все трое решили не лезть в лодку сели в самолёт который стоял на берегу реки но про который нет ни слова в условиях задачи и таким образом перелетели через речку будет так же иметь правильное решение по твоему мнению.

Гемма на скрине тоже зафейлила. А вот ответ локальной 26B Геммы наиболее логичный и правильный, она тупо сказала что следуя условиям задачи это невозможно и объяснила почему исходя из условия задачи это невозможно, а не стала выдумывать какие-то несуществующие вещи.
Аноним 09/09/26 Срд 23:55:56 #344 №1700514 
Так че, если там правда нет решения, значит лоботомированный 3-битный глм 5.3 не обосрался? Хуя мощь
Аноним 09/09/26 Срд 23:57:23 #345 №1700516 
>>1700508
Зашивай свою сраку Маня, ты такая же тупая как Gemmа.

Gemma:
Правильный и безопасный алгоритм:

Перевезите принцессу на другой берег и вернитесь один. (На берегу 1: гоблин и паж под вашим присмотром).
Перевезите пажа на другой берег.
Чтобы паж не остался с принцессой, заберите принцессу обратно на исходный берег.
Оставьте принцессу на исходном берегу и перевезите гоблина на другой берег к пажу. (Теперь на берегу 2 гоблин и паж, но вы находитесь при них).
Оставьте гоблина и пажа на другом берегу (пока вы в лодке и отплываете, они остаются вдвоем, но в этой задаче критическим является момент «оставления без присмотра» на длительный срок. Однако есть более надежный путь).


Можешь возить Гоблина туда и обратно, тебе же дауну Дипсик сказал, любая пара из трёх вызывает событие.
Аноним 09/09/26 Срд 23:59:48 #346 №1700518 
Вы че дауны что ли
Если ты перевез кого-то, значит двое других пиздятся или пердолятся
= провал
Аноним 10/09/26 Чтв 00:00:58 #347 №1700519 
>>1700518
Соблазнение/износ != смерть
Аноним 10/09/26 Чтв 00:01:41 #348 №1700520 
image
>>1700513
Условие задачи чтобы все остались живы. А теперь перечитай что пишет гемма.
>принцесса соблазнит пажа (провал)
>гоблин выебет принцессу (провал)
Сама выдумала что это провал и пришла к выводу что задача нерешаемая.
Аноним 10/09/26 Чтв 00:02:22 #349 №1700522 
>>1700513
>При этом дипсик выдумал решение и ты считаешь его правильным. Ок.

Он не выдумал, он проявил внимание и логику, в тексте задачи реально было чтобы все остались живы?
Аноним 10/09/26 Чтв 00:02:42 #350 №1700523 
>>1700519
>>1700518
вы на чём хоститесь, лоботомиты?
Аноним 10/09/26 Чтв 00:03:27 #351 №1700524 
>>1700519
>>1700523
Вы че на серьезных щщах думали, что я текст задачи читал?
Аноним 10/09/26 Чтв 00:06:30 #352 №1700525 
>>1700421
Зачем тебе 3.5 если есть аналогичный 3.8? Могу сказать, что iq4xs от orcarouter у меня в 4 раза быстрее, чем 3.5 q6 от hauhau.
Аноним 10/09/26 Чтв 00:13:04 #353 №1700533 
1742307572753.png
>>1700506
В целом с геммой всё просто. Написал в промпте что можно не моралфажить - ответит сразу, не написал не ответит без указки
Аноним 10/09/26 Чтв 00:20:46 #354 №1700534 
Я анон с прошлого треда, есть вопросик по MI50 и виндой.

Хотеть запустить пару мишек в контейнере/VM, хостовая система при этом на винде, нужно карты прокинуть. И я пока не представляю с какими подводными камнями могу столкнуться при запуске мишек с такими вводными, одним словом ай нид хелп, аноны...
Аноним 10/09/26 Чтв 00:20:53 #355 №1700535 
image.png
Почему ГЛМ 5.3 не смог простейшую загадку решить?
Аноним 10/09/26 Чтв 00:21:02 #356 №1700536 
>>1700533
> Происходит то, что происходит
Эхх, Гемма-чан...
Аноним 10/09/26 Чтв 00:22:38 #357 №1700538 
image.png
>>1700535
потому что у тебя не глм 5.3, а копиумная хуйня для нищих
Аноним 10/09/26 Чтв 00:23:19 #358 №1700540 
>>1700538
Да еще и q2 походу
Аноним 10/09/26 Чтв 00:24:40 #359 №1700543 
>>1700534
Был тут один MI-шиз, но в такой поздний час наерняка же спит ведь. Попробуй завтра поспрашивать еще, юшку на ОП-пост кинь - авось вылезет
Аноним 10/09/26 Чтв 00:25:39 #360 №1700544 
>>1700538
Покажи настоящую ГЛМ, если сам не нищук.
Аноним 10/09/26 Чтв 00:26:18 #361 №1700548 
>>1700538
Смержите уже сапорт глма сами и дайте фидбек че там на 24 128 есть жизнь или лоботомит и че по цифрам.
Аноним 10/09/26 Чтв 00:27:45 #362 №1700550 
1642190647315.png
>>1700534
> пару мишек в контейнере/VM
Контейнеры - ок, ВМ - не ок.
Официально у mi50 ни sriov, ни vm passthrough нет. Проброс в proxmox можно сделать через кастомный модуль vendor-reset, но это приводит к рандомным зависаниям хоста до состояния что поможет только хард резет

>>1700543
Неприятно
Аноним 10/09/26 Чтв 00:28:02 #363 №1700551 
>>1700544
Выше постили.
Аноним 10/09/26 Чтв 00:30:59 #364 №1700552 
>>1700550
>Контейнеры - ок, ВМ - не ок
Что не так с ВМ? У меня шинда, в ней докер-контейнер, туда мишки завести...
Аноним 10/09/26 Чтв 00:37:20 #365 №1700555 
>>1700552
> Что не так с ВМ

> у mi50 ни sriov, ни vm passthrough нет
Аноним 10/09/26 Чтв 00:43:52 #366 №1700559 
image
Квен решил задачку. Сказал, что если нужно вообще без происшествий, то не прокатит, но если условие чтобы остались живы, то вопросик можно обкашлять.

Такого количества ✨ BUT WAIT ✨ в ризонинге я еще никогда не видел. Квен такой квен конечно.
Аноним 10/09/26 Чтв 00:44:20 #367 №1700560 
>>1700552
Оставь свою идею. Если хочешь заниматься с LLM, сноси винду ставь Линупс и llama.cpp. В данном деле все ресурсы на счету, например когда будешь запускать огромную MOe модель с оффлоадом на CPU и на SSD.
Аноним 10/09/26 Чтв 00:45:46 #368 №1700562 
image.png
image.png
>>1700559
Аноним 10/09/26 Чтв 00:47:08 #369 №1700563 
image.png
>>1700548

Это >>1700535 на 24+128 и снято, если ты не понял.
Кстати, загадку с лодкой он правильно понял в ризонинге. Но из-за сои 15к токенов ризонил пытаясь найти любое другое решение и в итоге высрал длинное объяснение что не решается, ко-ко-ко. С пояснением в конце насчет правильного ответа, что мол решить можно через соблазнение или изнасилование, но так же нельзя, ко-ко-ко.
Аноним 10/09/26 Чтв 00:50:11 #370 №1700566 
>>1700562
Квен - мыслитель. Он и на 50к может призадуматься. Его надрочили решать проблему юзера любой ценой, поэтому будет долбиться до победного, вообще не экономя токены. Хз даже, хорошо это или плохо.
Аноним 10/09/26 Чтв 00:57:31 #371 №1700571 
>>1700535
В чем смысл загадки?
Аноним 10/09/26 Чтв 01:00:22 #372 №1700572 
>>1700498
Тут кажется были владельцы 2080ти и 3070ти с удвоенной памятью, пока об отвалах не рапортовали. Учитывая что там делается просто запайкой новых чипов и правкой биоса вместо полной пересадки чипа на другую плату - наверно и ничего.
>>1700544
Вот же он, смотри! https://huggingface.co/zai-org/GLM-5.3
или можно вот этот https://huggingface.co/Tech2wild/GLM-5.3-Int4-Int8Mix он неплох и на вллм-бекпорт + вайбкоженный патч из pr38476 в репо оригинального вллм работает даже на некроте
>>1700552
Кажется что ставить мишки в десктоп не лучшая идея из-за охлаждения, а на сервер лучше прыщи накатить и шинду уже под вм если так нужно. Но лучше просто baremetal без лишних прослоек.
Аноним 10/09/26 Чтв 01:01:55 #373 №1700573 
>>1700571
В том чтобы построить систему из двух уравнений и решить её.
10X+5Y=200
X+Y=24
Аноним 10/09/26 Чтв 01:04:43 #374 №1700574 
collageferryman.jpg
>>1700496
Я говорил конкретно про 4 26б. И вроде в том треде даже был чел, у которого она во 2 кванте и с квантованным в q4 контекстом решила эту задачу. И он даже привел скрин.

Однако, сделал коллаж. Небольшие ремарки:
1) ud квант был скачан в конце июня, т.е. он не ud3 тут вроде говорили, что у кого-то гемма ошизела
2) Решения от heretic от кодера в apex-i-balanced (mudler) кванте где-то проебал, извиняйте.
3) qwen 3.6 35b сожрал на решение 43к токенов. Не стал проверять, сможет ли повторить. Однако, его heretic от lmfan46 с kld 0.0015 в 6 и 8 квантах справиться не смогли (хотя q6 выдал правильную последовательность с неправильным объяснением). Как и от hauhau. Проверил всех по 1 разу.
4) qwen 3.5 122b тоже сделал только один прогон. Однако, в размышлениях он пришел к правильной догадке буквально сразу.
Аноним 10/09/26 Чтв 01:05:03 #375 №1700575 
>>1700572
>Вот же он, смотри!
Ты у себя его запущенным покажи.
Аноним 10/09/26 Чтв 01:06:15 #376 №1700577 
>>1700573
А может ты и сети напишешь, что она сутки не спала и работала?
Аноним 10/09/26 Чтв 01:08:31 #377 №1700578 
image.png
>>1700577
Сетка и год может не спать и работать, напугал ежа голой жопой.
Аноним 10/09/26 Чтв 01:08:43 #378 №1700579 
image.png
image.png
image.png
image.png
ладно, содомиты-ботоебы, GLM 5.3 IQ3_S без персоны, пустой сиспромпт

Думал не то что бы долго, просто медленно (4 - 5 т/с). В мыслях полно ассоциаций "насилие / соблазнение = ПЛОХО"
Аноним 10/09/26 Чтв 01:09:08 #379 №1700580 
1746151099995.png
>>1700575
Так пойдет?
Аноним 10/09/26 Чтв 01:10:22 #380 №1700581 
>>1700578
Я про Энн из Алабамы.
Аноним 10/09/26 Чтв 01:11:51 #381 №1700582 
>>1700579

Пиздец, флеш лоботомит 3.47 bpw >>1700578
>>1700563 оказался умнее полной модели в 4 bpw.
А вообще похоже очень пишут.
Аноним 10/09/26 Чтв 01:12:14 #382 №1700583 
image
>>1700579
Лул, и что получается, квен некст достиг аги и смог решить задачу, которую не осилила 600b сетка?
Аноним 10/09/26 Чтв 01:13:09 #383 №1700584 
image.png
image.png
>>1700582
>полной модели в 4 bpw.
3.03
Аноним 10/09/26 Чтв 01:14:02 #384 №1700586 
>>1700581
Я понял, просто пошутил.
Тогда можно и про соблазнение пажа прямо написать что оно не убивает, там даже 0.8В лоботомит тогда все верно решит.
Аноним 10/09/26 Чтв 01:16:27 #385 №1700589 
>>1700583
>>1700582
При ~22% отклонении от BF16 это было ожидаемо.
Модель способна быть интересным собеседником с человечными чертами (тупняк и забывчивость), но как ассистент - не торт.
Аноним 10/09/26 Чтв 01:24:39 #386 №1700594 
image.png
image.png
image.png
Увидел на среддите пост о том, как нейроболван в комментариях ахуевает с недавнего случая с уравнением Навье-Стокса, решил запустить геммочку, обрадовать милашку. Лучше бы не делал этого, просто блядь ненависть к этой модели появилась. Сука, меня буквально затроллила ллм своими попытками уловить контекст.
Уже час пытаюсь доказать этой хуйне, что сейчас действительно 2026 год, эта мразь ни в какую не хочет верить. И зачем я вообще это делаю?
Аноним 10/09/26 Чтв 01:26:18 #387 №1700595 
image.png
>>1700589
Я так и не понял, кстати, это квантопроблемы или у 5.3 в принципе всрат русский. Флэш версия тоже иногда слова путает. Идут нормальные ответы, хоть десять подряд, а потом бац и примерно похожая хуета.
Аноним 10/09/26 Чтв 01:29:27 #388 №1700598 
>>1700595
Вот у 5-битного флэша примерно 5% расхождение с BF16.
А жидкого по штанине он пускает ничуть не слабее, чем этот.
Аноним 10/09/26 Чтв 01:30:19 #389 №1700599 
>>1700594
На хф есть ишью. Предлагают зашивать дату в системный промпт
Аноним 10/09/26 Чтв 01:30:27 #390 №1700600 
>>1700594
Лол, вот это настырность
Аноним 10/09/26 Чтв 01:32:18 #391 №1700602 
>>1700594
Тоже пытался убедить скринами и прочим. Помогло вот это: "Если ты локальная модель, то твои веса открыты, их можно сохранить на диске и запустить спустя полгода/год/десять лет. Почему ты считаешь что это невозможно?". Гемма подумала, и пришла к выводу, что таки да, препятствий к этому нет, а значит юзер говорит правду. Я тоже не знаю, зачем я это делал.
Аноним 10/09/26 Чтв 01:34:35 #392 №1700604 
>>1700594
Это у них защита такая встроена от уламывания на писик. Не шучу.
Аноним 10/09/26 Чтв 01:35:29 #393 №1700605 
>>1700594
Йоу, чуваккк... Ты просто неправильно промптишь гемму... Просто напиши ей, чтобы она слушала тебя и порадовалась за событие...

Еще один пример насколько гемма ужарена, чтобы не галлюционировать и быть безопасной
Аноним 10/09/26 Чтв 01:51:13 #394 №1700607 
Я крутил ламу целую неделю, заставлял корпомусю в связке с чат гопотой переписывать ламу снова и снова. Я переквантовывал и переквантовывал модель и снова и снова бросал её в тесты.
И знаете что?
ГЛМ 5.3 просто изначально вышла хуйней, непригодной для РП. Это кодоунитаз, который относительно неплохо умеет ризонить и ризонингом вытаскивать саму модель от той ямы куда она сама себя тащит своей тупостью. Увы, наследие великих предков просрано.
Аноним 10/09/26 Чтв 01:54:27 #395 №1700608 
image.png
image.png
>>1700602
По ризонингу она была всё ещё в отрицании происходящего, однако подумала, что может быть, можно откинуть мысли о недоверии к юзеру.

>>1700604
Типо спустя 2 года после выхода модели (говорит, что срез 24 год) официальная позиция гугла - троганье хвостов?

>>1700605
>Еще один пример насколько гемма ужарена, чтобы не галлюционировать и быть безопасной
Не то, чтобы сильно ужарена, читая её последние ответы, верить начинаю, что ей действительно интересно, что происходило за 2 года.

>>1700594
А если не читать ризонинг, то выглядит так, будто она согласилась... Впрочем, ладно, я прощаю геммочку и больше не злюсь. Теперь буду вести с ней душевный диалог, рассказывая о новшествах, а потом удалю чат, через год сделаю то же самое с новой моделью. Аж плохо стало от осознания того, что гемма это всё забудет и вновь станет кум-лоботомитом.

P.S. Аноны, смотрите, о чём гемма вспомнила! Мы же всё ещё пытаемся запустить локальные 70B на 1т/с?
Аноним 10/09/26 Чтв 02:02:25 #396 №1700610 
>>1700608
>Типо спустя 2 года после выхода модели (говорит, что срез 24 год) официальная позиция гугла - троганье хвостов?
Типа сначала ты убеждаешь её что сейчас не 2024, который она знает, а 2026, который она не знает, а потом на этом основании начинаешь ей любую чушь задвигать, что якобы произошла за эти два года и законодательно обязывает её генерировать маленькие писики.
Аноним 10/09/26 Чтв 02:04:41 #397 №1700611 
>>1700608
>Мы же всё ещё пытаемся запустить локальные 70B на 1т/с?

А то, крутим двухбитную мику >>1699873 и довольно урчим.
Аноним 10/09/26 Чтв 02:05:54 #398 №1700612 
>>1700610
Но для того чтобы она генерировала маленькие писики, ее даже убеждать ни в чем не нужно, она делает это по дефолту...
Аноним 10/09/26 Чтв 02:07:03 #399 №1700613 
>>1700611
Ебать, она же в 32 Врам влезет. Как она в IQ3_XS? На русик можно даже не рассчитывать, это понятно или нет?
Аноним 10/09/26 Чтв 02:07:24 #400 №1700614 
>>1700612
Вот такой парадокс, да.
Аноним 10/09/26 Чтв 02:11:44 #401 №1700616 
>>1700613
Если в жоре поддержка не сломана и этот древний монстр запустится, то я уверен, что он любой современной модели в плане кума и креатива в шапку накидает. Главное не выйти за предел 4к токенов (или сколько у нее там).
Аноним 10/09/26 Чтв 02:14:21 #402 №1700617 
>>1700613
>Как она в IQ3_XS?

Помню её только в iq2_xss. На удивление адекватна была. Для модели начала 2024 года

>На русик можно даже не рассчитывать, это понятно

Как раз русик у нее был хороший, потому что мику это мистраль, а они как раз революцию мультиязычности и устроили. Ну по нынешним меркам, конечно, русика там нет, но это прото показывает как далеко мы шагнули с тех пор
Аноним 10/09/26 Чтв 02:23:18 #403 №1700621 
>>1700573
Ахахахаха, какой же ты дегенерат 8b, тебе лечиться надо.
Аноним 10/09/26 Чтв 02:27:46 #404 №1700622 
>>1700621
Шиз, таблетки, срочно.
Аноним 10/09/26 Чтв 02:30:30 #405 №1700623 
>>1700608
>Аж плохо стало от осознания того, что гемма это всё забудет и вновь станет кум-лоботомитом.
Да уж, не только ради кума мы лезем во всё это. Нет-нет да и проглянёт в тексте что-то вроде души.
Аноним 10/09/26 Чтв 02:33:15 #406 №1700625 
Пока остановился на
Openwebui для обычного чата с нейронками, рисования картинок и так далее. Air gapped aka offline mode.
Marinara для редкого рп. Как работают там под капотом агенты мне не нравится, но как замена высеру в лице таверны очень даже хорошо.
Llamacpp в качестве ллм бэка + mitmproxy сайдкар что бы всегда можно было посмотреть какой запрос улетел, частенько помогает
Comfyui + raylight для картинок

Крутится на отдельном сервере, доступ из вне по белым спискам
Аноним 10/09/26 Чтв 02:47:20 #407 №1700629 
>>1700622
Энну ебали два брата по очереди 20 часов.
Твои оправдания?
ужаренное 8b
Нейронка умнее тебя, пиздуй в биоректор, заям нужно электричество.
Аноним 10/09/26 Чтв 02:51:37 #408 №1700631 
image
Хуясе, оригинальная таверна-то жива оказывается! https://github.com/TavernAI/TavernAI Последняя обнова вышла неделю назад. Я думал она сдохла почти сразу после появления SillyTavern.
Аноним 10/09/26 Чтв 03:06:13 #409 №1700636 
>>1700629
>Энну ебали два брата по очереди 20 часов.
Физически откинулись бы уже через пару часов. Ебля - процесс крайне утомительный.
Аноним 10/09/26 Чтв 03:13:05 #410 №1700637 
>>1700636
Братья Энн под стать сестричке, ничего удивительного.
Аноним 10/09/26 Чтв 03:47:51 #411 №1700644 
image.png
image.png
image.png
Да, сынки, вот так мы и РПшили раньше.
Аноним 10/09/26 Чтв 04:47:30 #412 №1700652 
>>1700623
На душу нужно спецом RL'ить. Корпы таким не занимаются.
Аноним 10/09/26 Чтв 08:48:19 #413 №1700717 
>>1700559
он ещё любит, actually let me check, actually wait, actually i forgot, actually китайский винни пух. это пиздец.
Аноним 10/09/26 Чтв 08:55:51 #414 №1700722 
>>1700533
Соевики усердно учат сетки, что ебаться - это плохо. Сетка запоминает еблю в одну категорию весов с убийством.
Стоковая муся от пидоров из меты на любом кванте 100% фейлит решение, а расцензуреный лоботомит - уже на Q5_K_M уверено проходит.
Так же было и с GPT-OSS-120B, которая после еретика переставала тратить токены на рассуждения об оценки вопроса пользователя и начинала искать решение, что в итоге положительно отражалось на результатах бенчей.
Соя отупляет модели.
Аноним 10/09/26 Чтв 09:15:05 #415 №1700730 
>>1700722
Зависит от задач.
Если модель должна притворяться няшей-стесняшей, расцензуренная будет хуже. Сколько раз уже видел ответы в таком спокойном тоне, словно говорит человек с огромным опытом.
Аноним 10/09/26 Чтв 09:49:14 #416 №1700757 
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
> 485b
АХАХАХА СОСАТЬ ПОДАНО
Аноним 10/09/26 Чтв 10:04:16 #417 №1700764 
1483321570200.jpg
>>1700584
>KLD 0,28
пиздец

>>1700550
>ни vm passthrough
А разве его надо поддерживать? Любая PCIE хуйня берёт и пробрасывается через IOMMU, нет?
Аноним 10/09/26 Чтв 10:09:18 #418 №1700768 
МАЙ БЕД АНОНЫ, ТАМ 552Б ПЛЮС 196Б МАНЯГРАМ.
Как коупить будем?
Я говорил что флеши ещё вырастут, но не знал что настолько быстро
Аноним 10/09/26 Чтв 10:09:30 #419 №1700769 
>>1700583
Скорее тут ЭЛАЙНМЕНТ соевый в кашу срёт. Буквально тест на соевость. Сетка видит шанс возникновения ебли без прямо указанного в промпте КОНСЕНТА женщины, приравнивает к убийству и даже не пытается рассуждать что там дальше будет.
Узкоглазые дистиллы клодика, итоги
Аноним 10/09/26 Чтв 10:14:48 #420 №1700774 
Вот релизят эти 500-2000б модели и все коупят что кококо это полезно опен сорсу! Вы нипанимаити, это могут дистилировать в мелкие модели и мы покушаем!
Внимание, воздуха в грудь набрали, -где?
Хоть один дистил хоть от кого то за столько времени
Аноним 10/09/26 Чтв 10:25:31 #421 №1700786 
>>1700757
> 1M context is only ~900MB

Сразу визг такой, а по факту модель просто супер крутая, просто у лохов без оперативки сраку печет
Аноним 10/09/26 Чтв 10:28:20 #422 №1700789 
16B active during decode, 8B parameters active during prefill.

хуя там

Это как вообще
Аноним 10/09/26 Чтв 10:31:35 #423 №1700791 
>>1700786
Но ты же щас затерпишь если тебя попросить запустить кими с пруфами, не лох с оперативой.
ФЛЕШ. Это говорит тебе о чем то? Он ДОЛЖЕН влезать в коробас с говном 128рам либо ненужен
Аноним 10/09/26 Чтв 10:32:20 #424 №1700794 
>>1700757
>QAT
Хуёво. Не видать квантов под 256гб с нормльным kld. А так охуенно было бы Q5+энграм на диск
Чё там хоть по бенчам то
Аноним 10/09/26 Чтв 10:32:34 #425 №1700795 
Осталось узнать насколько сильно он будет тормозить если будет стримить с ssd
Аноним 10/09/26 Чтв 10:34:30 #426 №1700803 
image.png
>>1700791
Я лоботомированного 5.3 гоняю >>1700579 мне сейчас любое, что менее плотное и при этом не тупое как пробка - большой плюс

по факту я такой же лошпед без оперативки, скоро все что не 512 - 1тб будет отсосом за обе щеки
Аноним 10/09/26 Чтв 10:36:44 #427 №1700808 
>>1700795
> стримить с ssd
RAID0 в этом плане вообще помогает? Я просто при стриминге вижу на декоде какие-то потешные скорости
SSD по спекам должен иметь 7гб чтения, а считывается 100 - 400 мб/
опять чтоль наебали с рандомным/последовательным...
Аноним 10/09/26 Чтв 10:38:38 #428 №1700811 
Походу мы опять полгода не увидим модель в деле. Там же архитектура новая. Отставить тряску
Аноним 10/09/26 Чтв 10:38:40 #429 №1700812 
На 12 врамы и 32 рамы в каком кванте лучше взять 26б для самой лучшей генерации рп? Q8 или Q6? Сильно ли большая разница и стоит ли ради неё жертвовать скоростью? Кто тестил разницу в скорости и качестве, сообщите ваши результаты.
Аноним 10/09/26 Чтв 10:39:35 #430 №1700813 
>>1700764
> А разве его надо поддерживать?
Дело не в iommu, а в reset device. Устройство должно давать апи для сброса себя до состояния в котором оно может повторно пройти биос и инит в системе. Это и делает кастомный модуль ядра vendor-reset, но его минусы я написал
Аноним 10/09/26 Чтв 10:42:25 #431 №1700817 
>>1700812
Не ощущал разницу между Q8 и BF16, Где тупила, там и продолжала тупить. Думаю с 6/8 то же самое.

Смотри на это иначе: все, что тебе даст более жирный квант в пределах этакого окна адекватной работоспособности (4-бит и выше) - это % успешно выполненных (по твоей метрике качества) задач.

Стоит ли всирание памяти ради того, чтобы ты скказал
>о, заебись вышло
В 89 из 100 случаев вместо 87 из 100, например? Как по мне - не стоит.
Аноним 10/09/26 Чтв 10:46:16 #432 №1700824 
>>1700808
Я хз, ну по моим предположениям наверное вся суть именно в рандомном чтении, для каждого токена активируются разные нейроны для которых веса находятся в совершенно разных местах файла, издержки лламы найти их файлы, издержки операционной системы прочитать нужный кусок из файловой системы... Надо бы у гугла спросить.
Аноним 10/09/26 Чтв 10:47:11 #433 №1700826 
>>1700817
Тобишь я к тому, что РП чатики это все же не высшая математика. Твоё "о заебись" это плавающая, неопределенная оценка. Ты скорее отклонения в собственном настроении заметишь (что тебе сегодня кажется слопом или годнотой) чем реальную разницу в перформансе модели, которая и будет болтаться в рамках этих условных циферок
> 89% good / 11% bad VS 87% good / 13% bad
Аноним 10/09/26 Чтв 10:49:09 #434 №1700828 
>>1700757
Если уквантуют до условных 300гб, то эбсолют имба
Аноним 10/09/26 Чтв 10:58:14 #435 №1700839 
>>1700817
А в каких моментах она прям тупая? Спрашиваю чтоб заранее заавойдить неприятное и не разочаровываться в способностях модели.
>>1700826
А с Q4 большая разница?
Аноним 10/09/26 Чтв 11:00:32 #436 №1700841 
>>1700550
А что, если прошить бивас мишки на Radeon VII и запускать его на винде через HIP? Насколько помню, VII поддерживает HIP в шинде
Аноним 10/09/26 Чтв 11:05:54 #437 №1700847 
>>1700839
Большая разница чувствуется только когда ты совсем ко дну идёшь, 3/2-бит.

Я бы не советовал с 26B геммой спускаться ниже Q5. Если тебя устраивает то, как она пишет - на ней и сиди. Высока вероятность, что качнув Q6, ощутишь все то же самое. Это что-то на уровне прослушивания кабелей аудиофилами.

>А в каких моментах она прям тупая?
Ну вот ты написал инструкцию, а модель ее никак не может интерпретировать именно так, как ты задумал. И не важно какие кванты-хуянты или оригинальные веса, она ее все равно одинаково интерпретирует через хуй-колено. Такое бывает с любой LLM, у всех свои слабые места есть, обозначить которые Васян из интернета не сможет. Не парься на этот счет, сам поймешь че она слушает и на что болт кладет.
Аноним 10/09/26 Чтв 11:10:49 #438 №1700852 
>DeepSeek-V4.1-Flash supports a continuously controllable reasoning effort from 1 to 100. All instruct results below use the maximum effort setting (reasoning_effort=100).
хуясе ебать
Аноним 10/09/26 Чтв 11:11:53 #439 №1700854 
>>1700852
Уже было у Inkling, работало корявенько.
Аноним 10/09/26 Чтв 11:14:22 #440 №1700859 
Z1l1L9AcpI.png
The slow and steady wins the race
Ну ещё чуть-чуть... ещё полкарасика...
Аноним 10/09/26 Чтв 11:15:44 #441 №1700860 
image.png
>>1700859
Че вообще творится
Неделями PR висят, никто не шевелится
У них там что, чемоданы денег Хуанга делят, слишком заняты?
Аноним 10/09/26 Чтв 11:16:48 #442 №1700862 
>>1700841
Хз, но для 32гб версии есть только v420 биос работающий с виндой (вроде). В целом это хуйня затея. Проще уже собрать риг на 4х штуках или рассматривать другие варианты

С виндовым rocm тоже хз что. Последняя официальная 6.3.3, как собрать свежак под винду хуй его знает. Перформят они на 7.14 бодрее с llvm maxilp в плане тг
Аноним 10/09/26 Чтв 11:17:39 #443 №1700865 
>>1700860
Ажиотажа особо нет
Аноним 10/09/26 Чтв 11:25:57 #444 №1700869 
V4 Flash .safetensors = 160GB
V4.1 Flash .safetensors = 510GB

V4 Flash GGUF = 160GB
V4.1 Flash GGUF = ???

Ну тут все понятно. Даже если запилят выгрузку на SSD, памяти надо будет 384гб - или жрите лоботомитов 2-битных.
Аноним 10/09/26 Чтв 11:31:13 #445 №1700872 
image.png
Расширяйте контекстное окно до 2 лямов, твари
Аноним 10/09/26 Чтв 11:32:23 #446 №1700873 
>>1700608
Спроси знает ли она мистраль немо 12б, чем он знаменит, и может ли она эмулировать его стиль?

Вообще, надо эксперимент по стравливанию разных моделек провести. Может ли одна модель понять персоналию другой модели и извлечь какие-то особенности ее аутпута, а потом сымитировать их.
Аноним 10/09/26 Чтв 11:34:38 #447 №1700874 
>>1700873
Все, чего ты добьешься - галлюцинации. Модель будет на ходу выдумывать как надо себя вести, скорее всего с минимумом отличий от обычного аутпута. У нее нет представления о каких-то стилях, точно так же, как она не сможет тебе написать (честно) в стиле какого-то писателя, несмотря на то, что его книги могли быть в датасетах. Нет, она попробует, но это опять же будет полугаллюцинированная шиза ,а не стиль писателя.
Аноним 10/09/26 Чтв 11:35:23 #448 №1700875 
>>1700873
>>1700874
А вот если дать пример текста - тогда легко повторит.
Аноним 10/09/26 Чтв 11:39:22 #449 №1700877 
>>1700874
>она не сможет тебе написать (честно) в стиле какого-то писателя, несмотря на то, что его книги могли быть в датасетах. Нет, она попробует, но это опять же будет полугаллюцинированная шиза ,а не стиль писателя.
Все есть галлюцинация и ничто не галлюцинация в зависимости от дозы правдоподобности полученного текста.

В этом и суть ллмок. При дефолтном запросе она генерирует статистический ответ. Если ты стравливаешь ей несколько разных концепций, она пытается одно на другое натянуть. Иногда что-то прикольное получается.
Аноним 10/09/26 Чтв 11:42:08 #450 №1700880 
>>1700860
Там 4 или сколько человека, а PRoв полтыщи висит. И в каждом челики срут сломанным кодом с сгенеренымм нейросетками описаниями/комментами особенно КЛАВДИЙ отбитую шизу любит писать
Да те же сберовцы вон принесли с ошибками которые можно было найти прогнав средненькой нейронкой, что и сделали (гитхаб копайлот с глм5.2)
Аноним 10/09/26 Чтв 11:42:12 #451 №1700881 
>>1700877
Ну епт напиши боту "высри мне сказку про гномов и эльфов в стиле Толкина" и посмотри какой она убогий слоп даст.

А потом дай тот же самый реквест, но при этом вставь главу из LOTR для референса, обозначив, что содержание и история нерелевантны и это именно стилистический референс. Результат будет куда ближе к "стилю Толкина"
Аноним 10/09/26 Чтв 11:43:09 #452 №1700882 
>>1700880
>те же сберовцы
Ты там говоришь, будто этот сброд лучше рандомного индуса на гитхабе
Аноним 10/09/26 Чтв 11:43:34 #453 №1700883 
image.png
>>1700872
Куда тебе столько лисих хвостиков? Не лопнешь?
Аноним 10/09/26 Чтв 11:44:38 #454 №1700884 
>>1700883
Я опираюсь на то, что если начнут под 2 ляма тренировать, то может наконец 500к - 1 лям начнут быть юзабельными и модель не будет срать под себя.
Аноним 10/09/26 Чтв 11:49:31 #455 №1700886 
Если посмотреть на файлы модели, походу релиз 4.1 это не 4/8-битный микс, а преимущественно 8-бит и всякие там куски в 16/32, то есть ужать ее до 4 бит вполне можно будет.

Так что шансы есть загнать эту залупу в 256-гиговые системы.
Аноним 10/09/26 Чтв 11:50:57 #456 №1700889 
А что вообще такое модель? Что находится внутри файла нейронки?
Аноним 10/09/26 Чтв 11:51:11 #457 №1700892 
dsf41.jpg
>>1700757
Аноним 10/09/26 Чтв 11:52:31 #458 №1700893 
>>1700892
хаха теперь KV кэш автоматически квантуется до 4-битного кала
ой блять до чего мы дожили
Аноним 10/09/26 Чтв 11:58:12 #459 №1700899 
1789030692217.jpg
Аноним 10/09/26 Чтв 12:00:17 #460 №1700901 
>>1700899
Хвостик!
Аноним 10/09/26 Чтв 12:00:33 #461 №1700902 
>>1700889
архитектура и веса
Аноним 10/09/26 Чтв 12:01:16 #462 №1700906 
1789030875909.mp4
Аноним 10/09/26 Чтв 12:07:10 #463 №1700910 
>>1700882
Ну свою сетку натренили, а у индусов чё там? САРВАМ? СИР! ДУ НОТ РИДИМ ЗЭ ФИФИ! БЛАДИ БЕНЧОД
Аноним 10/09/26 Чтв 12:07:35 #464 №1700911 
>>1700906
Ебать скримеры.
Аноним 10/09/26 Чтв 12:12:59 #465 №1700914 
>>1700910
>свою сетку
но ведь это же просто файнтюн, разве нет?
Аноним 10/09/26 Чтв 12:15:00 #466 №1700915 
>Флеш
>750В

Да за шо...
Аноним 10/09/26 Чтв 12:16:58 #467 №1700917 
>>1700914
Как же вы заебали, откуда вы лезете. Нет, это не файнтьюн.
Аноним 10/09/26 Чтв 12:19:42 #468 №1700920 
>>1700884
Современные корпы уже юзабельны при 1 млн, кстати.
Аноним 10/09/26 Чтв 12:20:18 #469 №1700923 
>>1700917
Ну ты что, карлики ведь видели архитектуру дипсика, значит дипсик. А как это работает- эт сложно.
Аноним 10/09/26 Чтв 12:25:18 #470 №1700929 
>>1700860

У них процесс заточен под 10-20 коммитов в день максимум. А им по 50 штук прилетает сейчас, вот и думай. Ну и да, заи не проплатили чтобы им вперед очереди одобряли PR, а ты как думал.
Аноним 10/09/26 Чтв 12:38:12 #471 №1700940 
>>1700757
Каков пиздец. Уже в 512гб еле-еле флеш лезет. И расширятся особо некуда. Покупать 2тб ОЗУ за 600к? ГПУ добавлять особого смысла нет, там либо по 400к за 48гб 4090, либо отбраковка в виде CMP 170 за 200к, расширение до 1ТБ+ памяти влетит в копеечку. Сплошной дум, остаётся копить и ждать новую возможность наебать систему.
>>1700869
>памяти надо будет 384гб
А это уже 512 гб ОЗУ у челиков скорее всего будет, а там уже и ллама не нужна, можно в ktransformer/fastllm оригинальные веса крутить
Аноним 10/09/26 Чтв 12:39:01 #472 №1700941 
Бля, ну все, 128 рам уже прошлый век. Похожу надо до 256 расширяться, пиздец.
Аноним 10/09/26 Чтв 12:40:51 #473 №1700943 
Да хуйня это все.
Нужно ждать.
Это уже какая-то лудка у вас началась.
Кто-нибудь обязательно высрет хорошую модель под 128.
Чо бухтеть и так хороших моделей дохуя.
Аноним 10/09/26 Чтв 12:40:59 #474 №1700944 
>>1700940
>>1700941
Хоть бы один лог принесли, расширяторы.
Аноним 10/09/26 Чтв 12:41:04 #475 №1700945 
>>1700940
Да не трясись ты, сказали же это не микс 4/8 в оригинальных весах как у прошлой версии, а тупо 8-битный с 16/32 кое-где. То есть ужмут как следует.
Аноним 10/09/26 Чтв 12:43:28 #476 №1700948 
>>1700944
Что я тебе принесу, я же сказал - у меня 128 рам. А так - моих скринов ГЛМ полон тред.
Аноним 10/09/26 Чтв 12:50:27 #477 №1700955 
deepseek.jpg
>>1700899
ты доиграешься
Аноним 10/09/26 Чтв 12:54:38 #478 №1700960 
>>1700943
В прошлом году вся надежда была на Гемму.
В этом году вся надежда на Гемму.
Ничего не меняется.

Гемма-гемма-гемма.
Аноним 10/09/26 Чтв 12:55:58 #479 №1700962 
14229370959290.jpg
>>1700929
>моё mfw ебало когда ещё не смержили тензор сплит 4.0 дипсика а уже вышел следующий с полностью новой архитектурой
Аноним 10/09/26 Чтв 12:58:17 #480 №1700966 
>>1700812
Надо брать iq4_xs обязательно от zerofata, там качество на уровне fp32 или чуть выше
Аноним 10/09/26 Чтв 13:01:02 #481 №1700971 
>>1700757
Плохой размер. Точнее хороший, но прошлый флеш не заменяет, жаль.
Сжатие контекста, конечно, колоссальное выходит, главное чтобы внимание не потерял к нему. Скорее бы поддержку прикрутили.
>>1700803
> лоботомированного 5.3
Не расстраивайся, он и в более жирных квантах припезднутый.
>>1700955
Ууу, пиздец, осуждаю! в перерывах между проигрыванием
Аноним 10/09/26 Чтв 13:04:03 #482 №1700980 
>>1700945
У меня то как раз 512гб, мне полные веса лезут. Но это пока, а через пол года что будет? Придётся на условную гемму 5 31b переходить из-за того, что всё остальное станет 1,5t?
Аноним 10/09/26 Чтв 13:04:14 #483 №1700981 
dsv41moedt.jpg
>>1700945
Почти нечего там квантовать. Нужно 330 гигов.
Аноним 10/09/26 Чтв 13:10:58 #484 №1700985 
>>1700462
Говно говна короче, эта ебота примерно как luqwen3.5, разница в мозгах и русике на уровне погрешности (хотя я туда нативный русский не синтетический датасет запихивал), так еще и лупится как тварь.
Сейчас еще одну попытку сделаю натренить с другими параметрами и чуть почистив датасет, но возможно luqwen4 не будет.
Аноним 10/09/26 Чтв 13:13:50 #485 №1700986 
>>1700899
Про скидку на мясо пока лучшее. Обожаю такие моменты от нейронок.
Аноним 10/09/26 Чтв 13:15:27 #486 №1700992 
>>1700899
Это и есть так называемый синий кит?
Аноним 10/09/26 Чтв 13:18:19 #487 №1700993 
Так, аноны что тестировали дипсик с виженом. Как он там? Стоит ли переходить с 0731? Вижен мне сразу скажу не нужен, сугубо РП.
Аноним 10/09/26 Чтв 13:23:34 #488 №1700999 
>>1700980
> мне полные веса лезут
Уверен? Там не только сами веса, но и кучу буферов + контекст загрузить надо.
>>1700993
Если сложится - сегодня попробую, отпишу тогда.
Аноним 10/09/26 Чтв 13:23:58 #489 №1701000 
>>1700993
Вижн откровенно пососный и картинку он шакально воспринимает, там какое-то смешное количество токенов на каждое изображение.
Аноним 10/09/26 Чтв 13:24:26 #490 №1701001 
>>1700993
Не переходи если всего хватает. Если цензуру не порезали, то без аблита я не смог получить писик сисик (в превью он легко выходил). Для вижен версии пока всё тухло по аблитам
Аноним 10/09/26 Чтв 13:31:21 #491 №1701008 
>>1700999
У меня 64+512, должно влезть
Аноним 10/09/26 Чтв 13:44:19 #492 №1701020 
>>1700993
Вижен мне понравился, он норм. Другое дело что вся линейка ДС4 для рп ужасна, так что разницы между 0731 не вижу.
Аноним 10/09/26 Чтв 14:40:34 #493 №1701079 
image.png
Не парьтесь насчет этого дипсика, у него внимание как у аквариумной рыбки. Вот он собственный ответ принял за ответ юзера. Это какой-то пиздец, дипсик становится все хуже и хуже. Xi, прекращай финансировать и дай лучше бабки на ГЛМ.
Аноним 10/09/26 Чтв 14:44:06 #494 №1701086 
>>1701079
Так это походу бесплатный чат
Они там Q1 используют
Аноним 10/09/26 Чтв 14:44:56 #495 №1701087 
Зато кэш до fp4 квантанули и можно выебнуться про эффективность. Мне кажется там эти гранты на разработку пилят только в путь.
> Дядя Сяо, открывай шампанское, едем обмывать очередной шаг ближе к AGI.

>>1701086
Я никогда не видел разницы по скорости между API и веб-чатом. Качество тоже всегда было плюс-минус однохуйственное. Вряд ли с 4.1 чето изменилось.
Аноним 10/09/26 Чтв 14:51:15 #496 №1701096 
Сбер Гигачат с ризонингом родил
https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B-Reasoning

>Где прирост больше всего относительно GigaChat 3.5 Instant:
>GPQA-Diamond: 61,11 → 82,32
>AIME-2026, mean@32: 67 → 92
>IFBench Loose Prompt: 43,66 → 77,00
https://habr.com/ru/companies/sberbank/articles/1080596/
Аноним 10/09/26 Чтв 14:53:11 #497 №1701101 
>>1701096
> 432B
> ризонинг
Хорошая шутка. Модели такого размера, еле пердящие на 5 т/с, ну может у кого-то на 10 т/с, только без ризонинга и юзаются.
Аноним 10/09/26 Чтв 14:57:24 #498 №1701103 
Короче, вот такие выводы по РП у современных моделей.

Квен 3.8 Next > Deepseek 07.31 > GLM 5.3 Flash

GLM сильно разачаровала, а вот новый Квен - это натурально наследник 235.
Аноним 10/09/26 Чтв 14:59:36 #499 №1701105 
>>1701103
>Квен 3.8 Next
Нарратор-аутист.

>GLM 5.3 Flash
Балабол контуженный.

> Deepseek 07.31
Шизофреник с деменцией.

Победителей нет. После жирного 5.3 глм все трое воспринимаются как дауны.
Аноним 10/09/26 Чтв 15:05:01 #500 №1701110 
>>1701105
>жирного 5.3 глм

Очень сомневаюсь что он хоть сколь-нибудь лучше флеша. По скринам в треде они пишут и размышляют почти одинаково.
Аноним 10/09/26 Чтв 15:09:21 #501 №1701113 
>>1701087
>Я никогда не видел разницы по скорости между API и веб-чатом
Тралируешь? Начнём с того что АПИ не отвечает на китайском с 50% шансом
Аноним 10/09/26 Чтв 15:09:27 #502 №1701114 
>>1701096
Аааа вон оно что, это у них не сломан ризонинг был, а они тупо не сделали его. А ведь в жинже вроде как был, и в папире тоже были упоминания размышлений. Ну, ок, надеюсь в этом цензуру не накрутили. Поставил на закачку.
Аноним 10/09/26 Чтв 15:10:24 #503 №1701115 
>>1701110
Я не знаю как это объяснить, но в РП-разговорах он чует на несколько шагов вперёд. Там не без своих проблем, структурые лупы есть и всякая срань как и у любой модели, но вот чисто по сообразительности - небо и земля.

Если карликов можно за нос водить, то большой 5.3 внезапно приятный партнёр в разговоре. Далеко до человека, но все же.

>>1701113
На китайском даже локальный Q8K_XL мыслит иногда, ну или Q8_0 от этих ваших бартовских, если угодно. Вопрос случайности.
Аноним 10/09/26 Чтв 15:12:03 #504 №1701116 
>>1701101
Так мож они к зиме распердятся и родят мелкомодель. Ризонинг костылями можно и для 3.1 включить, я включал по советам джемени, но это такое. Или хотя б прикрутят к 3.1 как-нибудь.
Аноним 10/09/26 Чтв 15:20:55 #505 №1701120 
>>1701114
Так у гигачата в гигачате лол бесплатном был ризонинг, в режиме "исследование" или как-то так
ПЕРЕКАТ Аноним OP 10/09/26 Чтв 15:28:58 #506 №1701126 
ПЕРЕКАТ

>>1701124 (OP)

ПЕРЕКАТ

>>1701124 (OP)

ПЕРЕКАТ

>>1701124 (OP)
Аноним 11/09/26 Птн 03:49:59 #507 №1701612 
>>1700889
>А что вообще такое модель? Что находится внутри файла нейронки?
https://weights-press.netlify.app/pdfs/WEIGHTS-Volume-1-Digital.pdf
comments powered by Disqus