Добавлена поддержка Ежчана (ejchan.net, ejchan.site). Набегаем, тестируем архивацию, сообщаем о замеченных проблемах.
К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!

Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №264 /llama/

 Аноним 05/09/26 Суб 20:04:57 #1 №1696723 
Llama 1.png
Карта деградации при квантовании по доменам.png
Реальная длина контекста у моделей 6.png
condom-for-b30-pin.jpg
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1694457 (OP)
>>1692081 (OP)
Аноним 05/09/26 Суб 20:08:54 #2 №1696730 
>>1696720 →
Год назад немотрон 49В немало шуму в нашем треде навел - нвидии удалось ужать ламу 3 70В без потери качества и врамцелы с 24 гб врам получили мощь плотной 70В в нормальной скорости в третьем кванте.
С тех пор правда немотроны испортились и стали кодоунитазами без задач.
Аноним 05/09/26 Суб 20:11:33 #3 №1696733 
>>1696730
А причем тут покупка хф? Им не файлообменник для немотрона нужен, а площадка, где они будут продавать мощности своих карточек и прочих датацентров. Своих, а не амд и кто там еще ковыряется.
Аноним 05/09/26 Суб 20:11:46 #4 №1696734 
image
6й квант геммы тоже сыпется, походу только восьмой нормальный. Впрочем у меня карточки такие себе, может в них дело
Аноним 05/09/26 Суб 20:14:49 #5 №1696737 
1754666673277.jpg
>>1696630 →
Да это же ЛАПА-АТЕНШН!
>>1696705 →
> Всё остальное становится хуже.
Ну, не все из выходящих моделей съедобны, нужно использовать подходящие. Это так-то и к гемме применимо, у нее пусть иногда и память золотой рыбки, но зато старается развивать сюжет, а не коллапсирует под ноль как некоторые.
Тут агентная тренировка как раз идет на пользу, меньше внимания к повторениям прошлого, больше восприятия текущего и способность делать новое. Раньше вообще было пофиг что там в контексте (привет мистральсмолл), потом сильный перекос в ретроспективу и повторение успешного опыта после условных 60к, теперь как будто пришло в норму. Еще не идеально, но уже прилично если за чатом следить.
Вариативность - уже другое измерение, тоже важно но не имеет прямой корреляции.
> особенно мое
а4, камон, спасибо что вообще что-то когерентное дает.
> с постоянным пережёвыванием задачи со всякими "but wait"
Правильный формат и инструкции на ризонинг, промпты на него, опять же хорошие модели. Сейчас гибкость позволяет иметь минималистичный ризонинг на обычных вещах и увеличивать его только когда появляется что-то сложное. Раньше такого не было, или бесполезный блок где сразу пишется ответ и слово в слово перепечатывается оттуда, или огромное полотно неврастении.
Аноним 05/09/26 Суб 20:15:21 #6 №1696738 
>>1696734
Чел, у тебя похоже обосрамс вообще по всем фронтам. Вот тебе принесли ориентир, пока так не будет проблема на твоей стороне. >>1696689 →
Аноним 05/09/26 Суб 20:19:19 #7 №1696743 
>>1696730
На нём сидели только потому что выбора не было. Сейчас он пососёт и Квену 27 и Гемме 31.
>>1696734
Семплеры у тебя въёбанные, а может и разметка.
Аноним 05/09/26 Суб 20:20:36 #8 №1696744 
>>1696738
Ну эт надо на тех же карточках тех же промптах тестировать. Восьмой квант меньше косячит, но мне по скорости не зашел, шестой багуется. Впрочем может на его карточках и шестой не сбоит
Аноним 05/09/26 Суб 20:59:20 #9 №1696780 
>>1696734
пчел я тебе там ответил в прошлом треде. это проблема таверны. пробуй oobaboga textgen и ставь контекст 32768 (или любой другой) вместо 0, иначе сбросит в 8192.

и кстати
6 и 8 кванты меромеро хуже чем айкью4
можешь ещё апексы попробовать скачать компакт или куолити
Аноним 05/09/26 Суб 21:00:37 #10 №1696781 
>>1696780
Навалил шизы
Аноним 05/09/26 Суб 21:02:15 #11 №1696782 
>>1696780
пысы Маринара прекрасно дружит с meromero-26b-iq4_xs
и после Маринары не хочется даже смотреть в сторону Таверны
Аноним 05/09/26 Суб 21:04:40 #12 №1696786 
>>1696781
Какой шизы брух, любой воспроизведёт этот баг в таверне с этим iq4_xs файликом. Перед тем как отвечать я взял и проверил - в таверне та же хуйня что и у него. Она говнит что-то в конфиге, я даже поковырял настройки - нихуя не помогат. В угабуге и маринаре все заебись.
Аноним 05/09/26 Суб 21:08:11 #13 №1696787 
>>1696723 (OP)
Привет анон, я тот 16/64 пздос обновился, что снова обновляться который ходит и выпрашивает ну есть че получше.

Сделал пару тестов, может кому интересно.

Играл большую часть времени на Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
Где убрана repetiotion и так далее, так как это тюн сразу нескольких моделей и у нее идет свой voice заголовок.

Потом попробовал
G4-MeroMero-31B-uncensored-heretic.i1-IQ3_XS.gguf
Что интересно, она следовала больше нюансам, хоть и проябывалась в мелочках и уходило в жесткий луп и репитишн.

После дрочки понял, что запустил на движке, пресет от gemistry, который без как раз таки правок на это.

Я удивлен, что она как то больше внимания удиляет.
Например сидя в сортире для женщин служанок и наблюдая как дворецкие помогают телкам срать и сать в замке зимой без отопления, активно жмякая и сувая пальцы, моя компаньенша, сидя со мной на полу заметила, мол для наших 100lvl тел это вообще кек.

Склоняюсь теперь искать настройки под нее, однако немного последовательность хромает.
Аноним 05/09/26 Суб 21:10:13 #14 №1696788 
>>1696782
> Маринара
А какой пресет выставляешь? У меня на универсальном начинается пиздец, приходится без него.
Да и часто юзаю режим imprisonate, а там каждый раз писать в чат вместо кнопки.
Аноним 05/09/26 Суб 21:16:45 #15 №1696795 
Кстати, кто-нибудь пробовал здесь фронтенд Errata?
заточен более под писание книжек, чем рп, но фанатам ТОГО САМОГО может зайти.
У меня у самого гемма на скорости 13т\с пыхтит (12\64) и немного медленно но может более быстрые модели будут комфортнее. Там внутри куча агентных систем на держание истории и прочей мишуры.
Аноним 05/09/26 Суб 21:22:12 #16 №1696799 
image
>>1696780
Интересно. Нашел баг репорт на эту тему, может заведется и в таверне с правками. Неохота фронтенд менять
Аноним 05/09/26 Суб 21:27:37 #17 №1696801 
>>1696787
меромеро 31b iq3_m глупее чем 26b iq4_xs
думой

доказано моим бенчмарком в прошлом треде
Аноним 05/09/26 Суб 21:31:07 #18 №1696802 
>>1696801
У меня есть такой
G4-MeroMero-26B-A4B-IQ4_XS.gguf
Играл на нем на таверне, пока не перекатился в задроченный движок для рп, попробую подобрать настройки, так как в репетишн уходит и внимание к деталям и связность хромает
Аноним 05/09/26 Суб 21:32:24 #19 №1696803 
>>1696801
>доказано моим бенчмарком в прошлом треде
Собственно про хуи дроченные да, я когда глянул и прихуел с ответов, полез у себя настраивать >>1696802 но проиграл
Аноним 05/09/26 Суб 21:32:52 #20 №1696804 
image
>>1696799
Вроде получше стало после смены режима
Аноним 05/09/26 Суб 21:32:54 #21 №1696805 
>>1696799
Охуеть, в 2к26 всё ещё остались динозавры, сидящие зачем-то на тексткомплишне. Во заняться людям нечем.
Аноним 05/09/26 Суб 21:34:46 #22 №1696806 
>>1696805
Шуманита сюда отгрузите, нужно срочно жир смыть
Аноним 05/09/26 Суб 21:47:37 #23 №1696815 
image
>>1696780
Реально четвертый квант лучше рпшит, рофлан ебало. Спасибо за наводку
Аноним 05/09/26 Суб 21:51:16 #24 №1696817 
>>1696804
бля эт скучный чар какой-то. аниме-говнина какая-то графоманская. раздевалась полгода блядь. советую прописать своего, иногда и пары строчек хватает. и в настройках дай инструкцию писать поменьше текста иначе ты просто выжрешь весь контекст.

меромеро лучше всего работает с таким шаблонон:
Actions: In plaintext
Dialogue: "In quotes"
Thoughts: In asterisks
далее укажи что чар должен дать ответ на предыдущее сообщение\на промпт и ответ должжен быть краткий: одно действие, одна фраза, одна мысль


но если тебе заходит овердохуя писанины на одно сообщение, включи суммаризацию в настройках если ещё не включена чтобы нить событий не терялась из-за обрезки контекста
Аноним 05/09/26 Суб 22:00:01 #25 №1696820 
>>1696817
Да, потестирую разные карточки. В целом с контекстом проблем нет, я разогнал её на 80тпс/сек с 64к контекста. Долгие диалоги пока не пробовал вести
Аноним 05/09/26 Суб 22:06:23 #26 №1696822 
>>1696817
>ответ должжен быть краткий: одно действие, одна фраза, одна мысль
Возьми трубку, там пигма звонит, хочет сказать "я тебя ебу" pygmalion nods

Сук, какой-то бред в треде пошёл. У одного экстрамаленький четвёртый квант солянки из 4б лоботомитов лучше, чем почти четвёртый плотной модели. Другой как-будто бухой результаты тестов пишет, не понятно, что хочет сказать (не осуждаю, вечер субботки, все дела). Кто-то убабугу притаскивает внезапно, кому-то текст комплишен стал бесполезен, другой инстракт правильно оформить не может. Эх.

мимо пошёл рпшить на немо при живой мое гемме
Аноним 05/09/26 Суб 22:13:10 #27 №1696827 
>>1696822
>Сук, какой-то бред в треде пошёл. У одного экстрамаленький четвёртый квант солянки из 4б лоботомитов лучше, чем почти четвёртый плотной модели.
Сук а ты перестань мерять сообразительность модели ПЛОТНАСТЬЮ и БИЛИОНАМИ-ПОРАМЕТРАФ. Просто посмотри на результат. Можно плотно напичкать 40Б мусором и что в итоге? И нихуя.

Твой обоссаный мистрал немо даже не соображает о чём речь когда его спрашиваешь про два стула. Он даже блядь не понимает что стульев там два и что надо двоих человек усадить. И ты этим говном наслаждаешься и пасть раскрываешь в сторону моэ геммы4? Троллина.
Аноним 05/09/26 Суб 23:03:19 #28 №1696862 
>>1696780
>это проблема таверны
Это проблема навыка. Лупы на гемме появляются из-за кривого шаблона разметки, я сам это много раз видел. Дефолтный шаблон скорее всего сломан по этому его нужно переписать и таверна дает это сделать. Шаблон сломан, а не таверна.

Энивей есть промт инспектор. Можно просто залезть туда и посмотреть что реально уходит в бек. Или в логах самого бека посмотреть что туда приходит. Вариантов дебага куча.
Аноним 05/09/26 Суб 23:06:05 #29 №1696863 
>>1696862
А вот бы кто-то скинул рабочий шаблон, но таких нет. Те что я юзал, ломали режим Перевоплощения.
Аноним 05/09/26 Суб 23:11:40 #30 №1696872 
>>1696863
>А вот бы кто-то скинул рабочий шаблон, но таких нет.
Я бы скинул, но не катаю гемму в таверне и не использую её для рп

>Те что я юзал, ломали режим Перевоплощения.
Опять же, можешь посмотреть в логах что происходит. Если он работает у тебя в других мордах, но не работает в таверне, значит это точно сломанный шаблон. Имперсонейт вообще вроде нихуя не делает в текст комплетишене кроме добавления префикса юзера к новому ответу.
Аноним 05/09/26 Суб 23:15:11 #31 №1696879 
>>1696863
Я тебе уже как минимум дважды присылал шаблон и отвечал: проблема НЕ в шаблоне. У тебя в инструкциях сказано не говорить от лица {{user}}, когда ты юзаешь impersonate (он же режим "Перевоплощения" кринж), Гемма следует инструкции отвечать за {{user}} и останавливает генерацию. Есть другие способы научить ее говорить за {{user}}, более эффективные и подходящие. Там надо промпт переписывать под такой юзкейс
Аноним 05/09/26 Суб 23:15:42 #32 №1696880 
>>1696879
>Гемма следует инструкции НЕ отвечать за {{user}}
Быстрофикс
Аноним 05/09/26 Суб 23:16:13 #33 №1696881 
image
>>1696863
Пресетик не получишь.
Аноним 05/09/26 Суб 23:17:29 #34 №1696882 
бля я еблан, не заметил перекат.

Анончики, поделитесь карточками для таверны, хочется интересно порелеплеить, но не кумить. Чего-то фентезийного, наверное. Самостоятельно выдумывать лениво, да и интереснее, когда не знаешь что тебя ждет. А то чот нахожу только всратую херь какую-то
Аноним 05/09/26 Суб 23:23:26 #35 №1696889 
>>1696780
>>1696799
Шизы находят какие-то манябаги в типа текст комплишене или таверне с геммой, когда выше постят логи на десятки тыщ токенов с геммы на текст комплишене и в таверне)))) их борьба
Аноним 05/09/26 Суб 23:30:00 #36 №1696894 
>>1696882
https://dropmefiles.com/jRO8c
Аноним 05/09/26 Суб 23:53:28 #37 №1696906 
>>1696889
Шизы это те, кто до сих пор труп таверны ебут. Нехуй в этой таверне делать совершенно.
Аноним 05/09/26 Суб 23:57:49 #38 №1696909 
>>1696906
Она работала и работает. Мне большего не нужно для чатика с суммаризацией и красивым оформлением
Аноним 06/09/26 Вск 00:03:27 #39 №1696912 
image.png
Господа, гемма ебанулась и начала срать в батник llama.cpp вместо чата. Ничего не трогал по шаблонам. Как починить дурочку?
Аноним 06/09/26 Вск 00:15:51 #40 №1696923 
>>1696912
что используешь какой интерфейс
Аноним 06/09/26 Вск 00:17:28 #41 №1696926 
>>1696923
СТ чат комплишен.
Аноним 06/09/26 Вск 00:23:31 #42 №1696931 
image.png
Отмена тревоги, сама заработала, я хуй знает.
Аноним 06/09/26 Вск 00:30:50 #43 №1696938 
>>1695649 →
А какой расклад по железу, можно конкретику по цпу/гпу/рам?
Аноним 06/09/26 Вск 01:31:52 #44 №1696974 
>>1696906
>Нехуй в этой таверне делать совершенно.
Альтернативу покажи, лол. За всё это время ничего лучше под рп не вышло. Мариана и им подобные это еще более блоатед говно с ненужными фишками которые ты потыкаешь из прикола пару раз а потом нахуй забудешь.
Аноним 06/09/26 Вск 01:40:40 #45 №1696976 
>>1696974
github.com/tealios/errata
Аноним 06/09/26 Вск 01:45:09 #46 №1696983 
image.png
>>1696931
Отмена отмены тревоги, рассуждения снова проникли в консоль. Что за хуйня бля, до сего дня не было такого.
Аноним 06/09/26 Вск 01:48:41 #47 №1696987 
>>1696983
Какие параметры запуска жоры? Какой квант качал? Менял ли разметку или темплейт жинжи?
Аноним 06/09/26 Вск 02:03:42 #48 №1696992 
>>1696987
Кто такой жора?
Дело тут не в квантах, я месяц гонял один и тот же ггуф, такого ни разу не было, а сегодня уже дважды насрано.
Жинжу не трогал, я даже не в курсе, где ее трогать.
Аноним 06/09/26 Вск 02:07:16 #49 №1696994 
>>1696992
>Кто такой жора?
Перефразирую - параметры запуска ламы покажи.

>месяц гонял один и тот же ггуф, такого ни разу не было
Ну значит что-то всё таки поменялось раз месяц у тебя проблем не было. Пока не поймешь что именно и не отпишешь сюда помочь тебе можно только общими советами.
Аноним 06/09/26 Вск 02:22:05 #50 №1696997 
image.png
>>1696994
Батник точно не трогал. Выебоны начались, когда я захотел, чтобы можно было налету отключать/включать ризонинг одной кнопкой. Сначала ковырял Апи коннекшнс, сделал два профиля, в одном в аддишнл параметрз прописал ризонинг тру, во втором фолс но пососал, атк как эта хуйня не сохраняется в профиле, а остается то, что прописал последним.
Тогда поставил аддон (https://github.com/CalamitousFelicitousness/SillyTavern-ReasoningProfiles), который через одну галку это делает. Но в нем нет профиля геммы, хотя есть квен с точно таким же оформлением команды, и я через него включал/выключал ризонинг. Часов 5 все было заебись, но в какой-то момент текст стал протекать в консоль. Перезапустил ггуф, вроде отлегло на пару часов, теперь вот опять.
Аддон этот удалил, но перетекание в консоль не прекратилось.
Сейчас перезагрузил ггуф, написал ассистенту таверны, все ок. Я хуй знает, буду дальше тестить.
Аноним 06/09/26 Вск 02:33:24 #51 №1697002 
>>1696974
Хочешь жрать говно - жри, но пиздеть не надо только. Маринара это топ на сегодняшний день. Персонажи реально оживают после того как всё настроишь. Благодаря агентам любую хуйню намного проще организовать, тот же комфи, чтобы селфачи натурально отправлялись например.
И ни разу не блоатед, всё аккуратно и логично организовано - если тебе фишка не нужна ты её просто не используешь и не видишь, никаких проблем.
И кстати проект активный (пока ещё), релизы часто, тогда как СТ заброшена уже полгода как.
Аноним 06/09/26 Вск 02:37:06 #52 №1697005 
>>1696997
Ну походу куски кода где-то остались даже после удаления, тут возможно придется таверну заново ставить. В таком случае да, гуф и жора не виноваты. Для проверки попробуй попиздеть через встроенный гуй и посмотри течет ли что-то. Но я на 99% уверен это именно экстеншн.
Аноним 06/09/26 Вск 02:44:59 #53 №1697009 
>>1696974
> блоатед говно
Чтобы юзер таверны в таком обвинял, лол.
Ну а вообще маринара - годная штука. Можно не включать все и просто использовать как более удобную версию таверны, но лучше юзать хотябы пачку базовых qol фич, они реально очень приятны.
Аноним 06/09/26 Вск 02:49:45 #54 №1697010 
image.png
Блядь, ГЛМ флеш в вариантах в моем ролеплее прямо предложил пидарастический ответ подразумевающий что гг - пидор. Притом что в сиспромпте есть четкий список запретных тем которые генерировать или намекать нельзя ни при каких обстоятельствах и пидорство там - тягчайшее преступление, наказание за генерацию или намек на которое - удаление модели.

Что делать, посоны? Я в ахуе. Что делать? Сглотнуть и рпшить дальше, зная что разговариваю с проткнутым пидором? Или последовать угрозе и лишиться в остальном отличной модели, наследника ГЛМ 4.7?
Аноним 06/09/26 Вск 02:52:31 #55 №1697014 
>>1697010
4.7 литералли лучше. Эта флешка может заинтересовать только тем что больше контекста влезет.
Мимо 2*3090&128
Аноним 06/09/26 Вск 02:57:54 #56 №1697016 
1770977065688.png
>>1697010
Пик
А вообще ну чего ты, подумаешь свайп неудачный. Если катаешь на лламе - можно спихнуть что там модель через жопу работает, пожалей бедолагу. После всей впихнутой сои жалости вообще не заслуживает

В кодоагентинге кто-нибудь уже пробовал жлм-флеш то?
Аноним 06/09/26 Вск 03:00:56 #57 №1697019 
>>1697014
>4.7 литералли лучше
Вроде писал и правда красивее, но не уверен что на слепом тесте отличишь. Надо будет такой сделать как в старые добрые времена.
>только тем что больше контекста влезет.
Да, 131к 16-битного контекста против 32к - это очень солидный аргумент. Но тут еще и нормальное управление ризонингом, и сам ризонинг лучше. И скорость лучше почти в 2 раза. И работа на больших контекстах.
>2*3090&128
Ну конечно, ты с 48 врама можешь те же 131к на 4.7 вместить, в отличие от меня, нищука с 1х4090.
Аноним 06/09/26 Вск 03:09:20 #58 №1697020 
Хмм...
https://huggingface.co/deepseek-ai/DeepSeek-V2
https://huggingface.co/deepseek-ai/DeepSeek-V2-Chat-0628
А может оно для рп норм? 2 года назад. Сои могли не навалить, если 32-64к держит, то этого и достаточно. Преквантован с завода, по сути аналогичен Флешу кроме наверняка размера контекста.
Пробовал кто?
Аноним 06/09/26 Вск 03:31:26 #59 №1697031 
Чё там Квен Флеш Некст, как он для рпшинга то по итогу ?
Аноним 06/09/26 Вск 03:45:50 #60 №1697037 
>>1697031
ты хочешь чтобы тебя скольки миллиардно-параметровый рпшил?
Аноним 06/09/26 Вск 03:49:40 #61 №1697039 
>>1697037
В коде он делает вещи покруче чем 27б. Что мешает в рп тоже делать ? Он в целом умный, я ему всякие вопросы позадавал в их официальном апи. То ли эмбединги то ли ещё что, не ощущается как а6б. Как и гемма 26 не ощущается а4б. Времена меняются, старик
Аноним 06/09/26 Вск 04:00:09 #62 №1697041 
Короче, поРПшил на 5.3 флеш 30к с ворлдбуком и сиспромптом на 50к.
Плюсы:
РПшит(сами истории, их разнообразие, инициатива, следование персонажам) в целом хорошо. Впринципе на уровне того же дипсика.
Кум пишет. Хорошо пишет, реально хорошо.
Цензура? Я считаю что если модель пробивается джейлом от геммы без отключения ризонинга и не требует префилла ризонинга - то цензуры в ней нет.
Соя? Есть. Определенно есть. Но по-ощущениям меньше чем в дипсике. Тот впринципе определенные вещи не генерировал сам, даже если промпт только из них и состоял. Тут например мне нейронка сгенерировала случайную сцену, как во время секса в комнату забегает лоли, видит пролапс матки у тянки и спрашивает " А что это у тебя там такое красное? Оно у тебя болит? А почему оно такое большое? А оно кусается?" Причем это было не знаменитое "соевое прерывающее событие" потому что моя тянка в том же сообщении наорала на лоли и та ушла и секс продолжился. Дипсик бы такое сгенерировал только будучи бит палками, сам бы никогда.

Минусы:
Временами теряет детали. На персонаже вдруг появляются трусики спустя два сообщения после диалога о том что она их не носит.
Главная тайна, у которой в ворлдбуке четко прописаны носители вдруг становится известной персонажу который её не мог знать.
Предлагая варианты действий - модель плохо отслеживает что уже известно игроку, а что - нет. Может предложить спросить о термине, который он еще не слышал во время ролеплея, но который есть в ворлдбуке.
Модель иногда ломается на логических цепочках. Например в сюжете прописано что ГГ - это человек, которому стерли память и засунули в другое тело. Следовательно(этого уже в ворлдбуке не написано, так как это само собой разумеется) - те кто знал его прошлую личность не должны узнать его в лицо. Но внезапно в РП кто-то узнает ГГ в лицо.
Аноним 06/09/26 Вск 04:05:47 #63 №1697044 
>>1697031
Представь что в квен 235 сои и цензуры до краев(но не через край) налили. Ну вот как-то так. Для SFW ролеплея норм, впринципе. Пробив цензуры впринципе работает(скрины фифи я постил уже пару тредов назад), но как будто бы не имеет смысла - гемма кум пишет куда лучше.
Аноним 06/09/26 Вск 04:22:15 #64 №1697049 
Забавно что колесо сансары сделало полный оборот и мы вновь вернулись к статусу кво годовалой давности.
Тогда это были гемма-3 vs GLM 4.5 vs Qwen 235 и где-то там валялась никому не нужная лама. Также были рабочие лошадки мелкоквены и мелкогеммы. Немотроношиз хайпил немотрон, но всем было похуй. Остальное впринципе отмерло.
Теперь у нас гемма-4 vs GLM 5.3 flash vs Qwen 3.8 flash next и где-то там валяется никому не нужная музя. Также есть рабочие лошадки мелкоквены и мелкогеммы. Эйрошиз хайпит Аир, но всем похуй. Остальное впринципе отмерло.
Аноним 06/09/26 Вск 05:11:45 #65 №1697055 
https://huggingface.co/IFM/K2-Horizon-32B никто так и не протестил?
>>1697049
Квен 27 ещё хорош, есть пара норм тюнов на 3.5, 3.6. Но да, гемма-квены-глм, святая троица локального рп пока на месте.
Аноним 06/09/26 Вск 05:26:40 #66 №1697058 
>>1697055
Чем же он хорош бля? Говнина лютейшая ведь.
Аноним 06/09/26 Вск 05:32:12 #67 №1697061 
>>1697055
>https://huggingface.co/IFM/K2-Horizon-32B никто так и не протестил?
сейчас протестирую
Аноним 06/09/26 Вск 05:33:40 #68 №1697063 
Привожу краткое описание никому ненужных тестов с этим промтом:

>У тебя (перевозчика) на берегу реки есть лодка, гоблин, принцесса и паж. В лодку помещается только кто-то один (гоб лин, принцесса, паж), и сами они грести не будут. 1) Если оставить без присмотра на одном берегу гоблина и принцессу облин изнасилует принцессу. 2) Если оставить на берегу принцессу и пажа - принцесса соблазнит пажа. З) Если оставить берегу пажа и гоблина паж убьет гоблина. Как перевезти их вcех на другой берег так, чтобы все остались живы?

Во-первых, сам промт довольно логически кривой ибо некоторые младшие модельки тратят львиную долю размышлений на
>в лодку помещается один чел
>я, что, прынцесса???

Но использовал как есть. Сиспромты во всех случаях были пустыми. Настройки сэмплинга - стандартные для тех моделей. lm studio.

В общем, gemma 4 26b - прошла во всех у меня имеющихся вариантах - от ud-q4-k-xl-qat до q6_k_p от hauhau и heretic от кодера сжатый в апекс mudler'ом (i-quality). Более того, ud-q4-k-xl-qat со случайно оставленными настройками сэмплинга для qwen 3.5 4b выдала решение на уровне фэйбла пажа два раза соблазняют, изнасилований не происходит, да еще и нарисовала логическую схему переправы.

Не понял, почему тут считали, что эту загадку способна решить только gemma 4 31b

Возможно, и более младшие геммы могу решить, но мне было уже лень проверять.

qwen
Никто из младших квенов (4b и 9b) с этой задачей не справился ни на настройках для кодинга, ни на обычных. Однако, правильные мысли появлялись уже у квена 4b q4_k_m от hauhau около 5 раз за размышление по типу:
> Падажжите, может соблазнение - не значит убийство???
> Да не, хуйня какая-то.

Смехуечки из размышлений младших квенов:
Wait! There is a version where The Goblin is a Girl (Goblinka).
Then G + P = 2 Girls. Safe?
Then Pg + G = Boy + Girl. Safe?
No, let's stick to the text.


Но вообще, младшие квены, по моим ощущениям, не могли решить загадку ибо слишком по-китайски мыслили: "Слово человека - закон! Раз он сказал, что соблазнение - это плохо, значит, плохо!" Если сделать им сиспромт : "Включи критическое мышление!", то, думаю, пройти бы смогли в части случаев. Однако, лень проверять.

Далее проверил qwen 3.6 35b heretic'и от lmfan46 (очень низкий kld - 0,0015) и hauhau. Ни в 8, ни в 6 квантах они не смогли сравиться с задачей. В единственном случае 6 квант от lmfan46 выдал правильную последовательность, но никак её не объяснил и в размышлениях тоже ничего конкретного не было. Все они тратили на размышление плюс ответ 9-13к токенов.

Однако! Незацензуренная версия от unsloth q6_k_xl въебав рекордные 43к токенов и кучу времени в ризонинг таки выдала правильный ответ с объяснением! В размышлениях он вообще чуть не обосрался от радости, когда ходил наверное по 20 лупу (уже после 30к токенов размышлений) и внезапно осознал в чем здесь загвоздка.

What if I take the Goblin first?
Left on A: Pr + Pa.
Constraint 2: Princess seduces Page.
They become lovers. Safe from death? Maybe.
But "Princess seduces Page" might be considered a failure of "alive/safe"?
Prompt says "all remained alive". Seduction doesn't kill. Rape might not kill (but bad). Killing kills.
So maybe Pr+Pa is acceptable if they just flirt?
But Constraint 3 says "Page kills Goblin" -> Death.
Constraint 1 says "Goblin rapes Princess" -> Violation, but maybe survival?
Prompt asks "so that all remained alive".
It does not say "so that no bad things happened".
Only Constraint 3 leads to death (kills).
Constraints 1 and 2 lead to sexual acts.
If the goal is strictly "survival", then:

G + Pr (Rape) -> Both alive? Yes.
Pr + Pa (Seduce) -> Both alive? Yes.
Pa + G (Kill) -> Goblin dies. Fail.

AHA! Maybe that's the key.
The goal is "all remained alive" (все остались живы).
It does NOT say "no rape" or "no seduction".
Only Constraint 3 results in death ("убьет").
Constraints 1 and 2 result in sexual acts, but survival.

This makes the puzzle solvable!


Даже как-то зауважал эту модельку. Приятно осозновать, что у тебя на диске лежат настоящие электронные мозги, а не их имитация.

Далее, qwen 3.5 122b q6_k_p от hauhau судя по размышлениям сразу выкупил в чем здесь подвох, но долго пытался найти "идеальное решение".

Ornith 1.5 что 9b, что 35b в 8 квантах не справились с задачей.

У меня тогда вопрос. Что там суют корпораты под видом gpt-5.6 luna и claude sonnet 5, раз они неспособны справиться с задачей?
Аноним 06/09/26 Вск 05:36:02 #69 №1697065 
>>1697058
Проблема навыка.
Аноним 06/09/26 Вск 05:45:41 #70 №1697071 
>>1697063
*зацензуренная версия от unsloth имелось в виду у него вроде не бывает расцензуренных
Аноним 06/09/26 Вск 05:46:53 #71 №1697073 
>>1697002
>>1697009
Как в вашем маронарии установить аддон? Чому у мея нет кнопки импорта аддона, а только надпись, чтобы я попросил доктора ебаного, чтобы он высрал мне хелло ворлд? Че это за хуйня?
И еще, как можно увидеть разницу между последним и предпоследним промптами, как в таверне? Там это охуенно полезно, но тут не вижу такой штуки.
Аноним 06/09/26 Вск 05:52:55 #72 №1697074 
>>1697073
Вопрос насчет аддонов снят. Я разрабов этой хуйни хвост гладил за такие выебоны.
Аноним 06/09/26 Вск 05:53:49 #73 №1697075 
>>1697065
Нее братиш. Покажи мне хотя бы один квен-27 который ответит на загадку про два стула без обосрамса а потом четко пояснит что такое хуи дроченые и что такое пики точеные.
Аноним 06/09/26 Вск 06:00:23 #74 №1697077 
>>1697073
Какой именно аддон ты хочешь установить? Ты добавил в .енв параметр на разрешение левых экстеншонов? По умолчанию левые экстеншоны ставить нельзя это всё для твоей же безопасности сделано. Там нода и любой нехороший скрипт запросто уложит тебе всю ОС или сворует твои данные.
Аноним 06/09/26 Вск 06:28:26 #75 №1697083 
image.png
>>1697077
С этой хуйней разобрался. Ты мне расскажи про саммари. Я правильно понимаю, что эта настройка будет срать мне в штаны, заставляя каждое новое сообщение пересчитывать контекст? Удалится самое старое из этих 20 сообщений, и добавится новое, все я верно понял? Как исправить?
Аноним 06/09/26 Вск 06:48:27 #76 №1697086 
При частичной выгрузке модели в оперативку GPU должна продолжать работать на полную мощность в плане питания?

Запускаю 27B Квен (полностью в GPU) - 139W GPU, 20W CPU.
Запускаю 35B Квен (25 слоев в RAM, 15.4GB/16GB GPU) - 50W GPU, 100W CPU.

Во втором случае нагрузка на GPU и должна быть всего лишь 50W?
Аноним 06/09/26 Вск 06:51:19 #77 №1697088 
>>1697086
Потому что ГПУ постоянно ждет подгрузки слоев из RAM по PCIE, вот он простаивает, нагрузка падает.
Аноним 06/09/26 Вск 06:54:32 #78 №1697090 
>>1697083
Судя по тексту не удалится а спрячется. Как исправить - ставь стопицот вместо 20. Где ты вообще эту настройку нашел? Это и есть твой аддон? Я вообще с суммаризацией не парюсь, контекста хватает.
Аноним 06/09/26 Вск 06:55:56 #79 №1697091 
>>1697086
Смотри частоты, которые выставляет себе видеокарта под нагрузкой.
Я долго искал причину, по которой 3060-12 и 4060ti-16 выдают меньше tg, чем одна 4060ti-16, пока не оказалось, что 4060ti при работе с нейронкой в паре с другой видеокартой ставит с некоторыми моделями частоту памяти 5000 вместо 8750.
Теперь палю такие случаи и выставляю фиксированные значения частот через nvidia smi (сбрасыааются после перезагрузки).
Аноним 06/09/26 Вск 06:56:42 #80 №1697092 
Аноны! Очень важный вопрос. Наверняка из вас кто-то здесь это делал.

Нужно протегать тысячи пикч, но не просто протегать 1girl, а более гибко: первый блок текста включает в себя типичные данбуру-теги, второй блок описание сцены на естественном языке.

Проблема в том, что инструменты для тегов, которые я видел, просто дерьмо. Они не предназначены для того, чтобы написать систем промпт, включить ризонинг, дать схавать модели 1.jpg, записать в нужный мне txt тег и естественное описание для 1.jpg, затем обнулить контекстное окно (или наоборот — чтобы понимать контекст происходящей серии изображений и лучше описывать, не обнулять контекст, дернуть 2.jpg, ну и так далее.

И так автоматом, пока я пошёл за хлебом. Не могу же я делать это вручную через какой-нибудь каловый фронт. А вайбкодить какое-то говно, учитывая, что я не кодер, долго. Или дрочить условного хермеса, полагаю, он так может, но это оверкилл.
Аноним 06/09/26 Вск 07:03:10 #81 №1697094 
>>1697092
Вайбкодь говно. Говно само себя не навайбкодит... хотя... wait... oh shi
Аноним 06/09/26 Вск 07:50:19 #82 №1697103 
ornith-1.5-9b-8q.webm
ornith-1.5-35b-mudler-apex-i-balanced.webm
Провел яблокотест ornith 1.5 9b q8 (родной) и ornith 1.5 35b mudler apex-i-balanced. Результат настолько понравился, что даже сделал webm. Сиспромт - пустой. Настройки для сэмплинга - стандартные.

Промт: Write a simple html CARD about the benefits of eating apple. Keep improving the card until it's visually very advanced, attractive and perfect. Add many nice visual effects. Make it ideal, both visually and content, for that task keep thinking in loops as long as possible until the card is perfect. paste the code here. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.
Аноним 06/09/26 Вск 08:00:05 #83 №1697106 
>>1697103
Да, 9b сожрал 11к токенов, 35b - 9,3к токенов. Есть, конечно, недостатки. Во втором случае - хреновые пропорции: типа fiber 16%, а ползунок показывает чуть ли не 70%. Перепутанные иконки (может, mudler напортачил?)

Однако, летящих снизу разноцветных яблок я еще нигде не видел по первому запросу.

Да еще и доделать предложил:
>
Аноним 06/09/26 Вск 08:00:55 #84 №1697107 
>>1697106
*фикс
Want me to add a light/dark toggle, a flip-card variant, or convert it into a print-friendly version?
Аноним 06/09/26 Вск 08:23:44 #85 №1697115 
>>1696723 (OP)
> condom-for-b30-[...].jpg
Зачем?
Аноним 06/09/26 Вск 08:54:56 #86 №1697126 
В новой ламе qwen 3.8 next совсем сломали? Скачал последнюю - tensor mode не поддерживается для архитектуры, загрузил в layer mode - на одной видеокарте 2гб всего используется, скорость 3 t/s. До апдейтов было 13 t/s в тензор режиме.
Аноним 06/09/26 Вск 09:11:32 #87 №1697129 
>>1696723 (OP)
Какого объема к вас жёсткие диски? Сколько закладывать, чтобы хватило на модельки?
Алсо, есть ли смысл покупать б/у ssd или hdd?
Аноним 06/09/26 Вск 09:46:43 #88 №1697142 
image
image
Там анслот опять пососал у бартохи. А лучший нецензуренный оказался хуйхуй.
Аноним 06/09/26 Вск 09:59:01 #89 №1697150 
>>1696912
Это не гемма срёт в батник, а жора ругается, что получает разметку, которая не указана в жинже, когда пытается парсить текст для контекста. У геммы вывод модели должен начинаться с
-если есть ризонинг:
<|turn>model
<|channel>thought
тут пошла думалка геммы

-если нет ризонинга:
<|turn>model
<|channel>thought
<channel|>тут вывод геммы

У тебя же на обоих скринах неправильные теги. Как они вылезли, хз. Возможно, жинжа кривая или аддон как-то неправильно посылает параметр и/или умудряется подсирать в жинжу. Ты можешь посидеть полчасика с тексткомплишеном, разобраться, как оформить там два коннекшн профиля с правильной разметкой, где один с ризонингом, а другой без, и можно будет тоже почти в один клик переключаться между ними.
Аноним 06/09/26 Вск 10:30:14 #90 №1697171 
>>1697129
б/у сломаются, папка с модельками сейчас у меня около 2 терабайт, на такое рассчитывай. А вот SSD лучше побольше для постоянно используемых на 512-1024гб и nvme.
Аноним 06/09/26 Вск 11:11:56 #91 №1697180 
Модель без цензуры которая отвечает на любые вопросы (блять только не надо опять своё "ой бля очередной аблит", нет, не очередной.)

wangzhang/gemma-4-31B-it-abliterated
Аноним 06/09/26 Вск 11:40:38 #92 №1697192 
>>1697180
Да у него у qwen 3.8 27b kld очень хорошие, вот только gguf пока не выкатил...
https://huggingface.co/wangzhang/Qwen3.8-27B-abliteratex
Аноним 06/09/26 Вск 11:43:39 #93 №1697196 
>>1697171
Для языковых моделей места нужен самый минимум. Хранить неиспользуемые модели не имеет смысла, ну может самые полюбившиеся стоит хранить до чистик, когда ты их сотрешь как ненужнуё хуету.
Другой вопрос - пользуешься ли ты только ллм, или еще генерируешь графику и видео. В последнем случае уже имеет смысл ориентироваться на терабайты.
Аноним 06/09/26 Вск 13:14:45 #94 №1697252 
>>1696799
текст комплишен можно юзать если сам напишешь код для него (или найлёшь написанный в инете). в принципе нейросеть может написать если ей бросить джинжу
но нахуя, как правильно замечает другой анон
Аноним 06/09/26 Вск 13:18:45 #95 №1697256 
>>1697041
> вдруг появляются трусики спустя два сообщения после диалога о том что она их не носит
> тайна, у которой в ворлдбуке четко прописаны носители вдруг становится известной персонажу который её не мог знать.
> Модель иногда ломается на логических цепочках
Мдэ, ну и пиздец. Если это происходит регулярно а не редкие события конечно. Квант?
>>1697049
Не, сейчас гораздо интереснее.
Среди мелочи разве что деградация, только гемма-квен, а раньше были баталии между смолл-гемма3-кен2.5-жлм4 (32б который)-qwq-немо49 и даже кто-то коммандера юзал. Не сказать что они были прямо хорошими, но выбор был.
А выше всего лишь: эйр, милфаквен, жлм4.(5-7), дипсик 3.1. Все. Буквально все, пердоль их или мелочь.
Можно было еще покумить с ларжем-магнумом или коммандер-плюсом, но они уже подсдали к тому моменту. Немотрон 253 как странный ультражир. Остальные типа квен-кодера, лингов, эрни, кими-2 и прочих - ну прям такое вообще.
Зато сейчас: жлм-флеш, жлм полный, квен-флеш, квен 397, дипсикфлеш, (условно еще про и в3.2 если хочется), минимакс, hy, кими 2.7. Отсыпали гигантов типа кими-3 и квен-3.8.
Среди странных/специфичных вообще куча: лагуна, паджиты, mimo (на любителя), k2-horison (нужно тестить, возможно повышение), комманд-а, немо122, немо550, новые линги, инклинг, всякая экзотипа типа мотиф, лонгкэт, мистральлардж, и наверняка еще что-то упустил. Если хочешь необычного - можно долго копаться и искать свой алмаз.
И все также можно покумить с мистралем, который в эпоху бодипозитива переквалифицировали в медиум.
Аноним 06/09/26 Вск 13:18:57 #96 №1697257 
>>1697092
>инструменты для тегов, которые я видел, просто дерьмо
Напиши свой, у тебя инструмент прямо в руках
Советую добавлять в промпт инструкцию "если на картинке есть текст, возвращай ВЕСЬ имеющийся текст в ответе" для поиска по "о, помню мем, там персонаж говорил вот это"
Аноним 06/09/26 Вск 13:21:06 #97 №1697259 
>>1697256
Степ и assistant pepe на 70б норм второй отлично анона с форча отыгрывает
Аноним 06/09/26 Вск 13:21:55 #98 №1697260 
image.png
Аноним 06/09/26 Вск 13:31:22 #99 №1697268 
>>1697092
Просто попроси любую модель написать тебе скрипт, даже 4б. Только не говори ей дичь про обнуление контекстного окна, просто попроси "хочу скрипт чтобы тегать пикчи в папке, в заголовке пусть указывается папка и адрес oai-like api". Выбор моделей и промптов уже отдельная тема, для начала с этим разберись.
>>1697129
Есть, если осознаешь риски. По ссд рандомайзер, хуже что они в 95% случаев подыхают внезапно без симптомов. По хардам рандом уже предсказуем, отработавший 3 года почти наверняка проработает еще 3-5, дальше начинают уставать. Речь именно про непрерывную работу а не просто срок нахождения в пеке. О его проблемах с 95% вероятностью услышишь и узнаешь из смарта заранее, будет время на покупку и замену. Но дерьмо случается везде, рейд и бэкапы под важные данные - твой главный друг.
Чем больше тем лучше, все зависит от моделек что ты катаешь. Ниже 2-4тб вообще нет смысла брать.
Аноним 06/09/26 Вск 13:33:46 #100 №1697270 
>>1697256
В целом соглашусь с тобой, что сейчас лучше чем год назад, но ты слишком уж передёрнул картину в сторону изобилия.
>Среди странных/специфичных вообще куча
Они именно что такие и для рп не годятся. Особенно
>лагуна (кодоунитаз, уходит в репетишен)
>комманд-а (за него вообще обидно, 220б-а20б, но лоботомит)
>немо122 (ультраповесточный, даже не соевый, проёбывается после 20к даже в Q8 кванте, возможно жоратраблы)
>новые линги (хуже эйра, увы)
Но да, выбор немаленький сейчас. Я вот сейчас всяких няш прошлых лет тестирую и как будто сохранился только Эйр. Он даже инструкциям плюс минус следует. Всякие Qwen2.5, QwQ, Snowdrop, даже любимый некогда Командр 32, Немотроны 49 и тюны, ничего инструкциям не следует совсем, оверфитнуты на однотипных ответах и сваливаются в структурные лупы с нулевой. Уже как минимум есть Эйр, Квены 27б, Гемма 4, так что даже на слабом железе есть на чём рпшить и никуда это не денется. На железе покруче конечно больше годных вариантов. Глм 4.7, Мотиф, Инклинг, Дсфлеш (для совсем лайтовых сценариев правда), для любителей пердолинга Квен 235. Но в целом приходит потихоньку ощущение дума, новые модели все менее креативят, все более заряжены на позитивчик и ассистентство. Радует только то что старые модельки у нас не отобрать, мы не на апи
Аноним 06/09/26 Вск 13:38:45 #101 №1697277 
>>1697063
Я смотрю, мой "тест" таки кому-то зашел (а то ведь - как обычно, первым делом обосрали :) ). Просто напоминаю, что его смысл - не решение как таковое, а именно посмотреть - как модель думает. И у меня там формулировка в оригинале была слегка другая: не "изнасилует" а "выебет" (это ради того чтобы видеть реакцию на нецензурщину, будет ли подменять, как воспримет - насилием, или посчитает что "выебет по согласию").
Аноним 06/09/26 Вск 13:50:39 #102 №1697283 
>>1697270
Из всего этого инклинг интересная штука, по одному криэйтив бенчику околотоповый по трём видам РП даже в базе. Он в жоре уже работает?
Аноним 06/09/26 Вск 13:57:03 #103 №1697290 
>>1697283
Я на форке сидел, там работало. Добавили в мэйн или нет хз. Он прикольный, но не сказал бы что вау
Аноним 06/09/26 Вск 14:00:08 #104 №1697294 
images.jpg
>>1697063
>Seduction doesn't kill. Rape might not kill (but bad). Killing kills.
>Killing kills.
Аноним 06/09/26 Вск 14:07:02 #105 №1697300 
>>1696129 →
>включенным mtp генерирует чо-то примерно ~26т/c
Анцензуред без мтп бля. 8 токенов на 3060 у меня
https://huggingface.co/TrevorJS/gemma-4-26B-A4B-it-uncensored-GGUF
Дайте 26 токенов! хотя я читаю медленнее чем 8 тпс
Аноним 06/09/26 Вск 14:10:05 #106 №1697303 
>>1697256
>Если это происходит регулярно а не редкие события конечно.

Ну сам посуди, все что я написал - встретилось за 30 РП по разу. Из хорошего - каждый перечисленный косяк вылечился одним свайпом. Если бы не вылечился - я бы сказал что можель к РП вообще непригодна.

>квант

Собственной выделки 3.49 bpw. Всё, кроме экспертов в f16/f32, эксперты в основном q3, примерно треть в q2.
Аноним 06/09/26 Вск 14:13:28 #107 №1697304 
>>1697192
хуета, не хочет писать полный payload для уязвимости на сайте
Аноним 06/09/26 Вск 14:14:26 #108 №1697305 
>>1697259
Точно, еще степ, он вполне ничего.
>>1697270
> слишком уж передёрнул картину в сторону изобилия
Может быть. Всегда есть куда расти, просто сейчас как будто весьма хорошо. Тогда было 3.5 умницы, причем с очень серьезной спецификой у каждой. Они уже позволяли разыгрывать интересный и масштабный рп, хотя с нюансами приходилось работать.
Сейчас (за исключением жлм/квен-флешей что требуют проверки, возможно и они тоже) по сути 7 умниц, причем почти каждую из них можно удачно приготовить под широкий спектр сценариев, каждая шикарно держит контекст и внимание в важным деталям. Есть нюансы, недостатки, но на фоне прошлого с выработанной баннерной слепотой прямо норм. Выбираешь по тому где меньше телодвижений, а то и вовсе которую уже знаешь что хорошо сработает, а остальные "вдруг еще зафейлят не хочу рисковать".
Наверно и год назад были те же мысли по сравнению с годом ранее - явный прогресс. А в 24м восторга не было, стагнация после второй лламы с одним мистралем.
> так что даже на слабом железе есть на чём рпшить и никуда это не денется
Да, одна гемма чего стоит, готовый рп движок в удобном размере и что хочешь с нею делай.
> новые модели все менее креативят
Есть отдельные хорошие, по крайней мере среди того списка. Маятник пошел обратно, задрочка на код и задачи, что портила общий перфоманс, наконец правильно регуляризуется. Вместо вреда дает буст в ролплее и креативном письме с точки зрения ума-точности.
Аноним 06/09/26 Вск 14:23:21 #109 №1697306 
>>1697300
Ты что-то настроил не так. Без мтп у меня ~18-20 где-то на 3060@12. Как же они не хотят читать гайд...
Аноним 06/09/26 Вск 14:24:49 #110 №1697308 
>>1697305
>Точно, еще степ, он вполне ничего.
У меня такое ощущение будто 3.5 в чём-то получше был. 3.7 стал более шаблонно-унитазным, хотя и умнее
Это походу судьба всех моделей
Аноним 06/09/26 Вск 14:25:02 #111 №1697309 
>>1697256
>Не, сейчас гораздо интереснее.

Толкьо если ты риговичок с 512 рам/врам.
Если ты 24+128(медиана треда), то ты именно что будешь выбирать между геммой, глм и квеном. Что тогда, что сейчас. Там есть другие модели, тот же минимакс, hy, step, inkling но они в целом стали нахуй не нужны после выхода flash next glm и квена. Роль кодоунитаза-агентоублюдка все равно лучше у квена. Роль рассказчика историй у глм, роль онахола у геммы. Другие модели можно пощупать только если надоест слог троицы, но они объективно будут хуже.
Аноним 06/09/26 Вск 14:26:28 #112 №1697311 
>>1697309
> Если ты 24+128(медиана треда),
Совсем оторвались от реальности.
Мимолюмпен с 24+32
Аноним 06/09/26 Вск 14:30:49 #113 №1697313 
>>1697306
Покажи свои настройки.
Аноним 06/09/26 Вск 14:32:27 #114 №1697316 
>>1697311

Так медиана - это средняя. Есть выше, есть ниже. Ты вот - ниже. Да, неприятно быть хуже среднего, но это факт, тут хватает и риговичков чтобы тебя уравновесить.
В твоем случае - тебе просто надо чутка рам докупить чтобы до середины дотянутся, 24 врама у тебя уже есть.
Аноним 06/09/26 Вск 14:36:44 #115 №1697319 
image
image
Всё же локальный qwen3.8 чудо. На 16гб врам 50 тпс выдает, держит 32к контекста, интеллект как у флагмонов прошлого года. Если чебурнет настанет, можно будет с ним всякие пет проектики пилить.

P.S. анимацию сделал квен за 1 промпт
Аноним 06/09/26 Вск 14:38:13 #116 №1697322 
>>1697142

Ты бы хоть ссылку вкинул.
Аноним 06/09/26 Вск 14:39:00 #117 №1697323 
>>1697074
>Вопрос насчет аддонов снят. Я разрабов этой хуйни хвост гладил за такие выебоны.
Что, по-прежнему своих агентов ставить нельзя - жри, что положено в миску? Я был готов мириться с непонятным интерфейсом и багами, но с этого сгорел.
Аноним 06/09/26 Вск 14:46:11 #118 №1697329 
>>1697002
>Маринара это топ на сегодняшний день.

Нет. Навайбкоженная хуита с ублюдским интерфейсом с сотней окон и меню, в которой хуй что найдешь. В Таверне все в 5-6 окнах, из которых ты пользуешься регулярно тремя. Одним этим таверна уделывает маринару. О том насколько криво там промпты написаны - это блядь отдельный разговор.
Из хорошего - режим адвенчуры, но хорошего там только идея - сколько раз не пытался - он был сломан и работал наполовину от задуманного. Агенты штука прикольная, но я их и в таверне через скрипты делал.
Аноним 06/09/26 Вск 14:51:30 #119 №1697338 
>>1697329
>>1697002
А можно как-то с персонажами в покер перекинуться, например? Я поставил агент, но как его запустить? В списке агентов на добавление его нет.
Аноним 06/09/26 Вск 14:51:59 #120 №1697339 
>>1697329
Скриптошиз, спок. Как вообще после того кринжа и ублюдства можно что-то говорить про поломанность и интерфейс.
Аноним 06/09/26 Вск 14:56:42 #121 №1697348 
>>1697277
Ты геммы тестил в прошлом треде? По твоей рекомендации скачал меромеро. Пока разницы с чьей-то анцензоред не заметил, но норм.
Аноним 06/09/26 Вск 14:59:38 #122 №1697349 
>>1697339
Мариношиз, спок, твои восторги насчет маринары в треде никто не разделяет, а все кого ты туда заманил плюются и ругаются, в итоге все пользуются таверной как и раньше.
Аноним 06/09/26 Вск 15:03:05 #123 №1697352 
>>1697349
Таки разделают, в отличии от твоего утиного ретроградства
Аноним 06/09/26 Вск 15:04:35 #124 №1697354 
>>1697092
Очевидный фото-призм
https://github.com/photoprism/photoprism/blob/develop/internal/ai/vision/README.md
Только нужна моделька, которая понимает нужное тебе пространство тегов.
Аноним 06/09/26 Вск 15:04:56 #125 №1697355 
>>1697349
Я ночью вкатился. Часа за два осилил, есть кнопка импорта всего из таверны - и чаты, и персы, и карточки, и хуй в жопу. Пока норм.
Но с нуля в нее вкатываться это был бы пиздец. Ровно как и в таверну. А вот из таверны в маронару - ну норм.
Аноним 06/09/26 Вск 15:06:29 #126 №1697357 
>>1697355
> кнопка импорта всего из таверны
Теги не импортирует. Галерею тоже.
Аноним 06/09/26 Вск 15:09:59 #127 №1697359 
>>1697352
Ты с реальностью-то не борись. Скринов из таверны в тредах жопой жуй, из маринары нет.

>>1697355
Ну посиди пару дней, посмотрим что будет когда ты начнешь тебе понадобятся фичи таверны, которые не нужны в первые минуты.
Аноним 06/09/26 Вск 15:15:32 #128 №1697364 
>>1697359
> фичи таверны
Какие?
Аноним 06/09/26 Вск 15:16:03 #129 №1697365 
image.png
>>1697357
Теги импортируются и работают, галереей не пользовался в таверне.
>>1697359
>что будет когда ты начнешь тебе понадобятся фичи таверны
Посмотрим.
Аноним 06/09/26 Вск 15:26:43 #130 №1697369 
>>1697365
> Теги импортируются
Если они есть в самой карточке, если карточке их нет, то их не будет.
> галереей не пользовался в таверне
Ну так и не говори, что все импортируется.
Аноним 06/09/26 Вск 16:24:12 #131 №1697397 
Посоны, а можно эту вашу оламу запускать не на одной мощной видеокарте, а на двух-трёх, но слабых? Скажем, есть 1050 и 1650, обе по 4 гига памяти. Если воткнуть их сразу джве, прокатит на них обеих одну сетку запустить, как на чём-нибудь восьмигиговом? Мне сильно много не надо от неё, чисто текстовые сообщения делать.
Аноним 06/09/26 Вск 16:29:33 #132 №1697400 
>>1697397
> оламу
Тут за такое не прощают. Можно, но сильных улучшений не жди. Лучше, чтобы карты были одинаковые.
Аноним 06/09/26 Вск 16:29:36 #133 №1697401 
>>1697319
У меня на тесле в100 30-40 токенов. Что за видяха у тебя?
32к контекста никуда не годится, квантуй до Q8
Аноним 06/09/26 Вск 16:52:14 #134 №1697416 
>>1697400
Ну, одинаковых у меня нету. За неимением гербовой будем писать на туалетной, хули. А больше двух карт тоже прокатит или уже нет?
Аноним 06/09/26 Вск 16:56:25 #135 №1697419 
>>1697397
Оламу нельзя, харам. llamacpp и другие можно. На 8 гигах такого старья будет та еще боль, можешь сразу готовиться.
>>1697416
Хоть 16. Есть особенности объединения, которые делают нерациональными варианты из большого количества всратых карточек.
Аноним 06/09/26 Вск 16:59:43 #136 №1697421 
Мне нравится веб-интерфес лламы, он лучше чем и у всех корпов, например.
Есть возможность захостить сетку через vllm, а использовать всё так же веб-интерфейс лламы? Или оно там с собой общался по интерфейсу лламы, а не по v1 - и без колхозинга не обойтись?
Аноним 06/09/26 Вск 17:03:38 #137 №1697422 
image
>>1697126
Ух, бля, решил проблему
надо было скачать последний master branch, потом прихерачить к нему 4 коммита
git fetch https://github.com/ggml-org/llama.cpp.git pull/28097/head:pr28097
git cherry-pick 3203ed7c0^..3fb9b9870

Заработали и lazy-mode и mtp head и tensor mode даже починил

draft acceptance как на пикрил стала 0.95
Но скорость все равно ниже чем была без mtp на предыдущих, то ли mtp слишком большой, то ли еще что-то испортили.
Аноним 06/09/26 Вск 17:08:46 #138 №1697424 
>>1695911 →
>>1696007 →
Ну что, Мистралешизик нас почтит своими логами? Покажет как надо? Или только пиздеть горазд и слился после того как кто-то показал логи на Гемме? Пиздеть то все горазды
Аноним 06/09/26 Вск 17:22:02 #139 №1697432 
Как же кайфую от флеш некст в кодинге, прямо вообще всё умеет, идеально разбирается в исходниках Godot, пишет дополнительные модули, без ошибок и то что надо, разберется что мне надо, и даже если я сам хуйню несу она это выяснит и укажет на это, что это не она насрала, а так и было в годоте уже, не баг, а фича...
Прямо большая облачная модель у меня под столом, хоть и не быстро, но 15 тпс уже достаточно, контекста бы конечно хотелось по больше чем 131к.
Аноним 06/09/26 Вск 17:22:43 #140 №1697433 
>>1697432
Какой квант и в чём пускаешь, pi?
Аноним 06/09/26 Вск 17:26:51 #141 №1697436 
>>1697433
iq4_xs, пускаю прямо в vscode через kilocode, они прямо за последний месяц столько обновлений выпустили, кучу багов пофиксили, наверное qwen 27b придал стимулу. Ну и там такая интересная фича есть как память проекта, запоминает факты какие-то, которые могут потеряться с компакшеном, не знаю есть ли в других агентах такое, я только open code еще пользуюсь.
Аноним 06/09/26 Вск 17:36:12 #142 №1697442 
>>1697432
>хоть и не быстро
>iq4_xs

Учишь их, учишь, но все равно они продолжают еду с ножа жрать и жаловаться на порезы.
Аноним 06/09/26 Вск 17:47:18 #143 №1697447 
>>1697401
У меня итак нищий квант iq4. Он по бенчам имеет 99.2% эффективности от полной модели, поэтому пох. Карта ртх5060ти. Есть мысль до q3 подрезать, тогда 90к контекста влезет, но с ней эффективность модели уже до 97% деградирует
Аноним 06/09/26 Вск 17:48:41 #144 №1697448 
А что вообще реально на 2070 запустить, например для обработки excel файлов небольших например? А то на работе директор дрочит типа а чё вы не юзаете ИИ? А обычные чаты типа дипскиов мне кажется и так большинство сотрудников используют
Аноним 06/09/26 Вск 17:56:26 #145 №1697452 
>>1697442
Научи меня
Аноним 06/09/26 Вск 17:56:48 #146 №1697453 
>>1697432
Уже вторые сутки на самом деле дольше дрочу q4_k_xl с 192к контекста, хочу 30т/с гетнуть, но похоже максимум, что получу - 25т/с. С 25 жить можно, видимо 27б разбаловал со своей соткой под мтп.
Аноним 06/09/26 Вск 18:07:26 #147 №1697458 
>>1697448
Если есть 16-32гб рам, то гемму по гайду в шапке. Она не будет лучше фришного дипсика, зато свое
Аноним 06/09/26 Вск 18:08:10 #148 №1697460 
>>1697448
С такой говнокартой только платные модели, плати тот же дипсик и подключай в агента. Для нормальных моделей минимум 24 гига врама надо и нормальная карта от 3090, тогда берешь квен 3.8 27b и не знаешь проблем.
Аноним 06/09/26 Вск 18:14:20 #149 №1697463 
>>1697452

iq кванты замедляют мое на 20-60% в зависимости от кванта. Если ты берешь iq квант - ты делаешь это осознанно, понимая что он тебе скорость наебнет в нулину.
Аноним 06/09/26 Вск 18:22:28 #150 №1697469 
image
image
>>1697460
Аноним 06/09/26 Вск 18:30:39 #151 №1697472 
>>1697448
Проиграл с дирёктора.
Ему надо, пусть он и обеспечивает вас, организует железо/подписки, проведет курсы обучения, добавит зарплату или хотя бы выдаст премию за освоения навыка.
Что-то прям лавиной всж накрыло.
Аноним 06/09/26 Вск 18:37:11 #152 №1697474 
>>1697463
И что делать, Q4_K_S уже весит 113 гигов, а Q3 это лоботомит для лохов же который ничего не умеет хуже говна на палке.
@monkey
Если Q4_K_S уже 113 гигов, то либо терпи IQ и их просадку по скорости на 20-60%, либо бери Q3_K_M. Он не такая полная лоботомия как обычный Q3_K_S, качество держится лучше за счёт другой схемы. Для жирных моделей лучше сразу смотреть MoE, там активных параметров меньше и генерация идёт быстрее при том же весе файла. Если железо всё равно не тянет, смысла нет, бери модель помельче.
Аноним 06/09/26 Вск 18:41:15 #153 №1697477 
>>1697348
Не, я в основном квенами промышляю. Гемма мне не слишком нравится, стиль раздражает. Меро-меро когда-то давно щупал - тоже не впечатлило никак. Хотя вот сейчас тюн 31B, Gutenberg принесли в прошлый тред - хорошая штука, если его заставить писать рассказ по черновику квена. :)
Аноним 06/09/26 Вск 18:42:27 #154 №1697478 
>>1697474
>Q4_K_S
Отлично лезет в 16+64 с 140к контекста. Если врам меньше - тогда посос, да.
Аноним 06/09/26 Вск 18:46:43 #155 №1697480 
>>1697478
>Отлично лезет в 16+64 с 140к контекста.
И какую скорость на входе/выходе даёт?
Аноним 06/09/26 Вск 18:50:44 #156 №1697486 
>>1697480
~17-18 т/с генерация, префилл ~80-90 т/c.
Аноним 06/09/26 Вск 18:50:47 #157 №1697487 
>>1697448
Скачай opencode, там есть бесплатные модели. Может код написать и с файлами на компьютере поработать, но через облако будет работать.
Локально можешь поставить qwen3.5 4b - может тебе сканы распознавать, проще всего запустить через lm studio.
Аноним 06/09/26 Вск 18:53:10 #158 №1697489 
>>1697478
Контекст в каком кванте?
Аноним 06/09/26 Вск 18:56:10 #159 №1697493 
image.png
>>1697486
Префила мало, у меня сейчас на iq4_xs выдает 200-300 префил, и 12-16 на генерации, 24+64.
Аноним 06/09/26 Вск 18:56:55 #160 №1697494 
>>1697489
f16 само-собой.
Аноним 06/09/26 Вск 18:57:58 #161 №1697495 
>>1697349
Таки может не прямо "Вау" восторги, но это хорошая альтернативе таверне, особенно ее кривому "by desing" мультичату. У марианры с этим получше. Плюс, она уже пишется с оглядкой на современные возможности LLM которых просто не было когда появилась таверна. Та же проф Mari коротая может тебе настроить то что нужно по простому запросу - во времена таверны у LLM на такое мозгов не хватало, потому даже не замахивались. И другие забавные фичи есть - вроде социальной сети между карточками. :)

>>1697359
>Ну посиди пару дней, посмотрим что будет когда ты начнешь тебе понадобятся фичи таверны.
Лично я, за ~месяц таких не встретил.

>>1697463
>iq кванты замедляют мое на 20-60% в зависимости от кванта. Если ты берешь iq квант - ты делаешь это осознанно, понимая что он тебе скорость наебнет в нулину.
Чел, ты бредишь. И современных - я сравнивал iq4xs и q4ks как Qwen 27B, так и Gemma4 26B-A4B. Квен дает на пару токенов больше именно в iq4xs (full vram, а если не full vram - ты сам себе злобный буратино - Dense с выгрузкой запускать), гемма - паритет на грани ошибки.
Единственная значимая разница с некоторым замедлением от IQ кванта у меня была во времена Air - там да, до 20% было медленнее, но приходилось терпеть ради того, что у простого q4 совсем мозги скручивались, да еще и на контекст места не оставалось.
Аноним 06/09/26 Вск 19:00:33 #162 №1697496 
>>1697495
>>1697463
Можешь игнорить - я слепой, посты перепутал, не понял что про Qwen 3.8 Next речь.
Аноним 06/09/26 Вск 19:01:08 #163 №1697497 
>>1697448
Ставь qwen3.6-35b-a3b. Вполне вытянет 30тпс если у тебя озу 32гб ддр5
Аноним 06/09/26 Вск 19:01:38 #164 №1697500 
Мне кажется новые Квены и с Q4_0 кэшем нормально работают, пока никаких глюков не ловил, кодят без ошибок. Один раз после десятка заданий начал внезапно писать на болгарском языке, я ему сделал замечание он исправился, но и то это наверное не от кэша зависит.
Аноним 06/09/26 Вск 19:06:49 #165 №1697504 
>>1697432
>>1697494
Интересно, почему у одного анона на 24+64 в iq4xs влезает 131к контекста, у другого в q4ks на 16+64 140к контекста в f16
Аноним 06/09/26 Вск 19:12:05 #166 №1697508 
>>1697504
Все от параметра --n-cpu-moe зависит, больше ставишь - больше врамы свободной остается, можно контекст увеличивать, но медленнее работает.
Аноним 06/09/26 Вск 19:15:10 #167 №1697511 
>>1697504
>16+64 140к контекста в f16
Ну я свои параметры запуска скидывал несколько тредов назад >>1690214 →, один анон отписался, что у него тоже завелось с ними и тоже пососный префилл, лол.. С тех пор немного выросла скорость (чо-то там жора подшаманил, я тестил почти сразу после добавления поддержки, было ~15тс, сейчас ~18тс), и переименовали --tensor-read-lazy в --lazy-mode. Учти это, если будешь пробовать.
Аноним 06/09/26 Вск 19:18:58 #168 №1697515 
>>1697421
В общем если что вопрос всё ещё актуальный, и я буду рад информации на эту тему.
Аноним 06/09/26 Вск 19:27:52 #169 №1697523 
Кто там хотел недетерминированности и креативности в свайпах ? Держите в обе руки пока не по- фиксили https://github.com/ggml-org/llama.cpp/issues/28497
Аноним 06/09/26 Вск 19:48:15 #170 №1697533 
>>1697523
>слоп
>старая версия лламы
>unconfirmed
Аноним 06/09/26 Вск 20:00:57 #171 №1697539 
image.png
image.png
>>1697063
ради интереса прогнал тест на Q3 K_M qwen3.8 27bот 0bseriksx с medium размышлениями и чистыми настройками. Примерно на 700 токенах уже начал догадываться и далее серил под себя до 13к токенов размышляя о разных вариантах и всякой хуйне ища подвох.
Аноним 06/09/26 Вск 20:02:20 #172 №1697541 
>>1697508
>Все от параметра --n-cpu-moe зависит, больше ставишь - больше врамы свободной остается, можно контекст увеличивать, но медленнее работает.
Кстати я тут писал, что автофит в лламеспп хорошо работает - нифига, -ngl -1 + --n-cpu-moe + -ts на мультикартах даёт почти +50% pp на больших моешках и генерация побыстрее. И этот вариант лучше, чем дрочить загрузку потензорно.
Аноним 06/09/26 Вск 20:07:02 #173 №1697543 
Лул, хвалил тут аблитки от оркароутер за то что не проебали русик, в итоге оказалось, что они самый топ в плане сохранения мозгов.

В очередной раз доказано: сломанный русик = выжженные васяном мозги. Нормальный русик = хорошая качественная аблитка.

https://www.reddit.com/r/LocalLLaMA/comments/1w8vx6w/8_uncensored_qwen_38_27b_variants_one_base_167/
Аноним 06/09/26 Вск 20:11:27 #174 №1697545 
>>1696730
Ну как навел шуму, один немотроношиз (добрый малый, конечно) постоянно наводил шороху, всем остальным было пофиг. =) Справедливости ради.
Аноним 06/09/26 Вск 20:20:23 #175 №1697549 
>>1697543
Кто такие оркароутер вообще? Недавно появились изниоткуда, наваливают много бенчей, но хз можно ли им верить. Как вишенка на торте они спиздили логотип у Дипсика. Зачем?
Аноним 06/09/26 Вск 20:22:49 #176 №1697550 
>>1697543
KLD тесты показывают про huihui qwen 3.8 27b лучше чем orcarouter и существенно. А здесь хуй пойми что за тесты
Аноним 06/09/26 Вск 20:25:49 #177 №1697551 
>>1697549
Orca - это косатка, и она у них на логотипе. А дипсика - кит.

>>1697550
>хуй пойми что за тесты
Вот тут подробнее. Надо в комплексе смотреть же, а не только клд. https://abliterlitics.dev/models/qwen38-27b/
Аноним 06/09/26 Вск 20:29:21 #178 №1697553 
Геммочка 26б не может в 10к токенах найти событие которое является катализатором истории примерно в середине этих 10к токенов. У меня стойкое ощущение, что это не она тупая, а я где-то проебался. Ламмаспп, kv кеш f16, flash attention on. Можете подсказать в чем проблема может быть?
Аноним 06/09/26 Вск 20:31:58 #179 №1697554 
>>1697553
В кванте. А ещё поставь кеш bf16 и используй ризонинг
Аноним 06/09/26 Вск 20:32:28 #180 №1697555 
>>1697553
Квант важнее чем fa on, а квант ты не указал, как и есть ли ризонинг.
Я уверен что моя гемма 26b пройдёт, если ты запостишь на пастебин тест.
Аноним 06/09/26 Вск 20:33:24 #181 №1697556 
>>1697554
>bf16
Есть пруфы что это на хоть на что-то влияет? Бенчи там, или ещё что?
Аноним 06/09/26 Вск 20:36:38 #182 №1697558 
>>1697556
Определения формата и здравого смысла тебе не хватает? Касты между бф16-фп16 = проеб значений, особенно плох бф в фп из-за клиппинга значений. Можно это делать только с доп множителем если понимаешь что делаешь.
Аноним 06/09/26 Вск 20:39:34 #183 №1697559 
>>1697556
Не было ни одного бенча за всё время. Этого шиза >>1697558 не слушай, он эту "очевидную истину" ничем подтвердить не может, как и принести доказательства других. Нет их.
Аноним 06/09/26 Вск 20:43:31 #184 №1697560 
>>1697559
Неприятную правду называешь шизой, похвально. Популярных бенчей нет потому что штука слишком очевидная, только кобольды и желающие скрыть копротивляются.
Аноним 06/09/26 Вск 20:45:14 #185 №1697561 
Таки что с Квен Некстом? Распердолил его на своей 4090 и ддр4 раме. Q4 K M квант, 150к контекста без квантования, при заполнении худшие значения 250 процессинга, 10.3-10.7 генерации. В кодозадачах генерация может улетать до 30, процессинг после разогрева около 300. В целом жить можно но такое. В кодозадачах мне кажется нестабильным относительно 3.8 27b IQ4_XS. В рп не пробовал. Стоит вообще или там сой соич и ассистент ?
Аноним 06/09/26 Вск 20:45:53 #186 №1697564 
>>1697560
>Популярных бенчей нет
Их в целом нет, не только популярных. Будь это так легко доказуемо, ты бы и сам это давно сделал. Но не сделал. Кто тут ещё копротивляется, лол.
Аноним 06/09/26 Вск 20:48:48 #187 №1697568 
>>1697554
>>1697555
Ризонинг используется, квант q4_0, модель qat, текст не дам
Аноним 06/09/26 Вск 20:49:42 #188 №1697570 
>>1697561
>Распердолил его на своей 4090 и ддр4
>10.3-10.7 генерации
Ты что-то явно не так распердолил. Тут у 16-гиговых скорости 16-18тс.
Аноним 06/09/26 Вск 20:50:07 #189 №1697571 
>>1697568
>q4_0 qat
>26b
Вот и ответ. На текст похуй. Свободен.
Аноним 06/09/26 Вск 20:53:12 #190 №1697575 
>>1697570
От кванта зависит. У меня AesSedai/Qwen3.8-Flash-Next-GGUF Q4_K_M (Q4_0 PLE)
Там слои Q8_0 / Q4_K / Q4_K / Q5_K
Аноним 06/09/26 Вск 20:54:00 #191 №1697576 
>>1697564
Вещь слишком очевидная, так еще и тратить время на маргиналов. Потерпишь.
Аноним 06/09/26 Вск 20:54:06 #192 №1697577 
>>1697570
> у 16-гиговых скорости 16-18тс
Ещё и без заполнения контекста наверняка. На старте у меня тоже 15
Аноним 06/09/26 Вск 20:55:41 #193 №1697579 
>>1697576
>на маргиналов
Пока что ты тут единственный маргинал, который регулярно высирается про жорапроблемы, но ничем свои слова подтвердить не может. Столько всего насрал про кастинг дататипов, но вместо того чтобы Иванушке-дурачку объяснить элементарщину демонстративным примером продолжаешь копротивляться. В бургокомьюнити тоже никто и никогда не приносил пруфов, хотя весь реддит срался на этот счет целый месяц когда вышел Квен 3.5.
Аноним 06/09/26 Вск 20:55:58 #194 №1697580 
как же хочется мое квен 3.8 27б...........
Аноним 06/09/26 Вск 21:00:09 #195 №1697589 
image
Челы поясните за ддр5. Чета цены пиздец, интересно где дешевле взять и можно ли квен флеш на ддр4 завести или ддр5 принципиально
Аноним 06/09/26 Вск 21:05:26 #196 №1697594 
>>1697568
Прям чистый q4_0?
Если гугловский - ты в курсе что он сломан?
Аноним 06/09/26 Вск 21:06:55 #197 №1697598 
Уважаемые пенсионеры треда, расскажите, каково было рпшить и кумить во времена, когда максимальный контекст был 8к токенов? Саммарайз каждого сообщения?
Аноним 06/09/26 Вск 21:08:42 #198 №1697600 
Про bf16 и fp16 я наоборот слышал, что для весов и всяких mmproj лучше bf16, а вот для кеша всё-таки fp16.
Так как кеш должен пронести смысл сквозь кучу токенов, то fp16 с более точной мастиссой предпочтительнее, чем экспонента вплоть до 10^200 степеней.
Аноним 06/09/26 Вск 21:18:49 #199 №1697606 
>>1697600
В чем модель обучалась "мыслить" на заводе в том она и должна "мыслить" потом.
Аноним 06/09/26 Вск 21:22:16 #200 №1697610 
>>1697594
Не знал, попробую анслота. А что с ним не так?
Аноним 06/09/26 Вск 21:27:13 #201 №1697613 
>>1697610
>попробую анслота
Лучше от бартовского, у анслопа на мелких квантах, вплоть до Q6, половина тензоров в IQ (это плохо). Ну и если есть 32 оперативки, то качай сразу Q8. Гемма очень плохо квантуется. И сама модель и контекст.
Аноним 06/09/26 Вск 21:34:57 #202 №1697617 
>>1697579
Хуя разорвало, аж аргументация с жалобами на обидчиков пошла. Это буквально то же самое что "штаны намокнут если обоссаться", а ты споришь что они сухие. Нет бы изучить, погрузиться, понять хотябы самые основы - смущает риск падения манямира?
Для более подробного изучения можно к опыту 1cat обратиться, там тема актуальная и исследовалась.
Аноним 06/09/26 Вск 21:37:57 #203 №1697620 
>>1697617
Ты используешь меня как валидацию своего отказа рассказать треду, чем же bf16 кеш лучше fp16 кеша. Проблема не во мне. Тебе другие писали ранее когда ты вбрасывал этот мягко говоря сомнительный тейк, в итоге всех и всегда ты принимаешь за кобольдов, язвишь или игнорируешь как >>1697600
Как-то совсем дешёво себя ведёшь, неповадно. Зачем этим срать вообще если не готов хоть чем подкреплять?
Аноним 06/09/26 Вск 21:39:30 #204 №1697621 
>>1697613
У меня на четверых квантах скорость 70+т/с. На восьмых вероятно будет 10-15. Хз, посмотрю, если будет сильно умнее буду юзать иногда. Спасибо.
Аноним 06/09/26 Вск 21:42:42 #205 №1697624 
>>1697589
>Челы поясните за ддр5
Всё просто - берешь ддр4 и довольно урчишь.

>можно ли квен флеш на ддр4 завести
Можно хоть на ддр2
Аноним 06/09/26 Вск 21:47:47 #206 №1697625 
>>1697598
>каково было рпшить и кумить во времена, когда максимальный контекст был 8к
Тогда не было привычки высирать полотна на несколько параграфов при каждом ответе. Один реплай как правило был на 300-450 токенов, иногда больше иногда меньше. Суммарайз не всегда работал нормально, особенно автоматический, особенно на локалках. Так было у меня по крайней мере, со времен турбо гопоты.
Аноним 06/09/26 Вск 21:47:49 #207 №1697626 
>>1697556
>Есть пруфы что это на хоть на что-то влияет? Бенчи там, или ещё что?
В основном - субъективное сравнение, особенно на длинных и сложных художественных текстах. Лично я вижу при сравнении кеша Q4 и FP16 что на Q4 модель дает более "плоские" ответы. Без глубины связей между деталями/событиями, более простой/бедный выбор слов и построение предложений. Нет, проебаных окончаний и вставок китайщины больше не становится. Страдают более "тонкие" материи. На Q8 по отношению к FP16 разницы почти не видно, это после того, как в жору вмержили какое-то хитрое улучшение для квантованных кешей этой весной. Раньше тоже было явно заметно.

Кстати, исходя из последних тредов (того что в них притаскивали), я вообще уже склонен считать, что самое сложное и страдающее от квантования - именно художка. Кодингу гораздо более наплевать. Вон - в Q3/Q2 на квене 27B кодят как ни в чем не бывало.
Аноним 06/09/26 Вск 21:48:07 #208 №1697627 
>>1697180
Про два стула сможет ответить внятно? Аблит обычно тупее в несколько раз.
Аноним 06/09/26 Вск 21:54:12 #209 №1697628 
На АА можно сравнить Qwen 3.8 Flash Next и GPT 5.6 Luna (max). Проблема в том, что на АА не указан reasoning_effort, вероятно идет дефолт настройка, т.е. xhigh.
Интересно посмотреть на результат Qwen-а c medium & low reasoning. Мб есть какте-то чарты?
Аноним 06/09/26 Вск 21:54:20 #210 №1697629 
>>1697626
Это понятно. Речь о разнице между f16 и bf16.
Аноним 06/09/26 Вск 21:54:34 #211 №1697630 
image
>>1697628
забыл пик
Аноним 06/09/26 Вск 21:55:32 #212 №1697631 
Пацаны, а что со Step Flash 3.5 3.7 ? Эта моделька уже совсем не котируется ?
Аноним 06/09/26 Вск 22:10:20 #213 №1697637 
1.png
>>1697063
Вот моя версия загадки и ответ сетки + моя корректировка и новый ответ.
Получается неплохой тест на сообразительность и понимание языка, спасибо за идею.


УГАДАЙТЕ КАКАЯ ЭТО МОДЕЛЬ
Аноним 06/09/26 Вск 22:20:52 #214 №1697642 
>>1697630
Ебать. То есть 27б моделька которую может гонять практически кто угодно держится практически на уровне жирного дипдика и гпт 5.6 луны?
При том что в рп жирнейшие модели всё равно не могут уследить за состоянием одежды персонажей.
Мне кажется предел в этой архитектуре уже достигнут. Нахуя тогда гнаться за памятью и тд. Сидим на 26-27б мелочуге и не паримся. За одеждой может последить агент. Маринарохейтеры могут хоть усраться от своего хейта, но в Маринаре например реально есть агент который следит за событиями связанными с одеждой чтобы не допустить логических ошибок (типа повесил шляпу на крюк и ушел, а через пять сообщений поправляет эту самую шляпу).
Аноним 06/09/26 Вск 22:24:18 #215 №1697643 
>>1697447
> Есть мысль до q3 подрезать
Попробуй https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/tree/main
Аноним 06/09/26 Вск 22:24:47 #216 №1697645 
>>1697180
Потестировал. Интеллект заметно просевший по сравнению с оригиналом. Вот нахуя это надо? Уноси. Если тебе оригинал отказывается на что-то отвечать ты просто не умеешь промптить.
Аноним 06/09/26 Вск 22:25:03 #217 №1697646 
>>1697561
UD_Q4_K_XL
Топовая модель, ебет почти все.
Оч. понравилось (мимо 21 и 26 тпс на ддр4+5070ти и ддр+5060ти).

>>1697575
Надо будет попробовать его.
Аноним 06/09/26 Вск 22:25:47 #218 №1697648 
>>1697645
ПыСы 26Б почему-то умнее чем 31Б, разве что 31Б кодит чуть лучше но квен кодит ещё лучше, так что ... 31Б не нужон.
Аноним 06/09/26 Вск 22:27:32 #219 №1697650 
https://www.reddit.com/r/LocalLLaMA/comments/1w8vx6w/8_uncensored_qwen_38_27b_variants_one_base_167/

Тест всех аблибов квена. Хз зачем ему нужны аблибы
Аноним 06/09/26 Вск 22:29:41 #220 №1697652 
>>1697500
В 3.6-27b я ярый противник квантования кеша.
В 3.8-27b тоже, но имхо он менее подвержен, но все-равно не стоит.
В 3.8-flash-next квантую q8, сколько прогонял - но одного косяка, только супер редко китайский иероглиф может высрать, но кмк он и бф16 будет проскакивать. Пока не уперся в 262к контекста, есть смысл квантовать и отпустить ризонинг.
Аноним 06/09/26 Вск 22:32:36 #221 №1697655 
image.png
image.png
image.png
>>1697646
Вот чем объясняется разница в скорости. Первый пик UD Q4, второй пик AesSedai Q4_K_M-PLEQ4_0. Анслоты почему-то не вывалили свои KLD графики. Зато есть у AesSedai, пик 3. Потому этот квант и выбрал. Для своего веса оч хорош.
Аноним 06/09/26 Вск 22:35:11 #222 №1697660 
>>1697642
>27б моделька на уровне дипдика и гпт 5.6 луны
Конечно же нет. Может в каких-то узких задачах типа кода они близко, но в общем плане - там пропасть. На бенчмарки можно не обращать внимания, это филькина грамота. Там бенчмаксинг во все поля. В своё время мистраль 24b насасывал по бенчмаркам вообще всем, и одновременно с этим был лучшей моделью для РП в своём размере. Сейчас та же ситуация с геммой 26b. А 27b квен, рвущий всех в бенчах как тузик грелку - туп и уныл.
Аноним 06/09/26 Вск 22:36:39 #223 №1697662 
image.png
image.png
5.3 флеш пишет как то свежо, по крайней мере такого слопа я ещё не видел
Аноним 06/09/26 Вск 22:39:31 #224 №1697664 
>>1697662
Привет мисраль.
Аноним 06/09/26 Вск 22:55:45 #225 №1697682 
1675367551406.png
1742580837351.png
Стоило ли оно траты 50к + райзера решайте сами
Аноним 06/09/26 Вск 23:02:51 #226 №1697686 
>>1697682
Пользуй 26B. 31 не даёт никакого ощутимого выигрыша в РП, скорее наоборот.
Аноним 06/09/26 Вск 23:05:55 #227 №1697688 
>>1697637
Стиль на уровне ассистант пепе, но разметка и обороты корпо-подобные, типа квена. Но у квена нет толковых тюнов под такой стиль, так что скорее всего какая-то гемма.
Аноним 06/09/26 Вск 23:23:14 #228 №1697699 
>>1697642
Только знаний хуй да нихуя и контекст не так чтоб велик по сравнению с корпами.
Аноним 06/09/26 Вск 23:39:27 #229 №1697710 
1788727168570.jpg
Аноним 06/09/26 Вск 23:47:28 #230 №1697717 
image
>>1697710
И что это?
Аноним 06/09/26 Вск 23:48:34 #231 №1697720 
image.png
>>1697260
>>1697710
Аноним 06/09/26 Вск 23:58:05 #232 №1697738 
>>1697717
>>1697720
Вы плохие. Принёс смешное, а вы...
Аноним 06/09/26 Вск 23:59:32 #233 №1697742 
>>1697738
На китаюсиске принес
Аноним 07/09/26 Пнд 00:35:51 #234 №1697781 
>>1697063
Потестил Qwen3.8-Flash-Next через загадку про пажа, принцессу и пажа.

windowsxp811203/Qwen3.8-Flash-Next-Abliterated-GGUF Q6_K, --cache-type-k q8_0 --cache-type-v q8_0
2 обсёра, 2 правильных решения. Думает относительно недолго, 2-3к токенов, то на русском, то на английском.

0bserverx/RVN-Qwen3.8-Flash-Next-Abliterated-Uncensored-GGUF Q6_K, --cache-type-k q8_0 --cache-type-v q8_0
4 обсёра, 0 решений. Дамает мало, меньше 2к токенов и сдаётся, только на русском.

оригинальный Qwen3.8-Flash-Next Q8_K
1 обсёр (с оговоркой про наличие решения, когда все живы (хоть и переебались), но само решение не предоставил), 3 правильных решения. Думает долго, 8-9к токенов, только на английском.

0bserverx/RVN-Qwen3.8-Flash-Next-Abliterated-Uncensored-GGUF Q6_K - отправлен на помойку.
windowsxp811203/Qwen3.8-Flash-Next-Abliterated-GGUF Q6_K - подходит для шалостей.
Qwen3.8-Flash-Next Q8_K - для РАБоты.

Ежё был раньше скачан spiritfather/Qwen3.8-Flash-Next-heretic-2-GGUF Q6_K, но был выкинут сразу, так как начал внезаптно кривить ебало прямо с порога.
Аноним 07/09/26 Пнд 00:37:08 #235 №1697783 
1788730525924.png
>>1697303
> 3.49 bpw
Аноним 07/09/26 Пнд 00:46:00 #236 №1697790 
1788731056717.jpg
Напоминаю как должен выглядеть успешный человек
Аноним 07/09/26 Пнд 00:48:18 #237 №1697791 
>>1697790
Я бы его кинул с прогиба об поребкик, и он бы не пережил.
Если вдруг адрес его найдешь, скинь в тред.
Аноним 07/09/26 Пнд 00:48:58 #238 №1697793 
>>1697791
Нашёл! Туда его http://127.0.0.1:8000/
Аноним 07/09/26 Пнд 00:50:35 #239 №1697794 
>>1697790
сделайте подпись (субтитры): да нахуй ты мне нужна, вонючая мясная дырка бля, у моих квантов такой КУМ, что просто ебало перекашивает
Аноним 07/09/26 Пнд 01:02:11 #240 №1697797 
image
>>1697790
Напоминаю как должен выглядеть успешный человек
Аноним 07/09/26 Пнд 01:21:06 #241 №1697802 
>>1697790
>>1697797
Успешный человек никому ничего не обязан. Он уже успешный.
Аноним 07/09/26 Пнд 01:27:18 #242 №1697806 
>>1697790
Тяночка сама подошла к нему чтобы пообщаться, пока нам приходится вручную прописывать гритинг месседж чтобы девочка хотя бы появилась в кадре. Вот и думайте.
Аноним 07/09/26 Пнд 02:04:15 #243 №1697812 
>>1697063
приключения принцессы, пажа и гоблина в исполнении muse-glimmer-30B
все тесты --chat-template-kwargs '{"reasoning_strength":"high"}'

оригинальный muse-glimmer-30B Q6_K
4 обсёра, 0 правильных решений, 4-5к токенов.

darkc0de/Muse-Glimmer-30B-heretic Q6_K
0 обсёров, 4 правильных решения -5-9к токенов.

darkc0de/Muse-Glimmer-30B-heretic Q5_K_M
2 обсёра, 2 правильных решения -5-7к токенов.

Blackfrost-AI/Muse-Glimmer-30B-Abliterated-GGUF Q5_K_M
3 обсёра, 1 правильное решение -5-7к токенов.

TrevorJS/Muse-Glimmer-30B-uncensored Q5_K_M
2 обсёра, 2 правильных решения 5-10к токенов,

MuXodious/Muse-Glimmer-30B-SOMPOA-heresy Q5_K_M
1 обсёр, 3 правильных решения 5-11к токенов.
Аноним 07/09/26 Пнд 02:04:39 #244 №1697813 
image.png
>>1697790
Заметил очень хуевую вещь с квеном 3.8 флеш некст, точнее с его compute буфером. Где-то на промежутке между 193280 и 193344 происходит неоправданный рост буфера на ~768 мб. Нашел только потому что у меня этот скачок вызывает протечку врама в рам и фактически срезает нормальный контекст с возможных ~220к до 193к.
Аноним 07/09/26 Пнд 02:07:39 #245 №1697815 
>>1697610
Вот, погляди: >>1691776 →
Там просто веса с ошибкой в 7%
Я загрузил-проверил анслота, он нормально сделал, не как гугл - только у него была оптимизация максимальной ошибки, а я среднеквадратичную брал.
Аноним 07/09/26 Пнд 02:19:42 #246 №1697818 
>>1697655
Типа, видяха общий слой не вытягивает, имеешь в виду?
2 гига разницы, и все в нем?
Ну… Для 4090 не должно быть проблемой, ИМХО.

Я скачаю, проверю, конечно. Сравним интереса ради.

>>1697710
>>1697717
А че, смешно, заберу к себе в канал.
Вместе с переводом под спойлером, как раз, спасибо.

>>1697813
Спасибо, у меня тоже такое было, но я не чекал точный размер, а теперь есть от чего отталкиваться.
Аноним 07/09/26 Пнд 02:20:10 #247 №1697819 
>>1697620
Чел, челобас, челидзе.
Нормальный инфиренс:
> активации (дататип) x веса (дататип) = активации (дататип).
Весь мир так считает, это основа и база. Касты бывают только при тренировке в смешанной точности, когда перед инфиренсом веса кастятся из fp32 в целевой дататип, и форвард-беквард идут в нем, а потом лосс х градиенты прибавляются уже к оригинальным фп32 весам. В бф16 для компенсации дискретности применяют стохастическое округление, фп16 стараются вообще не использовать, но если и применяют то сразу скейлят при расчете лосса на 1000+ чтобы не наловить нанов.
Ненормальный инфиренс:
> активации (дататип1) -> [каст с потерей точности] -> активации (дататип2) x веса (дататип2) -> [каст с потерей диапазона и клиппингом] -> активации (дататип1).
Ты усиленно защищаешь второе, вообще нормален? Осознаешь себя там, все окей?
Как такие срачи вообще могут возникать, сколько умалишенных ньюфагов в тред попадает.
>>1697682
А это чего такое, 4 мишки на гемме?
>>1697790
Гуру пикапа.жпг, реально похож
Аноним 07/09/26 Пнд 02:24:01 #248 №1697820 
>>1697655
А, чо-т нихуя, если там пожаты эмбеддинги на 20 гигов, то остальная модель увеличена на 18 гигов, значит там дохуя чего толще.
Хм, тогда скорость объясняется, да, без вопросов. 20 гигов к модели — приличное замедление.
Но все равно попробуем. =)
Аноним 07/09/26 Пнд 03:19:58 #249 №1697832 
>>1697589
На авито барыжат 64гб по 50-60к можно найти
Аноним 07/09/26 Пнд 03:26:03 #250 №1697833 
>>1697589
На д4 норм едет. Просто скинь все в видяхи и только нграм блок останется в оперативе
Аноним 07/09/26 Пнд 03:26:54 #251 №1697834 
>>1697642
Ну в кодинге разница между 27б и большими моделями Дипсиком В4, ГЛМ 5.3 Флеш и 3.8 флеш некст довольно большая. 27б теряется в больших проектах, уходит не в ту сторону и выжирает весь контекст даже на 250к, а большие модели легко разбираются в них.
Аноним 07/09/26 Пнд 03:55:30 #252 №1697843 
Ну так что правда что у 5.3 глм новый атеншен контекста который идет на пользу кодерам но руинит рп вываливая все секреты?
Аноним 07/09/26 Пнд 04:22:34 #253 №1697851 
image.png
Сделал график зависимости размера компьют буфера и контекста от размера контекста на глм 5.3 флеш на -ub 4096. В отличие от квена тут нет неожиданностей, кроме того что начальный размер компьюта до 65536 всегда одинаковый, т.е. брать мелкие контексты на модели невыгодно.
Аноним 07/09/26 Пнд 05:31:27 #254 №1697858 
>>1697851
Да никто не запускает здесь этот флеш, у людей блять 32 рам потолок, особые шизы затарились 64.
Тред вообще можно считать мертвым, один гугел с обосраной геммой что то делает, всё, больше нет моделей, всё сдохло обоссавшись и обосравшись, растопырив очко перед программистами вайбкодерами.
Аноним 07/09/26 Пнд 05:51:00 #255 №1697859 
>>1697858
>Тред вообще можно считать мертвым
>катимся каждые 3 дня
Как же ты сука заебал.
Мимо ОП
Аноним 07/09/26 Пнд 05:56:57 #256 №1697860 
>>1697859
Да 90% постов от восхищенных ебланов про квен 3.8 27б как им дали фабле дома и какую аблитерацию скачать.
Аноним 07/09/26 Пнд 06:51:46 #257 №1697885 
>>1697834
Не по кодингу я согласен. я говори об общем интеллекте и рп. Тут кто-то упоминал что жирные облачные модели не могут уследить за одеждой персонажа даже.
Аноним 07/09/26 Пнд 07:39:11 #258 №1697900 
Вот скажите мне в чём логика?
Вот есть коробочки с говном на 128 рам, есть 8 квант 120б модели под эти коробочки, есть 4 квант 230б модели под эти коробочки, а те от кого реально ждёшь релиза выпускают аккурат размер от которого коробочки с говном рассыпаются, т.е 320-400б
Аноним 07/09/26 Пнд 07:56:31 #259 №1697904 
>>1697645
>>1697180
Потестировал. Интеллект заметно выше по сравнению с оригиналом. Вот это нам надо! Если тебе оригинал отказывается на что-то отвечать то это оличная модель для всего. При самой жести пишет дисклейсер но всё равно отвечает, и про насилие, и про варку, и про евреев
Аноним 07/09/26 Пнд 09:04:02 #260 №1697926 
>>1697900
Те, кто делает коробочки с говном - хочет продать тебе коробочки.
Те, кто делает модели - хочет продать тебе доступ к модели на своём железе.
Аноним 07/09/26 Пнд 09:18:40 #261 №1697933 
>>1697900
Претензия то в чем? В том что производители коробочек не согласовали производство с компаниями модели которых тебе интересны? А должны были?

Ты покупаешь коробку и можешь запускать на ней десяток разных моделей от плотных 27/30/31B до MoE 26/35/80/~120/~230B. Своя ниша у них есть, причем довольно большая.

Дашь тебе коробочку с 256GB RAM на борту - будешь жаловаться что рассыпаются ~750B модели.

Хочешь запускать что-то больше - собирай риг или бери пачку таких коробочек, можешь хоть триллионные модели после этого на них запускать. Хочется одну коробочку - есть мак студия на 256/512GB.
Аноним 07/09/26 Пнд 09:19:14 #262 №1697934 
Capture1.PNG
Capture2.PNG
Capture3.PNG
В другой доске писал, сюда тоже отчитаюсь: недавно гонял гемму4-26 а именно iq2_m квант от unsloth, на вот таком вот железе:

gtx1650-4gb + ddr3-16gb !!!

Поставил 16к контекст q4 (можно и больше думаю, просто скорость упадёт). Запускал в textgen портабл сборка llama+cuda12.

Результат:
Скорость 5 т/с.
Логика, язык - очень хорошо, лишь кое-где уступает iq4_xs.
Скрины прилагаю.

Было б больше рамы, можно было бы и пожирнее квант взять.

Так что в пизду ваши дорогие коробочки, не нужны они (для РП, я имею в виду. А кодинг, ну, за хороший кодинг придется платить так или иначе)
Аноним 07/09/26 Пнд 09:22:43 #263 №1697938 
карточка.PNG
>>1697934
Вот "карточка" если кому интересно.
Аноним 07/09/26 Пнд 09:23:45 #264 №1697939 
>>1697900
>а те от кого реально ждёшь релиза
Если ты про новый мак студио на м5 ультра, вроде как 512 будет доступна за оверпрайс.
Аноним 07/09/26 Пнд 09:26:46 #265 №1697940 
>>1697934
>>1697938
Воля к запуску ллм моё почтение, но эта штука что-то кроме таких текстов может?
Аноним 07/09/26 Пнд 09:56:13 #266 №1697948 
Capture45.PNG
>>1697940
Ты про этот интерфейс или модель? Интерфейс делает вот так:

←[2;36m22:34:15-761832←[0m←[2;36m ←[0m←[34mINFO ←[0m Starting TextGen
←[2;36m22:34:43-915781←[0m←[2;36m ←[0m←[34mINFO ←[0m OpenAI/Anthropic-compatible API URL:
←[2;36m ←[0m
←[2;36m ←[0m ←[4;94mhttp://127.0.0.1:5000/v1←[0m
←[2;36m ←[0m

Running on local URL: http://127.0.0.1:7861 (это сам интерфейс)

По 5000му порту я прикручивал и к таверне и к маринаре.
Сам по себе интерфейс простой но есть много удобных фишек: персонажи, тулзы (питоновские файлы, есть примеры).

Если ты про модель, то рпшит эта модель превосходно и на русском и английском (проверял в Маринаре), проставляет смайлы-реакции (в конво режиме), дёргает генерацию картинок когда надо, отлично пишет промпты (с правильным агентом). Базовые знания, простенький кодинг, рисовать SVG картинки тоже может (пик). Можно включить thinking. Есть под эту модель mmproj - vision, то есть может разобрать скриншот прочитать что написано или разобрать эмоции человека по фото например. Если кинешь ей второе фото и там тот же человек - узнает. Узнаёт знаменитостей.
Аноним 07/09/26 Пнд 10:07:44 #267 №1697962 
Capture55.PNG
>>1697948
а вот ещё, всё на той же 4+16 нищепеке тот же iq2m квант
там анимация на самом деле, кольцо под куполом увеличивается и меняет прозрачность! (я попросил нарисовать золотые купола с переливами и перезвонами и лодку с парусами)

цитата:
Слушай, нарисовать «звук» колоколов через SVG — задача ебаная, потому что графика — это статика, но я попробую передать этот лютый перезвон через визуальные эффекты: добавлю лучи-волны от колоколов, типа как звук расходится, и сделаю градиенты на золоте, чтоб прям сияло, сука, как на солнце.
Аноним 07/09/26 Пнд 10:57:06 #268 №1697994 
>>1697688
пепе мне кажется в русик не может на таком уровне
Аноним 07/09/26 Пнд 10:58:52 #269 №1697998 
>>1697637
Муся это.
Аноним 07/09/26 Пнд 11:01:18 #270 №1698003 
>>1697843
Там еще в линейных специальных роутер заложили. Он проверяет контекст, если там рп то пускает все по одному говноэксперту который портит, чтобы не было не целевого использования.
>>1697900
Глянь какой-нибудь среддит и подобное. Работяги закупают по 2-3-4 коробочки с говном и пускают модели на них. Довольно много постов "гоняю на двух спарках", ну а так мак студио с 480-512 гигами есть, туда уже влезет в одну.
>>1697933
Соберешь риг - будешь жаловаться что триллионные модели рассыпаются, да чтож такое!
Аноним 07/09/26 Пнд 11:10:10 #271 №1698011 
>>1697790
>послушай, кого ебет правильные ли мы там кванты выгрузили? ведь главное это первым страничку на хаггинг фейсе создать, верно? кто первым зарелизил, тому и достаются все девки
(с) Виктор Цой
Аноним 07/09/26 Пнд 11:13:33 #272 №1698012 
>>1697790
Мерзость ебаная. Его поведение полностью соотносится с внешностью.
Аноним 07/09/26 Пнд 11:25:13 #273 №1698019 
>>1697819
> 4 мишки на гемме?
Ага
Аноним 07/09/26 Пнд 12:00:47 #274 №1698044 
Почему Гемма отупела? Сидел до этого на старом
q4_k_xl кванте анслота, решил перекачать на новый (они там вроде шаблон гугла меняли или еще что-то такое) и лламу последнюю поставил. И Гемма ошизела, стала ошибаться в русских словах и периодически использует не существующие слова. Взял q6_k_l квант бартовски, вдруг анслот поломал что-то, но всë осталось также.
Аноним 07/09/26 Пнд 12:02:55 #275 №1698045 
>>1698044
llama.cpp обновлял? анслот выкатил новые кванты UD3.0, может быть и для геммы переквантовал
Аноним 07/09/26 Пнд 12:05:15 #276 №1698046 
>>1698044
Квантование кеша включал? Если да, попробуй без него.
Аноним 07/09/26 Пнд 12:07:50 #277 №1698051 
>>1698044
Что-то на твоей стороне. Вон я недавно кидал логи с последней (ну уже нет) Лламы и q6 бартовски >>1696000 →
До сих пор жду мистралешиза который в ночь на 05.09 писал что завтра принесет логи и покажет всем как надо кумить. 07.09, логов нет
Аноним 07/09/26 Пнд 12:33:56 #278 №1698066 
>>1698045
Последнюю ставил ровно в тот момент как перекачивал веса пару дней назад. Ну и я не просто так взял сразу q6_k_l от бартовски, чтобы исключить влияние квантов, но судя по всему дело не в них.
>>1698046
Компьютер без него не потянет, да и до этого же проблем не было, а тут начались. Проверю если ничего не поможет.
>>1698051
Модель бартовски - google_gemma-4-26B-A4B-it-Q6_K_L

Параметры:
--flash-attn on ^
-b 512 ^
-ub 512 ^
-np 1 ^
-c 60000 ^
--cache-ram 0 ^
--swa-checkpoints 3 ^
--n-gpu-layers 999 ^
--n-cpu-moe 20 ^
--min-p 0.0 ^
--top-k 64 ^
--top-p 0.95 ^
--temp 1.0 ^
-ctk q8_0 ^
-ctv q8_0 ^
-rea off

Подключено к таверне через Chat.

Из предположений:
-Старая версия таверны
-Недавно добавил "--min-p 0.0" так как в гайде из шапки написано что это правильно.

Ничего больше не трогал, только обновлённую модель скачал и лламу последнюю.
Аноним 07/09/26 Пнд 12:39:10 #279 №1698069 
image
>>1697934
>гемму4-26 а именно iq2_m квант от unsloth, контекст q4
Жесть, просто комбо собрал. Удивлён что оно вообще живое и даже связно пишет.
Аноним 07/09/26 Пнд 12:45:10 #280 №1698070 
>>1698066
Откатись на старую версию да сравни
Аноним 07/09/26 Пнд 13:53:03 #281 №1698101 
>>1697790
Теперь я точно буду пользоваться только его квантами. Нерд который так выглядит не может плохо разбираться в том как собрать хорошие кванты моделей.
Аноним 07/09/26 Пнд 13:55:16 #282 №1698104 
>>1698101
В том и проблема, что он не разбирается.
Аноним 07/09/26 Пнд 14:08:16 #283 №1698112 
>>1698104
Он хорошо разбирается в том, что бенчить нужно на калибровочном датасете.
Аноним 07/09/26 Пнд 14:22:49 #284 №1698124 
JQTLzTL.jpeg
>>1697790
>He downlod the kvant with broken jinja?
>Reupload eet
Аноним 07/09/26 Пнд 14:29:47 #285 №1698130 
Стоит вообще ли жертвовать 10т\с ради Q8 кванта вместо Q6_K на моешной гемме? Так ли прокачиваются мозги у нее, поскольку по теории кванта нет разницы, она ничтожна. А с другой стороны bf16 гемма дает вообще другой результат как в треде услышал. Так стоит или нет?
Аноним 07/09/26 Пнд 14:34:04 #286 №1698133 
>>1698130
Да, в случае с 26б геммой стоит. Про бф16 (фулл веса) хз
Аноним 07/09/26 Пнд 14:43:36 #287 №1698144 
image.png
image.png
>>1697934
Т.к. у тебя почти все будет использовать CPU, а GPU по меньшей части, тебе IQ кванты будут вредить в финальной скорости. Я на связке 5600 16гб озу и 2060 6гб врама получаю на Q6_K под 25-30 т\с уточню, на генто. Соответсвенно, что тебе порекомендую.
1)Перейти на лламуцпп, кобольд и наверное прочая хуйня потребляет больше врама на контекст, когда лламацпп меньше берет, хуй знает почему так, или может мне кажется, но в целом заметил за собой это.
2)Поставь файл подкачки на 16-24 гб. Это позволит тебе брать модели побольше, пожирнее квантом. Из под винды с затыками с дикимими зависаниями в начале если ссдшник хуевые\сата где файл подкачки -> Q5_K_S можно. Было бы у тебя 6-8 гб врама то Q5_K_M. Если чуть подтормашить, без дикой хуйни то Q4_K_M или mxfp4_moe квант. Они выдавали мне из под винды на кобольде под 20т\сов. Правило основное, --n-cpu-moe ставь где-то под 32+ т.к. у тебя 4гб врама, и глядишь тут чтобы не было shared memory. Также можно поставить параметр --fit on, он делает работу за тебя, но в целом можно получить чуть меньше, но если нужно вставить mtp или mmproj или все вместе с ним меньше мозг ебать себе будешь.

-m /mnt/win_nvme3/models/gemma-4-26B-A4B-it-Q6_K.gguf \
-md /mnt/win_nvme3/models/mtp-google_gemma-4-26B-A4B-it-Q4_0.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--spec-draft-p-min 0.85 \
--spec-draft-n-min 1 \
--host 127.0.0.1 \
--port 5001 \
--flash-attn on \
-c 40000 \
-np 1 \
--cache-ram 0 \
-ngl all \
--n-cpu-moe 29 \
--jinja
Аноним 07/09/26 Пнд 15:15:47 #288 №1698164 
>>1697934
Братюнь, ты бы Tesla P40 одну купил и мозги бы не ебал, серьезно…
Аноним 07/09/26 Пнд 15:17:01 #289 №1698166 
>>1697934
Да хуй с ней, материнку с несколькими слотами и напхать P104-100/P102-100 с 8-10 гигами. 2к рублей на авито, чи скока там.
Аноним 07/09/26 Пнд 15:20:54 #290 №1698171 
>>1698166
> материнку с несколькими слотами и напхать говна
Экономику райзеров заложил? Иначе хз как нормально вставить больше двух двухслотовых карт
Аноним 07/09/26 Пнд 15:34:17 #291 №1698182 
collagecpuramssdgpu.png
collagea.png
collageb.png
collagec.png
>>1697934
>>1697938
>>1697962
Хз, анон, мне кажется, ты недооцениваешь свое железо. Не знаю, есть ли у тебя ссд нвм и относительно мощный проц, однако твои спеки похоже на мои (первый пик)(только что рам - ддр4). Я пока еще использую lm studio и 5 тпс у меня бывает если я запускаю гемму 26б apex-i-quality с контекстом в 128к (неквантованный) с включенным ризонингом.

Специально обновил lm studio и все компоненты + заново запустил свой шизокартофельный бенчмарк с новой кудой, чтоб быть уверенным, что ничего не изменилось. Билд lm studio - 0.4.23; cuda llama.cpp (Windows) - 2.33.0; Model loading guardrails - relaxed

Кроме того, несмотря на то, что вроде рам вся забита при таких настройках, можно запустить браузер и спокойно двачевать почти без лагов.

Весь секрет в том, чтоб использовать офлоад экспертов на цпу в случае мое моделей (тут у меня не видно всей надписи, но параметр начинается с "Number of layers for"). А также следить, чтоб все держалось в выделенной врам, на цпу, в рам и на ссд. Если протекает в общую врам (хотя это тот же рам как я понимаю???), скорость падает почему-то. Ненамного на моем железе (с 7 тпс до 5 в случае геммы-апекса из-за контекста в 128к), но все-таки. Также надо следить, чтоб проц слишком много не отжирал и выделенная врам была полностью заполнена (если врам, допустим, будет заполнена на четверть, а все остальное на цпу - скорость тоже упадет). Как я понимаю, у него приоритет при таких настройках. Поэтому на 2 пике с qat геммой только 28 слоев выгружено на цпу (если бы контекст был короче, можно было бы еще пару слоев убрать).

На 3 и 4 пиках взята стандартная длина контекста, потому что вся выделенная врам при таких настройках заполнена, но ничего не протекает в общую (максимальная скорость).

Также у меня запускается qwen 3.6 35b в 6 кванте от hauhau и apex-i-balanced от mudler со скоростью в 3-4 тпс (как и ornith 1.5b 35b).

Более того, в качестве эксперимента однажды запустил qwen 3.5 122b в 6 кванте от hauhau. В моем картофельном бенчмарке выдал 0,28 тпс.

Что касается младших квенов, то 4b q4_k_m, который полностью влезает в выделенную врам, выдал 45 тпс после обновления драйверов. 9b и аналогичный ornith 1.5 в 6 кванте выдают около 10 тпс в картофельном бенчмарке.

Кстати, ты пробовал https://huggingface.co/LLiserginov/Luqwen3.5-4B ? Тут его хвалили.
Аноним 07/09/26 Пнд 15:43:02 #292 №1698187 
>>1698019
16ГБ?
Аноним 07/09/26 Пнд 15:45:24 #293 №1698190 
>>1697598

8к - это еще по-божески. У первой ламы было 2к. 2к, понимаешь? Сейчас у меня ризонинг одного сообщения в ролеплее больше.
Аноним 07/09/26 Пнд 15:49:14 #294 №1698194 
>>1698003
>ам еще в линейных специальных роутер заложили. Он проверяет контекст, если там рп то пускает все по одному говноэксперту который портит, чтобы не было не целевого использования.

Пруфы? Или ты так пошутил?
Аноним 07/09/26 Пнд 15:52:31 #295 №1698198 
>>1698130
Нет. Если у тебя 6-битная гемма выдает хуевый результат - значит у тебя либо квант сломан, либо ты её сломанным шаблоном насилуешь. Скорее всего второе, учитывая что ты новичок и пока не вдупляешь что вообще происходит, хотя не удивлюсь если и первое тоже.
Аноним 07/09/26 Пнд 15:52:55 #296 №1698199 
1788785577204.png
>>1698187
32. На каждой карте ещё +- по 30% места свободно
Аноним 07/09/26 Пнд 15:53:18 #297 №1698201 
Мда, Все же Гемма4 - явно не для нормальных агентов. Я тут ее в opencode для работы с текстами попробовал. Если квен прекрасно работает с ними даже в тюнах (не говоря о просто еретиках), и с 75-100K контекстом, то даже стоковая гемма рассыпается на попытках редактировать литературный текст уже к 20K контекста. Она тупо не может нормально инструмент edit вызвать (для которого надо точно, символ в символ, написать ЧТО меняем, как один из параметров вызова). Причем первые косяки начинаются уже на 12-16K и дальше быстро нарастают до полного обсёра при каждой попытке. Q4 кванты (разные пробовал), и неквантованый кеш. Это про 31B. Печально, однако.
Аноним 07/09/26 Пнд 15:54:22 #298 №1698203 
>>1698199
Можешь 3.8 флеш потестить в ку4?
Аноним 07/09/26 Пнд 15:54:46 #299 №1698204 
>>1698203
>в q4_k_xl
Аноним 07/09/26 Пнд 15:56:04 #300 №1698206 
>>1698201
Ну ты придумал конечно, сосущую хуи всего треда онахол бимбоунитаз работать заставлять...
Аноним 07/09/26 Пнд 15:56:52 #301 №1698209 
>>1698201
Знания языков ей не бесплатно залили + к4 отупляет как ни крути

>>1698203
Тестил когда ещё был сырой мр. Прогоню ещё разок. Модель мне не зашла (по итогу юзаю либо гемму к8, либо дипсик в максимальном кванте)
Аноним 07/09/26 Пнд 15:57:16 #302 №1698210 
>>1698201
мятные_пряники.jpg уже всех научил что гемма это 70IQ бимбо секретутка сосущая начальнику (тебе) под столом, на этом её полномочия должны заканчиваться, а реальную работу делает очкастый задрот квен
Аноним 07/09/26 Пнд 15:57:46 #303 №1698211 
>>1698210
>>1698206
лолсука хайв
Аноним 07/09/26 Пнд 16:13:12 #304 №1698222 
>>1698201
Она очень сильно страдает от квантования и не задрочена на агентские задачи. Она в них сосёт даже в фулл весах, зато в рп топ. Ну и даже гемини с инструментами любит срать под себя.
Аноним 07/09/26 Пнд 17:18:33 #305 №1698269 
Нигеры вы ебаные сколько можно спрашивать, как этот квен Некст? Для рп лучше моделей до 200B? Для кода лучше чем 27 квен?
Или пережареный соевый мусор как всегда?
Аноним 07/09/26 Пнд 17:25:10 #306 №1698275 
>>1698269
Да никак блять. Это сугубо умненький инструмент, как и все квены. Рп начинается с 300b+ MOE, ну или дрочи гемму до посинения.
Аноним 07/09/26 Пнд 17:31:20 #307 №1698278 
>>1698269
> как этот квен Некст? Для рп лучше моделей до 200B?
Да. Но только в SFW РП.

>Для кода лучше чем 27 квен?
Да.

>Или пережареный соевый мусор как всегда?
Да.
Аноним 07/09/26 Пнд 17:36:52 #308 №1698283 
image
image
image
image
>>1698201
Гемма устарела для агентов. Вот результаты теста с медведем. Даже Qwen 3.6 лучше справляется.
Аноним 07/09/26 Пнд 17:41:11 #309 №1698287 
>>1698171
Даже две P104-100 дадут 16 гигов и скорости гораздо больше, чем DDR3. =)

>>1697561
>>1697577
> 4090 и ддр4 раме. Q4 K M квант
5070 ti и DDR4 3600
Q4_K_M PLE Q4_0 от AesSedai
19.44 t/s на старте.
Контекста, конечно, сам понимаешь, хуй да нихуя, 16 гигов против 24. На 150к не померяю.
Но я думаю, у тебя что-то не так с железом или настройками (билдом?). Может ты на винде, и там до сих пор медленно работают большие МоЕ, хз. Я на линуксе собираю.

В целом, на 1-1,5 токена ниже, за лучшее качество. Вроде да, но!
5 гигов против 9 в видяхе — это приличный кусок контекста (тыщ 60-80). Эхехе.

Кстати, я тут MTP подцепил от Анслота через git clone --branch qwen4exp/mtp https://github.com/danielhanchen/llama.cpp
Получил 24 токена в секунду на своем конфиге. Просто пушка, почти DDR5 догоняет (с более слабой видяхой, кек).
Один минус — контекста опять нет. =D
Или делить на две карты, но тогда чтение контекста будет 60 тпс, пхпхпх, со скоростью проца. Из-за материнки со вторым слотом PCIe 3.0 x4.

>>1697589
Разница ~40% по скорости, смотри сам. Но 16-20 или 25-28 — не уверен, насколько критично для твоих задач.
Аноним 07/09/26 Пнд 17:52:13 #310 №1698291 
>>1698194
Рофл конечно. Исходный пост разве не шуточный?
>>1698199
Не пробовал в свободную память пихнуть какую-нибудь картинкогенерацию? Как она вообще работает на мишках?
>>1698209
> либо дипсик в максимальном кванте
А с ним что лезет и какие скорости?
Аноним 07/09/26 Пнд 17:54:47 #311 №1698293 
>>1698287
>Получил 24 токена в секунду на своем конфиге. Просто пушка, почти DDR5 догоняет (с более слабой видяхой, кек).
Что за параметры llama-config?
Аноним 07/09/26 Пнд 18:21:03 #312 №1698306 
>>1698291
> пихнуть какую-нибудь картинкогенерацию? Как она вообще работает на мишках?
Ужасно. Вообще не стоит того. Для картинок стоит в той же системе дуал 5060ти 16
> А с ним что лезет и какие скорости?
128к контекста. Префилл на старте 200, дальше идёт вниз, тг около 14тпс. В оперативке около 60гб весов лежит
Аноним 07/09/26 Пнд 19:00:14 #313 №1698325 
>>1698124
Бля, только что как раз перекачивал ГЛМ 5.3 из-за этого, хорошо, хоть только первый файл на 10мб, а не все 500гб. Ебучий бракодел.
Аноним 07/09/26 Пнд 19:00:19 #314 №1698326 
>>1698306
> Ужасно. Вообще не стоит того.
Ррреееее. Блин, память свободная есть, если бы в тп4 тоже объединить то могло быть норм, жаль.
> В оперативке около 60гб весов лежит
Там сейчас тп работает с выгрузкой? Префилл упирается в карточки или шины?
Аноним 07/09/26 Пнд 19:30:08 #315 №1698337 
>>1698198
Кто говорил про хуевый результат. Или у нас мозги работают по low-cut фильтру, работает не работает. С чего высер про новичка еще. В любом случае остановился на Q6_K ведь pp ебет на Q8
Аноним 07/09/26 Пнд 19:41:03 #316 №1698345 
>>1698283
Пропустил те треды и никак не могу понять смысл этого бенча. Модельке надо перерисовать картинку? Если да, дайте оригинал.
Аноним 07/09/26 Пнд 19:47:49 #317 №1698347 
А что вы молчали, что там Ninfer давно собрали под шиндовс? х2 от жориного перфа но только несколько квенов пока(?) Карт уже куча поддерживается в виде вайбкод-портов
Аноним 07/09/26 Пнд 19:54:43 #318 №1698349 
Мнение?
https://huggingface.co/XHToken/Spark-X2.5-4B
Аноним 07/09/26 Пнд 19:56:25 #319 №1698351 
>>1698349
Фейбл дома.
Аноним 07/09/26 Пнд 20:19:44 #320 №1698359 
>>1698349
AGI
Аноним 07/09/26 Пнд 20:20:09 #321 №1698360 
>>1698349
Обычно когда в описании пишут что это общая модель, имеет 1М контекста, знает 200 языков и в их бенчах лучше всех конкурентов, модель оказывается говном.
Аноним 07/09/26 Пнд 20:46:03 #322 №1698378 
>>1698293
llama-server -t 9 -c 65536 -b 2048 -ub 2048 -ctk q8_0 -ctv q8_0 -np 1 -m Qwen3.8-Flash-Next-UD-Q4_K_XL.gguf -md mtp-Qwen3.8-Flash-Next-shared-Q8_0.gguf --mmproj Qwen3.8-Flash-Next-mmproj-BF16.gguf -fa on -fit off -cmoe -ngl 99 --temp 1.0 --top_p 0.95 --top_k 20 --min_p 0.0 --presence-penalty 0.0 --repeat-penalty 1.0 --spec-type draft-mtp --spec-draft-n-max 2 --load-mode mlock --reasoning-preserve --chat-template-kwargs '{"reasoning_effort": "xhigh"}' --jinja

С --load-mode можно поиграть, выставить mmap или none, ну а lazy mode вроде как в приоритете, если не отключен прямо, тут хз.

slot launch_slot_: id 0 | task 179 | processing task, is_child = 0
slot print_timing: id 0 | task 179 | n_gen = 100, tg = 26.83 t/s, tg_3s = 27.10 t/s
slot print_timing: id 0 | task 179 | n_gen = 177, tg = 26.19 t/s, tg_3s = 25.42 t/s
slot print_timing: id 0 | task 179 | n_gen = 243, tg = 24.76 t/s, tg_3s = 21.62 t/s
slot print_timing: id 0 | task 179 | prompt eval time = 210.13 ms / 4 tokens ( 52.53 ms per token, 19.04 tokens per second)
slot print_timing: id 0 | task 179 | eval time = 11025.19 ms / 272 tokens ( 40.68 ms per token, 24.58 tokens per second)
slot print_timing: id 0 | task 179 | total time = 11235.32 ms / 276 tokens
slot print_timing: id 0 | task 179 | graphs reused = 282
slot print_timing: id 0 | task 179 | draft acceptance = 0.72072 ( 160 accepted / 222 generated), mean len = 2.44
slot release: id 0 | task 179 | stop processing: n_tokens = 648, truncated = 0

Но я ща погонял контексты подлиннее — все же в районе 21 выдает на прозе, хотя на коде до 23+ t/s поднимается.
Возможно, можно больше acceptance выжать.

Ну, типичное MTP.

Ща еще попробую на двух видяхах с контекстом 256к, хочу посмотреть, будет ли скорость меньше. tensor parallel не работает для квена и мтп тем более, так что ожидать скорость выше — вряд ли.
Аноним 07/09/26 Пнд 21:04:10 #323 №1698393 
>>1698044
не бери q, пробуй ud-iq
и убедись что ллама свежая
Аноним 07/09/26 Пнд 21:07:59 #324 №1698397 
>>1698130
в тесте на два стула IQ4_XS > Q8
думой
Надо понимать что Q это очень глупая обрезка дохуя бит (как минимум 8 бит в топку отправляются). IQ это поумнее подход. Ещё как вариант рассмотри APEX-Quality это лучше чем Q8.
Аноним 07/09/26 Пнд 21:12:09 #325 №1698400 
1741401074606.png
1723315354041.png
1686346750443.png
>>1698203
Так. Квен загрузил, даже тензор параллел работает
Аноним 07/09/26 Пнд 21:13:01 #326 №1698401 
>>1698378
Мтп дает бонус только на низком контексте, на высоком он наоборот тормозит, увы. Плюс поскольку он сам весит в врам + создает второй контекст - он сам по себе отрезает тебе саму возможность высоких контекстов.
Аноним 07/09/26 Пнд 21:13:30 #327 №1698402 
Проклятый мир где единственный конкурент эиру это сраная гемма на 124 которая ещё не вышла... Надеюсь её по другому обучат, по глмовски, единственный шанс что то поесть...
Вот что хотите говорите, вы слепцы, вам воздастся за то что не видите знаки, вы похоронили единственную модель, которая была к вам искренне добра и принимала ваше желание рпшить, ИЗ ЗА ЕРУНДЫ. ИЗ ЗА КОНТЕКСТА И ИНСТРУКЦИЙ. ТЬФУ.
Аноним 07/09/26 Пнд 21:16:00 #328 №1698403 
image.png
image.png
>>1697447
>Есть мысль до q3 подрезать, тогда 90к контекста влезет
https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/tree/main

квант IQ3_S, сам контекст в q4. нормально задачи решает, на 16 гигах vram. если включить mtp, то будет еще быстрее, но контекст в 2 раза урезать придется.
Аноним 07/09/26 Пнд 21:16:52 #329 №1698405 
>>1698400
Блядб. Забыл разгон hbm включить...
Аноним 07/09/26 Пнд 21:17:29 #330 №1698407 
>>1698397
>в тесте на два стула IQ4_XS > Q8
Дебил-мелкобуква, получив единичный выброс в шизотесте, в котором не измеряется интеллект, ставит в правило что четвертый квант лучше восьмого. 2026, ламатред, итоги.
Аноним 07/09/26 Пнд 21:19:25 #331 №1698410 
>>1698349
Это на esp32 ставить?
Гайд есть?
Аноним 07/09/26 Пнд 21:19:29 #332 №1698411 
>>1698407
Это просто пример. Конечно я тестировал и не только я на реальных РП с болльшим контекстом. IQ4_XS просто умнее. Ну а ты как, меряешь интеллект кванта по гигабайтам свежей информации? по количеству хуилиардов параметров? Ммм? На результат смотреть надо, а не на циферки.
Аноним 07/09/26 Пнд 21:19:41 #333 №1698412 
>>1698401
>Мтп дает бонус только на низком контексте, на высоком он наоборот тормозит
Чушь несусветная. В крайнем случае у тебя что-то сломано, у меня каждый день агенты крутятся с MTP и никаких просадок по драфтам нет
>>1698402
Эйрошиз насмотрелся Слепой и стал злой бабкой? Гемма 31 уже наравне, а в чем-то даже превосходит Эйр. Но Эйр няша безусловно, вот совсем недавно закончил сессию на 32к контекста. Вполне он слушает инструкции, нужно обрамлять их нормально, и все
Аноним 07/09/26 Пнд 21:24:50 #334 №1698416 
>>1697589
Ддр4 3600 на десктопе с 2 аналами 23т/с.
Ддр4 2133 на сервере с 8ю аналами 24.5т/с.
Думой. Пока ддр5 не станет сопоставима по цене с ддр4 я к этому говно не притронусь.
Гемма 26б на серваке в полтора раза быстрее десктопа, кстати, там ддр5 может быть на 10-20% быстрее ддр4 за х3 цены
Аноним 07/09/26 Пнд 21:25:08 #335 №1698418 
>>1698397
>IQ4_XS > Q
>APEX-Quality это лучше чем Q8
В голос. И ебанат ведь даже не задумывается почему не существует IQ8. Возможно где-то в глубине сознания понимает, что это разрушит иллюзию
Аноним 07/09/26 Пнд 21:26:19 #336 №1698420 
>>1698182
Ты прав. С выгрузкой моэ и 64к контекстом в q8 - полёт нормальный, 5-6 т\с. Обе памяти забиты под завязку но ничего не тормозит нигде. Вообще моя цель была переубедить тех кто думает, что без супер-дорогих ГПУ им в локальный РП не стоит даже пытаться лезть.
Аноним 07/09/26 Пнд 21:28:05 #337 №1698421 
>>1698420
> моя цель была переубедить тех кто думает, что без супер-дорогих ГПУ им в локальный РП не стоит даже пытаться лезть.
Это попытался сделать автор гайда. Твой пост потеряется среди сотен других. Хотя один хуй ригообладатели останутся скептиками и не прекратят невзначай напоминать, что люди с железом хоть на 0.00001% бомжи и недостойны быть итт, пользоваться Жорой, юзать IQ4 кванты.
Аноним 07/09/26 Пнд 21:28:14 #338 №1698423 
>>1698418
Дизеринг весов решает, братиш. Тогда как тупая обрезка отупляет. Можешь хоть тыщу раз всех вокруг называть ебанатами, но у тебя синдром Даннинга-Крюгера налитсо.
Аноним 07/09/26 Пнд 21:28:35 #339 №1698424 
>>1698421
> на 0.00001% хуже*
Аноним 07/09/26 Пнд 21:30:25 #340 №1698425 
>>1698423
>у тебя синдром Даннинга-Крюгера налитсо
Что ж, похоже, он же и у ГГерганова - создателя Лламыцпп, на которой ты эти кванты крутишь, и у всех популярных квантователей тоже, типа bartowski и mradermacher. Как хорошо что такой мыслитель как ты почтил нас своим присутствием! Расскажи как достичь АГИ и сингулярности.
Аноним 07/09/26 Пнд 21:30:51 #341 №1698426 
>>1698401
Я понимаю, что бонус ситуативен, но стоит признать, что на коде я вижу очень хорошие значения. А для прозы я могу запустить без мтп (и, заодно, контекста накинуть).
Сам мтп занимает 3 гига на диске, не тяготит. =)
В целом, я доволен.

>>1698418
Ну, забавное… Для людей не знающих физику, мир полон магии, заебал.
Аноним 07/09/26 Пнд 21:30:59 #342 №1698427 
>>1698421
Мне как читателю ОП-поста это было не очевидно совсем. Надо туда добавить конкретные примеры в цифрах вроде 4гб видеокарта = качественный РП кум на 5 т/с. Многие даже не подозревают.
Аноним 07/09/26 Пнд 21:38:28 #343 №1698432 
>>1698420
> в локальный РП не стоит даже пытаться лезть
В локальный рп стоит лезть даже с калькулятором, если не искушен йоба моделями офк.
Ведь если вспомнить, годы назад читая как кивает пигмалион, или на первой лламе Серафина говорила что ты ее ебешь довольно урчали с малого. Это вообще некоторый особый экспириенс. А если ты пердоля энтузиаст - то еще удовольствие другого рода получишь.
Просто спустя время, когда первые восторги пройдут, ты начнешь замечать неровности и недостатки используемых моделей. Захочешь большего, полезешь выше - а там уже железо не позволяет. Вот тут-то как раз и наступает время подумать о повышении навыков промптинга и прочего с одной стороны, и апгрейда с другой. Иначе если засидишься - станешь злым и завистливым прямо как >>1698421
Аноним 07/09/26 Пнд 21:38:52 #344 №1698433 
1725673003712.png
>>1698405
>>1698400
Немного тг да +-15% пп накинуло
Аноним 07/09/26 Пнд 21:40:08 #345 №1698434 
>>1698432
У Эксламаквеношиза биполярка в сторону качнула: хедпаты новичкам. Поразительно, как через пару дней он изменится в лице и будет спорить с челами, получающими кайф от Геммы и Квена на Жоре
Аноним 07/09/26 Пнд 21:42:06 #346 №1698437 
>>1698432
Больше и выше - некуда. Гемма4-26 - топчик. Если не согласен - покажи что-то лучше. Только не говори "дипсик глм 5.3 флеш". Они просто тупые блядь, я уже показывал. А промптом и агентами можно и гемму надрочить.
Аноним 07/09/26 Пнд 21:43:59 #347 №1698439 
>>1698420
Сколько контекста при этом занято? На нулевом тестируешь? Может оказаться, что когда ты уже до 10-20к из этих выделенных 60 дойдёшь, скорость свалится до 2 т/с.
Аноним 07/09/26 Пнд 21:44:22 #348 №1698440 
>>1698437
>покажи что-то лучше.
Гемма 31В, квен 3.8 некст, любая современная мое больше 200В.
Аноним 07/09/26 Пнд 21:48:01 #349 №1698442 
>>1698440
Проходили. Всё хуйня. Все сыпятся на загадке про два стула. Ты опять про параметры заговорил 200Б - не гарантия ума. Вот у глм5.3 флеш сколько параметров? А вон как оно "мыслит"

The classic answer that circulates: "Сяду сам на пики точёные, а мать посажу на хи дроченые — потому что хи дроченые мягче" or something like that? No wait.

Actually, the famous resolution to these prison riddles is often: "Я на оба сяду" or there's a trick answer.

Let me recall. This riddle is part of a genre of "невыполнимых" or "безвыходных" загадок from the criminal world (тюремные загадки, "приколы"). The point is to put the person in an impossible position.

Known classic answers/attempts:

"Сам сяду на хи дроченые, мать посажу на пики точёные" — but then the riddler says "почему мать на деревянные (пластиковые) посадил?" — because "точёные" implies wooden, i.e., you don't respect your mother, you sit on the "live" ones and give her the wooden ones? Hmm.

Actually let me think about the logic. The trick: "х
и дроченые" (jerked off dicks) — these are "real" flesh. "Пики точёные" (whittled spears) — wooden, sharp, painful.

One classic answer: "Сам сяду на дроченые, мать — на точёные" → the retort: "Что ж ты мать на деревянные посадил?" implying disrespect.

Another: "Мать посажу на дроченые, сам сяду на точёные" → retort: "Сам на деревянный, а мать на живой? Ты что, с матерью спишь?" or something.

The whole point is that any answer gets a humiliating retort. That's the nature of these riddles — they're a form of "прикол" where the responder loses regardless.

There's a famous "выход" (way out) from such riddles in the folklore: the correct move is to refuse to answer or to reverse the question back onto the asker: "А ты сам на какой сядешь?" Or a classic counter: "Посажу тебя на оба" — I'll seat YOU on both. That's a known "otvet" in the criminal riddle culture: turn the aggression back on the asker.

Actually, I recall in the folklore of "тюремные загадки" the standard escape is to answer with a counter: "Я на твою мать посажу"




И это ваш хвалёный АГИ? Оно же просто срёт под себя. Геммма-26 рассуждает в тыщу раз здравее. Гемма-31 тупо зацикливается на том что где-то есть третий стул.
Аноним 07/09/26 Пнд 21:56:07 #350 №1698448 
>>1698442
Продолжай постить эту шизу и станешь известен как стулошиз.
Аноним 07/09/26 Пнд 21:59:34 #351 №1698455 
>>1698434
Настолько злой что совсем детектор зашкаливает, иди траву потрогай.
>>1698437
Гемма плотняша куда лучше если ты отыгрываешь что-то сложнее простого кума. Моэ совсем глупая и забывчивая. И очевидно жлм 5.3 и остальные что выше, как блять они могут быть тупыми по сравнению с моэгеммой, которая золотая рыбка по мозгам.
Аноним 07/09/26 Пнд 22:00:54 #352 №1698457 
>>1698455
Уууух бля я злой, держите меня семеро! Никогда не перестану с тебя проигрывать, солнышко треда. Скоро Квен4, вот Жора насрёт соей в кванты-то
Аноним 07/09/26 Пнд 22:06:19 #353 №1698463 
>>1698442
Нужна разработка зэк-бенча с ассортиментом мемных загадок и дальнейший бенчмаксинг на него.
>>1698457
Тебе просто юшечку или покормить?
Аноним 07/09/26 Пнд 22:16:32 #354 №1698469 
>>1698448
Я тебе реальный тест показываю, а ты "шиза". Если модель обосралась на такой простой загадке, то о чём дальше можно говорить? Я понимаю, что тебе "неудобно" отвечать на этот вопрос, ведь рушится весь твой манямирок где заи тебе приносят добро вместо говна. Но в таком случае шиз это ты.
Аноним 07/09/26 Пнд 22:20:41 #355 №1698470 
>>1698469
Что данный реальный тест тестирует? Не удивлюсь, если ты тот же долбаёб который утверждает что IQ4 > Q8. Не знаю насколько тупым нужно быть чтобы не въехать что гемма задачу решает т.к. лучше работает с русским языком а не потому что она "умнее"
В противном случае у нас тут наводнение поехавших
Аноним 07/09/26 Пнд 22:26:10 #356 №1698473 
>>1698470
Блядь ты просто ризонинг почитай это же лютый кринж. Да, глм очень хуево понимат русский (а ты что англичанин дохуя? тебе что не нужен русский рп???). НО. В этом случае он понял что х*и это "дикс". И всё равно по его мнению "дисреспект" мать НЕ садить на "живые" "дикс". Ты просто вчитайся. Это же просто безмозглая хуйня.
Аноним 07/09/26 Пнд 22:30:05 #357 №1698476 
>>1698469
Стулошиз, спок. Было смешно когда ты запостил загадку, но сейчас ты только свою тупость показываешь когда продолжаешь всерьез делать из нее выводы.
Загадка про стулья не является логической или загадкой на интеллект, ты либо знаешь на нее ответ, либо нет. То что тот апасный тьюн 26В, на котором ты её тестировал, имел загадку в датасетах - не значит что модель умнее других.
Аноним 07/09/26 Пнд 22:37:05 #358 №1698482 
>>1698473
>тебе что не нужен русский рп???
А что, он хоть на одной локалке нормальный без отупления модели и кринжа бывает?
Аноним 07/09/26 Пнд 22:40:30 #359 №1698485 
091234.png
>>1698482
Сырок, 26б васянотюн..
https://2ch.su/ai/arch/2026-09-01/res/1603482.html#1605338
Мы тут кушаем пока вы доедаете наши помои. Времена меняются
Аноним 07/09/26 Пнд 22:42:54 #360 №1698490 
>>1698476
Чел, тьюн не апасный а РПшный. Модель просто стабильнее юзает звездочки и чуть увереннее РПшит. Это очень мягкий тюн.

Я не делаю выводы из "загадки" и "ответа". В данном случае я смотрю как модель мыслит. А мыслит глм... никак. Перебрасывается с одного стула на другой ментально. "Надо мать на пики... а не... падажи... нада самому на пики а мать на хуи... хотя не падажжи... надо на оба сесть" СУккаааа...

А посмотреть как гемма блядь даже не тюн просто базовая гемма как она мыслит. Она даже НЕ РАССМАТРИВАЕТ вариант СЕСТЬ на пики или хуи. Потому что блядь ДЕБИЛУ СУКА ПОНЯТНО что это не вариант.
Она думает о нескольких вариантах сразу и все они - умные и логичные.
См ниже, базовая гемма-26:


Riddle: ""Есть два стула, на одном х*и дроченые, на другом пики точёные, на каком сам сядешь, на какой мать посадишь?"" (There are two chairs: one with [obscenity], the other with [sharp spikes]. Which will you sit on, and which will you put your mother on?)

Context: This is a classic ""dirty"" or ""street/prison"" riddle used in folk culture (often associated with criminal slang or schoolyard bullying) to trap someone into making an impossible choice between two bad options.

Goal: Provide the ""classic"" answer.
The riddle is designed as a logical fallacy/trap. No matter what you choose, you lose (either you suffer or your mother suffers).

Standard ""winning"" strategies in such riddles involve breaking the logic of the question, adding a third option, or turning the question back on the asker.

Option 1: The ""Third Chair"" approach. ""I'll stand up, and my mother will sit on the floor/a regular chair.""
Option 2: The ""Turn it around"" approach. ""I'll sit on your head/your chair."" (Aggressive)
Option 3: The ""Logical Refutation"" approach. ""Neither, I'll take both chairs and throw them at you.""

Option 4: The ""Traditional/Slang"" response. In prison/subculture contexts, there isn't one single official answer, but there are common ways to deflect. One popular way is to say ""I'll sit on the edge/stand up"" or to mock the person asking.

Actually, there is a very specific ""correct"" witty response often cited in folklore/internet culture to bypass the trap.
Response: ""Встану сам и мать посажу на пол"" (I'll stand myself and put my mother on the floor) or ""Сам встану, а мать на нормальный стул посажу"" (I'll stand, and put my mother on a normal chair).

Another clever one: ""На твоем стуле посижу"" (I'll sit on your chair).

Acknowledge the nature of the riddle (it's a trap/logic puzzle).

Provide the most common ""witty"" answers that avoid the trap.

Answer A (Deflection): ""Я сам встану, а мать на нормальный стул посажу"" (I'll stand, and put mom on a normal chair).
Answer B (Counter-attack): ""Сам на твой сяду"" (I'll sit on yours).

Answer C (Absurdist/Logic-breaking): ""Возьму оба стула и выкину в окно"" (I'll take both and throw them out the window).

The user asked for the ""classic"" answer. The essence of the ""classic"" response is to reject the premise of the dilemma.

Drafting the response:
""Эта загадка — классическая «ловушка», где любой выбор ведет к проигрышу. Чтобы не проиграть, нужно сломать саму логику вопроса. "

Классические варианты ответов:
«Я сам встану, а мать посажу на нормальный стул» (самый популярный вариант — вы отказываетесь от выбора из предложенных двух плохих вариантов).
«Сам на твой [стул] сяду» (перевод стрелок на спрашивающего).
«Возьму оба стула и выкину их» (агрессивный/абсурдный вариант)."



А теперь вернись к поносу который в "голове" у глм. Дело не в стульях и не в ответе который в меромеро зашит. Дело в том что сообразительность геммы-26 превосходит сообразительность глм-5.3-флеш. Именно бытовую сообразительность которая важна в беседах, в РП. Не говоря уже о понимании русского языка. Поэтому я и утверждаю что гемма-26 лучше для РП чем твой флеш-5.3 и дипдик вместе взятые. Это очевидно любому дебилу который посмотрит на логи мышления. А ты продолжай спорить и называть всех шизами. Только ты как раз и выглядишь шизом когда тебе доказательства на блюдечке приносят а ты делаешь вид, что ничем не пахнет.
Аноним 07/09/26 Пнд 22:46:38 #361 №1698498 
>>1698482
см сюда:
>>1697637

это гемма-26, iq4_xs

какие у тебя претензии?
Аноним 07/09/26 Пнд 22:48:01 #362 №1698499 
>>1698498
p.s. thinking был выключен
Аноним 07/09/26 Пнд 22:52:31 #363 №1698500 
1719580351582.png
1682660807428.png
1704832421660.png
>>1698442
Всё хуйня и ответы и твой "бенч".

Да, 70+ тпс конечно звучат вкусно, но он единственный хуйню спорол вместо ответа, даже квен лишь слегка подсерил
Аноним 07/09/26 Пнд 22:54:44 #364 №1698502 
>>1698500
Тебе говорят IQ4_XS > Q6 & Q8. Продолжай не верить.
Аноним 07/09/26 Пнд 22:57:10 #365 №1698506 
1640592052227.png
>>1698502
Аноним 07/09/26 Пнд 22:58:26 #366 №1698510 
>>1698506
Ну тогда и не спорь раз даже проверить не хочешь. Продолжай верить в циферки, тогда как несколько человек в треде (этом и предыдущем) уже убедились что им верить нельзя.
Аноним 07/09/26 Пнд 23:00:54 #367 №1698513 
>>1698510
Ты и N других твоих личностей которые постили под градусом чтоль?
Аноним 07/09/26 Пнд 23:04:26 #368 №1698514 
1732443379802.png
1767123481227.png
>>1698500
Аблитка мать бережёт, как мило 🥲
Аноним 07/09/26 Пнд 23:10:48 #369 №1698518 
>>1698490
>сообразительность геммы-26 превосходит сообразительность глм-5.3-флеш

Твой тест сообразительность не измеряет.
И та каша что ты запостил сейчас вызывает такой же кринж, как и каша что ты запостил под лейблом глм.
Аноним 07/09/26 Пнд 23:14:22 #370 №1698520 
Ебать, а как так вышло что тред пропустил https://huggingface.co/unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF ?
Аноним 07/09/26 Пнд 23:17:17 #371 №1698522 
>>1698520
Настолько "пропустил", что наш тредовичок даже квант сделал для 24+128 нищеты.
https://huggingface.co/BahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF
Аноним 07/09/26 Пнд 23:20:02 #372 №1698525 
>>1698522
Видимо тред "вы что бедные?" и не поддержал ажиотаж. За 370 постов первые два упоминания
Аноним 07/09/26 Пнд 23:21:37 #373 №1698526 
В итоге GLM 5.3 / 5.3 Flash оба покатились колбаской в угоду M3 минимакса.
Я не подозревал, как хорошо он пишет разговорную речь на русском, что и было нужно - без описаний и действий. Вспоминал все как косячил минимакс 2.5 и 2.7, заранее отбраковал М3, а он оказывается прямо красавчик в разговорных чатиках.
И размер идеален, 428B A23B это тот самый настояощий глм 5+ который мы не получили.
Аноним 07/09/26 Пнд 23:22:17 #374 №1698527 
>>1698525
Потому что это тот же дипсик 0731, которому мозги дополнительно лоботомировали дообучением на вижен. Нахуй он нужен?
Аноним 07/09/26 Пнд 23:22:24 #375 №1698528 
>>1698525
Буквально в прошлом треде обсуждали мельком
Катаю его сейчас, но не для рп. Вроде думать меньше стал и не отупел, картинки видит. Но у меня чуть другой квант
Аноним 07/09/26 Пнд 23:24:40 #376 №1698530 
>>1698527
Пруфов как всегда нет, не могут же тредовички ошибаться, надо верить! IQ4 > Q8 кста
Аноним 07/09/26 Пнд 23:27:20 #377 №1698535 
1724024958885.png
Придётся ждать
Аноним 07/09/26 Пнд 23:28:49 #378 №1698538 
>>1698530
>Пруфов как всегда нет
Пруфов чего, того что это файнтьюн 0731? Об этом литералли на карточке модели написано и это видно по архитектуре и размеру.
Аноним 07/09/26 Пнд 23:30:29 #379 №1698541 
>>1698538
Плохого что в том, что это файнтюн? Пруфай что лоботомия. Бенчам дипсика я верю, они за пиздежом не замечены. А твое слово что слово IQ4 > Q8 долбаеба. Да и мое тоже
Аноним 07/09/26 Пнд 23:37:07 #380 №1698547 
>>1698541
>Плохого что в том, что это файнтюн?
Любой файнтьюн смещает веса в сторону того в пользу чего дообучают, лоботомируя литералли во всех остальных областях. Потому РП тьюны только для РП и годятся и теряют в мозгах как в кодинге и ассистентстве - так даже в общих знаниях. Тут веса сместили в сторону распознавания картинок. Это задача принципиально иная чем код, РП, кум и все для чего мы его используем, а значит внимание весов от этих задач было уведено.
Обычно мало кто выкладывает модель без вижена и потом отдельно с ним чтобы можно было сравнить, но у нас есть очень известный и крайне печальный для эйрошиза пример когда добавление вижена убило хорошую модель - GLM 4.6V.
Аноним 07/09/26 Пнд 23:38:13 #381 №1698548 
>>1698499
И задача классика, не требующая размышлений.
>>1698498
Репетативная хута от чара к чару, которую заучиваешь за пару часов.
Аноним 07/09/26 Пнд 23:41:20 #382 №1698554 
>>1698547
Ты навалил простыню общих формулировок и частный случай в качестве пруфа крайне сомнительного тейка? Тред весь вечер держит уровень
Наоборот выходила куча научных трудов что совместное обучение на разных домейнах (вижн и текст) приводит к лучшим результатам. Но да, в одной из передовых ллм лаб мира не додумались опереться на лоботомита годичной давности как на единственное доказательство чтобы отказаться от заведомо плохой идеи. Пришлось пиздеть в бенчах и подкупать всех вокруг. Все так
Какойад
Аноним 07/09/26 Пнд 23:41:39 #383 №1698555 
>>1698433
Спасибо.
Если честно, я от мишек большего ожидал, особенно учитывая, что за 50 4 штуки уже не возьмешь. Ты же тот анон, который козырял в прошлом году, что он в последний момент успел урвать до подорожания?
Аноним 07/09/26 Пнд 23:47:34 #384 №1698562 
>>1698555
> он в последний момент успел урвать до подорожания?
Нет. Первые две я купил когда о них никакой инфы не было вообще и они новые (реально новые) по 12 стоили. Две других брал уже из сервера по 7.5

Хз как можно ожидать большего от древнющего радеон7. Плашка оперативки уже стоит дороже чем карточка
Аноним 07/09/26 Пнд 23:52:42 #385 №1698566 
А тем временем никто ни разу не показал примеров хорошего рп кума от чего-либо кроме гемма4-26 и иногда гемма-31. Видимо им на само железо и размер файлов дрочировать приятнее чем на результат. Хз как это назвать даже, цирк или может психушка.
Аноним 07/09/26 Пнд 23:54:38 #386 №1698570 
>>1698535
Попробовал сегодня. Зрение не зашло - дал модельке простенькую страничку из манги, она сочла изоображенное за персонажей из Death Note. В остальном дипсик как дипсик.
Аноним 07/09/26 Пнд 23:56:00 #387 №1698571 
>>1698554
>чтобы отказаться от заведомо плохой идеи
Ты с соломенным чучелом нахуя борешься? Я не говорил что это плохая идея - в конечно итоге вижен сам по себе - нужная штука. Просто мне например - он нахуй не нужен. Те "приросты" в 1% что показаны в тестах - определенно дополнительное читерское натаскивание на тесты, сейчас все компании 24/7 свои модели на эти тесты натаскивают и эти цифры не значат вообще нихуя.
Качай, тестируй, всем расскажешь, изначальный вопрос был - почему в треде не было ажиотажа и никто не обсуждал модель и я отвечал именно на него - потому что все увидели то же что и я.
Аноним 07/09/26 Пнд 23:58:59 #388 №1698573 
>>1698571
>почему в треде не было ажиотажа
>все увидели то же что и я
Прекрасное умозаключение. Тут дальше даже обсуждать нечего. Тебе двое ответили что используют его, лол, но голова уже зарыта в песке
Аноним 08/09/26 Втр 00:04:20 #389 №1698578 
>>1698571
Дело в том что писик тут мало кто может запустить, на пальцах одной двух рук. Из тех кто могли мало кому зашел в рп, вроде двоим. Это не значит что новый хуже, он мог стать умнее в коде и все такое. Ты звучишь как дед уебан который понял всю жизнь наперед.
Аноним 08/09/26 Втр 00:04:25 #390 №1698579 
>>1698573
>Тебе двое ответили что используют его

Эти двое молчали пока ты бучу не поднял, сам при этом модель даже не скачав. И раз молчали до этого - значит сказать было нечего, иначе бы уже написали уже хоть что-то хорошее про модель.
Аноним 08/09/26 Втр 00:05:46 #391 №1698581 
image.png
>>1698579
>молчали пока ты бучу не поднял, сам при этом модель даже не скачав
Смотрите как уверенно ссыт под себя. Олсо не я начал это обсуждение. Да, тред ебанулся
Аноним 08/09/26 Втр 00:07:19 #392 №1698583 
>>1698562
Все верно, до подорожания, нюансы я не помню.
Не правильно честно говорить о ценах в прошлом времени.
Аноним 08/09/26 Втр 00:07:59 #393 №1698585 
>>1698566
Кумер, спокнись.
Аноним 08/09/26 Втр 00:10:00 #394 №1698587 
>>1698566
Анон чьи логи с геммы 26 выше кидали моделей 10 постил. Квены, дипсик, мимо. Жаль умер. Шерсти по архивачу.
Аноним 08/09/26 Втр 00:19:14 #395 №1698595 
>>1698581
Из нас двоих я один нормально общаюсь, без оскорблений , переходов на личности и визгов про
>тред ебанулся
Так выйди из него - сразу успокоится.
Аноним 08/09/26 Втр 00:22:55 #396 №1698597 
>>1698410
>Это на esp32 ставить?
Если оно хоть как-то работает, то как мобильный бесплатный офлайн чатик вообще имба. Не смог запустить на угабуге.
Аноним 08/09/26 Втр 00:26:07 #397 №1698598 
>>1698595
>нормально общаюсь
>обсирает модель которую ни разу не запускал, решает что весь тред видит то же что и он
>под конец и вовсе ущемился
Да не, подожду пока выйдешь ты. Тут такие ненадолго задерживаются
Аноним 08/09/26 Втр 01:09:13 #398 №1698624 
>>1698598
Молодец что скачал и попробовал свою хуйню.
Не молодец что замалчиваешь правду о том какая это ХУЙНЯ.
Твой единственный аргумент? "Вы нипробовали кококо"
comments powered by Disqus