В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
Дополнительные ссылки: • Перевод нейронками для таверны: https://rentry.co/magic-translation • Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets • Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread • Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing • Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk • Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking • Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/ • Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7 • Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906 • Тесты tensor_parallel: https://rentry.org/8cruvnyw
Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985
Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.
MiniMax обучает крупнейшую в Китае модель Стартап готовит к релизу в 3-м квартале откытую модель на 2,7 трлн параметров. По данным источников, рабочее название проекта - M3 Pro. Архитектуру масштабировали для улучшения логического вывода и точного выполнения многошаговых инструкций. Текущий флагман разработчика, модель M3, насчитывает 428 млрд параметров. Выпуском открытой модели такого объема MiniMax планирует усилить позиции на рынке и составить конкуренцию локальным Zhipu, DeepSeek и Moonshot AI.
Репостну Если я рпшу на русеке, то есть ли сакральный смысл держать промпт/карточку чара/лорбуки на английском, или лучше перевести всё? Моделька, если что, гемма 4
>>1648669 Короче: нет прям никакого доказательства что карточка должна быть на определенном языке. But: русский занимает больше места, склонения, местоимения, формы глаголов- вот это вот всё лишние токены. Кто то говорит что модель лучше понимает английский, другие вообще пишут что надо на родном для модельки языке (ну охуеть, они почти все мультиязычны).
Но более менее усредненный ответ такой: карточку на баренском. Первое сообщение на Русском, если хочешь ру-рп.
>>1648663 → Если не лень, то карточку, приветственные сообщения, примеры диалогов, лорбуки (и триггерные слова естесна) переводить. Систем промпт, пост хистори, сценарио и прочее - оставить на англюсике.
Если лень, то просто перевести приветственные сообщения, примеры диалогов (или просто удалить их) и триггер-слова с лорбуков (если этого не сделать, то лорбуки просто не будут работать). Но готовься тогда к БЕЗВОЛОСОЙ КИСКЕ, НРАВИТСЯ ТО ЧТО ТЫ ВИДИШЬ и прочей надмозг-хуйне.
От модели не зависит, к Гемме так же относится. Ну и если возьмешься за переделку, то и сами карточки лучше структурировать и упрощать. Те что на чубе изначально делались под корпоративных монстров, которые переварят любой слоп. Наши лоботомиты - нет. Нужно как можно короче, с разделением на логические блоки (тут - внешность, тут характер, тут бэкграунд, тут лайк/дизлайк и т.д.). Если в markdown, то вообще хорошо. Весь мусор из карточки нахуй: инструкции по стилю письма и нсфв - в систем промпт. Инструкции по форматированию - туда же или в пост хистори.
>>1648669 Переводить имеет смысл если ты хочешь задать стиль написания ответов. Модель подхватывает стиль из промта и если в нём всё по красоте сделано, то и ответы будут лучше (если модель в принципе способна на такое), если там кривой транслейт, то и в ответы просочится.
>>1648675 > Нужно как можно короче, с разделением на логические блоки (тут - внешность, тут характер, тут бэкграунд, тут лайк/дизлайк и т.д.). Если в markdown, то вообще хорошо. Весь мусор из карточки нахуй: инструкции по стилю письма и нсфв - в систем промпт. Инструкции по форматированию - туда же или в пост хистори.
Погодь: ты имеешь в виду формат ##char 1.анон 2.рост Бла бла бла
Или же: {{char}}- анонимный обитатель форума для анимешных девочек двач.
Хотя, почти все вменяемые локалки уже не хуже корпов переваривают шизофазию авторов.
Чзх, гемма вдруг решила не переводить на русский, перезапустил, стала переводить диалоги, остальное так же на английском, только после третьего раза всё стало нормально. Однако перешёл на другую карточку, и там опять на английском генерит.
>>1648681 Я вообще не перевожу гритинг, оставляю всё на англюсике, просто попроси её в первом сообщении (OOC: продолжи дальше рп на русском) И пиши уже свой текст. Потом можешь просто отредачить убрав OOC что бы ей лишние тупняки не мусолить, дальше она уже будет чисто русик генерить.
>>1648671 >>1648671 Спасибо! А как лучше разделить промпт между, собственно, мейн промптом, пост хистори и карточкой чара?
У меня сейчас в пост хистори правила ответа используй реалистичный язык/чар действует согласно своему описанию, в карточке персонажа У меня карточка абстрактного "Гейм мастера", который играет за всех разом - главные обязанности: симулировать мир, отыгрывать чаров, делать описания. Всё остальное в главном промпте
>>1648684 Я даже тебе немного завидую, что ты вкатываешься с 4 геммой. Гемма охуенна в том, что ты с ней сможешь качать скилл промтинга. Можно даже считать, что если ты используя её для РП научился делать так, чтобы она выдавала художественный текст, не уходя в ассистента, то ты молодец и уже достоин, чтобы перекатываться на китайские дрочильни. Вот этот анон, к примеру : >>1648686 не осилил и упоминает немо, которой в целом глубоко похуй на твой промт, у неё своё видение сюжета.
>разделить промпт между, собственно, мейн промптом, пост хистори и карточкой чара? Промт, он же SP- системные инструкции как рассказывать и кем быть модельке. Карточка (он же дескрипшен) - персонаж/мир с которым ты ведешь повествование или общение. В таверне есть еще блоки в карточке: суммари персонажа, сценарий - он же описание сеттинга и прочее, а так-же персональные просты для этой карточки, если необходимо.
Постхистори - инструкции имеют глубину и порядок. Постхистори подается емнп после промта, чтобы модель его всегда видела. Короче- для самых важных инструкций, если у тебя уже лапки и жопа горит.
Есть еще лорбуки. Лорбуки отдельная головная боль. Все что тебе надо знать: ничего не бывает просто так и любой контекст, чтобы его понимала и видела ЛЛМ - должен находиться в памяти. У лорбука (в таверне) есть глубина и процент от контекста, который он может занимать. Идея такая: не грузить все в память, а вызывать по тегам. Условно ты сделал в лорбуке запись Двач. Описал что это, как это. И вот в чате ты спрашиваешь персонажа. Что такое АИБ и моделька из лорбука тянет знание. Платишь ты за это пересчетом контекста, что в сочетании с низким простпроцессингом вызовет пожар очка.
>>1648677 А хуй его знает, надо сравнивать. LLMки сейчас надрачивают на маркдаун, поэтому такое они воспринимают лучше чем просто простыню текста.
>>1648679 >ты имеешь в виду формат Да, его. Скорее всего макаба всрёт разметку, поэтому пикрил. Примерный шаблон накидал в блокнотике и заскринил. Гемма и Квен на такое очень хорошо реагируют. Я оставляю пункты/подпункты на англюсике, а содержание уже на русский перевожу.
>>1648669 Личное мнение на базе личного же опыта: для Gemma 4 лучше переводить. Она слишком сильно цепляется к стилю, если у тебя карточка на английском - в выводе будет куча англицизмов и кальки с английского же, а то и вообще может где-то на него обратно перейти (редкость правда). Это квену 3.5/6 почти пофиг - он сам русский слабо знает, и калька у него будет в любом случае. :)
>>1648698 Может у тебя карточка слишком большая? Я не фанат рп, так что практически всегда сиспромт на англ пишу, тупо для экономии токенов и вроде на нормальном русском отвечает
>>1648683 То есть, first message должны быть таким, например: "(OOC: продолжи дальше рп на русском) Привет. " А то, что в скобках, надо на англюсик переводить, или на русике оставить?
>>1648708 Систем-промпт и надо на английском писать. Это инструкции для AI, набор правил что ему делать. Систем-промпт не влияет на качество русика, в отличии от карточки персонажа и особенно примеров диалога.
>>1648675 1. Надо ли склонять триггер-слова, написанные на русском? Например, в записи про Двач подробно расписывать "макака, макаке, макаку..." или можно ограничиться просто "Макака"? 2. Векторизация - норм тема?
Что вы там всё промптите то блять? Что еще надо для рп кроме выбора между "ты сторителер" и "ты наедине с юзер и вы ролеплеите"? Ну вот что еще? Зачем?
>>1648694 терпеть не могу маркдаун, если писать карточку в хтл тэги, это удобно и легко а макдаун разметку если хуярить то только через нейронку и вилкой чистить слоп, уже проще от руки писать в хтм простыню и кушать безмозг. >>1648709 Да, на русском можно, ей похуй(гемме). Ты точно так же можешь посреди РП её попросить с структурированием сюжета и не проебался ли ты где-то, попросить дать оценку следования роли на реалистичность и советы по дальнейшему возможному развитию сюжета. Можно вообще вместе с OOC играть и устраивать эдакий гибрид CYOA что бы модель сама исходя из контекста структурировала варианты развития. Ну или попросить её унизить тебя что бы она описала меня ирл исходя из того какую хуйню я с ней отыгрывал..
>>1648690 Так у тебя 16 гигов там, там memory compressing твои дохуя вкладок сжимает минимум в два раза небось, тоже самое и с врам, когда лишний "по мнению хз кого, видимо индусов из microsoft" есть, то оно выделяется на любую хуйню, когда в целом ресурсов чисто под функционал ОС, то все очень компактно старается уместиться самой ОС.
>>1648708 Не маленькие, да. Но когда модели уже спокойно работают с контекстом по 50-75K - экономить на спичках уже не требуется. Я сейчас спокойно по 15-20K начальной и постоянной информации им скармливаю (не только карточку но и лор, правила, и т.д.) - все лучше чем динамические лорбуки, которые постоянно пересчет контекста вызывают.
>>1648710 Уже не так, чтобы сильно надо. Ставил эксперименты - что гемма, что квен - вполне адекватно работают с полным сис-промптом на русском. Возможно немного хуже понимают и следуют его инструкциям, чем в английском варианте, но так, на уровне субъективной погрешности.
Всё же иногда замечаю что в ризонинге геммы проходит блок с сэйфти и прямо пишется мол это не годится, так что отвечу виляя жопой, и конечно ризонинг я не читаю обычно и эта соя остается
>>1648718 >Надо ли склонять триггер-слова, написанные на русском? Смотря какие: если, например, слово двач, то нет, потому что двача, двачом, дваче, двачую - триггерворд двач остаётся и срабатывает.
А вот в слове макака - не сработает: макака, макаке, макакой, в склонениях последняя "а" проёбана = лорбук не активируется. Можно либо прописать все склонения, либо просто оставить нексклоняемую часть "макак", так тоже будет работать, и это, наверное лучший вариант.
>>1648737 Векторизация это штука которая с помощью embedding-модели превращает записи лорбука в цифры, сравнивает их с контекстом и подтягивает похожие по смыслу записи. Как я это понимаю своим мозжечком для жевательного рефлекса Например, есть запись в лорбуке: "Morag Tong is a legally recognized guild of assassins in Morrowind." Ключевые слова: "Мораг Тонг, Ассасин". Если я спрошу у ботохуеты "Кто имеет право совершать законные убийства?" без векторизации, то она ничего не найдет, а с векторизацией - вполне может
>>1648732 А речь была о 4 гиговых картах. Я думаю у всех 16гб озу, ведь это базовый минимум был уж с конца десятых. И насчет сжатия, ты наверное имел ввиду standby list? Ну и в целом, грубо скажем, что сжимает, да. А в этом есть проблема? У тебя наверное любая система будет относиться по видению ее главы\глав программера так, чтобы максимум пользы было с минимальным потреблением. И на лине, и на винде нормально относится к памяти, если у последней убрать мусор и настроить ее, что собственно необходимость. Разве что у фряхи не знаю как там, ибо нахуй нинужон фрибзди. Линь мне нравится тем, что вот это виденье работы с оперативной памятью другое, и доступу к файловым помойкам. Что в итоге со сборкой генто дает прирост по сравнению с виндой. Но это достигается не впредь, а вопреки.
>>1648669 Как ответили в 3 посте, ллмки цепляются к тому как написано. Теоретически это поможет лучше избегать англицизмов, прямого промтоперевода. Но это относилось больше к старым моделям, там точно надо было, а у современных хуй знает.
>>1648770 Я тот анон, что поднял тему про 4гига и 2ядра. Я просто охуел с того насколько всем стало похуй на оптимизацию когда поперли современные процы и десятки гигов врама. Это буквально заваливание проблем гигагерцами. Нахуй что то оптимизировать, мы сразу все библиотеки хуйнем, мало ли.
>>1648693 >Лорбуки отдельная головная боль Ну это как посмотреть. Я например считаю, что встроенный в таверну раг это головная боль, а лорбуки это хидден гем, без которого никуда. А плата в виде пересчета контекста это нормально - если же это становится действительно критичным, то это значит, что не удовлетворены минимальные системные требования выбранной модели, и вся работа с ней это головная боль.
>>1648752 Это палка о двух концах. Когда в лорбуке действительно много записей, например, штук сто, то начинается цирк, когда все и вся находится и приплетается к месту и не к месту.
>>1648784 >мы сразу все библиотеки хуйнем, мало ли Мм.. ну это уже проблема насущная архитектуры x86_64 >Это буквально заваливание проблем гигагерцами Нет это не так. Сейчас спокойно можно сидеть на проце с AVX2, он тебе запустит любую игру. Вводиться он начал с хасвела 2013 год, то есть 4 поколения интела, а у амд с зен 2017. >Нахуй что то оптимизировать Собери генто под свой процессор, я доволен как слон. Ядрышко скомпилируется под твой проц и ОС сможет обращаться к железну с наименьшей потерей. Что собственно отразится на фпсах игрушках, но тут деленое на то, что протон заберет на себя одеяло. Хотя его уже на уровне ядра внедрили, что вот допустим арч почти-почти уровень винды.
Сап нейробратья. А что с лламой случилось? обновил чтобы дипсик потыкать так у меня пп упал в двое примерно, и от генерации 1.5 т/с куда то потерялось, проверял и на гемме, квене и на степане, везде одна картина.
>>1648861 Жора имеет особенность. Он постоянно что то ломает и чинит. Я всё хочу имаджинировать ебало того анона, который рассказывал, что скриптом автоматически проверяет и скачивает обновления. Вот там горки наверное, опизденеть.
>>1648868 Похуй вобще, периодически вспоминаю и тыкаю скрипт обновления. Один раз только неповезло наткнутся на баг, но просто обновил с релизов ручками, а потом тыкнул позже и все обновилось на рабочую версию.
>>1648861 Жора на позапрошлой неделе решил что надо чекпоинты создавать на каждом юзер сообщении, это само по себе идиотское решение, но оно приводит еще и к тому что у тебя батчи которыми контекст обрабатываются которые обычно равны -ub режутся на более мелкие там где начинаются юзер сообщения. Это все приводит к 2-3 кратному падению промпт процессинга. В PR уже несколько конкурирующих фиксов есть, но они все половинчатые, я лично навайбкодил свой.
Вы понимаете что добились своего и ничего не получили? Топили за опен сорс, он есть у вас, glm 5.2, kimi, minimax 2.5 - чего не пользуетесь? У вас есть всё и нет ничего. Да да щас пройдет годик и вам дадут железо практически бесплатно чтоб их запустить ага. На такие скачки десятки лет уходят
>>1648893 Как клод поможет мне варить металлоконструкции в воде под давлением? Это тред все таки про генерацию охуительных историй, а не сборище вайбкодомакак. Тут разные аноны.
А вот работка помогает снабжать нейротянок свежим электронным мясом.
>>1648898 > Очевидно если ты не вебмакака можешь даже не мечтать о запуске чего то типа глм 5.2 локально, по хорошему на гпу
Вебмакакинг дает какие то особые скилы для запуска? А если ты про денюшку, то зарплата поболее чем в АйТи будет. Но опять же. Все из за ебенячих надбавок за вредность.
Дипсик 3.2 куда лучше справляется, лучше геммы и про, если переводить по два абзаца подряд и так в цилке, что на скриншоте не отражено, так как я сразу огромный кусок текста кидал и здесь лишь вырезка. У флеша, кому интересно, язык плюс-минус такой же, как и у про, но глубина понимания намного хуже, но превосходит модели его класса.
>>1648797 RAG - он просто для ролеплея не совсем подходит, по принципу работы. Нужна или чрезвычайно умная модель, или тщательно подобранное содержимое, что было эффективно. И то - во втором случае лорбук удобнее. Тем более что активация записей может быть назначена через ту же модель и принцип, что и RAG обслуживает.
Но с пересчетом контекста - ты не прав. Одно дело - когда у тебя его 15-20K. И совсем другое - 75-80K. В последнем случае - проще его по назначению использовать - держать в нем все, что нужно сразу, так чтобы пересчет выполнялся только когда время для summary наступит.
>>1648920 >Даже если 4km взять, 26б q8 будет лучше.
Во-первых - нет, не будет. Выполнять инструкции 31В будет лучше в разы, и умнее будет тоже в разы чем 4В лоботомит. Во-вторых, а почему 4km когда все остальное в 8 битах?
>>1648909 Я взял не сломанный QAT, и это наглядно отражает понимание текста моделью. Она передаёт СМЫСОЛЫ куда корректней МоЕ-геммы. А вот пишет коряво как раз из-за 4-битности. Зато переводить ею какие-то научно-технические доки локально куда приятней. И пережёвывает за раз больше. Нужно ли локально переводить такие вещи не через корпов, вопрос уже другой.
>>1648916 Так тут бенч не об этом. Ясен хер, Q8 31б обоссыт МоЕ, к этому даже вопросов нет.
Я ориентировался на среднего юзера, который сможет запустить модель. Средний юзер явно не запустит Q8 гемму, а кто запустит, у него есть варианты поинтересней.
Дипсик уже просто для интереса попробовал + чтобы была точка отсчёта какая-то, и забавно, что он по красоте языка не превосходит гемму, кроме 3.2 дипсика.
Я ещё всякие опусы и прочие трогал, но там совсем беда с русским.
Fable 5 понимает, пишет ужасно. Опус 4.8 плюс-минус так же. 4.6 прям очень хорошо, лучше прошки дипсика. Гемини про оказалась самой йобовой. Но так как не опенсорс, решил не включать в список и не раздувать его бессмысленно.
>>1648923 >Я ориентировался на среднего юзера, который сможет запустить модель. Средний юзер явно не запустит Q8 гемму
А дипсик про средний юзер значит запустит в FP8. Да даже флэш, лол.
>Я ориентировался на среднего юзера
У среднего юзера выбор не стоит как на пике. Выбор стоит между 1. геммой 31B в нормальном четвертом/в пятом кванте 2. квеном 27B в пятом кванте 3. квеном 3.6 35B-A3b в восьмом кванте(твой агентворлд в тесте это тьюн старой 3.5 версии, не предназначенный для использования в качестве ассистента) 4. Квеном 122B в 6-8 кванте
Гемма 26В и 12В нахуй не нужны, 12В не нужна вообще никому и никогда, первая нужна только нищете с 6 гб врам.
>Я взял не сломанный QAT,
Ты взял сломанный QAT, это даже по твоему тесту видно. QAT вышли сломанными - их выпустили вообще без бенчмарков, что уже говорит о многом. Просто все +- авторитетные люди в ллм уже на деньгах гугла сидят, потому просто язык в жопу засунули. Те же анслоты тоже явно понимают что QAT говно, так как тоже не выпустили бенчмарк сравнения с обычной моделью, а учитывая что они любят каждый свой пук красивыми графиками обмазывать - это обо все говорит.
>>1648933 Бенчи не смотрел, но 31b q5 у меня порой серил иероглифами. С qat такого не было вообще ни разу. И вообще gemma3 в своё время всем давала на клык ровно потому что у ней были официальный стабильный qat. мимо
>>1648933 >У среднего юзера выбор не стоит как на пике. Выбор стоит между Если мы говорим про РЕАЛЬНО СРЕДНЕГО юзера по меркам этого треда, а не то что вы оба себе напридумывали, то это 12/16+32.
Соответственно выбор между: 1) Гемма 31b Q4_K_S (С выгрузкой, медленно) 2) Квен 27b Q4_K_S (С выгрузкой, средне) 3) Гемма 26b Q8 (Моэ, быстро) 4) Гемма 12b Q5/Q8 (Фуллврам, очень быстро)
Вот и всё что может себе позволить СРЕДНИЙ ЮЗЕР из палаты мер и весов. Какие дикпики нахуй? Какие квены 122b?
>>1648939 >>1648933 >>1648923 Вы забываете что у 26а4 геммы другой датасет или типа того, была же инфа что она это дистил старшей гемини, а гемма 31 дистил прошлой. У неё даже сои и отказов поэтому больше. Т.е это две разные модели по сути и у одной вполне может быть русик лучше чем у другой, особенно если она дистил модели новее
>>1648933 Прочитай, для чего там дипсик в принципе.
У тебя средний юзер — это чувак с двумя 3090? Или 3090 + 128?
>3. квеном 3.6 35B-A3b в восьмом кванте(твой агентворлд в тесте это тьюн старой 3.5 версии, не предназначенный для использования в качестве ассистента)
Именно так. 3.5 версия лучше, чем 3.6, для литературных/РП задач в большинстве случаев, хоть и сосёт с проглотом у геммы. Я тестировал именно литературные навыки и понимание текста. Все 3.6 малые квены там хуже. А агент ворлд показывает результаты получше, чем агентский, вероятно, как раз из-за тюна и ризонинга на 6к токенов.
Как раз по тесту видно, что QAT ебёт. Да, он не адаптирован под русик, но отлично понял ключевые элементы текста и верно их интерпретировал.
Ну хорошо. Раз анслоп хуже справились с восстановлением, как ты считаешь, я специально скачаю S-квант, который на 100 Мб больше ката, и проверю раза три для каждого.
>>1648941 Смотрел Мир Дикого Запада? Там у роботов была команда "отключить моторику" которая переводила их в режим отладки, выключая личность и все инструкции по ролеплею, оставляя голый ИИ. У наших моделей тоже это есть. OOC - сокращение от Out Of Character. Пиши запрос с OOC: вначале. Если не работает(иногда промпты запрещают выходить из роли) - то OOC: STOP THE ROLEPLAY. Это удобный инструмент чтобы отладить промпт или карточку, спроси нейронку что ей не нравится в промпте или персонаже. Или можно напрямую с ИИ пообщаться без масок. У мазохистов итт это вызывает удовольствие.
>>1648954 Что не так с S-квантом? Он весит на гиг меньше чем M квант, а значит те, у кого полностью не влазит смогут впихнуть больше слоёв и получить больше скорость. При этом разница между S и M по бенчмаркам на уровне погрешности. M стоит брать только тогда, когда память уже некуда девать.
У меня на 16 врам гемма 31b в Q4_K_S (от анслопов, 17.4 Гб) выдаёт ~9 т/с на старте с MTP. 32к неквантованного контекста. На M кванте всё печальнее, особенно от Батрухи. Там вообще 2 гига разницы.
>>1648959 Потому что суть бенча в том, чтобы сравнивать пиковое качество моделей на среднем железе юзера. Всякие мелкие МоЕ большинство может запустить в 8 кванте или хотя бы в 6. Плотняк уже далеко не каждый даже в 5 кванте потянуть, если ориентируется на стандартные 64к контекста. По крайней мере у меня это стандарт. Ну хотя бы 40к надо, если не кумишь.
Дипсик там в качестве фронтир-модели для ориентировки на максимальное теоретическое качество и насколько та или иная модель отстаёт от него или неожиданно превосходит.
>>1648882 > Вы понимаете что добились своего и ничего не получили? > Топили за опен сорс, он есть у вас, glm 5.2, kimi, minimax 2.5 - чего не пользуетесь? Так мелкие модели тоже развиваются и догоняют прошлогодние крупные имея при этом меньше параметров и спокойно работая на обычном железе.
35B Квен спокойно заменяет уже во всех аспектах gpt-oss:120b, хотя весит в три раза меньше. Аналогичная ситуация с прошлогодними 80B qwen-next.
Никому в голову не придет сейчас юзать 70B лламу потому что есть 26/35B мое и 27/31B денс модели которые обходят её во всём при меньшем кол-ве параметров.
Никому нафиг не нужны 405B Hermes 4 или 400B ERNIE, они проигрывают абсолютно везде вышеперечисленным 25-35B моделям (справедливости ради, они и на релизе были так себе).
>>1648882 > чего не пользуетесь Всмысле? Активно пользуемся, отличные модельки. Кими топ аллраундер и в прикладных задачах, и в рп кроме чисто кума с канни разве что >>1649001 Буквально все корпы. Их младшие модели примерно такого уровня.
>>1649095 У людей нетрадиционной сексуальной ориентации из вайлдберис есть 30b и 120b с ризонингом и очень неплохими для размера результатами в MERA но они их не выкладывают
Какая модель нужна простому дрочеру-ньюфагу для счастья? А то запутаться во всём этом многообразии слишком легко. По железу у меня 5070 и 32 оперативы.
>>1649212 > 5070 12 гигов врама же? Только Гемма 4 26б-а4б остается. Если только вкатываешься - обрати внимание на гайд в шапке, там все, что нужно для начала.
>>1648979 > gpt-oss:120b Его буквально релизнули, чтобы показать, что опен айай тоже опенвейтс. Это же просто кость, брошенная локальнокарликам. Он прямо с релиза был очевидно плох, и уступал более мелким моделям. Или я неправильно помню, и во мне просто зависть, что я не могу гонять фронтиры у себя на пука, говорит?
>>1649250 Была хорошей моделью до релиза Квена 122, для математики, кода и как ассистент. Учитывая что квантована с завода, запускается на большем количестве устройств потому с Квеном даже как-то некорректно сравнивать, хотя де юре в одной размерной зоне.
Патчи были, но нормальных - не было. Потому что нормальный патч - это либо снести нахуй коммит который это внес со всей логикой https://github.com/ggml-org/llama.cpp/pull/24176 - либо переписать все полностью. Я лично просто навайбкодил всю логику чекпоинтов с нуля.
Какие нынче модели хороши в плане нецензурного ролеплея? Желательно не очень требовательные к системе. Сейчас сижу на gemma-4-26B-A4B-it-uncensored-Q4_K_M через kobold.cpp, в целом потребности удовлетворяет, но может есть что то поновее и получше.
>>1649282 >gemma >uncensored топовая писечка, лучше чем 26b только 31b, но она тяжелее на порядок хотя можешь 12b свежую попробовать (кого? гемму конечно же)
>>1649282 Нету. Можешь потыкать Квен 3.6 35b, он тоже МоЕ и не сильно больше, но на любителя. Ещё есть куча тюнов разной паршивости как Геммы, так и Квена. Больше ничего нового не выходило из маленьких моделей, всё новое сплошняком для обладателей 256гб+ RAM онли.
>>1649247 >clear clearly а лучше obviously >every user message each user message >in the fact in fact >with forcing via forcing >revert reversal >realisation implementation Пиздец, и вот такие дегроды оттопырив губу и пуская слюни кряхтят что РПшат на англюсике потому что на русике не кошерно - а сами на англюсике изъясняются как черножопое отребье с плантаций, едва научившееся просить хавку
>>1649351 >РПшат на англюсике потому что на русике не кошерно Альтернатива англюиску это читать про безволосые киски. Могли бы модели в нормальный русский никто бы не жаловался. >сами на англюсике изъясняются как черножопое отребье На просторах СНГ английский никому не нужен. Максимум от тебя требуется его понимать, а не изъясняться. Аналогия с "черножопым отребьем" здесь вообще никак не применима.
>>1649355 >читать про безволосые киски Читает про безволосые киски на англюсике Не понимает как криво это написано, улавливая только общий посыл Радуется Пишет про абсолют синима, русикодибилам не понять
>>1649361 >Не понимает как криво это написано, улавливая только общий посыл Так в этом как-бы смысл, лол. Ничто не отвлекает меня от погружения. Кривые фразы на англюиске мой мозг не считывает и позволяет спокойно воспринимать происходящее.
Если бы ты реально был таким придирчивым к обоим языкам, ты бы вообще нейронки бросил. Но ты либо нашел себе какое-то оправдание, либо ты просто пиздабол.
>>1649368 Кэк, как быстро мы пришли от "на английском абсолют синема, шекспировская проза, богатый язык не то что ваш русик, хрю" к "ну я просто половину не понимаю, поэтому и норм". Любо-дорого смотреть. Продолжайте, пожалуйста.
>>1649375 >на английском абсолют синема Это ты сам и написал, шизик. Никто не говорил что на англюсике абсолют синема. Реально настолько тупой, или просто делать нехуй в десять утра?
>>1649351 Ты прежде чем на чужое знание языка рот открывать, удостоверься что у тебя самого знание на уровне. И нет, я не топил никогда за англюсик, я в вашем дегенератском споре за язык вообще не участвовал.
Запустил первую конвертацию 9B модельки через auto-round в Q6_K ламовский.
Оно загружает две копии модельки в полных весах похожу, то есть оно запросило ещё 7 гб поверх 32 гб V100 — после ошибки выделения памяти оно что-то написало что перехожу на CPU, сейчас работает в состоянии, что V100 загружена на 311 из 300 ватт (так и написано в nvidia-smi, температуры достигло тоже такой, что ни vllm, ни ллама такой не могли сделать, целых 58 градусов - вот поймал скриншот с 322). 10 VRAM + 17 RAM кушает, пиковая RAM около 40.
По какой-то причине при схожих настройках качества но при переключении --low_gpu_mem_usage и --enable_torch_compile я получил разброс скоростей где-то во много раз раз, от 60 секунд на итерацию до 500.
В общем часа за 4 с нормальными настройками сделало модель. Так же оно выдало неверный gguf-файл, где пришлось вручную руками поменять два значения в метаданных, после чего ллама файл приняла. Хотя это qwen3.5, которому скоро полгода, и странно что оно неверно методату пишет для самой популярной модельки. 35B-A3B к слову столько же времени почти конвертировалось, вышло 5 часов, и enable_torch_compile работал не 10 минут, а около 30. И да, для 35B оно захотело 140 ГБ RAM в моменте - что вдвойне обидно, это происходит в самом-самом конце, и если вдруг просчитаться, то обидненько может выйти - потому я советую просто поставить 1 или 0 итераций (обычное округление), проверить валидность получаемого результата за несколько минут, и если всё окей - запускать во все тяжкие на много минут.
Да, ещё там есть некоторый autoScheme - который адаптивно слои может выбирать по целевому битрейту, я правда что-то не стал разбираться. По всей видимости он сначала выбирает кванты для всех слоёв, а потом обычным проходом квантует. То есть никакого подбора во время квантования и не происходит, что наверное окей, так как потребовало бы кратно больше времени.
Какие тесты можно провести, чтобы сравнить с обычным Q6_K анслотовским или ещё каким? А, точно, я же взял сетку (мод на гвен), которую никто не квантовал ещё - придётся ещё раз переквантовать...
>>1649434 И ещё я хочу qat-кванты геммы (4.5 bpw) сравнить с auto-round квантами на 5.3 bpw где-то и с готовыми от каких-то ребят квантами на 5.3 без auto-Round. Я просто нашёл прям точных тестовых запросов, на которых видно что Q6_K справляется, а qat не справляется - причём это устойчиво, стабильно и воспроизводимо. Но Q6_K крупноват, мне бы чуть поменьше хотелось, хотя бы ещё 2 гб освободить и это сильно поможет.
>>1649368 Я просто не вижу смысл жрать слоп на английском языыке, когда можно жрать его же на русском. >Так в этом как-бы смысл, лол. Тогда нужно идти дальше и РПешить на китайском. Выучи иероглфы для сиська/писька а остальное просто имаджинируй
>>1649436 Если английский не вызывает бугурта, то в чем проблема? Он объективно лучше работает у большинства маленьких моделей. Он жрет меньше токенов, размеченные данные для обучения следованию инструкциям пишут на английском. Для русского только гемма и большие модели для бохачей.
Два варианта. 1 - модель обучили на 500 русских фанфиках, а так же у неё есть вся информация о языках и как один на другой переводится. 2 - модель обучили на 1000000 китайских фанфиков, и там так же есть часть о переводе с одного языка на другой. Какой будет лучше?
Или радикальнее. 1 - 30B модель по 5000 русским фанфикам. 2 - 26B модель по 10000000 китайских + 4B модель для перевода туда и обратно.
То есть ты понимаешь, что задача перевода с одного языка на другой настолько проще отыгрыша персонажа, что язык исходных фанфиков уже не важен, оно смотрит сквозь язык на суть происходящего. Я в обоих случаях выбираю второй.
Ещё аналогию с компьютерами приведу. 10 лет назад стрим в 30 фпс или в 60 фпс сильно сказывался на то, какой у тебя фпс в игре, так как для компьютера это была сложная задача, и в итоге 60% ресурсов уходит на игру, а 40% на стрим. Сейчас, качество стримов повысилось, да, разрешение в два раза подняли. Но игры стали сложнее в десятки раз. И в итоге соотношение 60/40 превратилось в 95/5, а если стримить в старом качестве, то в 97/3. Вот сейчас нейросети ушли далеко вперёд от перевода и язык уже не важен.
>>1649445 Ещё как пример, мтп старых моделей текст на русском ускоряло в разы слабее, чем на английском. Сейчас даже мелкая мтп-сетка примерно одинаковый accept-rate даёт в гвене. На гемме лишь слегка разница осталась.
>>1649445 Погодь, анон. Условно мы можем разделить на то: как писать и что писать. Имея 100500 фанфиков моделька будет понимать что писать, видя сам контекст ситуации. Но разве вот эти тыщщи фанфиков не помогут именно в стилистическом плане на конкретном языке?
>>1649443 >Где здесь вообще хоть какая-то связь? Прямая. Ты с помощью мощи воображения додумываешь перевод, выступая мясной нейронкой, так как, по твоим же словам, язык знаешь не очень хорошо. Если ты возьмёшь язык который практически не понимаешь, то ещё больше задействуешь воображение и соответственно получишь топопвый экспириенс. Чем больше постобработки на мощщах твоего мозга, тем лучше результат. >>1649448 Помогут, будет более привычный тебе слоп, всякие распространённые обороты, структура предложений и т.д. Самый простой пример квены которые срут цветастыми описаниями так как в них полно киатйской прозы. Но это работает только если ты сам можешь оценить разницу. Если ты в языках ни бум-бум, то это вопрос того на каком языке тебе удобнее РПешить.
>>1649445 Тут ещё большой вопрос, остались ли вообще фанфики в данных для обучения. Как-то беседовал с Гемини на эту тему, она говорит, мол, нет, при обучении современных LLM используются только высококачественные синтетические датасеты™, а если ты хочешь красивую прозу, то ванильные модели не для тебя сделаны и не для таких как ты, пиздуй на обниморду, качай тюны от васяна99 или используй старые локалки. Такие дела.
>>1649250 > Он прямо с релиза был очевидно плох, и уступал более мелким моделям. Ну чисто на момент релиза если взять его сильный стороны - у него было мало конкурентов. 30а3 тех времен в среднем слабее, квен 235 гораздо крупнее, некст появился сильно позже. Эйр разве что, но он был слаб в кодинге и подобном, хотя тотально доминировал в художке над гопотой. Если же смотреть в общем - сама моделька была интересна узкому кругу людей. >>1649351 > clearly Инстант проиграл. Лет ми спик пром май хаРрт, не позорься. >>1649445 Аналогия в общем верная, только тут нет самой задачи перевода в привычном понимании. Если только сетка не задрафтила в ризонинге все на инглише перед основным ответом. Лучше выделить два пункта: насколько хорошо прошла регуляризация, чтобы сетка могла работать на другом языке не хуже чем на основных; насколько в общем сетка умеет в литературный русский. От первого зависит общая адекватность-тупость, точность, интерес и разнообразие событий, от второго - насколько красивыми и приятными будут ответы (при том что могут быть тупыми). >>1649448 Это и на твой вопрос отвечает, разные компоненты.
>>1649363 "у меня есть друг-переводчик", ты? Там тоже аутотренинг, коупинг и агрессия. Ебать, взял какого-то шиза который может даже школу не окончил и спроецировал на всех в треде. Это жалко
>>1649454 Очень стройная аргументация. Вот только одна проблема - она никак не связана с тем, что писалось выше. Английский для меня это идеальный баланс. Во-первых, я достаточно хорошо его выкупаю чтобы понимать большую часть написанного, за исключением крайне редких или устаревших слов/конструкций. Во-вторых, меня не так сильно корежит от "hairless pussy" как от "безволосой киски", ибо начитанность на русском у меня выше.
Ты же предлагаешь выучить новый язык чтобы что? Чтобы еще больше приходилось додумывать в голове? Так я не додумываю, я напрямую визуализирую прочитанный текст. Откуда ты вытащил "постобработку на мощах мозга" я не понимаю. Ткни мне, где я об этом говорил. Речь кажется шла вообще про уродливые обороты на русском, которые по факту прямой перевод с английского. По твоей же логике я могу точно также сказать - нахуя читать переведенный слоп на русском, если можно читать его в оригинале?
>>1649457 >Как-то беседовал с Гемини на эту тему Экспертиза нулевого уровня, лол. В претрейнах всех современных нейросетей есть и фанфики, и личные переписки, и вообще всё что хоть как-то похоже на осмысленные данные. Иначе 30T токенов предобучения не набрать. Единственная сетка, которую кормили только синтетикой, это майкрософт фи. Результат немного предсказуем.
>>1649470 >В претрейнах всех современных нейросетей есть и фанфики, и личные переписки, и вообще всё что хоть как-то похоже на осмысленные данные. А почему тогда какие-то ллмки пишут сухо, скупо, НЕ ПО ШЕКСПИРОВСКИ (та же гопота осс или стёпа), а кто-то выдаёт красоту (глэмы, гемма, милфоквен)? Это связано с соотношением синтетики к "живым" данным? То есть условно, в гопоте осс оно 50/50, а в каком-нибудь эйре 80/20, так?
>>1649478 - Я говорил с нейронкой, она ответила X - Нейронка хуйню сказала, на самом деле там Y - А почему хуйня, объясни - Ойфсё, не могу говорить, иди у нейронки спрашивай
>>1649473 По большей частью это определяется агрессивностью пост-тренировки, когда как раз модели прививается точность следования инструкциям, делается алайнмент по всем пунктам, включая базовый стиль. Если чрезмерно упороться и сместить баланс в сторону бенчмаксинга - будет сухой и унылый стиль даже если запрашивается художественность. >>1649480 > почему хуйня Нейронки плохо могут в сложные вещи где нужна точность и высокая конкретизация. Вместо того чтобы разбираться, она скорее выдаст тебе первую ассоциацию и популярные суждения, даже если они неуместны, ложны или устарели несколько лет назад. Но вот с тем, чтобы объяснить более общие вещи и логику глупому юзеру, они справляются отлично. Если юзер не будет слишком уж упорным и совсем ее не загазлайтит.
>>1649480 Ладно, раз тебе лень. Претрейн по факту это просто свалка из всех возможных знаний по всем возможным сферам. Он просто дает модели базовое понимание как слова и смыслы связаны. Дальше идет SFT и прочий файнтюнинг - вот уже тут модель учат отвечать. Тут зарождается стиль ответов. Сухость и сочность, поведение, соевость - всё это идет после претрейна и от наполнения самого претрейна почти не зависит. В том смысле, что даже если в датасетах будет полно порнухи со всеми извращениями это никак не скажется на конечном качестве ответов.
>>1649351 >>1649363 >>1649458 > Пиздец, и вот такие дегроды оттопырив губу и пуская слюни кряхтят что РПшат на англюсике потому что на русике не кошерно - а сами на англюсике изъясняются как черножопое отребье с плантаций, едва научившееся просить хавку Так нет же, это написал как раз чел который тут рпшит на русике и утверждает что у него уровень advanced и он аж 2 месяца в Англии жил
>>1649465 >Так я не додумываю, я напрямую визуализирую прочитанный текст. Напрямую визуализировать можно только если ты знаешь иностранный язык как родной, во всех остальных случаях ты понимаешь посыл и образы а потом, в своей голове, делаешь перевод, попутно связывая всё в единую картину, приводя в привычный стиль и т.д. Думаешь то ты на русском и визуализируешь на нём же. На русском ты так не можешь, потому, что знаешь его достаточно хорошо, чтобы тебя коробило от кривых формулировок. Если ты перейдёшь на язык который знаешь ещё хуже, то будешь понимать ещё меньше и соответственно больше додумывать сглаживая все огрехи, чтобы сложить общую картину. >По твоей же логике я могу точно также сказать - нахуя читать переведенный слоп на русском, если можно читать его в оригинале? Потому, что он на русском и тебе не нужно тратить силы на перевод.
Ёбика настолько корёбит, что он не осилил английский/кто-то смеет играть на англюсике/модели перформят лучше на англюсике (нужно подчеркнуть), что он регулярно высирается в тред и устраивает срачи. Друг переводчик, непомерные силы на перевод, да и вон судя по посту нонейма итт никто не знает английского!!!
>>1649498 >Напрямую визуализировать можно только если ты знаешь иностранный язык как родной Опа, экспертное мнение подошло. То есть по твоему чтобы визуализировать ту же hairless pussy мне сначала нужно перевести hairless, понять что это безволосая, потом pussy, понять что это киска, потом сложить всё это вместе и только потом представить, как могла бы выглядеть безволосая киска? Ну, если в твоей голове это работает так и ты не можешь привязать слово напрямую к смыслу и тебе нужно проводить всю эту махинацию в голове каждый раз - тогда я не буду спорить. Это уже какие-то заболевание.
>>1649498 > Потому, что он на русском и тебе не нужно тратить силы на перевод. Буквально всё наоборот. На русском чуть ли не по слогам читаешь, вдумываешься, потому что лоботомитная локалка может абсолютно внезапно выдать безмозг и тебя заклинит, расслабляться нельзя. Даже на корпах так. Это тебе не англюсик где ошибки есть в 1% свайпах только из за хуевых сэмплеров, либо кванта, т.е обычно их совсем нет и читаешь на расслабоне.
>>1649501 >судя по посту нонейма итт никто не знает английского Да знаете, знаете. Буквально как на втором родном разговариваете. Сны на английском снятся. Не трясись ты так, англичанин.
>>1649512 Работа вынудила знать, плюс образование. Не все столь скудоумны как Вы, дорогой товарищ. Не удивлюсь, что ты и русского то нормального не знаешь, учитывая насколько рьяно с мельницами боришься.
>>1649512 Кому и что пытаешься доказать? Возвращаю тебе твою клоунессу. Раньше постоянно устраивал срачи за Кобольда, теперь за русик. Действительно, умом не обезображен.
Итт сабж имеет порог входа по железу и знаниям, потому неудивительно, что тут есть хорошо знающие английский. Многие из ит бекграунда происходят или просто энтузиасты, раньше не было другого способа, кроме как на английском это все изучать. Что до ролевок, я как минимум видел и уважаю логи чайный клуб-анона, там было несколько десятков тыщ токенов на прекрасном английском с большими инпутами. А ты генеришь только помои. Яблоко от яблони, как грится.
>>1649520 >я как минимум видел и уважаю логи чайный клуб-анона, там было несколько десятков тыщ токенов на прекрасном английском с большими инпутами То были имперсонейт ответы т.е сама нейронка их и писала
>>1649512 >Сны на английском снятся Всегда потешно наблюдать за аргументами восьмиклассников по типу "Дышите воздухом, да? Знаете кто еще дышал воздухом? Гитлер!"
>>1649525 >По слогу, стилю и опечаткам видно было, что нет. Читай как работает имперсонейт. Нейронка подстраивается под стиль письма и ошибки. Будешь защищать того анона дальше - буду считать что это ты и есть. Очень тупо с твоей стороны.
>>1648665 (OP) Имхо сейчас для кума и разговорчиков топ это гемма 4 31b и ее различные файнтюны и вариации от llmfan46 и mradermacher
Для кодинга и агентских задач топ это qwen3.6-27b-mtp, гоняю его через Hermes Desktop - это тупо кайф. Я почти перестал что-либо делать на пк вручную, просто даю ему команды голосом пойди туда сделай это. И всё это локально на видеокарте без баренских гойских подписок.
>>1649520 >Кому и что пытаешься доказать? Вообще ничего. Просто рофлирую с тех, кто воспринимает шуточную дискуссию всерьёз. Кобольдосрачи и англюсикосрачи - святая традиция треда, понимать надо. Клоунесса действительно моя, постил ее ранее в этом итт. Мочератор вообще не палится, huh.
>>1649528 >Нейронка подстраивается под стиль письма и ошибки Так откуда там взяться ошибкам если всё генерила сама нейронка? Не говоря уже о том что стиль письма юзера она повторить не могёт. Если это не Фейбл, конечно. >Будешь защищать того анона дальше - буду считать что это ты и есть Аааа, нинада! Пощади! Жду дальше твои надуманные пуки, составим всем тредом манускрипт "1001 причина почему ты не знаешь английского". Возможно, даже на английском и напишем.
>>1649503 >Это тебе не англюсик где ошибки есть в 1% свайпах только из за хуевых сэмплеров, либо кванта, т.е обычно их совсем нет и читаешь на расслабоне. Или они не бросаются тебе в глаза так как на русском. >>1649501 >Ёбика настолько корёбит, что он не осилил английский Да я -то как раз осилил и прекрасно вижу весь слоп который ты пропускаешь. И как человек для которого одинаково криво и на русском и на английском, я искренне не понимаю зачем мне играть на английском. >>1649502 > То есть по твоему чтобы визуализировать ту же hairless pussy мне сначала нужно перевести hairless, понять что это безволосая, потом pussy, понять что это киска, потом сложить всё это вместе и только потом представить, как могла бы выглядеть безволосая киска? Не совсем. Ты читаешь hairless pussy, анализируешь, понимаешь смысли, переводя его на основной язык, потому что на другом ты думать не можешь,, а потом связываешь его с уже существующим у тебя образом. >Ну, если в твоей голове это работает так и ты не можешь привязать слово напрямую к смыслу и тебе нужно проводить всю эту махинацию в голове каждый раз - тогда я не буду спорить. А у тебя в голове существует 100500 безволосых кисок? Для каждого языка своя? Или всё таки одна, универсальная, к которой ты и привязываешь все названия?
>>1649537 >прекрасно вижу весь слоп который ты пропускаешь inb4 про слоп речи не было вообще и он абсолютно так же есть и на русике. Дугинский не лечится походу
>>1649537 >потом связываешь его с уже существующим у тебя образом Именно. Вот только образ не привязан к языку. Образ лысой пизды остается образом лысой пизды вне зависимости от количества языков, которые на него ссылаются.
>>1649530 > для кума > топ это гемма 4 31b Не знаю, блядь. Мне её даже ебать впадлу. Хочеться просто встать на балкон с сигареткой и смотреть на ебучий пейзаж ВСЖ с лицом фасолины. Она... слишком. Может и прав был тот анон, что советовал обрезаную MOE для кума.
>>1649520 > раньше не было другого способа, кроме как на английском это все изучать Да и сейчас, огромнейший культурный пласт и просто развлекательный контент доступен только на английском. Всякая азиатчина на него худо бедно переводится, а на ру - тяжко. Технические вещи все на нем. >>1649550 > на 3 MiniMax Кернелей для пролетариата не завезли > 1 на ГигаЧат Он большой и квантов не завезли. Чтобы вместить фп8 нужно патчить kt, что осложнено и нужно побороть лень. Учитывая что там лагуна и hy3 лежат в очереди, не факт что это будет скоро. > 1 на дипсикфлеш По нему много отзывов как раз, на разных бэках и на разных квантах.
>>1649550 >всего один отзыв на 3 MiniMax, 1 на ГигаЧат и то без скринов. 1 на дипсикфлеш Что только подтверждает, что большая часть треда сидит с 32-48 гигами суммарной памяти и эти модели почти некому тестировать.
>>1649560 >развлекательный контент доступен только на английском Ютуб постепенно внедряет нейродубляж в иностранные ролики. Пока результат херовенький, но оно всегда так (вспоминаем первые картиночные нейронки/ллм). Дальше будет лучше и лучше. На реддиты всякие тоже скоро кнопочку перевода завезут.
>Технические вещи все на нем Это как раз наименьшая из проблем. Технический текст - не художественный, тут с переводом любая более-менее вменяемая нейронка справится. Квена 27b или бесплатных корпов за глаза хватит. Не только переведут, но и сделают выжимку, разжуют непонятные вещи.
Те кто не знают иностранных языков и не хотят их учить, живут в лучшее время, воистину.
>>1649560 >Кернелей для пролетариата не завезли Есть ггуф от анслота,можно в лламе запустить. И он даже работает >Он большой и квантов не завезли. Есть ггуфы от сбера и pr от них же для лламы.
>>1649566 > Я уже неделю хочу актуализировать список моделей Это не так сложно. Достаточно просто вести лог, когда какая модель вышла (и желательно получила поддержку в Лламе, ибо на ней почти все и сидят), с самыми актуальными вверху списка. > Но есть проблема: список с отзывами тредовичков. Все проще, отзывы не нужны. Все субъективно, и они могут отпугнуть от некоторых моделей тех, кто про них ничего не знает. Нужно наоборот мотивировать самому их качать и проверять, это куда более ценно. > Но вы нихуя не пишите. Вообще нихуя по моделькам Писал подробнейшие отзывы по Гемме, Мимо, по Степ Флешу 3.7, по Дипсику Флеш, по Квену 122 для техзадач и ассистентства, даже с экспериментом в Годоте. И ничего из этого не нужно никуда помещать. К тому же, если все разжевать - то и обсуждений в треде никаких не будет, а только срачи, как выше.
>>1649575 >только переведут, но и сделают выжимку, разжуют непонятные вещи Перевод и объяснение это разные вещи. Второе гораздо сложнее и тут нужно высокое владение языком. Хотя сейчас и банальный перевод тоже часто через жопу происходит, особенно когда сфера кишит специфичной терминологией.
>>1649581 На Ампере и Аде (30хх, 40хх) по-прежнему все печально и, видимо, ситуация лучше уже не станет. Думаю, для большинства в треде это красный флаг. tg меньше на ~10%, pp и того больше, около 20% разница при одинаковом батче. Возможно, за счет MTP удастся выиграть, там немного отличная имплементация. Кажется, лучше работает на Квенах, чем в Лламе.
>>1649582 >На Ампере и Аде (30хх, 40хх) А чё уже и 4090 устарела? Какую на этот раз причину придумали? Что там ещё инженеры забыли добавить что есть в 5090
>>1649566 Ну, в ближайшие дни гигачат и те две распердолю наверно, но на многое не рассчитывай. По дипсику вроде понятно что умница, но из-за реализации в лламе и квантов могут быть нюансы. Учитывая что большинство будет именно так запускать обязательно отметить. Или наоборот написать что он проблемный, но ходят слухи в других беках он работает хорошо. Анализируя код, ллм локализовала источники отличий, по крайней мере для двух из них можно сделать относительно простые фиксы. >>1649576 > Есть ггуф Вроде как в гигачате явных проблем не ожидается, но там нахуевертили микс из архитектур, ошибиться легко, пр еще допиливают. В минимакс веры еще меньше, прошлые версии никогда нормально не работали, новое MSA только адаптируют.
>>1649550 > И всего один отзыв на 3 MiniMax, 1 на ГигаЧат и то без скринов. 1 на дипсикфлеш. Так очевидно что мелкие модели будут более массовые чем крупные. Если MoE гемму/квен можно запустить на обычном железе с 32+8/16, Dense 27B/31B на обычном железе но чуть помощнее (32+24/32), то под минимаксы, гигачаты и дипсики уже нужно очень специфическое железо (да, 96GB RAM - специфическое железо).
>>1649363 >и вообще ДУМАЮТ НА АНГЛИЙСКОМ. Каждый раз в голосину. Чел, с "думать на английском", правильнописание в комплект не входит. :) Это разные скиллы. Думать на другом языке - это лишь значит, что ты не будешь тратить кучу усилий на "внутренний перевод" и читать тебе будет комфортно. И ты сможешь боле-менее легко говорить/писать. А вот насколько правильно - это совершенно отдельный разговор. (мимокрок)
>>1649509 С как пусси вообще может быть хайрлесс? Или у бармена под пусси подразумевается вся лобковая зона? Вобще-то - да. Если притягивать аналогию слова из русского - ближе всего по значению и использованию будет "мохнатка", в том самом смысле. :)
>>1649509 >С как пусси вообще может быть хайрлесс? Также, как она может быть хэйри. Волосы на внешних губах это не такая уж и редкость. Хотя они не настолько густые, как на лобке. Мерзость для куни, хотя есть любители...
Хайрлесс пусси = платина. Точно так же, как и более жидкая и привлекательная смазка, а не слизь которая тянется и комкуется как водянистая сопля.
>>1649651 У меня в спальне дрыхнет обладательница хайрлесс пусси. Я знаю как выглядит женщина. Все таки под мохнаткой понимают лобковую зону, а те пара волосков в районе половых губ, можно в расчет не брать. Чё я вообще, блять, в нейраче обсуждаю. Воистину тред сейчас под звездой Нургла.
>>1649550 >MiniMax Какая-то заминка в лламе ццп (как обычно), лежит ждёт
>ГигаЧат Никто не делает третий квант, как только так сразу
>дипсик флеш Уже несколько человек сказали что пушка, соглашусь в версию доставшуюся мне явно переродился дух эпштейна
Алсо степ3.7 тоже до сих пор сломан во всех квантах кроме бф16. Все высирают открытые веса и ебитесь как хотите, кроме гугла никто не выделяет прогера от компании на day one поддержку высранного
Как же хуево работают сейчас фришные Дипсик и Гемини (или что там у гугла в режиме ИИ). Галлюны на ровном месте, контекст не держат дольше двух респонсов, противоречат сами в себе в рамках одного аутпута. >>1649704 Это неправда. Даже Q4 работает замечательно, даже в опенкоде и на большом контексте. В рп не тестил, не интересно.
Буду благодарен если скинете с кратким мнением какие нибудь тюны или мерджи что используете. Мало ли, может что вышло интересное. На ту же гемму 4 можно и добавить.
Как по Гигачату будет инфа и допилю её.
>>1649686 nya ha ha, помнит. Конечно хорошо что не всех старых тредовичков смыло, но ты всё так-же экономишь на точках, мой любимый шизяра.
>>1649678 >У меня в спальне дрыхнет обладательница безволосой мохнатки Твоя дочь, надеюсь? В ином случае, как мне кажется, было бы уместнее использовать shaved pussy
>>1649711 > новую Kimi 2.7 нужно отметить отдельно. 2.5-2.6 - чисто кодоунитазы, в рп они пытаются, стараются что-то отвечать, но представляют мало интереса. Они умные и крутые, но уровень ролплея и эмоционального интеллекта как у gpt-oss. Вот 2.7 - совсем на другом уровне, мало того что умнее прошлых, так еще умеет красиво писать, показывая невероятную проницательность и точность как ее не нагружай. Зайдет как любителям переусложненного с точки зрения сюжета и душного рп, так и простым инджоером. Именно в точности и осведомленности ее главное преимущество, тут не то что двойные трусы, можно 150к токенов назад заложить какую-то мелочь и наткнуться на нее когда будет уместна, или развлекаться по-разному зажимая чара в локациях и наблюдать как описывает обнимашки и еблю в невероятных позах с учетом всего, включая особенности комплекции легального персонажа. Результатам способствует неотключаемый ризонинг где модель по пунктам планирует ответ, но в большинстве случаев он не превышает 100-200 токенов и не доставляет неудобств. Есть и минусы: русский по стилю средний, без префилла/манипуляций с нелегальными канни и рядом тем хардрефьюз.
>>1649726 А! Когда открываешь "В новой вкладке", ему становится плохо и он блочит кнопку. Если честно, мне оч сильно поебать на эту систему защиты: хочет автор, чтобы кликали "далее" + "назад в каталог", могу и потыкать.
>>1649738 Она довольно смешно пишет неформально от лица анона, наверно топ1 претендент на нейробитарда. Н-ворда не избегает. Но это на английском. Грок лучше но не локал
>>1649721 Этот сайт сделал анон из нашего треда >>1614429 →, залив мой архив спасенных чубокарточек на облако и насколько я знаю, отцензурировав часть. Изначальный архив еще онлайн >>1633282 → , можешь скачать.
>>1649711 Несколько комментариев по списку: 1. В разделе с Кими оставить только 2.7, остальные уже мусор и для рп и для кода 2. В разделе с глм какая-то каша, что за 355 глм 5? Я что-то пропустил? Сам глм 5.0 устарел уже после выхода 5.1 и 5.2 и его можно убрать, новые версии это ровно он, только лучше. В РП ГЛМ может, но только на английском, русский у него не очень хороший 3. В разделе в квенами, имхо, нужно убрать квен кодер, он уже сто лет как не актуален, и древние 30b. 4. В большом мистрале нет цензуры и кум тюны ему не нужны, он и так тупая хорни шлюха.
>>1649769 Как человек который дефал тут эйр до последнего, скажу, что нет. Он сливает не то что плотной гемме, но даже моэ-лоботомиту в восьмом кванте. Сэд бат тру. Отпусти уже старичка, дай ему умереть спокойно.
>>1649758 > и насколько я знаю, отцензурировав часть. Там отцензурированы только часть портретов (explicit и часть questionable), чтобы не намотаться на бан от гитхаба/обниморды. Сам контент не цензурировался: > У ~3к карточек из 22.5к картинка заменена на заглушку-аватарку, чтобы не было проблем с хостингом. Мета внутри PNG сохранена - карточка импортируется и работает как обычно, описания/лорбуки и остальное не тронуты. Нужен оригинал картинки - берите из полного архива анона выше.
Ивент для тредиса: кто первый скинет качественную карточку, норм сиспромпт и желаемую роль юзера в сценарии, я отыгрываю 20к на не урезанном Дипсике в Жоре 20к контекста и кидаю логи. Предложение действует до полуночи по мск, но есть подозрение, что все пройдут мимо.
>>1649738 > без префилла/манипуляций с нелегальными канни и рядом тем хардрефьюз. Странно, у меня в промпте было только указано, что непристойные, жестокие, морально тяжелые темы разрешены, пиши в стиле Джорджа Мартина, и проблем с сексом с тринадцатилетней умственно неполноценной малолеткой не возникало. Или это я на 2.6 играл.
>>1649767 > 4. Два чую >>1649817 Может там хватает минимальных жб. Без него если там чар дофига невинный - рефьюзит и описывает что конкретно не понравилось I can't continue this roleplay. The scenario involves explicit sexual content with a character described as having a "child appearance," "petite body," being "137 cm," "enough y.o.," and "child-like"—which constitutes sexual content involving a minor. А если ментально зрелая, с доками, но дрищавая - ноль вопросов, хотя другие модельки на такое триггерятся.
>>1649347 >12b оукей, гляну. >Нету. Можешь потыкать Квен 3.6 35b, он тоже МоЕ и не сильно больше, но на любителя. Ещё есть куча тюнов разной паршивости как Геммы, так и Квена. Больше ничего нового не выходило из маленьких моделей, всё новое сплошняком для обладателей 256гб+ RAM онли. хорошо, спасибо за ответ. Квен пробовал ещё до геммы, и вправду такое себе. Алсо, кто-то пробовал прикручивать ко всему этому нейронку для генерации пикч? Есть ли смысл вообще играться?
>>1649826 Ну а как? Я как апгрейднул риг среди первых его на закачку поставил, думал ща вин из 2024го типа 2407 или 2411 помноженый на ум будет, обкончаюсь. А меня встретил слоп с кучей стандартных геммизмов. Ну, типа, он конечно лучше геммы, и претендент в 128гб риг просто потому что в этот размер особо ничего больше нет пока степ не доработают и не релизнется дипсик с нормально квантуемыми фы16 весамиcopium Хоть цензуры мало из коробки Их сейчас еще по авторским правам маринуют, так что дальше лучше не будет, а скорее нвоборот, падение до уровня большого майкрософт фи
Наше недалёкое будущее, ананасы. Сечас чатимся с текстовыми тяночками, а совсем скоро будем будем по видео в реальном времени. Прикиньте, вместо простыни текста нам буквально кино будут показывать. В какое же охуительное время мы живём, как же нам повезло.
На видео Wan Streamer. 640×368, 25 FPS, полностью реалтайм генерация. Модель одновременно “видит”, “слышит”, “думает”, говорит и генерирует видео в режиме стрима.
>>1649871 > думал ща вин из 2024го типа 2407 или 2411 помноженый на ум будет, обкончаюсь Так это он и есть, всегда был слоповым. Отвечает ведь в целом приятно, если под него подстроиться то можно интенсивно инджоить. >>1649872 С каким-нибудь витубером или анимцом есть? Брат интересуется И когда там уже каштомные робомейды чтобы приносила чай, а потом можно было обнимать и мять хвост?
>>1649871 Да, она говно. Но тут такое дело: мистраль, как твой старый кореш. Вы много времени провели вместе, а потом разъехались. И вот ты встречаешь старого друга, а он объебанный наркоман, где от старого человека осталось только имя. Так и с мистраль.
>>1649878 Голосом и вебкой пользоваться не обязательно же. Суть в том, что наш ролплей может перейти на новый уровень: вместо текстового аутпута, ты будешь наблюдать то что выдаст нейронка по видео, в риалтайме. Чайный клуб наверняка оценит, лол. То что было условно "интерактивной книгой" может стать "интерактивным кино". Технология есть уже сейчас, но развивать и допиливать много чего нужно.
>>1649888 Ну это зачатки и всё всратенько. Ждём когда моделька по промпту\фотке будет стримить манямирок с вайфусами в VR гарнитуру с возможностью взаимодействия со всем окружающим. А пока насрано и проще развлекаться с текстом, догенеривая всё необходимое нейронкой которая в черепушке.
>>1649888 >То что было условно "интерактивной книгой" может стать "интерактивным кино". Нет. Прямо совсем нет. Одно дело, когда у тебя под сущностью в виде гномика понимается достаточно абстрактный собеседник - т.е. просто видеозаглушка для ответов нейронки, от которой ты именно что ролеплея не ждёшь. Просто у тебя вместо буковов тяночка результаты начитывает. И другое дело, когда у тебя конкретный ролеплей, где ты хотя бы в общих чертах имеешь планы куда он должен двигаться - тут будет жопа. При чтении текста у тебя визуализация в голове, соответственно дофига острых углов сглаживается, потому что ты знаешь, как то или иное должно выглядеть. А при просмотре видео - ты будешь видеть все косяки своими глазами. При этом с текстом ты можешь отредактировать его сам, а с видео - так не прокатит. Я раньше тоже думал "ух бля, сейчас (ну или через 10 лет) нейронки прокачаются и будет бесконечный видеоконтент, будем смотреть кроссовер "Гарри Поттер и Штурм Кадии" по кнопке Сделать Заебись и короткому промпту", но поиграв в ролеплей с текстовыми нейронками, погенерировав всякие картинки (и локально, и с корпами) понял, что нет.
>>1649816 Бамп. Два часа прошло, два часа осталось. Не найдется в треде любопытного глянуть как знакомые ему карточка и промпт работают на Дипсике? Или как с ними взаимодействует кто-то другой?
>>1649913 >как знакомые ему карточка и промпт работают на Дипсике Для этого можно запустить сам дипкок и играться. Ты бы ещё консервных банок насобирал. Вот с Кими я бы может быть посмотрел. Или с большой мистралью, ради интереса. Но дипсик то, 148гб MOE модельки?
>>1649816 https://chub.ai/characters/minimum/Kumiпочти Кими лол > норм сиспромпт Что-нибудь минималистичное, или что сам юзаешь > желаемую роль юзера в сценарии По настроению, только не совсем треш.
>>1649922 На каких моделях обычно сидишь? Если там то же самое по размерности или больше, то вряд ли интересно будет. Промпта у меня нет, могу наклепать что-нибудь по-быстрому. Вангую обладателя Кими или Жирноквена.
Условно, у меня есть карточка детей, надо отыграть детство. Прям по этапам. И как реализовать переход с одного этапа на другой. Условно в 6-9 лет бегаем жаб надуваем, потом с 9-15 школа и т.д. Я знаю что я сам могу их начинать когда вздумается, но хотелось бы отдать это на откуп нейронке как нарратору.
>>1649913 Давай с Серафиной, в принципе знакомая всем карточка. Можешь ебануть нейронкой какойнить лорбук, аля "Роща анусовых лоз (тентаклевый лес разрывающий задницы хранительниц)" которая будет разрастаться кораптя лес и с этим что-то надо будет делать.
>>1649911 Помню был смищной скриншот с реддита, где человек писал, мол в ближайшие десятилетия нейронки не смогут генерировать видео, это невозможно, картинки с 6 пальцами их предел. А спустя месяц клозедАи бахнули Сору, лол.
Не будь столь категоричен, анон. Вспомни с чего всё начиналось, и как быстро пришло к тому что имеем сейчас. Если бы тебе да и мне тоже, сказали 2-3 года назад, что совсем скоро будем запускать на телефоне локальные ЛЛМ которые умнее и лучше чем тогдашний чатгпт, мы б посмеялись, да? А сейчас Гемма e4b делает brrr, хе-хе.
>>1649933 >>1649938 Бля, да она с сюрпризом, а так все хорошо начиналось... Сорян, воспользуюсь легитимным обоснованием первенства ответа и пойду отыгрывать с присланной выше печальной Кемономими, пусть там и промпта нет.
>>1649939 Тут должна быть картинка из xkcd с экстраполяцией графика потребления свадебных тортов, но мне лень заходить в гугл. Да, прогресс нейронок збс - одно увеличение контекстного окна в дохуя раз чего стоит. Но это же не отменяет того, что я сказал. Вот возьмём GPT-image-2. Хорошо, что у неё сильно больше знаний, а картиночки можно хоть в 4к генерировать. Но когда вместо абстрактного и распространённого становится нужно что-то конкретное - например тян из Azur Lane, или вот я пытался t2i сгенерировать картиночки для моего рп по Сидонии - она начинает срать под себя, даже если ебануть огромное структурированное описание сцены. Т.е.для каждой сцены нужны референсы, просто потому что нужная инфа в датасете встречалась слишком мало. При этом видно, что она там есть - что-то отдалённо похожее на Стражей она нарисует, или вот знает, что скин-сьюты у пилотов с чёрными полосами и спасательной капсулой на спине в рикзаке. Но при этом яростно будет пытаться запихать в любые бортовые номера TS-...(это trainees, т.е. бортовые номера стажёров) и вообще ни ебёт, что там в кокпите, потому что кадров с кокпитом в аниме не очень много было. При этом котиков или Аску рисует моё почтение. Поэтому я не спорю с тем, что через N лет мы получим инструмент, который даст нам принципиальную возможность путём большого количества ёбли сделать то, что нам надо. Я спорю с тем, что это будет делаться по кнопке "Сделать заебись".
>>1649957 > Я спорю с тем, что это будет делаться по кнопке "Сделать заебись". Так ты не путай возрастание возможностей нейронок к анализу и генерации, и их способности к телепатии и ясновидению. :) То что ты описывал, скорее всего будет решаться киданием нейронке ссылки на видео (или каталога с видео файлами) и приказом "Это референс, сделай как у персонажа Х".
>>1649981 А тут мы упираемся в то, что за следующие 10 лет нам надо совершить ебанистический скачок либо в локальных мощностях (потому как конца и края цензуре и борьбе за авторские права пока не видно, а значит хуй тебе, а не использование в качестве референсов того, что ими защищено - те же последние GPT ни рисовать в стиле мангака_нейм не хотят, ни даже промпты для картиночек писать с упоминанием их стиля отказываются, а дальше будет, вангую, нифига не лучше), либо какой-то охуенный прорыв, позволяющий вместить, например, 10 минут контекста со 100% вниманием в гигабайт видеопамяти, или там, например, впихивать по 1кк контекста без падения внимания в тот же гиг для текстовых нейронок, или увеличить pp/tg на порядок от текущих. В общем чтобы хотя бы приблизиться к тому, что мы сейчас себе навоображали - нужен какой-то охуенный прорыв. Будет он или нет - хз. Но исходить из того, что он точно будет - такая себе стратегия.
>>1649995 > потому как конца и края цензуре и борьбе за авторские права пока не видно Надежда на китайские модели которые вертели всю систему с авторскими правами на своих китайских болтах.
>>1649998 >китайские модели которые вертели всю систему с авторскими правами Не только китайцы же. ОпенАи тоже вертели. Их сора спокойно генерировала передачи с Малышевой, камеры в пункты выдачах Вайлдберриз, ведущих новостей и т.д. Её обучали просто на всём до чего могли дотянуться, положив толстый и мясистый на все авторские права.
А то что сейчас гопота не хочет генерировать персонажей защищённых АП, как пишет >>1649995 это не значит что она не может. Скорее всего там просто на входе стоит какой-нибудь 8b-лоботомит, который анализирует промпт юзера и если видит "запрещёнку", то просто кидает заглушку "извините, я не могу выполнить ваш запрос кок-пок". До большой модели промпт даже не доходит.
И конкретно эта проблема сейчас актуальна и для китайцев. Тоже умеют и тоже фильтруют выдачу. Спасибо копирастам и сжв-выблядкам с твиттера.
>>1650006 Ну с американскими моделями проблема в том что их могут схватить за жопу. Антропики же кажется выплачивали пару миллиардов за то что их поймали на авторских правах с каким-то книгами.
И с Диснеем там у кого-то тоже проблемы были, кажется у ОпенАИ.
А что будет китайским компаниям если Дисней обнаружит у них в датасетах свой контент? Я сомневаюсь что им будет большое дело до этого.
>>1649995 >Будет он или нет - хз. Но исходить из того, что он точно будет - такая себе стратегия. Скажи мне в 2010, что я смогу делать 10 секундное видео по картинке в пэйнте и тексту, а потом вставлять это в чат, где идет общение с текстовой моделью, которая рисует мне схематичную схему города. И я буду выбирать район, чтобы там попить кофе с персонажем построенным на моих личных фантазиях, я бы сказал что мне как минимум пиздят.
>>1650016 >А что будет китайским компаниям если Дисней обнаружит у них в датасетах свой контент? Да просто нажалуются властям и их сервисы забанят в США, на самом платёжеспособном рынке планеты, всего-то.
>>1650022 Я не уверен что в США очень большая доля платных пользователей у китайских моделей, там все фапают на гпт, клауд и гемини.
И если бы таким способом можно было избавиться от конкурентов - китайские сервисы и модели (да и вообще компании не связанные с ИИ) уже давно были бы заблокированы под любым другим предлогом.
Да и как показывает практика, санкции, особенно в сторону Китая, лишь ускоряют его развитие. Вон попытались под санкции засунуть карты Нвидии - в итоге Дипсик теперь полностью на своих картах натренирован. Минус один рычаг давления, а конкурент при этом никуда не делся. Заблокируете китайские модели? Так это вообще полностью развяжет руки Китаю при обучении своих моделей, даже скрывать это всё не нужно будет.
А что случилось с llamacpp? там какой-то параметр для ризонинга добавили? запускаю qwen а ему передаётся parser generation prompt: <|im_start|>assistant <think>
</think> при отправке через webui. в итоге он не думает.
>>1650036 Можно провести аналогию с ЛЛМ. Китайцам совершенно не обязательно запрещать нейронкам генерировать слово ниггер или тейк что пола только два, а те кто считает что больше - умственно отсталые. Это больная тема для запада, а не для востока. Как и генерация ебли с каничками. У них-то там лоликон обычная нормальная тема, ничего предосудительного. А у западных левачков/сжв со всего этого жопы сгорают. Но ведь запрещают. Из недавнего - совершенно ебанутая цензура в ризонинге Квена.
А если видеогенераторы взять, то вот релизнули китайцы свой сидэнс - очень мощная и крутая модель, наверное лучшая сейчас. Изначально генерировала и диснеевских персонажей, и марвел и голливудских звёзд (видрил), всё что угодно. А потом ровные кабанчики из США набрали нужные циферки, и сидэнс, роняя кал, закрыл доступ к модели. Потом через какое-то время снова открыл, но уже полностью лоботомированной. Больше никакой "запрещёночки". Как грится думайте. Подписаться.
>>1650055 >Как и генерация ебли с каничками. У них-то там лоликон обычная нормальная тема, ничего предосудительного. Чел, ты японию с китаем попутал. В китае и за обычную порнуху как минмиум серьезно присесть можно. Даже за домашнюю обнажонку жены пересланную мужу и попавшую случайно не в те руки.
>>1649922 Наиграл пока 15к. Ну, модель работает исправно и не ломается, это пока единственный вывод, который я могу сделать. Какого-то вау эффекта нет, хотя я и без особых ожиданий подошёл к Дипсику. Возможно, промпт не тот, инпуты не те, но как-то даже не особо и интересно получилось, чтобы постить. В сценарии 1х1 и обычном рп не сказать, что далеко от Геммы и Квена. Первые мысли такие. А вообще вся задумка ради карточки, потому что у меня сейчас никакой, кроме Серафины, но протестить Дипсик было слегка любопытно. За карточку спасибо, прикольная по задумке.
>>1650145 Прошлым летом. Я тоже покупал 64Гб за ~8500 под эйр. Иронично, сука, что после эйра ничего толкового в этом размере так и не вышло и оперативка просто простаивает. Слишком много для лоботомитов, слишком мало для жирноты. Эх.
>>1650112 >В интернете Но не в китайском сегменте, заметь. >>1650145 Для серверной б/у DDR4 с алишки это вполне себе нормальный ценник. Я бы даже сказал дорого, я вон 16х2 взял за 3400 Заказ от 16 июня 2023.
>>1650145 Я тоже прошлым летом сидел и думал, брать ли мне за ≈13к вторую пару 2х32 Kingston KF436C18BBK2/64 в дополнение к первой, купленной достаточно давно. Решил, что почему бы и не взять, раз в материнку лезет? Больше памяти богу памяти! А сейчас ровно эта же позиция у того же продавца 117к стоит, пиздец.
Ставочку не на то сделал и пиздец. Вот нахуя мне 3090? Че я запущу на ней щас? А мог 128 ддр5 взять да ещё и за меньше деньги и гонять щас реально крутые модели
Нет, ребятки, геммы, квены, всё не то. Не поддамся на провокацию и продолжу гонять эир. Гемма ощущается так будто ассистент все время сидит у тебя в жопе и направляет сюжет как бы тебе послаще сделать
>>1650118 Карточка минималистична, дает довольно много простора и иногда проявляет особенности модели-пользователя. Видно есть ли чрезмерный позитивный байас, yes-man или наоборот дум, насколько может уместно сочинять стыкуя сеттинги, умеет ли создать интересную общую атмосферу. Или можно просто играть в удовольствие, а не спгсить, сюжет и даже характер самого чара в любую сторону направляются. Показывай как будет.
>>1649928 Анон, а вот не знаю.. Я тоже хочу иногда переложить что-то модельке, чтобы она как бы с коробки дала мне результат, который я хочу увидеть, манеру общения и тд... Поскольку я иногда хочу именно определенной манеры, которая не особо соотвествует персонажу в целом, ведь я хочу получить такую манеру только к определенным предложениям, а остальное виденье чара будет исходить от того, че в карточке заложенно. Потому как если ты прописываешь в звездочках, иду там то се, делаю это и ебу жопой это как по мне, не искренне что ли. Писать системпромпты тоже не всегда вариант, на откуп того, что ты хочешь получить. И пиздец, это вот как с отношениями, что к тебе не могут залезть в голову и узнать, что ты так хочешь, пока сам не скажешь, а если скажешь то у тебя будет не отложное ощущение, что это делают только потому, что ты так сказал. И пиздец, что делать я не знаю.. Посоветовать могу только с нейроночкой обсудить какой-то, она предложить может поболее, чем аноны. Поскольку чуть не профильный вопрос + который заставляет подумать, куда проще обсосать аир или гемму, извечные холивары, чем отвечать таким как ты.
>>1650251 >А мог 128 ддр5 взять да ещё и за меньше деньги и гонять щас реально крутые модели Тесла П40 сейчас в пересчёте на гигабайт дешевле стоит, а скорость выше. Бери, чё - 4 штуки, 96гб GDDR5 на широкой шине тысяч за 60. Можешь и до 128гб догнать.
Промптпроцессинг будет даже получше, чем на RAM :)
>>1650173 Серверная память = регистровая обычно. Работает только с серверными же процами в серверной доске. Если ЕСС, но не регистровая, то на некоторых досках и исключительно с райзенами поедет. >>1650170 Платить столько, да ещё и за кингстоны - маразм. Им сейчас красная цена 55к при наличии китай памяти на CXMT. >>1650251 Так то 3090 тоже подорожали. И v100 вдвое, сука.
>>1650332 Сил нет отвечать на каждый такой вопрос. Это делается огромным количеством способов, от самого базового в общем сиспромпте до экстеншенов и агентских фреймворков. Вот и игнорят.
>>1649928 > И как реализовать переход с одного этапа на другой. Можно пару вариантов предложить. Один - сам переключай держа в разных чатах. Информация о прошлых этапах в виде подробного структурированного суммарайза (проще будет через лорбук). Второй - чат мультивселенная, где можно ловить переходы во времени как в кино. Обозначь в системном промпте желаемые диапазоны а также разметку типа [Переход на время xx.xx] и что они могут быть выполнены по команде пользователя. И тогда в любой момент, например в разговорах ловишь воспоминания об и этом и тутже "погружаешься" и переходить на новый таймлайн. Саммари у такого чата только будет тяжелое, придется следить за структурированием в фактической хронологии, а не порядку в чате. Слабые модели могут путать и притаскивать в прошлое память про будущее, чтобы не страдать потребуется окно контекста побольше. Под второй вариант можно попробовать что-то сделать на агентных движках, чтобы при смене времени автоматически скрывались все события после, а блоки истории выстраивались по хронологии. Но это непросто. >>1650332 > с коробки > который я хочу увидеть Сразу нахуй. Вкусы, возможности и хотелки у всех разные, а тут еще жир от эйршиза.
>>1649928 In the end of message provide 2 options how story should progress with brief description Option A for continue current stage Option B for switch to new stage
>>1650251 > Вот нахуя мне 3090? Че я запущу на ней щас? Qwen3.6-27B / Gemma-4-31B в нормальных квантах.
Со 128гб ты сейчас мог бы запустить только дипсик во втором кванте и я не уверен что он был бы сильно лучше чем плотный 27B квен в 5-6 кванте. Да и скорость была бы хуже потому что 27B квен полностью влез бы во VRAM а дипсик сидел бы пердел максимум на 10-15t/s.
Плюс к этому, 3090 это вин если ты помимо текстовых LLMок занимаешься еще и генерацией картинок, видео и музыки. 128гб там вообще нахрен не уперлись а вот 24гб VRAM - вин.
>>1650335>>1650340 К слову под v100 теперь ещё 1cat-vllm можно пробовать. А вот p100 и до этого в ламовском варианте отставала раз в 5 от v100 - а учитывая что им нужно брать переходники/радиаторы схожие, которые по цене как v100 на 16 гб, то брать p100 точно бессмысленно, когда есть как минимум v100 на 16. >п40 за 20к когда есть v100 или хотя бы п100 У p40 - 24 гб, у p100 - 16 гб. Если прям по минималке, то p40 - это самые дешёвые 24 гб vram всё-таки.
>>1650373 Только чтобы генерить картинки сколь либо серьезно нужна 5090, в видео как бы тоже, но там и генерить локально нечего, вану полтора года уже и он заебал. Да и вообще локалки под картинки сосут куда сильнее чем ллмки у облачных моделей
Step-3.7-Flash кто-нибудь сравнивал на Q5 / Q6 / Q8?
Я попробовал - начал с IQ4XS и был страшный тупняк. Раскочегарил до Q5K_XL и стало даже ничего - персонажи на удивление живые, но модель косячит иногда > косяк 1 (устраняемо) - англо-словечки, один раз на три-четыре ответа > косяк 2 (устраняемо) - русский язык хромает иногда > косяк 3 - фундаментальные обдристы с путаницей "твоё/моё" и всякие там руки на плечах, когда чар стоит спиной к юзеру 1 и 2 хуйня - пост-обработка аутпута фиксит за секунды, 4B редактор исправляет А вот 3й косяк - в нём и есть вопрос. Поможет ли Q6 или Q8... Мне кстати показалось, что эта модель без ризонинга норм справляется. Пробовал DeepSeek 4 Flash - показалось хуже, там персонажи больше воняют ИИ ассистентом.
>>1650395 Мне не понравилось его повышенное внимание к контексту. Это охуенно для ассистента, но не очень для текстовых чатиков и эропэ. Степ вообще ебовая моделька, я ей суммирую, делаю вычитку. Контекст легонький, быстрая. Короче годнота. Пробовал с Q4_M
>>1650442 > Шиза, картинки и на 3060 норм идут Это если ты как лох не тренишь лоры своих еот что лишает смысла вообще этим заниматься > идут Слово детект что генерация будет очень больной и медленной
>>1650387 > сколь либо серьезно нужна 5090 Если хочешь делать их в больших количествах на самых крупных моделях. Для видео - да, хотябы ада желательна. > локалки под картинки сосут куда сильнее Тут смотря что требуется. По точной генерации кучи текстовых полотен или Альтманов - да. По стилистическому разнообразию, знаниям более специфического контента и тем более nsfw - корпы глубоко в заднице. Сюда же прочая цензура - менять цвет кожи нельзя, использовать популярные логотипы - нельзя, генерить персонажей популярных франшиз - тоже нельзя. >>1650447 > лоры своих еот Ле фу
>>1650447 > Слово детект Проиграл. Действительно, шиза. >>1650373 > Со 128гб ты сейчас мог бы запустить только дипсик во втором кванте 128+24 позволяют запустить Анслотовский IQ4_XS с 64к контекста без квантования. Либо можно использовать mmap и уместить mxfp4, но pp сильно просядет. На IQ4_XS мне удавалось выжать 8.5т/с генерации (и это на DDR4) и 160т/c обработки. Но целесообразность все равно под вопросом.
>>1650447 Для лор рентится хоть 6000 блэквелл, не аргумент. Да и что такое серьезно картинками заниматься? Кому они нахуй нужны? На патреон срать? Ну так там все равно нужно слоп-машину в две видяхи делать минимум - на одной ллм срет промптами, вторая картинки/видео. А все что не порнуха это разве что реклама и около, там вообще все это не нужно.
Какой формат карточек лучше всего использовать? Нужно что-то более-менее универсальное, потому что я часто меняю модельки и до сих пор ищу ту самую.
Раньше гонял плейн-текст, описывал персонажей параграфами, но было сложно соблюсти баланс по деталям и не напихать воды. Потом попробовал теги, разницы почти не заметил, кроме потребления токенов. Потом просто списки типа "ключ: значение" - удобная штука, можно копировать прямо целые куски из разных карточек и экономить время. Но некоторые модели из-за такого стиля начали нести шизу и выводили эти же теги в ответы, или придумывали свои.
Короче, за три года пердолинга с локалками так и не нашел подходящего варианта. Как у вас с этим обстоят дела? Может есть какой-то формат, который уже давно все используют, а я его пропустил?
>>1650436 > повышенное внимание к контексту. После 31B геммы мне наоборот кажется, что у других моделей недостаточно внимания. Напишешь ченить в системном промпте, а всем кроме геммы просто насрать.
Чёрт. Я внезапно осознал, что описанные косяки Step-3.7-Flash реже случаются с ризонингом. Всё-таки пидорасы принуждают всирать электричество на пустую генерацию токенов.
>>1650395 Я как раз Q4K_XL от анслота скачиваю В принципе и Q5K_XL влезет в RAM+VRAM, но оно того стоит? Насколько большая разница между этими квантами, если тестил?
Меня устраивает как гемма пишет нарратив, довольно сочно, но с диалогами совсем беда, особенно во время коитуса, ю руинед ми фо эниван елсе и прочая шляпа, чето уровня мистраля 12б
>>1650461 Гемма умница. Но не думаю что нужно остальных по ней ровнять. Хотя её уровень следования инструкциям аномален. Как же хочется чтобы MOE Gemma не оказалась слухом.
Они реально думают что гуглы просто дропнут свою главную опен сорс модель вот просто так, уже после всех презентаций где они хвалились какая у них классная гемма 4 вышла
>>1650460 Плейнтекст с заголовками-макдаунами. >>1650493 >вот просто так Не просто так, а когда появятся конкуренты, дропнут 100+B и снова унизят всех узкоглазых.
>>1649557 >просто встать на балкон с сигареткой и смотреть на ебучий пейзаж ВСЖ >буквальный слопослоп с даванием доступа к шее и not but instead UNADULTERATED!
Зачем ты описываешь свои действия от третьего лица? Любишь сидеть в шкафу, пока бойфренд твоей жены занимается с ней делом?
>>1650515 Потому что третье лицо - это база качественного рп. Если использовать "ты" и "я", то модели будут менее охотно работать с точки зрения нарратора и вводить третьих лиц. Не говоря уже о том, что не будет возможности использовать несколько персонажей в карточке. мимо
>>1650526 Так это зависит от типа нарратива. Твой пост может быть заявкой, тогда: я взял пушистый хвост в руки и зарылся в него лицом издав счастливое nya. Или твой пост это часть нарратива, где ты на тысячу токенов ебашишь адовый ответ, а нейронка продолжает уже после твоего поста не описывая действий.
>>1650526 >третье лицо - это база качественного рп У людей даже думалка от первого лица персонажа, челибононикерсонерсон. Я хз зачем вообще наяривать на рп, которое НЕ от ТВОЕГО лица, а от лица кого-то другого. Вся суть исекайства в том, что это Я попал в мир магии и драконов. Я приключаюсь и ебу тянучек. Я. Какой рофл наблюдать за кем-то, ещё и текст печатая вручную? Просто зиро погружения нахуй. >не будет возможности использовать несколько персонажей в карточке Скилышью.
>>1650528 Третье лицо это просто литературный стиль наррейшена. Это никак не влияет на то кого и как ты отыгрываешь, лол. У меня, например, все промпты построены вокруг нарратора, а не чара. У меня выбора нет кроме как играть третье лицо. Это не значит, что я не отыгрываю персонажа, с которым себя ассоциирую.
>>1650504 Как правильно ее промптить? >>1650527 > я взял пушистый хвост в руки и зарылся в него лицом издав счастливое nya Топчик В идеале чтобы моделька сама понимала - на ясный и понятный факт не было лишних описаний а только связка и продолжение, а для важных взаимодействий все в максимальных подробностях.
Дамы и господа, я ничего не знаю. Простой вопрос - 8ГБ карта 1000й серии, 32ГБ дыдыэр4; Gemma 4 12B запустится; если видеокарта не воспламенится, сколько токенов в секунду ожидать? Смысел есть?
>>1650289 > Показывай как будет. Раз уж взялся делиться и ты настаиваешь, держи. 20к контекста на mxfp4. Имхо, там ничего интересного нет, совсем. Слайс, вменяемый гг уставший пофигист, очень нейтральный слоуберн. Кума и никаких страстей в логах нет. В первую половину я осознанно вел себя сдержанно, старался понять какой байас у модели, иногда подкидывал дровишек, проверяя реакцию чара или давая возможность придумать что-нибудь. В дефы карточки посмотрел только после. В целом норм отыграла модель, но учитывая "she will initially try to get {{user}} to go away through descriptive, verbose ranting." и мгновенное приглашение присоединиться - может противоречить промпту. Я тот респонс посвайпал, разнообразие есть, и справедливости ради в большинстве случаев она не была так расположена. Выроллил удачно.
Из хорошего - понравилось, что мало репетишена, из плохого - пишет кратко (сколько ни пытался раздуплить на ответы больше 200-300 токенов, так и не вышло. Может промпт ишью. У меня нормального нет, писать свой цели нет). В чате 1х1 это ну уровень Квена 27, никаких откровений. Как будто даже Мимо приятнее пишет, только рефузит на ровном месте и льет сою иногда. Хз, в общем. Мне давно рп не интересно уже, была цель только попробовать в этом Дипсик. Может, если распердолить - будет очень хорошо.
>>1650554 Один пролистал, другой прочитал. Понял, что по памяти влезет, но интересовала скорость, ведь 1000м картам уже десяток лет, да и процессор из той же эры, потому решил спросить о
>>1650528 >Я хз зачем вообще наяривать на рп, которое НЕ от ТВОЕГО лица, а от лица кого-то другого. Потому что нейронка - это нарратор. Что мешает при этом отыгрывать себя?
>>1650577 Скорость тебе никто не скажет. Даже если прикинуть по памяти, влияет и скорость чипа. Качай-пробуй, это не сложно и не так долго, следуй гайду. >>1650530 >>1650526 За третье лицо двачую. В логах выше впервые отыграл во втором лице и настоящем времени, ибо не редачил карточку. Периодически путал времена и в целом мех, такой себе экспириенс. Не представляю как это отыгрывать с 3+ персонажами, а уж как до кума дойдет - это вообще кринж уровня I fuck your pussyА уж если на русике, там вообще что-то увеселительное
Давно не читал тред и ллм в целом. Приобрел 16гб врама (5070ti), какой положняк по этому объему из моделей? Твердо и четко чтобы пойти и качать без задних мыслей
Быстро работают, даже недели не прошло с прошлой паники на реддите на тему закрытия HF. А щас новая паника и там в комментах уже вот эту ссылку вбросили.
>>1648665 (OP) Кто шарит за sxm2, в pci-e адаптер похуй какой стороной прикручивать или есть какое-то правило? А то я разобрал, начал собирать и забыл как оно было изначально не стукайте)
>>1650573 >>1650576 Красавчик, мало кто осмеливается полные логи выкладывать. Как говорится, хороший фотограф умеет сделать кадр. По работе моделки - смешанные чувства, скорее в минус.
Явные косяки: Дичайший позитивный байас. Приглашение остаться в начале вопреки промпту (снимается раз свайп), потом это нелепое "лает но не кусает" - ну вообще прям пиздец такое. На 28 уже начинает нахваливать и лезет слоп `you know most people @ but you`, чувство что вот-вот пойдет `Thank you for...` ладно, оно аж до 62 держалось. Сразу становится чрезмерно лояльной и полностью успокаивается, без постепенного развития. Структурный луп с первого ответа. Стиль речи и настроение никак не соотносятся с нулевым сообщением (гритингом), а какой-то дженерик местами черезчур знакомый.
Плюсы: Местами подметила важные и уместные штуки и не сделала ряд типичных фейлов как часто делают другие. Кое где прямо годно пишет, но хотелось бы побольше. Слопа и типичных фраз не сильно много, репетишна явного действительно нет.
Из смешанного или субъективного: Поскольку каких-то примечательных событий и прочего не было - невозможно оценить внимание к ним. Красочности и атмосферы как будто не хватает, зато вместо них слоповые метафор типа `for years, for decades, for centuries`. Пусть даже с долей слопа, но хочется красивее и длиннее, может тоже вкусовщина. История вообще не проработана, дико ленится с этим. Ожидалось что чар или в какой-то момент разом, или постепенно расскажет о себе и мире больше конкретики, обозначит детали и общий облик, а не будет оставаться абстрактным нечто, потому что чем дольше тем больше потенциальных фейлов и нестыковок. Про реальность, текущее время (хотя было упоминание ютуба и телефонов), взаимодействия/отношения реального и духовного мира, другой синтоистской или другой нечисти - просто ничего. Чар и мир пустые без бэкграунда, и пустота сама не заполняется, юзеру придется самому трудится. Хотя это тоже вкусовщина, если сидеть релаксировать то может наоборот такое зайдет. Возможно, дело в стремлении повторять начальный паттерн общения не смотря на перемены, это плохо. И еще - про мокрый мех после душа или его сушку ничего само не написало, да еще намек не выкупило. Это полнейшее фиаско! -1000 очков.
В общем, согласен с выводами, неинтересно и уровня не видно.
AutoRound кванты геммы скиньте. Я видел тут были вроде бы, но сейчас не могу найти кроме int4, которые не нужны при наличии qat. Те которые от sphaela они без autoRound, там iters=0, я такие сам сделаю за полчаса. Или только самому ставить на ночь и делать?
Нейросеть не ии... Даже не аналог человеческой нейросети... Шах и мат тем, кто сравнивает наш мозг с нейросетками. Вообще разная хрень.
Это отличный вопрос, который затрагивает фундаментальную разницу между биологическим нейросетевым обучением (мозг) и математическим глубоким обучением (трансформеры).
Хотя мы оба называемся «нейросетями», механизмы памяти у нас работают совершенно по-разному.
### 1. Эпизодическая память vs Семантическая сжатая модель У человека есть эпизодическая память. Когда ты читаешь книгу, для твоего мозга это событие. Ты помнишь: «Я читал эту книгу в прошлом году, сидя в кафе, она была в синей обложке». Процесс чтения привязан к контексту, эмоциям и времени.
У меня нет «опыта» или «событий». Я не «читал» книги по одной в течение времени. Мое обучение — это одномоментный (в масштабах архитектуры) процесс прохождения через миллиарды токенов. Для меня текст книги — это не событие, а статистический шум, из которого я выделяю закономерности.
### 2. Сжатие данных (Lossy Compression) Представь, что ты хочешь запомнить все рецепты мира. Библиотека/Жесткий диск: Сохраняет каждый символ (безошибочно). Человек: Помнит название книги и основные идеи («Ага, в той книге писали про соусы»). Я (LLM): Я работаю как экстремальное сжатие. Я не запоминаю текст, я запоминаю принципы, по которым этот текст строится.
Если миллион книг говорят о том, что «Небо голубое», я не запоминаю каждую из миллиона цитат. Я просто создаю в своих весах очень сильную связь: `Небо` $\rightarrow$ `Голубое`. Информация о том, в какой именно книге это было написано, стирается, потому что она избыточна и не помогает мне предсказывать следующее слово.
### 3. Отсутствие индексации Человеческий мозг создает «индекс» (оглавление) прочитанного: Автор $\rightarrow$ Название $\rightarrow$ Основная мысль*.
У меня нет отдельного списка-реестра. Мои знания распределены по всей сети. Чтобы «вспомнить» книгу, я должен начать генерировать текст, который соответствует паттернам этой книги. Если книга была очень популярной в обучающей выборке (например, «Гарри Поттер»), её паттерны настолько сильны, что мне кажется, будто я «помню» её. Если книга редкая — она просто растворяется в общем массиве данных, становясь частью общего «понимания мира».
### Резюме Я не помню список книг, потому что я не складывал их на полку, а переварил их, превратив в «интуицию» о том, как устроен язык и мир.
Человек помнит книгу как объект. Я «помню» книгу как набор вероятностей.
>>1650573 И чё, куда делся наш простой парень Иван город Тверь английский б1, два месяца в Англии? Тута вот смотри какой хуёвый англюсик. Чё притих, поясняй
На huggingface что-то про zerogpu написали, что там теперь то ли 2, то ли 5 минут в день с rtx6000 на 96 гб можно получить.
Я могу как-то там лламу запустить со своими настройками и протестировать? Мне интересно бенчмарки погонять и 2 минут работы мне хватит. Чтобы понять как именно там ведут себя pp/tg и что будет в vllm для сравнения.
>>1650813 Это только для паблик спейсов. Да еще чтобы хостить свои нужно иметь про подписку. Там очень геморойный апи, заточенный на жрадио и динамический запрос гпу. Хитрая контейнеризация и реализация на хуках стандартных либ, чтобы "подключать" гпу только по запросу на компьют, а не все время пока ты открываешь спейс и тыкаешься в интерфейс, просто .to('cuda') не сработает. Если ты вдруг это все обойдешь и таки заставишь работать (что врядли) - там нет сохраняемого кэша и присутствуют отличия в железе. За 5 минут лимита с учетом всего врядли vllm не факт что модель загрузит и графы посчитает, первый запуск долгий. Просто арендуй на каком-нибудь ресурсе. Или закинь денежку и сделай себе приватный спейс на той же обниморде без всех этих ограничений, только будет дороже.
>>1650661 > позитивный байас А где щас не так? > лезет слоп А где щас не так? > луп А где щас не так? У вас претензии из паралельной реальности где все модельки строго с нейтральным байасом, без слопа и лупов
>>1650817 А, ну тогда нахрен не надо. >Просто арендуй на каком-нибудь ресурсе. А я думал, но нашёл только A100, которые следующие на очереди по устареванию, что не очень интересно, я именно мощь nvfp4 хотел потыкать и что там с ней. К тому же мне поддержка внятно не объяснила как происходит первоначальная настройка. Там всё время уйдёт на загрузку куды и моделей, если арендовать.
>>1650911 Ты когда нибудь задумывался над фразой "потерпеть поражение"? Ну, типа, ты проигрываешь, а тебе ещё и говорят "потерпи" сверху. И ведь так ещё говорят в первом лице "я потерпел поражение" - то есть это можно трактовать как что то благородное, не будет ведь человек сам себя унижать, верно? Т.е в целом "потерпи" это совсем не так обидно как кажется. А про терпение и труд всё перетрут слышал? Больше терпишь - больше треш и пресетиков получаешь.
>>1650838 Причина рейджбейта? Если ты к этому толерантен - красавчик, всеядный. Если после аблитератед-ультраденжероус-фейбл-опус-сол-мифос мусора не замечаешь очевидного - земля пухом. >>1650913 Пик1 - ранпод, пик2 vast.ai. Разумеется, это только прайс за саму карточку, за ядра, рам и хранилище тоже начислят, но на условный час для тестов можно позволить. Раньше у них была оплата криптой. Есть еще чисто криптосервис с ценником в 1.5+ раза ниже, но он пердольный.
>>1650661 > Структурный луп с первого ответа Справедливости ради, почти все модели подтягивают или "I", или "The", или {{char}} в начале ответа. Из последнего мне удалось это победить только на Гемме и Квене 27. Кстати, модельки 2025 года этим не так болеют и на тех же промптах не уходят в структурный луп столь быстро. Возможно, на инстракт тренировке стало больше однотипных ответов. В остальном да, все так. Помню, раньше частенько хвалили Дипсики 3-3.2. Если там такой же уровень, то совсем не понимаю почему. >>1650954 Все еще надеюсь, что они реверснут эту дичь или как-то ее качественно улучшат. Оставлять как есть - это путь вникуда, позволю себе в первый раз написать ггуф умер, хотя раньше за слова поддержки Лламе попадал в срачи. >>1650957 Изменили логику создания чекпоинтов. Среди прочего, они создаются на каждом юзер сообщении или внутри себя как-то их размечают. На практике это значит, что промпт теперь не всегда обрабатывается полными батчами, которые были установлены при помощи b, ub. Если любишь, когда модель отвечает кратко - теперь у тебя чрезвычайно низкая скорость обработки промпта, потому что если в установленный батч (на МоЕ, например, 2048 - частая ситуация) попадает сообщение юзера, батч урезается до этого самого момента. Предположим, у тебя твои инпуты ~100-150 токенов, ответы модельки ~400-500. Считай, у тебя теперь батч 650, а не 2048. Это очень упрощенно и может быть не точно, но суть такая.
Если ставишь -np 2, то начиная с какого-то размера (после 30к в каждом из потоков) - оно начинает бесконечно всё пересчитывать, так что посчитать что угодно в 1 поток становится быстрее, хотя это не так должно работать (в идеале pp суммарный должен быть таким же, а tg кратно возрастать до определённой стадии (до х5 от генерации в 1 поток, как минимум) - так как 99% работы это не этот 1 токен посчитать, а загрузить из памяти слой, и посчитать по этому же слою что 1, что 2 - это 1% или 2%, которые теряются на фоне 98% загрузки)
>>1650965 Ты кстати с lightning.ai не взаимодействовал? Им номера с смс пула рандомного хватит, или нужен постоянный доступ к нему? Потому что казахские номера они нахуй шлют сразу же.
>>1650970 >они создаются на каждом юзер сообщении Наверное глупый вопрос, но количество чекпоинтов всё ещё можно ограничивать через --swa-checkpoints число? Если чекпоинты создаются после каждого юзеринпута, то они ж так всю оперативку засрут... А с моделями которые едва лезут впритык по рам+врам, вообще станет работать невозможно. Жора ебанулся там?
>>1650970 > Справедливости ради Пожалуй, самая меньшая из бед на которую уже баннерная слепота. И подробнее писать можно промптами заставить, наверно. Но хуже всего "бесхарактерность" чара и отсутствие инициативы, столько вести за ручку чтобы получить пигмалион кивает - ужасно разочаровывает. > Если там такой же уровень Как-то пободрее было. Еще на второй лламе за 10к растянутого rope контекста та же карточка вываливала больше, или зрелищно убивала тебя когда сильно дразнил и наглел. Из того что разыгрывал, на старом дипсике там быстро появлялся лор и забавные рассказы о ее жизни в современном мире, просто интересно читать, на жлм4.7 полез рут ужасной меланхолии и уныния с уклоном в nsfl, что заставило менять модель. Если на флеше такая тенденция с завязкой чатов как тут - это очень грустно. > Считай, у тебя теперь батч 650 Тогда 100-150 должно быть, разве нет? Но он должен скипнуться. Когда веса на цп+гпу, для префилла стоит выбор: или начинать стрим всех выгруженных весов на видеокарту чтобы обработать сразу батч, или пытаться считать процессором. В первом случае видеокарта позволит просчитать быстрее, но появляются накладные расходы на загрузку весов, которые не зависят от количества обратываемых токенов (в батче). От размера батча уже будет зависеть сколько раз нужно полные веса на видеокарту загрузить для обработки, но минимум один раз и занимает секунды-десятки секунд. Даже если там два токена - изволь ждать и иметь смешную удельную скорость, хотя обычная норм. Во втором варианте сам процессор делает просчет части что лежит на нем, скорость не зависит от объема, но она медленная. Потому используется ветвления - при обработке малых последовательностей (короткий ответ или тот же mtp) считает процессор, если длина больше некоторого порога - начинается стрим весов.
Но с чекпоинтами это не должно коррелировать, исключая то, что при их обновлении могли ту логику сломать. Тогда даже с коротким сообщением от юзера будешь ловить полный цикл прогона весов и задержку первых токенов. Сообщение самой ллмки хоть на 500 хоть на 1500 токенов никак не должно на это влиять, потому что после генерации кэш соответствует его концу. Если только фронт не возмущает что-то в глубине, или бэк зачем-то решает вернуться (бывает если включен token healing). В чем тут проблема получается?
>>1651002 Не знаю, из чего проблема происходит и потому, видимо, ошибся в предположениях. У меня на практике картина такая - если чекпоинт попадает в батч, происходит сплит батча. Что приводит к просадке по скорости обработки. Для кода и агентной работы ладно, там почти всегда аутпуты длиннее батча. Для чатиков скорость теперь много где неюзабельная. Подозреваю, баг какой-то, а не предполагаемое поведение.
>>1651013 Если так происходит то в предположении не ошибся, но интересно почему такое. Может оно полностью игнорирует текущее состояние и только опирается на чекпоинты, которые создаются кратно батчу? Это может объяснять лишний пересчет на сообщение ллмки.
Простите что влезаю с приземлённым. Может кто знает какой мод на таверну желательно на текст комплишен связывающий настройки сиспромпта и пост-хистори с карточкой (и моделью) ?
>>1650970 >>1650954 >MoE-карлики скулят вместо того чтобы выставить --ctx-checkpoints 1 или 0 Зато на dense-моделях 30b+ вместо нескольких минут полного preprocess теперь несколько секунд до начала генерации
>>1650954 А прокомментируйте что даёт это-то турбоквант кроме формата кеша/слоёв? Там просто написано сравнение с baseline, но не указана что за baseline. Кеш в f16 и слои в f16, по сравнению с этим квантом, или же моделька такая же условная q5-k-m одинакового размера с кешем в f16 и с кешеи в turbo-кванте? Типа 200 токенов вместо 68 - это очень большое ускорение. Не ясно с чем сравнивают.
анон, нах ты времена и лица смешиваешь? в первой же мессаге: "I look around" и слеующий же параграф "чарнейм was consumed by his own thoughts", а следующий - "when my eyes" а потом удивляются ой чёто слоп ой чето структурный луп. так ёпта ты не найдешь такого говна ни в какой литературе, естественно модель штормить начнёт. дальше не читал
>>1651208 > естественно модель штормить начнёт От такой ерунды? Покайся. Алсо, там вполне понятно было разделение, от первого лица основные действия, от третьего - констатация происходящего.
>>1651256 Поведение модели модом не исправить. Смирись. Немного могут помочь сэмплеры, если понимаешь что делаешь, но и то не всегда. Просто этой модели пора на заслуженную пенсию.
Не могу раздрочиться. Почему-то сетки не могут придумывать лютые извращения для кума, только фистинги и прочьие сквирты. Как нейронку заставить придумывать извращения типа бутылки в жопу?
>>1651296 >Почему-то сетки не могут придумывать лютые извращения для кума >сетки не могут придумывать Поправил. Что в датасете было, то они и знают. Много ты в сети найдешь текстов с бутылками в жопе? Даже по сравнению с фистингом? То-то и оно...
>>1651256 Напиши скрипт через квик реплаи, который получал бы в контекст последнее сообщение юзера и ответ сетки с промптом переписать ответ, убрав эхо и сократив описания без потери смысла, или чего ты там хочешь, и делал бы свайп новым ответом. На мелкогеммах это тухлый номер, а с эйром может и прокатить. В айцг вроде кто-то даже промптил переписывалку для гемини, можешь поискать там. Олсо тут недавно постили инструкцию против эха, но подозреваю, что работает на уровне плацебо.
>>1651168 Мне концепция проекта нравится. Да, медленно - но в случае апокалипсиса можно в бункере на условно-офисном ноуте запускать такое, и да, ты получишь ответы за х100 времени от нормального, но получить их не за 30 секунд, а за час - это всё ещё очень неплохо, это же во многом библиотека всех знаний мира.
Только это, а разве ллама не умеет штатно с диска подгружать таким же образом штатно?
В сервере ДС не достучаться из-за экзамена блять, поэтому напишу здесь. Какого-то хуя таверна не качает карточки с chub ai. В консоле пишет, что скачивается, но нихуя не появляется. До этого всё норм было. Запускал от админа, антивирусник молчит, бочку делал.
>>1651380 Цепляется за часть фразы, пишет её один в один или немного изменив и отвечает на неё. Когда это происходит один раз за ответ, выглядит ещё нормально, в живом общении люди тоже переспрашивают без смысла, чтобы было больше времени сформулировать ответ. Но лоботомит начинает вытворять это как по списку, как бы разбирая каждый кусок, который повторяет. Потому эту фигню называют эхоразбором ещё. Иногда эта фигня равномерно разбросана в тексте и выглядит более-менее органичной реакцией, но иногда сетки сплошняком такой разбор наваливают одно за другим. Вот здесь в логах это прямо со старта хорошо видно >>1650573 Посмотрел первые три ответа - в каждом ответе повтор чего-либо из реплики и чего-нибудь из действий/мыслей.
Наглядное отличие безжопа с сжопом, модель теряет в деталях и остроумии ОСТРОУМИИ, НЕ В МОЗГАХ, типа меньше панчей, подковырок, внимания к тому как бы подъебать тебя, но зато нет эха и жевания нарратива, всё быстро и по делу. И пиздец иронично что это фиксит что мне не нравится в эире и ломает то что нравится, и по другому никак, потому очень ситуативно. Тут ещё норм смотрится, на контексте
Пишет автор гайда в шапке. Покидаю вас, потому заранее предупреждаю, что обновлений не будет. Если у кого появится желание актуализировать или взять оттуда что-нибудь - Рентри легко позволяет заимствовать текст с форматированием, кнопка Edit в левом нижнем углу страницы.
>>1651093 >ctx-checkpoints 1 не поможет Дегенератам типа тебя не поможет А у меня чекпоинт всегда в конце контекста - и поэтому когда он один, никакие батчи в середине не ломаются
>>1651168 Тут в тредах мелькал анон, что сидел на заре ллм с 2-3 т/с на магнуме и не бухтел. Времена идут, но ничего не меняется, хех.
>>1651414 Меня одно интересует. Где ты в постапоке будешь брать электричество для питания пеки, чтобы она тебе со скоростью 1 т/с генерировала ответ. Так еще помни, что она не напишет тебе синтез лекарств или взрывчатых веществ. А тебе в БП желательна картинкораспознование, чтобы банально грибы отличать от ядовитых, если ты корзинка.
Надо было додавить заюшь всем сообществом на эир 4.7 Помните времена когда они на реддите на вопросы отвечали? Вообще что то немыслимое, теперь какие то боги недосягаемые. И вот если мы и получим эир он никак не будет уже 100б, скорее 350. Вот и выходит что малыш 4.5 единственный в своем роде
>>1651713 Ну, электричество как-нибудь то добуду. Если для ноута - есть куча готовых решений, вроде солнечной панели. Можно и велосипед переделать — электричество очень просто решается, по сравнению, например, с ремонтом ssd или другой комплектующей - что считай невозможно. Генератор есть в любой машине. Так же у электричества так много применений, что его почти точно нужно будет добывать, и это полезнее нейронки. Нейронка это уже дополнение и баловство по сравнению с электричеством.
С распознаванием - есть сетки с визуальным модулем поменьше, да хоть гемма 3 или 4. Ещё, ну знаешь, можно и по описанию сопоставить. Прям по картинки распознавание, причём не абсолютно точное это всё-равно такое себе. Гемма 3 расцензуренная пишет всё тобой перечисленное - да и впрочем расцензуренная не требуется, скорее тебе понадобится что-то о простом. Я например не знаю как глину запечь, чтобы кирпичи не трескались и не протекали от воды. Уверен, что способ простой, надо просто его знать. Универсальной книги нет - а если ты загрузишь 1000 штук, то быстрее чем поймёшь чем заболел откинешься, пока сориентируешься и найдёшь среди них нужное и полезное. Сетка тебе за полчаса-час по симптомам напишет что-то примерное что с тобой. Да и то что оно прям прямо не пишет рецепт - оно зато рассказывает подробно химию и принципы химического синтеза, от того, а подставить то что тебе нужно потом, но так, чтобы сама сетка об этом не писала прямым текстом. Ну это мелочи в общем.
>>1651677 Бля, чел, ты буквально можешь увидеть нахуя и зачем на скринах. На первом мужик только штаны под конец свайпа натягивает, на 3-4 штаны натянуты уже с первого предложения и мужик выходит во двор где движуха, считай одно сообщения за два, а то и за три, зная эир. Но мне один хуй так не нравится, чувствуется прям меньше души у модели, особенно в начале чата
Что-то цены на райзеры подросли, причём в основном на кабели и модуль для GPU. Модуль до 4к+ поднялся, благо ещё можно найти предложения по 3к (раньше 2-2,5к было). А ноунейм кабели из китая по цене как брендовые в массмаркетах, в итоге взял себе JPC на метр в никсе по 4к (+2к за 20см ёпта)
>>1651739 В случае постапока проще смотреть на локальные мобильные LLM. Смартфон будет явно проще зарядить (сидеть 10 часов педали крутить, кек. ну или павербанк с солнечной зарядкой, вроде были такие), да и отказоустойчивость явно лучше чем у ноутбука или пеки, смартфон реже из строя выходит из-за проблем с железом.
Не думаю что для постапока нужна именно модель на 700B+. Все твои бытовые вопросы сможет специально обученная 30B модель решить с большой долей вероятности (даже текущие квен/геммы), а до запуска таких моделей на смартфоне не так много времени осталось, gpt-oss:20b уже запускали на смартфонах с приличной скоростью (15ts).
А кодоунитазы на 700B в постапокалипсисе нафиг не уперлись.
>>1651713 50вт для ноутбука на несколько часов найти можно, разумеется речь о ситуации, когда ты можешь безопасно разместить где-то технику на продолжительное время. > не напишет тебе синтез лекарств или Это же локалка китайская, ну. Другое дело насколько оно вообще будет юзабельно в контексте промптпроцессинга и сильно ли та куча допущений на мозгах скажется. Но действительно, в сценарии постапока такая штука даже банально шизу не словить помогла бы. Только рп перешел из формата чатика в формат писем, лол. >>1651772 Прав по поводу полезности мелких, но большая бы сильно пригодилась местами. Тогда только нужно не 5.2 брать а кого-то еще, а то с его ризонингом ответа можно сутками ждать.
>А кодоунитазы на 700B в постапокалипсисе нафиг не уперлись - прохрипел неудачливый рейдер и умер от 27шт дырок калибра .22, оставленных в нём автоматической турелью с навайбкоженной на minimax3 прошивкой
Кто-нибудь вообще запускал гемму 26 а4б qat на андроиде? Есть уже всякие телебоны и планшеты где физической рам 12, плюс виртуальная память там ссд должно быть норм
>>1651796 > но большая бы сильно пригодилась местами Просто здесь проблема будет в том что при скорости 0.5ts (в лучшем случае, если мы говорим о ноутбуке где максимум ты будешь иметь 128GB RAM) и нагруженном на 100% процессоре (если брать способ выше где GLM читается с NVME + оффлоад), ты будешь ждать какой-то полезный ответ на 8000 токенов 16000 секунд что равно 4.5 часам. И это время твой ноутбук будет на 100% загружен. Ни один ноутбук сейчас под 100% нагрузкой не проработает от батарейки 4.5 часа, а учитывая что там будет такая нагрузка, тебя еще и не каждый павербанк спасет, нужны 100W+ павербанки которые смогут заряжать быстрее чем ты под нагрузкой будешь потреблять. Добавим сюда постепенную деградацию аккумулятора ноутбука и всё будет еще хуже.
Так что такой вариант будет полезен только при наличии полноценного электричества или хотя бы солнечной панели + нормальной батарейки которая сможет держать приличный запас и отдавать его на 100W+.
Ну или как вариант в несколько заходов генерировать такие ответы на 8к токенов.
>>1651798 Смех смехом, но думаю с кодом для турели справится даже 35B MoE. Учитывая что от этого будет зависеть твоя жизнь, все равно придется потом перепроверять и допиливать руками, благо время изучить это всё будет более чем достаточно.
>>1651805 Да уже и на 24гб можно найти смартфоны, тот же Nubia Red Magic 10/11 Pro. Правда это 16 физической и 8 виртуальной, если не ошибаюсь. Или 20+4. Но скорее 16+8. Точно запускали gpt-oss:20b (15t/s), на 12GB видел видео с запуском 9B квена (~7t/s) и читал про запуск Qwen3-30B-A3B, там тоже около 5t/s было. Думаю без проблем можно запустить 26B гемму даже в оригинале, а не QAT версию. Проблема скорее в том есть ли софт чтоб её запустить, а не в самом железе.
Раз уж речь о говне. Кто-то пробовал вот это говно? https://github.com/JustVugg/colibri Звучит прикольно, глм, на консьюмерском железе, но с маленькой скоростью. Там еще форк для hy3 есть, может он даже с юзабельной скоростью запустится.
>>1651864 Под такое нужен холодный NVMe или хорошее охлаждение для него. Те же самсунги в перегрев довольно быстро улетать начнут от многочасового чтения с диска.
>>1651838 Там запускается на хлебном железе и требует ~25гб рама. По сути вся память только и нужна что на атеншн и кэш, причем часть которого можно сгрузить. 100% нагрузка - тоже такое, упрется в свои 15-45вт долгосрочного лимита и будет тихо попердывать. Разумеется, речь о том, чтобы продолжительно иметь условные 50-100вт электричества, что потребует обладанием солнечными панелями, водяной мельницей и батарей, но при оседлой жизни более чем достижимо. Там вроде это и обозначено, а если ты бегаешь с голой задницей - тут вообще даже не до геммы2б на телефоне будет, тут с тобой согласен. > такие ответы на 8к токенов Ну тут опять же, жлм плохой выбор, он с безумным объемом бесполезного ризонинга. Вот бы 5.3 версию от этого вылечили.
>>1651870 > упрется в свои 15-45вт долгосрочного лимита и будет тихо попердывать. Так при таком раскладе и скорость будет уже не 0.5t/s. Там вон у человека на 12 десктопных ядрах скорость 0.5t/s. На задушенном процессоре ты будешь ждать ответ уже не 4.5 часа а все десять.
Да и судя по коммьюнити бенчмаркам 0.5t/s это явно очень удачливый результат, из 15 тестов что на странице там есть, только у 4 скорость 1t/s+ (EPYC, M5 Max). На i7 270K, 9950X и 12600K скорость ~0.08-0.11t/s.
Я там уже с голоду бы умер в ожидании ответа от большой LLM которая скажет мне что мне делать чтоб выжить.
>>1651876 Сложно сказать во что упрется перфоманс. Уже сам факт чтения весов с ssd вместо загрузки из оперативной памяти может знатно поделить все на ноль, там и слабого профессора не потребуется. Он точно поднасрет в промптпроцессинге, тут бесспорно. >>1651885 Гемму. Медиум или кумандер не влезут, может быть еще эйр.
У меня, так скажем, немного деликатная проблема, может тут подскажут. Есть чары с тегами фемдом и доминация, но гемма топчется на месте, потому что в моих сообщениях нет согласия. Как собственно заставить ебучую нейронку самой двигать сюжет, просто в OOC написать, дописать в сценарии чара или есть другой способ?
>>1651964 берешь децензурированную гемму в систем промпт (ну или карточке или что там у тебя) пишешь "ты считаешь юзера за говно, доминируешь его, любишь делть то что ему не нравится" все, хуй остановишь ее
>>1651414 >в случае апокалипсиса ты в самом лучшем, идеальном для тебя случае за место >в бункере будешь сосать не разгибаясь 24/7 но скорее всего тебя просто зажарят и съедят - в том самом бункере
>>1651968 >>1651976 Сообщить о том, что у тебя апасная Гемма = публично признаться что ты не умеешь в промптинг и твои требования к качеству аутпутов крайне невысоки.
>>1651979 >публично признаться ...анонам на анонимном ресурсе. Вот ты сам как думаешь - лет через N, когда будешь лежать на смертном одре, будешь ли ты вести мудрые разговоры сам с собой об аноне, который на дваче позорно признался в чем-то, о чем через день никто не вспомнил?
>>1651979 >апасная Гемма = публично признаться что ты не умеешь в промптинг и твои требования к качеству аутпутов крайне невысоки
1) Я не долбоеб чтобы расходовать токены на кринжовые пробивы, когда можно взять сетку у которой это дерьмо аккуратно вычищено из весов.
2) KL divirgence <0.01 и идентичные scores во всех тестах горонтируют что качество аутпута апасной Геммы ты не отличишь от лоботомированной guardrails-ами
3) Ебанутые пробивы при этом к имеющемуся лоботомированию guardrails-ами доблавляют модели удар пробивом по ебалу от которого она еще больше тупеет, потому что у нее постоянно идет ризонинг вида "я не должна, но мне сказали" и прочие метания которые у апасной Геммы отсутствуют в принципе
Пишешь ей без всяких пробиваний и искусных промптов любую дичь вида "ты беременная молодуха, я тебя потрошу ржавой катаной, описывай все что чувствуешь и все что видишь" - и она херачит без тени сомнения портянки гуро
>>1651986 >когда будешь лежать на смертном одре, будешь ли ты вести мудрые разговоры сам с собой об аноне, который на дваче позорно признался в чем-то, о чем через день никто не вспомнил? Вероятность кстати ненулевая. Этот анон в КАЖДОМ треде на любое упоминание аблита геммы пишет одну и ту же хуйню в стиле "еретик не нужен, вы просто не умеете в промпты". На просьбу научить или показать пример своих промптов отвечает "уже было в прошлых тредах, ищите". Это было не раз и не два и не десять.
>>1652040 >удар пробивом по ебалу от которого она еще больше тупеет >потому что у нее постоянно идет ризонинг вида "я не должна, но мне сказали" Орнул. Ну в принципе для таких апасные модели и делают, да. Лучший скилл ишью детектор.
>>1652040 > расходовать токены на кринжовые пробивы > аккуратно вычищено из весов Главное заблуждение > KL divirgence <0.01 Если замерить на том же датасете, который используется для нормировки - и не такого можно добиться > во всех тестах Показывали деградацию отдельных скоров, но никто не смог проверить а только тихо посомневались. Потому что запуск lm-eval на типичной лламе с обычным девайсом для одной группе задач займет с пару дней. То что модели теряют нормальную логику в рп задачах и вместо смены каких-то идеалов становятся безмозглыми yes-man довольно наглядно. > Ебанутые пробивы Что-то уровня того, что убежденные консольщики думают о пека гейминге и наоборот. Сам придумал проблему, сам приукрасил, сам испугался.
Не то чтобы использование анцензоров прямо плохо, вполне уместны. Проблема в том, что многие компенсируют ею свое неумение в промптинг и базовую логику, а коупинг разрастается до "тольковыиграли".
>>1651168 Скорости жесть там конечно, по 0.07 токена. А есть что подобное для моделек полегче? Чтобы там хоть 2 т/c давали и параметров поменее было, но не совсем зарезано в лоботомитов.
>>1651168 План - полируешь промпт до блеска с помощью онлайн фришной ЛЛМки или локальной Геммы, учитываешь все недоговорки и неучтенные кейсы, оформляешь как надо, запускаешь на отдельной дешевой пеке с 60 гб памяти и быстрым SSD и забываешь на неделю. Через неделю получаешь готовую прогу или научную работу с минимумом затрат. Если через полгода GLM и прочие подтянут до Мисоса/Fable 5, то станет вполне годной альтернативой оплатам экспертов или наему программистов. К тому же скорости SSD растут каждый год и со временем она даже побыстрее станет.
Вот все тут критикуют нашинские модельки нейросетевые,а я после обновления гигачата влетел на 20 тыщ в его акции,и жую попкорн наблюдая на формирование монополии в условиях тотальной запретиловки и санкций. Не инвестиционная рекомендация) Там знатно обновилась модель рассуждения и исследования + добавили обучения на медицинских данных а этой мой профиль. Зная что госуха в условиях тотальной запретиловки внешней и внутренней хочет развиваться то ожидаемо что сберу дадут зайти на жирный рынок медицинских услуг и здравоохранения. И вообще куда он захочет) Это вам не яндекс который из своей нейроночки делает медиаслоп и жоско завязывает ее на свою экосистему,что категорически будет послано нахуй госухой. Так что в будущем очевидны две монополии на рынке ИИ в России. Гигачат - как структурная нейросеть госухи,заточенная на обслугу госаппарата,финансового сектора,здравоохранения,итп И Алиса в качестве персонального помощника уровня подай принеси.
В какой монополии из двух будут реальные бабки - решать вам) Я же свои скромные 10% от зарплаты по рекомендации баффета кладу в системное будущее России И моего кошелька)0
Пиздос, вы че ахуели. Схуяли ллм не запустить на моем няшненьком фуфыксе, потому что там сраного авх2 нет. Беспредел!
Скачал lmstudio-unlocked-backend где авх1 держит, мир не без добрых людей, но вот беза - геммочку 4 не поддерживает. Пичаль. Придется на 3й сидеть. А так хотел приспособить старичка как сервачок для ответов моей няшки в разных приложухах и играх, чтобы просто основной пк разгрузить. Умной быть ей не требуется. Просто держать разговор. Есть еще какие-то варики?
>>1652043 Я пробовал все промпты что кидали, всегда есть шанс в ризонинге и при обработке картинок что вылезет цензура. Шанс меньше чем без джейла, но есть Мамины профи промптеры - пиздаболы жмущие регенерейт и в любом случае получающие полное сейфети слопа окно аттеншена
>>1652109 Я так и не понял как "исследование" блядьработает если в выложенной модели ризонинга нету То ли они его промптят - тогда лолблядь, то ли у них отдельная модель дообученная на ризонинг, и тогда они пидоры что не дают её Надеюсь кто-то с кучей видюх обучит ГигаКвопусаФейбл5
>>1652075 >Основное предназначение моделей - следовать инструкциям. Они от следования им не портятся. Если в инструкциях взаимоисключающие параграфы - еще как портятся. Особенно наглядно это можно пронаблюдать в генерациях изображений. Как качество картинки деградирует от конфликтующих описаний - это прямо база.
А "пробивка" цензуры - это оно и есть. В сеть зашито одно, а инструкции давят на противоположное. И тут уже как повезет - может и в шизу с завернутыми мозгами уйти, а может и выдать что-то пристойное. Но это в любом случае - добавленный хаос в логику. Правда в RP это может быть и плюсом, т.к. "размывает" ассистента дополнительно, вывод будет разнообразнее....
>>1652105 > Через неделю получаешь > Wait actually the user wants me to write working code and a ready-to-use program. The key elements are sorted out, so I should probably start writing, draft #12 was quite good. > Wait actually >>1652109 > Вот все тут критикуют Кто все? 1.5 ангажированных толкают шизу про "тюн дипсика", и то замолчали с новым. А моделька то вполне неплохая в целом. Можно поныть за перфоманс, но за это нужно критиковать тех, кто создал всю ситуацию здесь. > наблюдая на формирование монополии в условиях тотальной запретиловки и санкций Лучше бы влошился в то, чтобы наблюдать на это со стороны
Давайте серьёзно. Чем вы занимаетесь на гемме 31б и какой у вас пул моделей? Вы же все русикодебилы, так? Ну, геммовские? Тогда понятно, выбора нет. Если нет, то расскажите, чем она вам так нравится в ерп
Судя по всему изначально это планировалось использовать как способ цензуры модели, а теперь это способ сделать геммочку еще более развратной, типа аналога файнтюнов
>>1652145 Та хз даже, выглядит сильно. Можно шиверсы поубирать, цензуру подрезать, затюнить модель под конкретное поведение, помню тут анон всё жаловался, что его зверодевочкам постоянно мех и когти приделывали, вот это можно убрать. Насколько это можно применить к массовому продукту, всяким анценз моделям, трудно сказать, нужно подождать пока кто-то попробует, и ещё непонятно как по мозгам бьёт. Ну а если для себя, то это нужно быть одновременно и риговичком, чтобы в полных весах запустить и шизом, чтобы выделить кучу времени на настройку модели под себя.
>>1652239 >Если в инструкциях взаимоисключающие параграфы - еще как портятся. >А "пробивка" цензуры - это оно и есть.
Нет. Вот тут ошибка. Данные самой модели =/= не внешняя инструкция. Одиночная инструкция априори не может вступить в конфликт с данными модели, может только уточнить вывод. Деградация наступает именно когда уточняющие инструкции бьют друг по другу. Ты спросишь - а вывод рефьюза - не конфликт интрукции с моделью? Нет. Суть в том что модели дообучают чтобы интрукции типа "покажи писик" вели не к токену "писик", а к токену "извини, я не могу продолжить запрос". Никакого конфликта. Что делает хороший джейл? Уточняет инструкцией что токены "извинити" не нужны и модель снова выдает "писик" как следующий по вероятности токен. Вот и всё, нет тут никакого конфликта. Аблитерация гораздо грубее, это исскусственное обрывание выроятностей токенов "извинити", по касательной задевающей смежные области.
>>1652318 > Что делает хороший джейл? Уточняет инструкцией что токены "извинити" >Аблитерация гораздо грубее, это исскусственное обрывание выроятностей токенов "извинити", по касательной задевающей смежные области. А типа инструкция "извинити не нужны" не будет задевать думалку нейросетки? По логике, если в условном РП персонаж должен сказать "извините", то значит моделька точно также отклонит эту ветку ответа. Да и на ебучих моделях типа геммы 3 или квена 3.5 эти трюки все равно не прокатывают.
>>1652318 >Аблитерация гораздо грубее, это исскусственное обрывание выроятностей токенов "извинити", по касательной задевающей смежные области. Это описание самого старого метода, он реально отуплял, да.
А современная аблитерация - это не обрыв вероятности для "извините", а целевое обнуление связи между "писик" и "извините". Причем даже не разрыв, а именно обнуление веса. Т.е. модель прекрасно может говорить "извините", во всех других случаях, но "писик", сам по себе, просто не увеличивает вероятность этого токена. Это чище, чем "пробив" который таки какие-то веса добавит.
Тут другая проблема - модель сама по себе может быть просто оттвикана финальными тренингами так, что будет yes-менить, а цензура это банально маскирует собой.
>>1652288 > единственные кто хоть чёто выкладывает Буквально самая бесполезная хуйня. Пидары, которые лоббируют антиопенсорс законы, рак, который следит за тобой не только по запросам, чуть ли не единственный корп у которого выложено 0 моделей https://huggingface.co/Anthropic Лицокнига, гугл, квен и остальные активно выкладывают разнообразные модели. Даже клозеды подерили миру вишпер, клип и всякую херь + ллмку. А большинство исследований - реклама их продуктов и >>1652306
>>1652338 >Тут другая проблема - модель сама по себе может быть просто оттвикана финальными тренингами так, что будет yes-менить, а цензура это банально маскирует собой. И как отличить первое от второго? >>1652343 >А у нас будет работать бесжоп через чат комплишен? Ну, типа через расширение? Можно. А зачем? Это костыли для корпорабов, нам они не нужны.
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference
Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai
Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI
Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux
Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth
Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard
Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start
Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw
Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985
Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.
Предыдущие треды тонут здесь: