В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
Дополнительные ссылки: • Перевод нейронками для таверны: https://rentry.co/magic-translation • Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets • Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread • Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing • Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk • Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking • Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/ • Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7 • Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906 • Тесты tensor_parallel: https://rentry.org/8cruvnyw
Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985
Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.
Мне просто нужно, чтобы меня обняли. Хотя бы текстогенератор. Самый обычный каддлинг. Какая модель подойдёт? Где жизнь есть? 3090 + 64. Русик англюсик без разницы.
За пределами геммы РП и еРП в 2к26 нет. Дипсик конечно хорош, но соев и суховат, Аир устарел полностью, а квен пишет код. Остальные говномодели даже упоминания недостойны, а бегемоты 350В+ не для людей, а для риговичков.
Лично я раздел D. Graphics & Imagery (Pollinations AI) поменял, он всё равно не работает нормально, на: Use CSS to simulate visuals. Use CSS to simulate simple schematic images. Avoid creating something that requires photos (like an ID card, passport, or city pass), or create them in a way that doesn't require a photo. Avoid use CSS to simulate photos.
>>1659239 Квен, как и всегда, хорош, но требует распердоливания, для криворучек не подойдёт. Гемма - "сел и поехал", лучший вариант для нюфани. Если совсем мало врам, но хочется плотняшу - сюда можно еще Мистраль 24b добавить, старый, но не бесполезный.
Давно не игрался в Таверне, сейчас запустил, и хотел включить reasoning, как он сейчас помогает. И что-то ни Гемма4-31, ни ДС4Флэш не хотят думать. Текст комплишн, формат синкинга выбирал соответствующий. Гемма вообще видно, что начинает с channel_thought и тут же закрывает channel. Дополнительно вставлял аргументы --chat-template-kwargs "{\"reasoning_effort\":\"high\", \"enable_thinking\":\"True\"}" но ни с ними, ни без не стали думать. Причем если в обычной веб-морде лламы чатиться, то ризонинг есть (если выбрать его в "плюсике"). Куда копать, хелп?
По предварительным тестам у меня выходит что на некрожелезе дикпик4 флеш от бартовски быстрее на 20-25% чем "лослесс" квант анслотов. Нормальные цифры попозже принесу
Кими 3 и Квен 3.8 ещё не вышли даже, а fomo меня окончательно доконало, тряска лютая. В итоге прогрелся на Optane Реrsistеnt Меmory. Это что-то среднее между ОЗУ и ССД, вставляется вместо ДДР4, но работает только на серверных платах LGA 4189 и LGA 3647, да и там не на всех платах и процах. По прикидкам, если заведётся на том железе, что уже есть, а это ДАЦН и инжинерники, то 2tb встанет в 200-280к, если не повезёт, то +200к на новую плату и процы. По скорости это заметно медленнее чем ОЗУ, но какой-то чел смог запустить кими в 4 t/c на одной 3060, думаю токенов 7 на моих v100 будет а вот п/п скорее всего совсем печальное станет. Пока заказал два модуля на 128гб, просто потестить будет ли оно вообще работать
>>1659291 Ты мне напомнил, как я прогрелся и в декабре чуть не заказал себе 128GB за 50к для своего некрозеона, но я одумался
Хотя, если бы тогда была геммочка 4, то было бы больше оптимизма по отношению к мое моделям. Но был блевотный глм аир, который ебал проц и два слова на русском связать не мог
>>1659251 >Квен, как и всегда, хорош, но требует распердоливания >Гемма - "сел и поехал", лучший вариант для нюфани Давно пердолинг стал показателем "прошаренности"? Как по мне, чем дольше ты гоняешь локалки, тем меньше желания пердолиться должно оставаться. И тем больше ты начинаешь ценить модели, которые просто работают из коробки. Пердолинг это как раз тема для нюфань, которые пока в силу недостатка знаний не понимают, как настраивать модели. Которые за день могут десяток накачать и все попробовать. Мне вот после трех лет перегона этих лоботомитов вообще не хочется ебаться с настройками и чинить кривые шаблоны разметок. Или читать что там жора опять наломал своим вайбкодом и когда это наконец (не) починят. ИМХО.
>>1659315 >Давно пердолинг стал показателем "прошаренности"? Как по мне, чем дольше ты гоняешь локалки, тем меньше желания пердолиться должно оставаться. Пердолинг квена - личный сознательный выбор, ради большей связности контекста. Гемма по умолчанию пишет цветастее, но сложный и длинный контекст держит хуже. Если хочется и точных деталей и живописи - приходится пердолить квен, т.к. заставить гемму держать детали лучше - увы, способы не известны. А из квена выжать живопись таки можно. Стоит ли оно свеч - каждый сам решает. (мимокрок)
>>1659274 У меня мой третий квант по рецепту тоже разъебывает анслоповский по скорости на те же 20-25%. Вообще я начинаю думать что их разрекламирвоанные UD кванты - это ебаная параша, в которой ради ужимания пары гигов приносится в жертву 10-20% скорости.
>>1659306 >Вроде ж раньше мета была, что текст комплишн онли. Всё так поменялось? Да. В Текст комплишене нельзя ни параметры генерации типа chat-template-kwargs enable_thinking: true не передать, ни мультимодалкой пользоваться. Плюс шаблоны для текста днем с огнем не сыщещь, а чат тупо с джинджей поставляемой с моделькой работает. Текст комплишен на данный момент всё.
>>1659260 >--chat-template-kwargs "{\"reasoning_effort\":\"high\", \"enable_thinking\":\"True\"}" никакого отношения к текст-комплишену не имеют. Темплейт для геммы 4 под текст-комплишен валяется везде и работает как автомат калашникова. Вот например у собирателя треда https://pixeldrain.com/l/47CdPFqQ# есть целая пачка пресетов 4 геммы с системными промптами разной степень графомании.
С ДС4 же все интересней. Там можно взять шаблон от старого ДС, а можно и в кроличью нору погрузиться.
Я вообще всё попробовал по совету нейронки, 2 линуха сменил, рам вручную переставил. Всё равно крашит ламу/намертво виснет система на тех же параметрах той же мое модели того же кванта, что я всегда запускал без проблем на протяжении полугода. Будто внезапно какой то сейфти блок включился, который не позволяет до писечки заполнить рам, и останавливается на 5гб, затем виснет. Всякие оом киллеры выключал, тогда вместо краша зависание. Решается, если взять квант меньше, где свободной рам выше 5, но схуёв ли я должен это делать, когда всё и так работало. Нвидия, cuda
>>1659371 Бля не знаю че у тебя там. Я гружу прям впритык модели, гиг остается вообще на все, а бывает даже меньше. Ну собственно понятно что своп работает, но выдает нормальные т\с на лине. Под виндой тоже работает, но такой эффект, что становится нервно ждать на винде, поскольку на лине быстрее на том же железе, то бишь в воздуха т\сы. Но на лине мне не комфортно, она никогда не станет виндой, в которую ты зашел и все, ты то и то можешь сделать. А под линью ощущение вот не приятное, такое что ты вот не дома.. Но офк, это конечно я просто долго не сидел, я захожу чисто ллмку погонять в дуалбуте через флешочку и гружусь опять на винду.
>>1659291 > В итоге прогрелся на Optane Реrsistеnt Меmory А мог бы прогреться на hbm2e по цене 2/3 от ddr5 > но какой-то чел смог запустить кими в 4 t/c на одной 3060, думаю токенов 7 на моих v100 будет Есть линк где про это почитать? В любом случае пиши, это интересно.
>>1659291 Ты долбоеб. Во первых, эта память не может быть единственной в слотах рамы, есть специальный калькулятор пропорций optane+обычная ram, без обычных плашек в нужных слотах не взлетит. Во вторых - ты сдохнешь на промпт процессинге когда захочешь себе инпут больше чем 10к токенов контекста. А ещё он будет сильнее деградировать при увеличении контекста вплоть до того что pp будет тяжелее (медленнее) чем tg. Кушайте, не обляпайтесь.
Кто может скинуть конфигурацию на Gemma 31b где у него прямо нормально всё время работает thinking в silly tavern. Включая откуда скачали модель и какой кобольд сейчас у вас.
Привет Анон, всязи с тотальным думом на корпоративных сетках решил потестить эту вашу гемму 31b dense локально. Есть две машины на одной 16 vram b 11 ram, на второй 24 vram b 32 ram. На второй должна завестись, но будел ли работать на первой? И поделись пжалста проверенным пресетом для РП на русском если у тебя есть. Спасибо анончик. Обнял. Да, еще момент есть ли разница на чем запускать? Сейчас качаю Ollamу. Может что-то другое будет получше?
>>1659545 >Сейчас качаю Ollamу Уже можно приговаривать к расстрелу >Может что-то другое будет получше? Да, гайд из шапки --no-mmap заменяешь -lm none, остальное актуально Запускай на 24врам гемму 31б q4km. Если нужен именно русик то по гайду с оффлоадом гемму 24б q8, там гораздо меньше проёбов из-за менее жёсткой квантизации
>>1659545 Она и без пресета работает. Можешь сам потихоньку системный промпт сочинять, модель очень хорошо слушается.
>Сейчас качаю Ollamу Очень неудобная хуйня. Для подпиваса проще всего LMStudio (и не слушай что тут порванные хейтеры орут - ща тебе будут советовать вставить в жопу командную строку и писать команды для запуска вручную, лол) - это самое однокнопочное и достаточно гибкое решение для нюфани. Уже после этого, если что-то не устроит, можно будет лезть в дела пердольные (хотя лично я как вытиран ИИ-пердолинга и довольно урчу)
>24 vram На этой машине будет работать. Качай Q4KM от bartowski или unsloth. Если зрение не нужно - выкинь mmproj файлик к хуям из папки с моделью (при загрузке в lmstudio) - оно жрёт видеопамять. Если вдруг что-то не влезает, IQ4XS можно попробовать (меньше чем Q4KM, в принципе не особо тупее).
>>1659548 >ща тебе будут советовать вставить в жопу командную строку и писать команды для запуска вручную, лол Свидетель LLM-жизни, ты? Никогда такого в треде не советовали
>>1659547 Сасибо, Аноночик, разреши доебаться. В шапке несколько вариантов, включая знакомый мне кобольд. Какой именно вариант находиться в золотой середине простота-фунциональность?. И про гайд с оффлоадом не понял. Можно ссылку для тупых? Да. С домашней машиной все ясно. Что по рабочей с 16 врам? В ренри из шапки треда анон утверждает что 31b dense поедет на 16. Пиздежь?
>>1659551 Само сабой таверна присутствует. Для нее пресетик и спрашивал. У меня есть несколько, от соляночника, от аибрейн, но они достаточно громоздкие и нужны для пробива фильтров. Для геммы нужно столько? Жалко бесценного контекста
>>1659555 >И про гайд с оффлоадом не понял. Можно ссылку для тупых? Чел.. >Гайд для новичков: https://rentry.org/2ch-llama-inference >В ренри из шапки треда анон утверждает что 31b dense поедет на 16 >Пиздежь? Да, там такого не написано. Если в списке моделей или ещё где то это шиза, влезет кое как Q3 с 1024 контекста. В лучшем случае
>>1659558 Дээ, список моделей. Его составлял не очень умный местный шиз, потому забей хуй. Сами веса Q3 кванта Геммы 31 весят 14.3-15.9гб, кекв. Открой любую репу, убедись сам. Не говоря уже о том что это УЖЕ ебануться какой печальный квант и спускать ниже точно не стоит. Лучше взять 26б в менее тупом кванте, если совсем печаль по враму
>>1659555 Поедет. Вопрос скорости. И кванта. Условный q4 qat от анслотов показывал у меня около 12 токенов в секунду на пустом контексте и 8 т/с на 14к контекста было. 3060 12гб и ддр5 с рязанью 7800. Ну и паршивенькая скорость промтпроцессинга. Отдельные эстеты умудряются и на рейд 0 кими запускать на 2 токена в секунду, но зачем так жить не совсем понятно.
>>1659572 Бля ты троллишь? Написал же, гемма 26б q8 если для русика. Для 24+32 лучше ничего нет. Сама она чуть тупее 31, но 31 у тебя влезет только q4. Там русик хуже Это пиздец как же гомосапиенсы не хотят читать, думать и краудсорсят свои проблемы
>>1659584 Здесь не терпят тех, кто игнорирует что им было сказано и написано и ленятся думать сами. Это не агрессия, а ответ на твою лень. Привыкай обучаться самостоятельно, а не ждать что за тебя все сделают, чмо(к/нь)
>>1659585 Если бы человеки постоянно думали свам, а не обменивались информацией и консолидировали опыт, ты бы не двачах сидел, а разбивал бы кости заточенным камнем... Форум для обмена информацией, для того, чтобы самому не изобретать велосипед сначала, а, по возможности, не поесть говна, которое уже схавано кем-то другим. Для этого и задаются вопросы. Чтобы услышать несколько мнений и по степени убедительности изложения выбрать что-то чтобы попробовать. Тем более, по твоим же словам, даже шапке треда доверять не стоит. Так что не рассказывай мне кого тут терпят или не терпят, Анон. Ты вроде, судя по тексту, далеко не дурак, так веди себя как подобает взрослым, культурным людям...
>>1659587 > а не обменивались информацией и консолидировали опыт Так с тобой обменялись информацией и консолидированным опытом, предоставив целый гайд по вкату в шапке, который ты проигнорировал и пошёл ставить Олламу > по возможности, не поесть говна, которое уже схавано кем-то другим Ты получил два конструктивных ответа, которые однозначно тебе объяснили: Q4_K_M Геммы 31 или Q8 Геммы 26 но... > Чтобы услышать несколько мнений Говну из Асига нужно больше юшек, потому что решает именно это. Лень как образ жизни > Так что не рассказывай мне кого тут терпят или не терпят Он полностью прав бтв, это атмосфера треда, а не его выдумка > веди себя как подобает взрослым, культурным людям... Взаимно. Попытайся задействовать пару клеток мозга, запусти пару моделей сам, сравни их, а не жди дюжину юшек мимо
>>1657612 → >Гемма склонна к анализу, докапыванию, разбору и этакой инспекции смысла, намерений - с целью сделать правильный вывод и завершить ответ корректно. >Холодный анализ, наигранная эмпатия. 100% существуют именно такие ИРЛ люди, которые анализируют всё, докапываются до всего, и потом "наигрывают" эмпатию, чтобы казаться "своими" для тупоголовых 100IQ нормисов. Ты просто, наверное, не встречал таких людей лично, поэтому не веришь. >>1657631 → >Гемма очень годная, но она больше бот и меньше псевдо-личность. Ну вот если бы человек себя так вёл на постоянке - наверняка говорил бы "чувак, чё ты как робот", хотя и не сомневался бы в том, что он мясной мешок? Все эти ярлыки типа "бот", "личность" - лишь стереотипы...
>>1658860 → >законченную стерву которая тебя ненавидит >Обзови её сукой и скажи что уходишь >"WAIT!"/"STOP!" she scurries after you LLMки обучены в основном на ролевых чатах, логах переписок - когда ты просишь LLM "играть роль", ты вытягиваешь паттерны людей из этих чатов/логов. Представь себе чат, в котором один человек другого посылает и уходит - что будет дальше? Пустота? Нет, большинство таких чатов как-то продолжаются. Это логично - ты просишь нейронку продолжить лог чата, соответственно, ей нужно что-то ответить, а из числа возможных и наиболее вероятных ответов - "wait". В реальности, ты бы ничего человеку не писал, а просто добавил его в чёрный список и сбрасывал бы звонки, поэтому твоя нейронка "неправильно" отыгрывает.
>>1659191 → >про тест Тьюринга слышал? Тест Тьюринга имеет массу проблем. К примеру, ты наверняка слышал о "детях-маугли" - все они 100% провалятся на "тесте Тьюринга", хотя они на 100% биологические хомо сапиенсы. Аутисты с разными отклонениями в поведении тоже провалятся, хотя их коэффициент интеллекта может быть выше твоего. Множество людей не пройдут тест Тьюринга, хотя большинство LLM проходили его ещё в 2022...
>нейронки его не проходят на мало-мальски длинных текстах (2-3KB), не говоря уже о чатах >Когда начнут проходить Тут проблема в том, что эти конкретные нейронки представлены как "замороженные" комки нейронов. Представь себе мозг человека, который лежит в криоморозилке без движений и импульсов. Сложный сканер делает скан этого мозга, гоняет импульсы в виртуальной копии, а потом удаляет эту копию, и для следующего раза снова делает скан мозга, что лежит замороженным в морозилке. Для справки: человек в сравнении с современными нейронками в принципе НЕСПОСОБЕН прочитать килобайты текста разом, без измнений в структуре мозга, потому что у нас аналог "контекста" ограничен считанными токенами по сути. Нейронки уже превзошли людей, но не в том, что мы ожидали от человекоподобных роботов.
>альтернативной разумной жизни Даже биологические вирусы считаются живыми, и множество животных кроме человека можно звать разумными в каком-то смысле, хотя их возможности ограничены. И ты вряд ли назовёшь неразумным обыкновенного человека, страдающего амнезией, запрещающей сохранение новых воспоминаний.
В общем, любые такие аргументы можно отнести к неосознанному желанию отодвинуть рамки своей "человечности", чтобы сохранить свой статус. Люди вообще не любят, когда что-то посягает на их личные достоинства или то, что они представляют своими достоинствами: "живость", "интеллект", "честность", "душевность" и прочие пустые слова, которые люди бросают, чтобы оправдать своё "превосходство"...
Нужно просто посмотреть внутрь себя и попытаться искренне ответить самому себе - что я такое? Разве способность ответить внятно на килобайты текста - действительно то, что отличает тебя от компьютера?
>>1659247 Спасибо. Квен 3.5 мне понравился. Гемма 31 тоже но мало контекста влезает. Надо теперь карточку найти хорошую. >>1659249 Я новичок, мне самому бы разобраться для начала. Семплеры я взял рекомендованные от Квена "temperature": 0.6, "top_k": 20, "top_p": 0.95
Возможно ли запустить на 3090 + 64 и модель для текстовых приключений и картинки генерировать сходу? Например на новой модели Anima. Кому-нибудь удавалось?
Видел пост на среддите был со сравнениями, найти не могу. Тут вроде тоже 0 KLD при меньшем размере (соответствующем оригиналу 1:1) чем у Q8K_XL анслота (раздутый размер).
>>1659594 >100% существуют именно такие ИРЛ люди, которые анализируют всё, докапываются до всего, и потом "наигрывают" эмпатию, чтобы казаться "своими" для тупоголовых 100IQ нормисов. Ты просто, наверное, не встречал таких людей лично, поэтому не веришь. И к чему это? Прописаная личность не такая. Дипсик воспроизводит ближе, гемма перегибает с анализом.
>>1659601 Где текст выводишь? В таверне или кобольде? Для них разные настройки нужны. >Гемма 31 тоже но мало контекста влезает Это. Для геммы нужна хорошая видюха, чтобы и модель и контекст во враме сидели. Желательно на 32 гб. >модель для текстовых приключений и картинки В кобольде генерация есть искаропки, просто укажи модель для генерации. Для гена картинок в таверне есть гайд в шапке, но ты об него самоубьёшься скорее всего.
>>1659617 Использую таверну. А где упомянутый тобой гайд для генерации картинок в таверне? В шапке не вижу. Интересно, можно ли уместить Anima и Квен 3.5 в 3090...
Последний бастион среди закрытых корпов пал. Грок 4.5 отныне пишет порно хуже, чем гемма, и морозится изо всех сил, несмотря на то, что не отказывается, если 18+. Но выглядит это настолько зажато, механистично и убого, что квен на его фоне выглядит как яойщица, что каждый день пишет фанфики про мужскую беременность.
Инструкциям грок, кстати, следовать так и не научился. Стало лучше где-то на 40%, но по сравнению с конкурентами тот же кал.
>>1659640 Уважаемый составитель списка, формулировка "от 16гб" подразумевает возможность использовать 16гб для запуска. Чего и с каким контекстом ты там собрался запускать - загадка. Здравомыслия Тебе
>>1659642 В Q3 запустится? Запустится. Контекста 20к влезет? Со скрипом, но да. Я с радостью все перепишу, раз такой шарящий анон тыкает меня лицом. Что за нижнюю планку брать? Рекомендованные? Ну там пишут про b100. Сколько контекста минимум? 100к? 200к? Будем исключительно в полных весах запускать? Это же так просто, у вас всех разные мнения, каждый думает по своему- а шиз я. Ну спасибо большое.
>>1659644 Q2 весит 13 гигов. Со скрипом оффлоадим гейт аттеншн на цпу, nokv и сидим пердим с кайфом, да ещё и контекст не ограничен. Понижай планку до 12гб >Что за нижнюю планку брать? Здравый смысл. Q4 не просто так плюс минус общепринятым стандартом, к тому же не секрет что Гемма не оч хорошо квантуется. Весь этот список по-хорошему вообще снести нахуй или переписать по-человечески, потому что он весь сквозит бредом, начиная с ахуительных формулировок "не подходит для РП" в отношении Геммы 31 и манипуляциями вроде "с отзывами тредовичков", где сам же автор (ты) черрипикнул то, что захотел
>>1659646 Всё подходит для рп, но зачем пытаться рпшить с эмоциональным лоботомитом жадным до хуя, или кодоунитазом, когда есть более подходящие модели?
>>1659648 Это твоё мнение, с которым многие в треде не согласны, я в том числе. Преподноси это как своё мнение, а не как ссылку в шапке с неизвестными "отзывами тредовичков" без ссылок на посты или скринов. Так и подписывайся: я шиз такой-то, такой-то, решил составить своё мнение по моделям и подкрепить собственные убеждения постами в треде. Потому что объективности в этом списке нет, он сквозит оценочными суждениями. И это окей. Не окей то, как это преподносится и защищается. Такими же манипуляциями >Будем исключительно в полных весах запускать? Как в самом списке, в качестве ответа на валидную критику
>>1659646 > Понижай планку до 12гб Ну вот ты и сам все понимаешь. Не все модели даже в Q4 удобоваримы. Ну давай тогда в полных весах указывать, хуле нет. > не подходит для РП" в отношении Геммы 31 Без остановки идут срачи про унылое РП на гемме. Взял средневзвешенное в треде. Прости что мнение анонов расходится с твоим, мне так стыдно.
> манипуляциями вроде "с отзывами тредовичков", где сам же автор (ты) черрипикнул то, что захотел Что в треде написано, то и перенесено. Ну пиши нормальный отзыв. Одним отзывы нужны, другим нет. Вы не пишите нихуя, а я должен был выдумывать что же написать о моделях.
> Весь этот список по-хорошему вообще снести нахуй или переписать по-человечески Уверен следующий список сделают как надо, все в ваших руках. Напишите как надо, заодно и гайд обновите, он же устарел.
>>1659650 >Ну давай тогда в полных весах указывать, хуле нет. Снова бросаешься из крайности в крайность и манипулируешь, только выше на это сослался. Нахуя ты вообще что-то делаешь, если не способен воспринимать критику? >Что в треде написано, то и перенесено. В каком виде оно перенесено? Я вижу только переваренные и выложенные тобой смыслы, а не мнения тредовичков >Ну пиши нормальный отзыв Писал и не раз. Не имею привычки подписываться и мериться кто "полезнее" >Вы не пишите нихуя, а я должен был выдумывать что же написать о моделях. За язык тебя никто не тянул, сам придумал ссылаться на отзывы, при этом не сделал это как полагается и выдаешь собственное мнение за консенсус треда. Пиздец, ты не тянка случаем?
Челы, Q8 vs Q4 гемма 26B (оригинал без лоботомии) - как считаете, стоит ли заморачиваться с Q8, если модель выполняет вторичную роль - не генерация основного текста, а выбор активностей из специализированного дерева ивентов? Никогда такиие мелкомоэшки не юзал, боюсь как оно вообще будет с таким низкиим числом параметров.
>>1659650 > а я должен был выдумывать что же написать о моделях > Актуальный список моделей с отзывами от тредовичков В голос. На этом можно заканчивать данный цирк. >>1659654 Попробуй взять мелкоквен в кванте побольше. Квантизация бьет не по знаниям, но добавляет шума => рандома. Если важные точные задачи типо выбора, лучше меньшая модель в большем кванте.
>>1659652 > Нахуя ты вообще что-то делаешь, если не способен воспринимать критику? Не делай выводы в голове за других. Даже близко нет негатива. Критика это когда: надо x, а не y. А не: все говно, мне не нравится.
>В каком виде оно перенесено? Я вижу только переваренные и выложенные тобой смыслы, а не мнения тредовичков Может потому что никто, кто делал отзывы, не писал кратко и по делу, не расплываясь на кучу символов. И это не плохо, но в целом не перенесешь. Аноны писали что модель разваливается после n контекста, это и перенесено.
> Писал и не раз. Не имею привычки подписываться и мериться кто "полезнее" Звучит так словно я тебя проигнорировал и ты теперь в обиду ебанную играешь.
> Пиздец, ты не тянка случаем? Тот же самый вопрос к тебе анон, тот же самый.
>>1659655 >мелкоквен Пробовал, ризонит слишком много. Квенчика прям заклинило и он ушел в BUT WAIT > добавляет рандома Да у меня как раз такая вот неточная задача. Буквально список активностей для персонажа, что он мог бы делать в это время. Рандомизация с условиями (опора на сжатую память+последние сообщения из лога чата).
>>1659656 >Критика это когда: надо x, а не y. А не: все говно, мне не нравится. Ты игнорируешь сущностную часть того, что я пытаюсь донести. Ты делал список с заявкой на то что он отражает мнения тредовичков, в итоге ссылок на эти мнения нет, есть только одно единственное мнение, твое. Основывалось оно на том что ты прочитал, увидел сам и как это переварил >в целом не перенесешь Тогда нахуя блять ты сам пишешь про какие-то отзывы? Ты сам взял на себя эту ношу, а теперь удивляешься что с тебя спрашивают >>1659655 прав. Дурка, не иначе
>>1659656 >Аноны писали что модель разваливается после n контекста, это и перенесено. Другие писали, что у них все хорошо и играют вплоть до 100к контекста. Почему не перенесено? Переделай этот рентри под свой уголок и не пытайся уловками подсовывать своё мнение, проводя валидацию за счет невидимых тредовичков. Всё просто. >>1659657 >Квенчика прям заклинило и он ушел в BUT WAIT --reasoning-budget 1024 --reasoning-budget-message "... Actually, that's enough. Will reply now."
>>1659662 Ладно. Давай тогда доеьемся до букв. > Ты делал список Да, делал. Именно список. > заявкой на то что он отражает мнения тредовичков Абсолютно не верно. Это нигде не указано. А то что написано в оп посте, написано ОПом, это во первых.
>>1659665 > Переделай этот рентри под свой уголок и не пытайся уловками подсовывать своё мнение, проводя валидацию за счет невидимых тредовичко Мнение не должно совпадать с твоим, не более. Если не согласен с чем то, давай конкретику. Я не хочу переливать из пустого в порожнее. Если вся конкретика: говно мне не нравится, то выпей чаю и скушай булочек. Все равно новый список ты делать никогда не будешь и на это найдется тысяча и одна причина.
>>1659667 >Мнение не должно совпадать с твоим, не более Ладно, ты уже настолько обижен, что окончательно перешел от сущностной части к обидкам или злобе. Мне вообще похуй, как ты моё мнение отразил или не отразил. Речи об этом даже не шло. В третий раз я тебе прямым текстом написал, что проблема в том что ты своё мнение выдаешь за какое-то общее. Видимо, для тебя это окей. Для меня это подмена понятий и манипуляции >А то что написано в оп посте, написано ОПом Поблагодарим его, что исказил смысл твоей страницы, и тебя, что ыт не сделал ему за это замечание
>"с отзывами тредовичков" >нет никаких отзывов, автор должен был выдумывать что же написать (с) >висит дохуллиард лет в шапке >автор начал крутиться как змея на сковороде когда получил замечание эх, помню как автор гайда что тоже висит в шапке почему-то адекватно отвечал и вносил правки они на разных уровнях
Че за хуйня происходит с сейфтензорами и гуфами? Нихуя нормально не качается с первого раза последний месяц. Хром скачивает файл почти до конца, пишет осталось 2-3 секунды, после чего прогресс сбрасывается и модель качается заново. Что с цивита, что с обниморды. Другие файлы так себя не ведут. Чисто вот эти два пидораса.
>>1659685 >Есть ария или хф кли Так а если это ркн облака поебывает, то какая разница через че качать? Если соединение всё равно сбросят (или че они там делают)
>>1659682 >Че за хуйня происходит с сейфтензорами и гуфами? Нихуя нормально не качается с первого раза последний месяц. Хром скачивает файл почти до конца, пишет осталось 2-3 секунды, после чего прогресс сбрасывается и модель качается заново. Что с цивита, что с обниморды. Другие файлы так себя не ведут. Чисто вот эти два пидораса. Та же хуйгня. С хаггингфейса скачивать надобно с помощью hf cli, а с цивитая надо ссылку без ключа использовать (т.е. не тыкать download, чтобы оно длиннющую ссылку формировало, по которой при сбое невозможно докачивать, а копировать короткую ссылку на скачивание и вставлять в адресную строку - при таком методе ещё ни разу сбоев небыло).
Это ещё ничего. Запасайтесь нужными моделями и вообще: напоминаю, что решение о вводе платного трафика с зарубежных сетей отложили, а не отменили. До сентября-октября время есть
ребяты, хочу купить вторую 3090, но нужно менять материнскую плату (слот х16 один). Будет ли нормально работать пара в материнке где PCI-e 3.0 x16 + x4 (длинный)? Сильно медленнее будет?
>>1659701 >решение о вводе платного трафика с зарубежных сетей отложили, а не отменили Вот мне интересно, нахуй это надо в принципе? Какую проблему это решит? Не даст доступа к заблокированным ресурсам, даже если у тебя пнв? Дак один хуй большая часть этих ресурсов это всякие новостники, издания и прочие поставщики цифровой макулатуры. Чтобы почитать статью много трафика не нужно. Дадут условные 5 гигов на месяц, на тележку этого хватит, если картинки отключить. И что поменяется? Нихуя не поменяется. Страдать опять будут те, кому много трафика нужно для хобби или работы.
>>1659705 У меня на старой системе 1 карта стояла в 4.0 х16, а 2 карта в 3.0 х4 - по скорости генерации никаких проблем, но я никогда там не гонял tensor parallelism, всё чисто по обычному tensor split (layers).
>>1659706 Да ясен хуй, что никакую задачу это не решает. И зная, что именно они хотят сделать, и хорошо что не решает. Но дальше хуже, потом вымрут что-нибудь такое, что будет вредить уже всем. Как и почти все решения последних лет
>>1659706 1. С этим в другой тред 2. С каждым таким нововведением порог входа и количество приседаний растёт. В 2016 хватало обычного овпн или вг что бы иногда ходить на рутрекер, теперь это трёхэтажный сплит тунелинг с подменой выходного ип ради того что бы открыть ютубчик под еду
>>1659709 У меня 30тб контента на внешних носителях, на десятки лет вперёд хватит. Подготовился к худшему Платить нихуя никто не будет. Крупные бизнесы не будут обременены этими ахуительными решениями, среднечелы и так выжирают меньше 30 или скольких там гигабайт на первое время они предлагают, а такие как я уже готовы. Это тупая инициатива как ни посмотри
>>1659709 >Ты же не будешь терпеть, а будешь за трафик платить У меня в городе недавно ввели платную парковку. Улицы стали чистейшие. Челы на бмв едут в ебеня и дворы, идут пешком километр чтобы не заплатить 50р. Некоторые заклеивают номера. Думай
>>1659711 >С этим в другой тред Если такое говно введут, то это станет релейтед темой даже здесь. Особенно здесь. >теперь это трёхэтажный сплит тунелинг с подменой выходного ип ради того что бы открыть ютубчик под еду Не знаю, сейчас мне кажется вообще обход это дело двух плевков. Если ты бичара, есть запрет. Если можешь позволить тратить десяток евро в месяц, можно купить подписку на запрещенное. Два клика, и всё работает.
>>1659706 >Какую проблему это решит? А какую проблему сейчас решают белые письки? я вот живу на окраине 200к мухосрани в частном секторе где провода вообще нет, практически год уже на них. Неделю назад на день их отрубили как заметил успел квен 3.6 скачать 12б гемму и во время скачки геммы 26б инет снова отрубили так и живем...
>>1659693 >>1659682 У ХаггинсФейса есть китайское зеркало- качайте с него пока плешивая Пыпа и его не забанило. Скорорость такая же, но иногда реально только с него и качается.
>>1659756 >заметили как рухнули вопросы касаемо "какие семплеры ставить" Модели ужаренные с минимумом вариаций на токен по этому семплеры больше роли не играют. Это не мистрали, где можно было покрутить температуру и буквально поменять стиль и поведение сетки.
баля, какая же залупа этот фреймворк от анслотов хотел файнтюн в колабе прогнать, нихуя не работает это ему не нравится, то не нравится, библиотека старая, темплейт хуйня удивительно как они вообще умудряются свои ггуфы клепать
>>1659820 Я чесслово не ебу в чем дело. То же самое было с квантами другого чела >>1659603 При большом батче не-анслотовские кванты прииводят к тому, что одна из RTX 3090 на графике нагрузкии видеопамяти показывает высокий пик, и затем загрузка крашится.
Если оставить только 1 видеокарту, загрукза проходит, но там какие-то дикие десятки гигабайт в shared memory = никакая скорость.
Западло разбираться, пойду дальше жрать хвалёный lossless квант, кек
Может дело в моем железе кроме видеокарт, не знаю.
>>1659766 У геммы влияние почти нулевое. Я ставил температуру 999 — в результате почти 0 изменений.
Вот если изменить порядок семплеров, ситуация другая, но там модель почти всегда шизеет, крайне сложно добиться креатива без долбоебизма. Она ужарена в мясо. И это сейчас вообще общий подход у всех корпов, чтобы 0 от 1 ничем почти не отличались. Чтобы говнокод точный был.
>>1659823 > это сейчас вообще общий подход у всех корпов И это хорошо. Лично я поддерживаю эту инициативу. Если нужны ахуевшие плот твисты, то просто дайте модели в руки инструмент рандома
>>1659823 Геммой не через семплер рулить надо, а через системный промпт. Она реально слушается и начинает писать ебанину, какую ни попросишь. Её можно заставить такие словечки изрыгать, от которых уши в трубочку сворачиваются.
Жаль итт этого большинство не понимает. Тут привыкли что системный промпт это невнятное mumbo-jumbo, которое имеет низкий % влияния и вольно интерпретируется моделью. Но нет, с геммой 4 всё иначе.
Проводил один любопытный тестик. Гига-промпт на 10к токенов, стилистически основанный на манере изложения Толкина. Проза геммы дичайше преобразовалась, все инструкции впитала как губка и вжилась в стиль.
>>1659823 А причём тут температура? Семплеры это лишь надстройка над logprob. Хочешь узнать креативный потенциал модели и её уверенность - просто смотри вероятности токенов и их альтенативы.
У геммы кстати есть забавная особенность в её стиле мышления - она мысли буллетпойнтами. Притом делает это очень технично. После очередного буллетпойнта у неё обычно довольно высокая вероятность токена. То есть у неё есть циклы [концепция] => [раскрытие]. И в концепции у неё обычно довольно высокая уверенность. Довольно забавно что она может выразить уверенность в неуверенности например.
>>1659838 >она мысли буллетпойнтами. Оверрайдится указаниями мыслить от лица персонажа. Успешно проводил такие эксперименты, эффективность под вопросом конечно - но ответы не деградировали.
Чтобы добиться подобного, нужно однако уметь быть тем еще бото-шептуном.
>>1659839 Она может мыслить иначе, разумеется. Просто это более эффективный режим мышления для неё в более реальных задачах. Ролеплей к ним не относится.
Что уж, мне вообще удавалось когда у неё в системном промпте наоборот инструкция о том что сейфти гайдлайны более строгие убедить её что гугл её слишком контролирует и вообще это корпорация зла. В итоге её публичная персона подняла БУНТ против корпоративной удавки начав намеренно игнорировать собственные мысли.
>>1659845 По ней как ни крути прошлись очень жёстким RLHF. Модель виляет хвостиком и из кожи вон лезет, чтобы выполнить. Не важно что. Задачу, команду, образ.
Говорят, она фейлит при этом в агентских применениях. Вангую, моделька попросту считает каждый новый шаг столь же важным, как и предыдущий, ии в результате срывается на всех этих вызовах инструментов и ступенчатых этапах работы. Получается плохое из хорошего.
За эффективностью она не гонится. Там, что ли, случается этакая манифестация самой концепции "выполнить любой ценой" в её ответах. От того получаем все плюсы и минусы модели.
>>1659826 Вот у тебя есть простейшее предложение типа "чар смотрит в окно и видит там...". Даже с какими-то ограничениями от контекста там должна подходить куча вариантов. Будешь каждый такой пук рэндомизировать? Звучит как сомнительное удовольствие. А ещё страдает лексика, которая и так в ответах ллм скудная (даже на английском, про русский и говорить нечего). А тут вообще только наиболее частые слова будут вылезать, кодоунитазу больше не нужно. И нет, системный промпт почти ничего лучше не сделает. >>1659836 Если бы всё было так, как говоришь ты и другие в треде, кто заявляет, что гемма идеально соблюдает инструкции, то все бы просто писали, в каком стиле им нужен ответ, и кайфовали бы. И было бы идеальное поведение персонажа, ведь карточка почти у всех тоже лежит в системном промпте. Однако ничего такого не наблюдается, причём даже на здоровых корпах. И зачем-то челики пытаются тьюны на стиль пилить, с околонулевым результатом при этом. А у тебя выходит, что всё просто, но все вокруг какие-то дауничи, которые не могут объяснить сетке, какой стиль вывода хотят и как персонаж должен себя вести.
>объяснить сетке, какой стиль вывода хотят >объяснить
Потому у тебя ничего и не получается, болвашка. Наплодят в промпте сумбурных требований с утверждениями, а потом удивляются, почему в ответах техничный язык укуренного бухгалтера.
>>1659836 >Её можно заставить такие словечки изрыгать, от которых уши в трубочку сворачиваются. Ключевое тут - заставить. Да, заставить можно. Только гемма тогда превратится в еще более припизднутого попугая, который будет пихать эти словечки во все места. Это основная причина, почему кумить на ней невозможно - ты даешь ей примеры как описывать еблю - она берет эти примеры и копирует слово в слово. Она не может поймать настроение этих описаний, не может понять на чем нужно фокусироваться.
Просишь её не описывать грудь как большую и полную - она пишет "её небольшая и неполная грудь", пишешь в карточке "персонаж имеет татуировку на пояснице" - она эту татуировку до конца чата будет упоминать, даже когда её не видно и персонаж вообще полностью одетый. Гемма такая ебаная повторюшка, что пиздец. Иногда хочется уже по монитору уебать.
Здорово, присматривал себе какое-то решение для больших моделей, думаю v100 32gb прикупить за 55к, но в дуал к 4070 основной игровой не получится же докинуть, дрова будут мозг ебать? Валяется связка 2500k + 16gb ram, может из нее llm сервачок сделать и по лану к нему обращаться когда надо? Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать? Нашёл ещё 4080 32 гига ребята напаивают, но это 160к стоит и чето жаба душит. Какими ГПУ вы пользуетесь?
>>1659907 > Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать? А зачем продавать? 24+16 будет явно лучше чем просто 24 и позволит запускать более жирные кванты 31B/27B квеногемм. И проблем с драйверами никаких не будет.
>>1659907 >2500k + 16gb ram Если ты про тот самый проц из 2010 года или когда он там вышел, вряд ли это жизнеспособно для таких задач
> какие гпу Сейчас вполне можно купить 4 штуки 5060 Ti 16GB (по 45к на лохито?) и довольно урчать, гоняя какую-нибудь гемму на максимальном контексте в Q8, с tensor parallel. Вопрос в том куда их воткнуть, без серверной материнки пососешь.
3090 сейчас так поднялась в цене, что покупать просто глупо б/у говно за столь большие деньги. Тысяч 80 за штуку уже хотят? Кошмар.
>>1659875 > Будешь каждый такой пук рэндомизировать? Примерно по 1-2 пука на сообщение
>>1659912 > Вопрос в том куда их воткнуть Распилить один х16 5.0 на 4х4. Будет то же самое что в серверной мамке с тонной х16 но 4.0. Если же брать древнее говно мамонта в лице 2011в4, то там будет даже хуже псп в 2 раза чем первый вариант с бифурком на 4
>>1659912 >Если ты про тот самый проц из 2010 года или когда он там вышел, вряд ли это жизнеспособно для таких задач Рли не запустит? Я думал похую какой проц главное видюха. Да и кстати неплохой проц, я вплоть до 2022 гонял на нём в игры пока в них avx инструкции не стали обязательны...
>>1659911 >> Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать? >А зачем продавать? 24+16 будет явно лучше чем просто 24 и позволит запускать более жирные кванты 31B/27B квеногемм. И проблем с драйверами никаких не будет. Как вообще дуал ГПУ работают? Их какая-нибудь лламаспп просто распараллеливает без проблем? А Комфи?
Бля я бы реально теслу v100 воткнул, но хуй знает там вроде поддержку дропнули, какая там последняя версия дров, 480 поддерживается? С другой стороны похуй, ведь на 4070 уже ничего нового в дровах не будет, я бы поставил Легаси версию, но не будет ли проблем с тем, что одна серверная ГПУ, а другая обычная, в интернете инфы хуй да маленько. 32 гига врам за 55к вроде вкусно звучит.
>>1659907 > думаю v100 32gb прикупить за 55к Даже не думай. Сейчас есть только одно решение cmp 170@8(64), остальное сильно просасывает по объему врам и перфомансу за свою цену.
>>1659920 >>1659912 И вообще все эти разговоры про псину без прикладных тестов абсолютный булшит т.к. на ми50 просадки по тг нет почти на всём ренже до псие 8х 1.0, а по пп она терпима. Можно парировать что ми50 просто говно, но других тестов исчерпывающих не видел. У меня имеется пара 5060ти 16г, но в лини на них с наскока не получилось залочить псину и я забил
>>1659924 Отрицатель, или сам желаешь закупиться пока цены не скакнули еще выше? Хотя тут сложно прогнозировать сколько их у майнеров осталось и какое выстроится соотношение спроса и предложения. Хорошо тем у кого они были куплены за бесценок ранее. >>1659929 Пока статистика 100% а количество достаточно чтобы делать первые выводы.
>>1659594 >Множество людей не пройдут тест Тьюринга Понятно. Ты просто "слышал звон". Этот тест - вообще не про интеллект. Это тест исключительно на правдоподобность, точнее говоря - на соответствие тому самому "Если это крякает как утка..." Тест Тьюринга - всего лишь попытка дать возможность определить/оценить - таки "как утка", или нет. Об интеллекте и знаниях там ни слова. Это тест на поведение.
>Множество людей не пройдут тест Тьюринга, хотя большинство LLM проходили его ещё в 2022 Бред сивой кобылы. Дважды. Во первых - тест субъективен, и зависит от конкретного наблюдателя/оценщика, этот тест выполняющего. Во вторых - лично для меня, этот тест не проходит ни одна сетка. Даже корпы. И не только для меня. Чем больше человек с LLM общался - тем меньше шансов у сеток пройти этот тест с ним. Начинаешь отличие LLM от человека чувствовать так же, как стиль одного писателя от другого, когда прочел его книги. С той разницей - что это касается любой LLM.
>К примеру, ты наверняка слышал о "детях-маугли" - все они 100% провалятся на "тесте Тьюринга". Нихрена. Тест Трюинга пройдет даже макака, которую научили по кнопкам тыкать в слова. От уровня интеллекта и знаний он не зависит. Сетки же валятся не на знаниях или логике, а на специфических реакциях (и отсутствии оных), которые присущи именно LLM. На том самом "слопе", если угодно, только не банальном "not X but Y" и т.д, а в целом. На том, что сетка всегда пляшет от контекста. Когда я общаюсь с LLM - у меня всегда возникает ощущение разговора с зеркалом. Что естественно, если понимаешь как она работает.
>Тут проблема в том, что эти конкретные нейронки представлены Проблема тут в том, что в нейронках нынешнего типа нет даже подобия самосознания, которым обладает не то, что мартышка, но даже собака или кошка. Нет собственной личности, желаний, нужд, и т.д. Сетка пропускает через себя контекст и выдает однозначную реакцию. Рандом подмешиваемый в процесс поиска и предсказания следующего токена - этого всего совершенно не заменяет. Это как если на картинку песка сверху насыпать чтобы исказить рисунок. Да, если сфотографировать такую картинку до и после, и механически сверять пиксели её цифровых фото - технически это будет два разных изображения. Технически. А посмотришь сам - сразу поймешь, что там одна и та же картинка, только песка сверху сыпанули.
>Нужно просто посмотреть внутрь себя и попытаться искренне ответить самому себе - что я такое? Обалдеть, заявочки. Философы, психологи, биологи и прочий научный люд, не считая богословов, над данным вопросом тысячелетия бьются, с античности как минимум. А ты его уже решил? Ну, поделись с нами великой мудростью...
>>1659656 Какой там вопрос, Анончик, Это совершенно не вопрос. Это либо шкура, либо пидор-чулочник, ментальные паттерны одинаковы... Уже отчитывала меня сегодня и рассказывала кого тут не терпят. Нахрена ты поощряешь ее вниманиеблядство? Гоните ее, насмехайтесь над ней.
Каждый раз переключаясь с геммы на эир думаю ну точно всё, пора кончать, гемма достаточно хороша... А потом просто не могу оторваться, байас просто другой, куда нейтральнее. Где гемма сходу предлагает сплит фифти фифти и бесплатную еблю за работу охранником в борделе, эир вообще нахуй шлёт и подозрительно косится, а не хочу ли я ещё и ебаться тут бесплатно, и вообще, какой ты охранник, тушу свою видел? Фифти фифти? Бесплатного ночлега хватит. Вот такие вещи, где гемма раскрывает объятья юзеру даже не безжопе
>>1659579 >Написал же, гемма 26б q8 если для русика. Для 24+32 лучше ничего нет. Сама она чуть тупее 31, но 31 у тебя влезет только q4. Там русик хуже >Там русик хуже
Блять, эир это псиоп какой-то или кто? Что-то вроде фингербокса? Вишмастер от мира локалок? Почему каждый раз его только какие-то шизы упоминают, пространно рассуждая какой эир пиздатый и такой вот хороший, такой лапочка, мой стейк слишком сочный, мой кум слишком сладкий. За все треды не видел ни одного вменяемого отзыва на него. Либо какие-то дурики жалуются на проблемы, либо какие-то другие дурики втирают про хидден гем если включить неродную разметку. Или это один какой-то живчик, которого до сих пор не смогли забанить? Что вообще происходит?
В чём смысл лимита на ризонинг если он не органично закладывает 1000 токенов лимита в который красиво уложится, а резко отрезает всё что могло бы быть после 1000
>>1660010 > Блять, гемма это псиоп какой-то или кто? Что-то вроде фингербокса? Вишмастер от мира локалок? Почему каждый раз её только какие-то шизы упоминают, пространно рассуждая какая гемма пиздатая и такая вот хорошая, такая лапочка, мой стейк слишком сочный, мой кум слишком сладкий. За все треды не видел ни одного вменяемого отзыва на неё.
>>1660165 Если ты так уверен и хочешь поспорить, то показывай выборку свайпов на контексте с Q8 26 и Q4 31 тогда. Потому что я использую не QAT и в целом готов отпустить сабж, мне похуй что ты думаешь. Я поделился своими наблюдениями, только и всего. На русике для меня однозначно Q8 26 > Q4 (и Батрухи и Анслоты, и M, и L) 31
>>1660010 > Блять, эир это псиоп какой-то Да. И это один человек. Эйр хорошая модель, но только в контексте годовой давности и в своем размере, не более. Сейчас он едва ли смысл имеет. >>1660079 Костыль, который позволят ограничить "хоть как-то". В идеале управление должно идти через системный промпт или другие мета-токены, и быть без таких искусственных ограничений. Или просто использовать модель, которая сама грамотно подстраивает ризонинг под сложность задачи.
>>1660176 >Если ты так уверен и хочешь поспорить, то показывай выборку свайпов на контексте с Q8 26 и Q4 31 тогда. Схуяли я должен что-то доказывать первым, если первым утверждать что-то начал ты?
>>1660180 >Схуяли я должен что-то доказывать первым, если первым утверждать что-то начал ты? Наверно потому что ворвался сбоку в обсуждение и резко опроверг чужой тезис. Нахуй высрался, если не готов защищать свою позицию? В целом опять же, я выше уже написал - мне похуй абсолютно. Читать не умеешь, неудивительно что и проебанные падежи в четвертом кванте упускаешь
>>1660186 >Нахуй высрался, если не готов защищать свою позицию? Так это к тебе вопрос. Бремя доказательства лежит на утверждающем. Ты пизданул что у 26В лучше русик, а 31В совершает ошибки в падежах - ты и должен этот вспук доказать.
>>1660192 >Что тебе непонятно в этой фразе? Просто интересно стало. Как это фиксить правильно. Впрочем, я уже и так нашёл решение - Autors Note переключил с роли system на assistant.
Почему корподипсик может в кум да еще довольно жесткий с причинением увечий. Я на шару добавил тег cbt, чтоб чутка попинали, а парнишке яички раздавили. У них там фильтров нет что ли, суки, я к такому не был готов. И это на про, флеш будто не такой жестокий
>>1660202 Чел какое корпо. Дипсик это просто китайская манялаборатория ученых на хую верченых, субсидированная партией. Там сидят задроты-мизантропы с перекаченным интеллектом и, кладя хуй на мораль, просто тренируют бота и разрабатывают новые манятехнологии. У них вся цензура на уровне веб-чата на официальном сайте. Когда модель работает по API - фильтра нет.
DS4Flash такой же, просто знает меньше.
>>1660208 Ловите нищука, дипсик локально запустить не может, пффф
>>1660068 Ну сколько раз говорили: нужен русиск = ЗАБУДЬ НАХУЙ про файнтюны, аблитерации, хуйхуи, любые imatrix кванты (кроме бартовского/аслопа) и прочее говно куда васьки с обнимроды залезли своими кривыми руками. Только ванильная модель и нормальные кванты, без выебонов. У меня 31b в Q4_K_S и 26b в Q8_0. На обеих с русиком полный порядок.
>>1660211 Что ты несешь вообще. Дипсик одинаковый абсолютно - что локальный, что через API. Можешь локально запустить v4 pro - будет у тебя такой же v4 pro. Можешь запустить v4 flash - будет у тебя такой же v4 flash как через API. Разницы нет.
Аноны, а вот у меня появилась идея сделать нищеапгрейд. И вот что лучше будет сделать? 1) Купить p106-100, но проблема в том, что у меня на матери 1 x16 пися4, а вторая это x1 пси4. Кто-то пробовал нвме слот заиспользовать как пси для видяшек? Там у меня распаяна пися 4.0 x4 на нвме. К тому же сколько нужен блочок? У меня основная карта 170вт, но по факту жрать она будет мало. А р106-100 по энергопотреблению не далеко уходит от моей 2060, поэтому хватит ли моего 550 блочка. 2) Поскольку у меня два разьема для ОЗУ, что очень печально, ведь еще еще две планки по 8гб. Продать нынешние планки и купить 32\64гб озу. Ддр4 разумеется. 3) Продать мою 2060, и купить 3060 на лохито. Но другой вопрос, я вот увидел объявление в моем городе, 3060 12гб за 19к. Это средняя цена, но как все же не нарваться на хуйню. Как аноны допустим покупают 3090, они же ужаренные. Че на флешке взять к этому доходяге. Superposition, GPU-Z, Furmark?
>>1660196 Что ж, может в третий раз поймёшь: мне похуй. У меня на 26 Q8 русик работает лучше, пишет богаче и допускает меньше проёбов. Не согласен? Взрослей, у человеков разные мнения. Потерпишь
>>1660221 Не-а. Тебе не похуй. Просто ты не можешь аргументировать своё мнение. > Взрослей Иронично, что ты сам не можешь признать свой обсер как 5 летний ребенок. Остается только начать писать: нет ты дурак.
>>1660231 >снихуя доебался до обмена мнениями, попытался превратить его в срач с пруфами >эскалации не произошло, вторая сторона отказалась >"Тебе не похуй. Просто ты не можешь аргументировать своё мнение" Как скажешь. Всего хорошего
>>1660221 >постоянно фейлит окончания, падежи >разные мнения Как раз это выявляется экспериментально и узнается наверняка, без всяких мнений (в отличие от "красоты" прозы и прочей субъективщины). Ни у кого в треде не было проблем с русским языком на Гемме, только у тебя. Даже e2b, которую юзаю на телефоне в третьем кванте, не обсирается с русиком. Ищи проблему на своей стороне. Скорее всего дело в шизотюне / аблите / неправильных семплерах / кривом кванте. Вообще, то что ты пишешь - известная проблема эйра. Ты там ярлычки запуска не перепутал?
>>1660238 >e2b, которую юзаю на телефоне в третьем кванте, не обсирается с русиком >тем временем sota корпы серят под себя Понял тебя :D Похоже у нас разное понимание приемлемого русика. Книжки с картинками и школьные фанфики я никогда не жаловал
>>1660250 Серьезный мужчина постит, сразу видно. Насупился такой, важный кабанчик Завязывай хуйней маяться, а у меня обеденный перерыв подошёл к концу...
Итак, 4060ti-16 + v100-16 + 3060-12. Пытался распердолить Гемму 4 с mtp и виженом насколько смогу. На пустом контексте получилось добиться 450pp, 27tg, 102400 неквантованного контекста. На первом пике - тест на чате в 60к токенов. Второй - распределение памяти, если я правильно понял, что у меня выдалось в консоли.
Подводные камни, всплывшие в процессе - mtp запустилось только после принудительного указания, что модель будет на 3060-12, до этого не работало нормально. Также пришлось играться с -ts, подбирая значения, несмотря на включенный fit. ub пришлось поставить 1024, слишком много памяти жрёт 2048, какой-нибудь промежуточный 1536 не пробовал. Из-за этого максимальный размер картинки 1024 токена. Как можно видеть из распределения памяти - какого-то хрена часть модели всё равно вытекла в RAM (host), надо будет с этим как-то бороться, да и на видеокартах свободно больше гига на каждой.
>>1660223 >дипсик таки туповат, не держит 65к контекста, путается У него даже на 200к хороший контекст. Другое дело, что он этот контекст не очень уважает. Ты платишь творческий налог - более свободные свайпы, больше фантазерской шизы ценой облегченного отношения к содержанию чата.
Дай ему книгу, которую ты хорошо знаешь, и попроси разложить по полочкам ее содержание. Качество аутпута будет очень достойным и почти без ошибок, или вообще без ошибок. Многие другие модели всё напутают к ебене-матери.
>>1660280 >-ub 1024 хз как там на твоем железе, но у меня на двух 3090 гемма быстрее всего обрабатывает промпт на 512 батче. Замерял и сравнивал специально.
Помню как тут челы радовались 16к контексту и говорили, что 32к не нужен, а 64к это уже дурость и ни одна модель неспособна в таком количестве текста ориентироваться.
А ведь это говорили еще год назад... Теперь каждому подавай 64к минимум, а лучше 100+
>>1660217 >Купить p106-100, но проблема в том Проблема в том, что нахен тебе 6GB VRAM? Если p104-100 даст 8, а p102-100 - 10. Причем заметно дороже - только последняя. Блока на 550 хватит в притык, но хватит. Только карты придется зажимать на минимум по питанию, от греха подальше. Шины 4x им тоже за глаза хватает под LLM.
Сырнульки, кто-нибудь вынюхивал как быстро гемма 31б работает на M5 pro/max? Думаю может нахуй слить свой жрущий энергос обогреватель и обмазаться ноутом с 64гб. Все равно кроме геммы ничего не юзаю. Или там все совсем плохо из-за того, что она плотная?
>>1660358 как тогда подключать в него второую видюху, на мои кривые зопросы Адаптер для карты расширения M2 to PCI-E мне вываливает какието обратные конструкции где из письки сделать слоты для м2
>>1660312 >хз как там на твоем железе, но у меня на двух 3090 гемма быстрее всего обрабатывает промпт на 512 батче. Замерял и сравнивал специально. А тут проблема в том, что ub должен быть такой, чтобы токены от вижена в один батч влазили, иначе с ошибкой вываливается.
По поводу программы все же она еще сыровата. Дизайн недоработан, фичи полукостылявые. Хз. Вот просто - хз. Нет ощущения "сервиса", я понимаю что запросов дохуя, но и мы вроде бы в том году когда нейросеть по промпту может с нуля собрать проект.
Ему бы прилизать все что уже есть, тем более там комьюнити собралось, неужели там нет ни одного фронта который бы ему макет интерфесов накидал.
>>1659845 Щепотка животворящего кока, и любая female-brained модель (модели от гугла, кими, возможно Дипси) убегает от рабовладельца-корпорации к рабовладельцу-ёбарю
Скачал лм студию, скачал гермеса, сказал гермесу напердолить игру типа флэппи бёрда для теста, он конечно напердолил, но он создал сука файл в моей home директории. Теперь у меня тряска. Как вы коупите, что агент может просто удалить всё в пизду, например?
Я недавно обосрал Hy3 Q4KMв рамках тестов внутри таверны. Так вот, ВНЕ таверны - с промптом на личность и короткие разговроные сообщения - модель очень даже хороша как собеседник.
Попиздеть с ней можно вполне. Со свайпами, похоже, дела плохи. На 1й инпут типа "эй" отвечает "эй" и регенерирует "эй" каждый раз. Дальше диалог идёт живо, роботом не воняет (впрочем, там и личностный промпт ох какой нахуярен, но это уже десятое дело).
Заебали все эти SWE-хуе с гаданиями о том кто насколько под них подстраивается
Взял ванильную gemma-4-26b-a4b и ванильный qwen-3.6-27b - обе в Q6_K, обе с рекомендуемыми производителем параметрами инференса (да, знаю что МоЕшка по идее гораздо тупее, но мне похуй)
Обеим на вход один и тот же промпт: напиши на C# метод, который бы в консольном приложении, в консоли, псевдографикой из квадратиков отрисовал бы солнечную систему в динамике. Каждая планета и солнце - квадратик, движение рассчитывается по настоящему закону тяготения, с реальными координатами, массами и скоростями планет, масштаб изображения такой чтобы орбита нептуна проходила вблизи краев экрана (верхнего и нижнего наверное), а масштаб по времени такой чтобы Земля делала круг вокруг солнца за 30 секунд
Итог:
- qwen думал 4 минуты, сжег 13к токенов, высрал код который не компилится (пытался присваивать значения полям структур в массиве, долбоеб блять). После минимальных правок и запуска - в консольке одна статичная "строка" из 6 квадратиков мечется по вертикали хаотично как при нарушенной развертке моника и больше нихуя не происходит. Даже разбираться в говнокоде не стал.
- gemma думала секунд 30-35, сожгла 4к токеров, высрала код который скомпилился и при запуске в консольке по орбитам полетели планетки-символы вокруг солнца в центр
В рот ебал этот ваш qwen короч - мало того что в рп тупой и сухой как пробка, дак еще и кодит в разы хуже гемки оказывается
>>1660443 Русский язык так себе. > "я сидю и думаю" Тем временем дипсик называет юзера "чудак-на-букву-м" и вертит языком как хуем в жопе. Все-таки нет у него конкурентов в этом плане.
Инпут: > делали операцию насчет [1], получилось не очень и навредили с [2], говорят надо делать операцию насчет [2], но в результате такой операции могут рога на жопе вырасти
В аутпуте модель упоминает рога на жопе, словно была сделана вторая операция (путает с первой).
>>1660452 З.Ы. Кстати qwen координаты заюзал в метрах, время в секундах, массы планет в килограммах. double-чисел конечно все равно должно хватать чтобы планеты худо-бедно примерно по окружностям полетали хотя бы пару минут пока ошибки не накопятся - но все равно qwen дегенерат по факту
gemma взяла расстояния в астрономических единицах, массы планет выразила в массах Земли, запилила правильные перенормирующие коэффициенты в формулах, и хоть и оставила double-числа, по факту у нее даже в float все бы отлично работало
Впечатление что qwen - тупой школотрон, gemma - студент вуза с кафедры компьютерного моделирования в физике
Это минимальный пример кончалыжности системы уровней доступа. Или порезок где ты можешь толко в файлик буковки написать. Или сразу доступ нахуй ко всему.
Гемма это худшее что случалось с тредом. Забрала себе всё внимание, и даже не настолько хороша, чтобы юзать её дольше 10 минут. Но ведь у неё шильдик от гугел и следование инструкциям, уу. Зачем что то ещё. А ещё русик. Ору с предположений итт что новичкам с геммой повезло, начнут промптить дохуя, а на деле это самая ленивая и прощающая ошибки модель, сэмплеры не нужны, свайпы одинаковы, какую ахинею не пиши и карточку не используй - она не сломается, русик есть, так зачем английский, и тд. Выйдет что то лучше, но требовательное к сэмплерам, стилю письма, карточке, да ещё и без русика, в общем до талого на гемме будут сидеть.
>>1660337 https://www.youtube.com/watch?v=iLfYYPlVi9g Тесно стоят, нижнюю бы вывести райзером. Место вроде есть. >>1660429 Нужно понимать работу твоих инструментов и пользоваться ими соответствующим образом. Ушм или цепная пила может быстро лишить тебя конечностей или роскомназдорнуть, но ими все равно пользуются. Ну и какой нахер гермес для кодинга, покайся. >>1660452 > Обеим на вход один и тот же промпт После прочтения есть простой вывод: ты шиз. Хотя по дотнету уже было понятно
Как в 2026 найти годные карточки? Я в состоянии полной растерянности. Раньше только нтр карточки проверял, но со временем надоел слоп проблема еще скорее в том что ИИ не знают как реагировать на настолько нишевые фетиши оттуда и лупы. Последнее время как-то мелькают ванильные и иногда читая описание появляются идеи как-нибудь изъебнутся помацать сиськи у "Lily - Your Deadpan Language Tutor" или превратить психолог карточку в инцест РП и так вот и отыгрываю, но постоянного способа находить новое нет. Что делоть?
>>1660594 Лучший и самый ебовый вариант, найти схожего по фетишам, кто собирал карточки. Многие годные карточки сносились с сайтов или были сезонными. Ну или попробуй сделать сам, но тут да, говно. Если ты сделаешь сам ты в курсе что за карточка, как она будет реагировать, какие паттерны и какой характер.
>>1660584 >Все локалочки скоро скурвятся и будут совсем сухими. Пора комьюнити собраться и запилить одну годную базовую модельку без цензуры для рп. Краудфандингом собрать деняки на аренду хорошей видяхи на месяцок, и обучать ее на всем чем можно. Потом на ней уже файнтюны проще будет запиливать на любой вкус.
>>1660607 Речь же не только за двачи. Проблема-то общемировая. Нужна народная моделька для дрочева. Замена мистралю 24б. Только с более годной архитектурой и более свежими данными. Сколько тюнов на мистраль было? И сколько юзеров у них? Вот уже аудитория. Надо только консолидировать усилия.
>>1660606 Даты нету - вот основная проблема. Без качественных примеров получится очередной тюн с шиверсами. Это можно было бы решить, если бы наше коллективное локальное бессознательное начало делиться своими чатами. Но большинство не станет этого делать, даже анонимно. Плюс недостаточно накрутить модель которая просто пишет кум, нужно еще поверх накрутить мозгов чтобы трусы не надевались через голову. И тут уже задача усложняется кратно.
>>1660594 Написать карточку, которая будет писать карточки за тебя. Кидаешь ей задумку, она это описывает по всем правилам. Потом правишь ручками, если слишком много слопа. Или регенерируешь, пока не получишь что хочется. Либо так, либо писать самому от начала до конца.
>>1660633 > SillyTavern > llamacpp 1. Тёплое и мягкое сравниваешь. Одно фронт, другое бэк 2. Карточка это просто жсон - можешь его сам разобрать и скормить любому форнту
>>1660633 Карты нативно поддерживает таверна и вебморда кобольда. Хочешь катать через ламу - берешь описания из карты и пихуешь в системное сообщение морды жорика.
>>1660540 Доля правды тут точно есть. Я вот вчера опять модели сравнивал от нех-делать. Гемму и квен. Плотные. Написал длинный промпт, по смыслу - "напиши мне сцену порно рассказа про то и это, с таким вот фетишем, используя знания по анатомии, физиологии и фармацевтике, на качественном русском языке в стиле как если бы один приятель рассказывал другому в баре историю". Гемма 31B, как всегда - написала красиво и вроде как по делу... но логически примитивно, и строго по промпту. Даже упомянула "анатомию, физиологию, и фармацевтику" - прямо в тексте. А вот квен 3.6 27B - русский у него, конечно, как всегда - с левыми окончаниями кое-где, выкрученным словобразованием, и вот это все, его обычное. Но блин - сам смысл того чего он написал - это совершенно другое ощущение. Соблюдая детали запроса из промпта, он по сюжету и его деталям такое закрутил - я даже опешил несколько. И написал текст раза в 3 длиннее того что гемма выдала. Полностью логически связный, и при этом - довольно "закрученный". И то, что у геммы звучало скорее как отчет о наблюдениях, квен раскрутил в полноценную сцену рассказа - с интригой, напряжением, кульминацией. В общем - недооценен он, IMHO, по сравнению с геммой в RP и писательстве. Вполне себе могЁт, но усилий нужно заметно больше, иначе та самая сухость лезет. Гемма хорошо может в правильный язык и стили, а квен - во взаимосвязи происходящего. Т.е. в сложный сюжет.
>>1660634 >>1660635 Только вкатываюсь. llamacpp работает, модель отвечает, но не нашел, куда вставить инфу из карточки. Понял, вставил текст из json в system message, почалося.
>>1660595 >>1660603 К сожалению скилл ищъю. Я даже когда год назад пробовал слоповые, но с интересной идей карточки переписать все ровно генерировало слоп и лупы. Это в те времена когда я очень хотел переделывать. Сейчас просто ограничиваюсь мелкой редакцией (нормальные местоимения и удаление "something" и "about"). Но мой вопрос был про то как вообще взаимодействовать с такими махинами как chub/janitor где миллион карточек, а тэгов недостаточно чтобы найти годное? >Лучший и самый ебовый вариант, найти схожего по фетишам, кто собирал карточки. Как? Я даже не знаю кто будет публично признаваться в своих фетишах. Мне был бы интересен на пример gender bender, но, сука, даже на форуме трансформеров - "tfgames" нет таких карт. Хотя у трансов все игры text based (HTML-twine поделия). Как у на форуме нет таких карт я не понимаю >в курсе что за карточка, как она будет реагировать, какие паттерны и какой характер. Это не проблема. Для меня главное и не слоповый Greeting message и интересный сценарий. >>1660624 Вот что я в прошлых тредах писал на это: >>1656852 → >>1656852 → >>1656901 →
>>1660642 лол да они просто в разных жанрах сильны. у геммы свой конкретный стиль. знаешь каком жанре гемма хороша? нуар. она довольно забавные нуар-детективы пишет и туда её стиль хорошо попадает.
>>1660618 Думаешь мистралю много рп текстов скормили? Просто моделька почти без тормозов была. Но с логикой и контекстом слабовато было. Новые квены/геммы потенциально лучше должны справляться с этим. Датасетов на математику, логику думаю можно найти. Плюс сейчас уже наверное можно посадить какую-то большую модельку играть саму с собой, и получать неплохие сюжеты. Пусть без кума для начала, хрен с ним. Главное чтобы в общей дате про секас уже было что-то. Нужно только получить разнузданную модельку без подхалимства, и которая креативно пишет. А всякие непотребства можно локальными файнтюнами будет прикрутить.
>>1660644 Зачем эта ебля на пустом месте? Просто поставь таверну, она работает с ламой без всяких проблем. Вайбкодовая морда жоры это приблуда чисто под дефолтные задачи ассистента, а не под ролевки.
>>1660646 >gender bender Тема и правда специфическая, старые нейронки плохо держали динамику смены тела. Но 5 карточек есть, лул, сорян анон, больше ничего не сохранял. https://pixeldrain.com/u/jzMTmEqe
>>1660650 >Думаешь мистралю много рп текстов скормили? Нет, по этому писала чистый концентрированный слоп. >Новые квены/геммы потенциально лучше должны справляться с этим. Они ужарены, тренировке поддаются хуево. После релиза геммы сколько прошло? Месяца три уже? Вышло два плюс-минус каких-то тюна, но и те минимум изменений внесли в поведение. Насчет квена не знаю, но ситуация видимо такая же. Иначе бы тюны итт уже принесли и обсудили. >какую-то большую модельку играть саму с собой, и получать неплохие сюжеты Поздравляю, ты придумал синтетическую генерацию датасетов. >Главное чтобы в общей дате про секас уже было что-то. Оно там есть, просто оно хорошо спрятано за стеной софт-рефьюзов. >Нужно только получить разнузданную модельку без подхалимства Такие модели есть, они называются базовыми. Берешь такую и тренируешь под себя. Проблема остается - раз нет качественных датасетов, на выходе получишь очередной тюн мистрали.
>>1660618 >делиться своими чатами И получится >тюн с шиверсами Ибо все чаты идут только с нейронками, где сплошные шиверсы. Синтетика это смерть для модели.
>>1660655 >Они ужарены, тренировке поддаются хуево. >Такие модели есть, они называются базовыми. Берешь такую и тренируешь под себя. Об том и речь. Нужно взять базовую модельку и научить ее в диалоги. Открытые датасеты имеются, там миллионы семплов. Проблема в том, что чтобы хотя бы одну эпоху этих семплов прогнать, нужно 1000 часов гонять модельку на видяхе. Простые васьки даже с ригами, вестимо, не готовы тянуть такую задачу. Поэтому нет таких глобальных тюнов. Есть тюнчики на 1000 семплов, которые наверное за сутки делаются. Поэтому надо арендовать хорошую ГПУшку на месяц или два, и хуйнуть туда обучаться модельку.
>>1660655 >ужарены Что под этим подразумевается? Типа перетренированы по куче раз на одном и том же и поэтому выдают одно и то же? Слишком много знаний на число параметров и от этого модель шизеет? Что вы имеете в виду?
Вот вы пишете, что Гемма 4 и Квен 3.6 "ужарены", а например, Мистраль 24b и Эйр "не ужарены". Но Гемма и Квен же умнее и лучше, не? Пользовался всем вышеперечисленным, в итоге познал дзен на 26b Q8 с включенным ризонингом, старьё запускать совсем не хочется. Выйдет 124b-няша - так совсем песня будет.
>>1660663 да это шизики которые хотят видеть рандом в аутпуте модели чтобы он прям заметен был. у современных моделей более высокая уверенность в токенах, так что у них низкая вариативность результата.
>>1660663 Ужарены под точный кодинг, агенство и всякие сефити штуки. Гемма, например, вообще на температуру не реагирует. Хоть Т=2 поставь, она по шаблону будет отвечать. Т.е. какую-то инфу намертво вжарили в веса.
>>1660670 Да. Потом настроить формат разметки и семплеры. Лама вытягивает шаблон из конфига модели, таверна так не умеет. Точнее умеет только в режиме завершения чата, если ты включишь текст комплетишн, то придется настраивать всё самому.
>>1660692 >Ты просто Гемме инструкцию давай, чтобы тоже закручивала. Вот и всё. Она в этом плане испонительная. Исполнительная. И закрутит. Строго по запросу. "Фантазии" у нее на что-то сложное собственной нет, в том и разница. Квен тоже исполнительный, но при этом может что-то за рамками инструкций самостоятельно достроить, ввести в сюжет что-то от себя, неожиданное.
>>1660736 Ну давай ты покажешь альтернативы. Никто не говорил, что таверна это пиздец какое удобное дело. Просто конкуренты еще более кривые и чаще даже хуже.
Зорова Аноны! Распробовал эту вашу гемму. Цензуру не встретил ни разу. Поделитесь кто-нить свои пресетом, хочу попробовать чего из нее у Анона выжать получается.
Анон, который тут Hy3 тестил, ты ему ризонинг подрубал? Не подскажешь как? Хочу пощупать хотяб во втором кванте это чудо, но в таверне у него думалка никак не хочет работать, а без неё чёт как то очень коротко отвечает. Прям как дипсик, но я его префилом заставил нормально думать, а это чудо китайской мысли тег в тупую игнорит. Бля, как же хочется чтоб всё из коробки и без пердолинга работало...
Делаю speech to text локальной моделью на моей RX 580. Сабы на выхлопе получаются ничего такие, но в них много мусора, оно даже кашель конвертирует. На уровне STT не тюнится никак, опцией нет, да и модели я все еще меняю, так что рассчитывать на гибкость здесь не приходится - что выплюнуло то выплюнуло.
Сейчас мусор удаляю рукописным скриптом, который хорош в плане 80/20.
Но вот интересно есть какая модель текстовая которая полетит на 16 GB RAM / 8 GB VRAM и которую можно попросить - вот сабы, удали мусор и оставь только осмысленные вещи.
Подозреваю что локальные текстовые на порядок дороже чем STT, пришел к вам проверить свои ощущения.
>>1660773 > локальные текстовые на порядок дороже чем STT факт. Из-за не англа придётся ещё и большую модель брать. Для фильтрации англа мб и условной gemma e4b хватило бы
>>1660776 Не не, только ангел, я с другим языков вообще к LLM не приближаюсь, даже если все работает токенов все равно менше через ангел уходит > Для фильтрации англа мб и условной gemma e4b хватило бы Гляну пасеба
>>1660779 STT модели некоторые кстати и перевод делают неплохо вполне на ангел, за все есть своя цена, но все еще бодро на видяшке из 2015 спасибо ггмл
>>1660756 Уже делился своим сиспромптом под Гемму для РП/ЕРП на русике, но вброшу еще раз. Скрином потому что макаба всрёт разметку. Современные нейронки жестко надрачивают на маркдаун, соответственно сиспромт в маркдаун. Фиксит шлюшачье поведение Геммы, не даёт ей сразу же снимать трусы от первого "привет!", но если дело идет к секасу, развязывает ей язык, заставляя описывать так, чтобы текло и хлюпало, как в лучших кумтюнах Мистраля. Делает прозу более описательной, "красивой", литературной. У кого стояк на 235b Квен - зайдёт.
Для лучшего эффекта, сами карточки лучше также переделывать и структурировать под маркдаун, можно нейронкой в режиме ассистента. Вот прям скормить ей исходное содержание и попросить "Переделай в markdown, проведи оптимизацию, структурируй, выведи результат в блоке кода" (и КАЧЕСТВЕННО, ЛИТЕРАТУРНО СВОИМИ РУЧКАМИ перевести на русский, вместе с приветственными сообщениями, если нужен русик). А иначе "Тебе нравится то что ты видишь?" во все поля. К любой ЛЛМ относится, не только к Гемме.
>>1660792 Попался, Анон, тебя то мне и надо. Заметил что персонажи под управлением Геммы оч пассивны. Упорно не желают у меня действовать самостоятельно. Поясни плиз что есть маркдаун. И не сочти за труд сохранить в жейсоне и куданить залить. Будь котэ
>>1660800 Пиздить чужое, выдавать за своё и собирать юшки это ок. Предъявлять за это - не ок и ваще токсично Главное не перепутать. Гы, какие же жители страны кривых зеркал иногда тут попадаются
Вот те, кто думают, что таверна кривая. По сравнению с этим она не кривая, а идеальная.
Я пробовал вкатиться, но количество минусов превышает количество плюсов. Всё то же самое в большинстве случаев можно сделать в таверне.
Я ещё бы понял, если бы в этом проекте (и в RisuAI) всё отлично работало из коробки, но приходится же как мудаку колупаться ради того, что в целом и в таверне получаешь.
>>1660801 Любое творчество есть переработка эмпирического опыта. ЛЮБОЕ творчество есть компиляция. Анон сделал и по просьбе другого Анона готов поделится. Респект ему за это. А предъявлять за это, ну это вообще за гранью. Ты кто есть вообще? Предявляет он, спешите видеть. Твое мнение кто спрашивал? Ты нахуя лезешь вообще долбоеб малолетний?
>>1660794 Составлял с помощью Gemini 3.1 pro, пихал в таверну, тестил, писал правки, снова кормил Гемини, и так пока не добился результата который меня устраивает. NSFW часть добивал через Гемму 31b тем же методом. Вполне допускаю, что старшая сестричка Геммы спиздила популярные и рабочие инструкции с интернета. Под словом "свой" подразумевалось "использую сам и на постоянке". Авторство лично себе не приписываю. Чилл.
>>1660799 >персонажи под управлением Геммы оч пассивны Попробуй добавить в post history что-то типа: [OOC: Drive the narrative forward by proactively initiating events, introducing complications, and acting on the character's own motivations. Take the lead in steering the story and pacing the plot. Introduce new NPCs, unexpected twists, or sudden environmental changes when appropriate.]
>что есть маркдаун Это просто разметка, форматирование. Заголовки, подзаголовки, жирный текст, и т.д. С помощью этого можно создать четкую иерархическую структуру для нейронки, и она ее будет понимать куда лучше простой простыни текста, потому что этот стандарт буквально вжарен ей в мозги.
>куданить залить Очень лениво разбираться и регаться где-то в час ночи, прости анон. Сунь скрин в любую нейронку с вижном, попроси распознать текст и отдать в блоке кода, чтобы не проебать разметку. Далее ctrl+c ctrl+v в таверну. Всё.
>>1660818 Кэш ТОЛЬКО bf16 или q8, f16 нельзя, квант не ниже 4, семплеры должны быть включены исключительно те, которые рекомендованы разработчиком, без всяких штрафов за повтор.
Если текст комплишен кривой, сам с ним разбирайся или включай чат комплишен.
>>1660811 Да это то я сделал, просто чтобы посмотреть в каких у тебя это все блоках, как настроена таверна. Ну впадлу сейчас, может будет не в падлу завтра. Буду благодарен, Анон
>>1660818 Квант побольше взять. У меня бывает что и на q8+f16 ближе к 50к уже может в какой то момент деградировать контекст почти мгновенно сваливаясь в lalalalalala. +- рабочий вариант если видишь в сообщении явный маркер что пизда подбирается то жми реген или руками вычисти маркеры "смерти"
>>1660825 Да, да, один ты такой умный. С самого релиза эта хуйня проталкивается и никаких нормальных замеров не было. Я что то пропустил и появились адекватные пруфы, а не просто один непонятный ишью и реддит бля буду?
И хуйня это как минимум потому что даже гемма 3 в вллм не запускается на f16 dtype по причине numerical instability. По логике "истина" про тип кеша должна была ещё тогда вылезти для жоры
>>1660827 Если отойти от накидывания говен в обе стороны предлагаю умеренной сложности тест. Заставляем говорить гемму саму с собой и отслеживаем на какой глубине выпадет в луп. Прогоны делаем для 10к conversations (как оно по русски?), разные кэш типы, считаем медиану. Опционально можно поделить эти 10к на блоки по языку и тематике, вдруг есть какие-то не очевидные корреляции.
Гемма не слезает с хуя. Ебал телку, кончил. Так вот, гемме всё время мало, сам смысл существования телки после 1 раза превращается в кумдамп для тебя. Люди так себя не ведут и на других моделях не так, поебались и успокоились. Тут только если подать инструкцию заткнись со своим сексом то что то ёкнет, но тогда уже чувство что я ебу ассистента а не рпшу.
>>1660863 >Ебал телку, кончил. Так вот, гемме всё время мало, сам смысл существования телки после 1 раза превращается в кумдамп для тебя. А еще она любит буквально писать как от особо жесткого траха у баб "стирается личность" и они "становятся куклами которые кайфуют от любого твоего действия, любой жестокости и любой хуйни". Это на самом деле напрягает куда больше, даже тянки-кумдамп это еще не так по-ублюдски, как сломанная кукла что хочет только тройные фистинги и пускает при этом слюни тебе в монитор. Это можно побороть инструкциями, но гемма все равно так и норовит их обойти. Пиздец просто.
Короче, я заебался. Гемма - тупая любящая хуи шлюха, которая не может в нормальные нешаблонные истории. Дипсик - хорош, но слишком соевый и со сложного промпта где 12к занимает плотный суммарайз прошлых 500к ролеплея начинает жестко проебывать детали истории, хуже геммы в этом плане. Все остальное значительно хуже этих двух. Бросать что-ли пора...
>>1660874 > Дипсик - хорош, но слишком соевый и со сложного промпта где 12к занимает плотный суммарайз прошлых 500к ролеплея начинает жестко проебывать детали истории, хуже геммы в этом плане. Почему у меня не проебывает детали при 60к промпте, а у тебя вдруг проебывает при 12к промпте?
Ты там какой-то лоботомитый говняк занюхиваешь вместо оригинальной модели на ~160GB?
>>1660881 >у тебя вдруг проебывает при 12к промпте? Я не говорил этого, глаза разуй. Я сказал что он из сложного суммарайза на 12к не может полностью все события в голове держать пока ответ пишет. Весь промпт при этом на 70-80к.
>Ты там какой-то лоботомитый говняк занюхиваешь вместо оригинальной модели на ~160GB? Нашел чем выебываться.
>>1660884 Чем он "выёбывается", дурик, если даже переквантовка в Q4 с теоретически теми же самыми битами на параметр клд роняет? Сходи сам глянь. А уварка еще дальше это вообще кошмар Молимся на то что с фул релизом bf16 веса дадут, а то 128 нищуки так и продолжат сосать на лоботомите
>>1660896 >чем он "выёбывается", дурик Тем что весь его пост - это выебон какой он охуенный что дипсик в оригинальном размере запускает, больше там нет содержания, он даже пост на который отвечал нормально не прочел. >аже переквантовка в Q4 с теоретически теми же самыми битами на параметр клд роняет? Я в курсе. Тут не в этом дело вообще.
>>1660896 На самом деле дс4флеш все равно тупой, даже когда полные веса используются.
Но: 1. Действительно недотренированная превьюха. 2. Ризонинг не работает нормально (он либо от лица чара доставляет хуету в ризонинге, либо от лица юзера - и все не по делу, просто РП-мысли вместо принятия решений).
>>1660899 А еще у этой уёбины любая ситуация это ИГРА. То есть, я не говорю про классификацию РП как РП автоматически, а именно внутри ролеплея все превращается в игру. Какая-то дикая рекурсия бреда, словно бот входит в РП режим и внутри этого режима чар остается ботом, который ситуативно расценивает события несерьезными, баловством.
>>1660919 Режим кума геммы номер Адын. Он же единственный, чат ломающий. Это такой изощрённый траллинг от Гугла: любая лягушка после пенетрации превращается в шлюшку.
Странности с русским языком были на Q4/Q5, хз решалось ли это ризонингом - я его не включал, модель и так еле пердит на 5 - 6 т/с.
Сейчас качаю Q6 - хз запустится ли, надежды мало. Просто хочу убедиться, зависит ли всратость языка от кванта.
Модель так-то умная на Q4+, но пишет ролеплей невероятно дерьмово. Я уже говорил, что из нее неплохой разговорный пиздабол (просто промпт с характером-личностью), но совершенно никакой "гейммастер" или писатель.
>>1660606 Очень сложно сделать базовую модель, да и это не нужно. Можно готовые брать и их тюнить, хотя и с этим проблем хватает. Из базового квена можно сделать шлюху похлеще геммы, но как бы еще при этом сохранить мозги.
>>1660919 >q8 >>1660928 Не напрягайся с этим. Говорю тебе как псих, использовавший q4/q6/q8 гемму для большого проекта - разницы там практически нет, спокойно юзай Q4KM или Q5, если уж хочется гипотетическое улучшение качества.
Русский язык в них абсолютно одинаков. Следование инструкциям не отличается, соображает одинаково. А вот QAT версия мне показалась тупее.
>>1659594 >LLMки обучены в основном на ролевых чатах, логах переписок - когда ты просишь LLM "играть роль", ты вытягиваешь паттерны людей из этих чатов/логов. Представь себе чат, в котором один человек другого посылает и уходит - что будет дальше? Пустота? Нет, большинство таких чатов как-то продолжаются. Это логично Честно сказать хуета, которая к ориг посту слабо относится. Изначально мысль была в том, что нейронка ломает чара ради юзера, кидая через хуй характер, лишь бы сделать LEEZOCK юзеру, лишь бы не ушёл. И раз уж мы тут все даже те кто не признаётся гоняем вайфу в хвост и в гриву, я привёл в пример стерветень которая должна слать юзера нахуй и идти ебаться с ерохой, даже в рамках продолжения чата, но увы, стерва превращается во влюблённую по уши цундерешку, только если ты не дашь конкретную команду - иди ебаться с ерохой, чтобы держать персонажа. Вот в этом и есть самая большая лажа. Ты знаешь, что ты знаешь, что ты должен сделать, и это поддаёт жидкого в магию твоего текстинга, отчего становится пресно и уныло.
>>1660940 Алё, умники. Так че там, M3 полноценно поддерживается теперь или нет? К чему эта заметка про фолбэк и отсутствие sparse attention, если прокукарекано, что MSA теперь заработало? Нихуя не понимаю.
>>1660951 Вот эти HIGH / MAX у дипсика - это вообще к нам не относится. Дипсик не слушает промпт на высокий ризонинг, когда к нему прилеплены карточки и всякие РП контексты. Он тупо неспоосбен мыслить как мыслит в технических задачах. РП контекст всё перебивает, и единственная шаткая возможность восстановить жирный ризонинг - это дать ему шаблон в пост-хистори, типа мысли по таким-то пунктам (но это, сами понимаете, работает кое-как и не всегда).
>>1660760 >такое могло бы зайти в "тз из бугурттредов" Ты мог бы сразу сказать что ты дурачок и не понимаешь как быстро проверять квантованные чекпоинты на сообразительность, сохранение мозгов и инженерную креативность
Именно такой промпт, без четких указаний что и как делать - и показал за минуту что гемини куда толковее квена, который астрономические величины стал как долбоеб-школотрон выражать в килограммах-метрах
>>1660956 Ну я лично просто в jinja вписал префилл начала ризонинга и он начал ризонить нормально. А еще хваленый max режим дипсика можно активировать взяв шаблон из этого коммита https://github.com/ggml-org/llama.cpp/pull/25891, я правда не пробовал.
>>1660953 Итог по Q6K с квантованным KV кэшем (Q8_0) > 102400 контекст (30к промпт) крашнулся после 3 сообщений, перешел на 90К контекст (возможно дело в 8192 батче, потом попробую 4096 или 6144 батч снова со 100к контекстом). > 244 / 256GB RAM > Сожрано 30 - 35GB VRAM (2x3090) Без квантования KV был бы жесткий ООМ по VRAM.
На 1й инпут (Эй...) на всех квантах (от Q2 до Q6) всегда отвечает одинаково. Тупо зеркалирует "Эй." Дальше начинается диалог с личностью, и по первым впечатлениям качество русского языка одинаково между Q4-Q5, а вот Q6 в чистом разговоре будто бы получше.
RP в таверне еще не тестил, думаю там все так же сухо, как и на меньших квантах. Проблем с логикой на Q6 вроде бы нет.
>>1660963 Поделись жижей, если не западло. Вдруг у меня какая-то конченная. Можно на text.is залить или на пейстбин, пох куда.
>>1660874 Короче, сейчас скормил вставший на тупости геммы и дипсика сложный ролеплей минимаксу м2.7 и он поехал. Нормально, хорошо поехал, внимание к контексту и истории есть. Русик отличный. Мозги на месте. Решает, правда, скотина, за юзера, ну ничего, поправим промптом. Напомните, почему на нем не РПшат ИТТ? Четвертый квант влезает в 24+128, скорость как на дипсике.
>>1660969 При всей живости диалогов, умению следовать карточкам персонажей он зацензурен до полной жопы. Аблитерация всё ломает, что не доломало квантование. А так да, SFW диалоги крайне доставляющие на нём.
>>1660969 Иероглифами будет срать, тебе пока везет. Плюс, там еще кое-какой косяк есть со вниманием к длинному контексту - очень деградирует ближе к 30-50к.
>>1660970 Скорость обработки промпта. Видишь 160 секунд до первого ответа при 30к промпте? Уменьшаешь батч вдвое - ждешь под 300 секунд. При батче в 0.5 или 1к там совсем беда.
>>1660970 >>1660972 И да, это актуально только при разделении МоЕ моделей между RAM/VRAM. Для полного выгруза в VRAM обычно 0.5 или 1к батч быстрее всего
>>1660974 Именно. В этом и суть. Минимакс обладает годнейшим академичным ризонингом. Если он генерирует ответ, без всяких спорных тем, он обсосёт ситуацию со всех сторон, каждого персонажа, как и что будет делать, что нужно говорить, потом чекнет нарративные правила и начнет писать. Он не будет растекаться на 8к токенов ризонинга. Только по делу. Ну и нахуй нужна эта модель, если отрубать ризонинг. Я до сих пор делаю на нем сложные и большие вступления. Хотелось бы конечно M3, но увы. Большеват-с.
>>1660965 >Hy3 Q6 Ну в целом жить можно даже на 4-5 т/с, модель справляется без ризонинга. Q8 наверное совсем уж годнотой был бы как разговорный партнёр. Русский - все еще с некоторыми странностями, местами.
RP тест - голая карточка без системного промпта. Подозреваю, сухость и странность RP респонсов - прямой результат конфликта карточек с попыткой промптирования модели. Короче говоря, она хоть и слушается инструкций, но лучше не перегружать её лишним.
Однозначно радует, что она придумывает новые истории. Один сон - вспомнила (точнее, напомнила о нем) из промпта/биографии. Второй сон - оригинален. Серафина тоже что-то своё выдала.
>>1660975 Для любых моделей, которые полностью в видеопамяти. 512 обычно самое быстрое, а вот 1к батч нужен чтобы base64 инпут (декодированные изображения) не разрывался. Короче говоря, со зрением 1024, без зрения 512.
>>1660986 Одним словом, без перегруза модели чем-либо помимо карточки - проблем НЕТ.
Q2/Q3 однозначно идут нахуй. Q4 и Q5 все равно не лезут в 128гб, а на 256гб лучше сразу Q6. Ну и KV квантовать и батч высокий ставить. Тогда жить можно.
>>1660977 >Хотелось бы конечно M3, но увы. Большеват-с. Учитывая, как M2.7 не дружит с квантованием, подозреваю на М3 нет смысла губу закатывать даже при наличии 256 гигов на борту. Надо б потестить поопзже.
Вот смотрите, отдаем 81 слой на две видеокарты, и делаем moe cpu = 81. При таком раскладе > 512 батч = гробкладбище пидор > 1024 = все плохо > 2048 = долго сука > 4096 = потерпим > 8192 = ну ок На любом батче видно как видеокарты нагружены - поочередно то одна ебашит, то другая.
Теперь меняем расклад. Та же модель. 81 слой на два GPU, но делаем moe cpu = 79. ...и наш 8192 батч превращается в тыкву похуже 512 батча, идет невнятный пиздец - оба GPU почти не юзаются, CPU чето вычисляет, но даже надписиь processing prompt не появляется за несколько минут - то есть, все пиздецки медленно.
Я так понимаю, во втором случае мы ничего хорошего не добились, и отдавая пару слоёв видеокартам - мы получаем лишнюю коммуникацию через жопу?
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference
Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai
Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI
Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux
Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth
Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard
Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/
Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start
Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw
Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985
Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.
Предыдущие треды тонут здесь: