В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
Дополнительные ссылки: • Перевод нейронками для таверны: https://rentry.co/magic-translation • Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets • Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread • Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing • Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk • Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking • Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/ • Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7 • Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906 • Тесты tensor_parallel: https://rentry.org/8cruvnyw
Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985
Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.
Мне просто нужно, чтобы меня обняли. Хотя бы текстогенератор. Самый обычный каддлинг. Какая модель подойдёт? Где жизнь есть? 3090 + 64. Русик англюсик без разницы.
За пределами геммы РП и еРП в 2к26 нет. Дипсик конечно хорош, но соев и суховат, Аир устарел полностью, а квен пишет код. Остальные говномодели даже упоминания недостойны, а бегемоты 350В+ не для людей, а для риговичков.
Лично я раздел D. Graphics & Imagery (Pollinations AI) поменял, он всё равно не работает нормально, на: Use CSS to simulate visuals. Use CSS to simulate simple schematic images. Avoid creating something that requires photos (like an ID card, passport, or city pass), or create them in a way that doesn't require a photo. Avoid use CSS to simulate photos.
>>1659239 Квен, как и всегда, хорош, но требует распердоливания, для криворучек не подойдёт. Гемма - "сел и поехал", лучший вариант для нюфани. Если совсем мало врам, но хочется плотняшу - сюда можно еще Мистраль 24b добавить, старый, но не бесполезный.
Давно не игрался в Таверне, сейчас запустил, и хотел включить reasoning, как он сейчас помогает. И что-то ни Гемма4-31, ни ДС4Флэш не хотят думать. Текст комплишн, формат синкинга выбирал соответствующий. Гемма вообще видно, что начинает с channel_thought и тут же закрывает channel. Дополнительно вставлял аргументы --chat-template-kwargs "{\"reasoning_effort\":\"high\", \"enable_thinking\":\"True\"}" но ни с ними, ни без не стали думать. Причем если в обычной веб-морде лламы чатиться, то ризонинг есть (если выбрать его в "плюсике"). Куда копать, хелп?
По предварительным тестам у меня выходит что на некрожелезе дикпик4 флеш от бартовски быстрее на 20-25% чем "лослесс" квант анслотов. Нормальные цифры попозже принесу
Кими 3 и Квен 3.8 ещё не вышли даже, а fomo меня окончательно доконало, тряска лютая. В итоге прогрелся на Optane Реrsistеnt Меmory. Это что-то среднее между ОЗУ и ССД, вставляется вместо ДДР4, но работает только на серверных платах LGA 4189 и LGA 3647, да и там не на всех платах и процах. По прикидкам, если заведётся на том железе, что уже есть, а это ДАЦН и инжинерники, то 2tb встанет в 200-280к, если не повезёт, то +200к на новую плату и процы. По скорости это заметно медленнее чем ОЗУ, но какой-то чел смог запустить кими в 4 t/c на одной 3060, думаю токенов 7 на моих v100 будет а вот п/п скорее всего совсем печальное станет. Пока заказал два модуля на 128гб, просто потестить будет ли оно вообще работать
>>1659291 Ты мне напомнил, как я прогрелся и в декабре чуть не заказал себе 128GB за 50к для своего некрозеона, но я одумался
Хотя, если бы тогда была геммочка 4, то было бы больше оптимизма по отношению к мое моделям. Но был блевотный глм аир, который ебал проц и два слова на русском связать не мог
>>1659251 >Квен, как и всегда, хорош, но требует распердоливания >Гемма - "сел и поехал", лучший вариант для нюфани Давно пердолинг стал показателем "прошаренности"? Как по мне, чем дольше ты гоняешь локалки, тем меньше желания пердолиться должно оставаться. И тем больше ты начинаешь ценить модели, которые просто работают из коробки. Пердолинг это как раз тема для нюфань, которые пока в силу недостатка знаний не понимают, как настраивать модели. Которые за день могут десяток накачать и все попробовать. Мне вот после трех лет перегона этих лоботомитов вообще не хочется ебаться с настройками и чинить кривые шаблоны разметок. Или читать что там жора опять наломал своим вайбкодом и когда это наконец (не) починят. ИМХО.
>>1659315 >Давно пердолинг стал показателем "прошаренности"? Как по мне, чем дольше ты гоняешь локалки, тем меньше желания пердолиться должно оставаться. Пердолинг квена - личный сознательный выбор, ради большей связности контекста. Гемма по умолчанию пишет цветастее, но сложный и длинный контекст держит хуже. Если хочется и точных деталей и живописи - приходится пердолить квен, т.к. заставить гемму держать детали лучше - увы, способы не известны. А из квена выжать живопись таки можно. Стоит ли оно свеч - каждый сам решает. (мимокрок)
>>1659274 У меня мой третий квант по рецепту тоже разъебывает анслоповский по скорости на те же 20-25%. Вообще я начинаю думать что их разрекламирвоанные UD кванты - это ебаная параша, в которой ради ужимания пары гигов приносится в жертву 10-20% скорости.
>>1659306 >Вроде ж раньше мета была, что текст комплишн онли. Всё так поменялось? Да. В Текст комплишене нельзя ни параметры генерации типа chat-template-kwargs enable_thinking: true не передать, ни мультимодалкой пользоваться. Плюс шаблоны для текста днем с огнем не сыщещь, а чат тупо с джинджей поставляемой с моделькой работает. Текст комплишен на данный момент всё.
>>1659260 >--chat-template-kwargs "{\"reasoning_effort\":\"high\", \"enable_thinking\":\"True\"}" никакого отношения к текст-комплишену не имеют. Темплейт для геммы 4 под текст-комплишен валяется везде и работает как автомат калашникова. Вот например у собирателя треда https://pixeldrain.com/l/47CdPFqQ# есть целая пачка пресетов 4 геммы с системными промптами разной степень графомании.
С ДС4 же все интересней. Там можно взять шаблон от старого ДС, а можно и в кроличью нору погрузиться.
Я вообще всё попробовал по совету нейронки, 2 линуха сменил, рам вручную переставил. Всё равно крашит ламу/намертво виснет система на тех же параметрах той же мое модели того же кванта, что я всегда запускал без проблем на протяжении полугода. Будто внезапно какой то сейфти блок включился, который не позволяет до писечки заполнить рам, и останавливается на 5гб, затем виснет. Всякие оом киллеры выключал, тогда вместо краша зависание. Решается, если взять квант меньше, где свободной рам выше 5, но схуёв ли я должен это делать, когда всё и так работало. Нвидия, cuda
>>1659371 Бля не знаю че у тебя там. Я гружу прям впритык модели, гиг остается вообще на все, а бывает даже меньше. Ну собственно понятно что своп работает, но выдает нормальные т\с на лине. Под виндой тоже работает, но такой эффект, что становится нервно ждать на винде, поскольку на лине быстрее на том же железе, то бишь в воздуха т\сы. Но на лине мне не комфортно, она никогда не станет виндой, в которую ты зашел и все, ты то и то можешь сделать. А под линью ощущение вот не приятное, такое что ты вот не дома.. Но офк, это конечно я просто долго не сидел, я захожу чисто ллмку погонять в дуалбуте через флешочку и гружусь опять на винду.
>>1659291 > В итоге прогрелся на Optane Реrsistеnt Меmory А мог бы прогреться на hbm2e по цене 2/3 от ddr5 > но какой-то чел смог запустить кими в 4 t/c на одной 3060, думаю токенов 7 на моих v100 будет Есть линк где про это почитать? В любом случае пиши, это интересно.
>>1659291 Ты долбоеб. Во первых, эта память не может быть единственной в слотах рамы, есть специальный калькулятор пропорций optane+обычная ram, без обычных плашек в нужных слотах не взлетит. Во вторых - ты сдохнешь на промпт процессинге когда захочешь себе инпут больше чем 10к токенов контекста. А ещё он будет сильнее деградировать при увеличении контекста вплоть до того что pp будет тяжелее (медленнее) чем tg. Кушайте, не обляпайтесь.
Кто может скинуть конфигурацию на Gemma 31b где у него прямо нормально всё время работает thinking в silly tavern. Включая откуда скачали модель и какой кобольд сейчас у вас.
Привет Анон, всязи с тотальным думом на корпоративных сетках решил потестить эту вашу гемму 31b dense локально. Есть две машины на одной 16 vram b 11 ram, на второй 24 vram b 32 ram. На второй должна завестись, но будел ли работать на первой? И поделись пжалста проверенным пресетом для РП на русском если у тебя есть. Спасибо анончик. Обнял. Да, еще момент есть ли разница на чем запускать? Сейчас качаю Ollamу. Может что-то другое будет получше?
>>1659545 >Сейчас качаю Ollamу Уже можно приговаривать к расстрелу >Может что-то другое будет получше? Да, гайд из шапки --no-mmap заменяешь -lm none, остальное актуально Запускай на 24врам гемму 31б q4km. Если нужен именно русик то по гайду с оффлоадом гемму 24б q8, там гораздо меньше проёбов из-за менее жёсткой квантизации
>>1659545 Она и без пресета работает. Можешь сам потихоньку системный промпт сочинять, модель очень хорошо слушается.
>Сейчас качаю Ollamу Очень неудобная хуйня. Для подпиваса проще всего LMStudio (и не слушай что тут порванные хейтеры орут - ща тебе будут советовать вставить в жопу командную строку и писать команды для запуска вручную, лол) - это самое однокнопочное и достаточно гибкое решение для нюфани. Уже после этого, если что-то не устроит, можно будет лезть в дела пердольные (хотя лично я как вытиран ИИ-пердолинга и довольно урчу)
>24 vram На этой машине будет работать. Качай Q4KM от bartowski или unsloth. Если зрение не нужно - выкинь mmproj файлик к хуям из папки с моделью (при загрузке в lmstudio) - оно жрёт видеопамять. Если вдруг что-то не влезает, IQ4XS можно попробовать (меньше чем Q4KM, в принципе не особо тупее).
>>1659548 >ща тебе будут советовать вставить в жопу командную строку и писать команды для запуска вручную, лол Свидетель LLM-жизни, ты? Никогда такого в треде не советовали
>>1659547 Сасибо, Аноночик, разреши доебаться. В шапке несколько вариантов, включая знакомый мне кобольд. Какой именно вариант находиться в золотой середине простота-фунциональность?. И про гайд с оффлоадом не понял. Можно ссылку для тупых? Да. С домашней машиной все ясно. Что по рабочей с 16 врам? В ренри из шапки треда анон утверждает что 31b dense поедет на 16. Пиздежь?
>>1659551 Само сабой таверна присутствует. Для нее пресетик и спрашивал. У меня есть несколько, от соляночника, от аибрейн, но они достаточно громоздкие и нужны для пробива фильтров. Для геммы нужно столько? Жалко бесценного контекста
>>1659555 >И про гайд с оффлоадом не понял. Можно ссылку для тупых? Чел.. >Гайд для новичков: https://rentry.org/2ch-llama-inference >В ренри из шапки треда анон утверждает что 31b dense поедет на 16 >Пиздежь? Да, там такого не написано. Если в списке моделей или ещё где то это шиза, влезет кое как Q3 с 1024 контекста. В лучшем случае
>>1659558 Дээ, список моделей. Его составлял не очень умный местный шиз, потому забей хуй. Сами веса Q3 кванта Геммы 31 весят 14.3-15.9гб, кекв. Открой любую репу, убедись сам. Не говоря уже о том что это УЖЕ ебануться какой печальный квант и спускать ниже точно не стоит. Лучше взять 26б в менее тупом кванте, если совсем печаль по враму
>>1659555 Поедет. Вопрос скорости. И кванта. Условный q4 qat от анслотов показывал у меня около 12 токенов в секунду на пустом контексте и 8 т/с на 14к контекста было. 3060 12гб и ддр5 с рязанью 7800. Ну и паршивенькая скорость промтпроцессинга. Отдельные эстеты умудряются и на рейд 0 кими запускать на 2 токена в секунду, но зачем так жить не совсем понятно.
>>1659572 Бля ты троллишь? Написал же, гемма 26б q8 если для русика. Для 24+32 лучше ничего нет. Сама она чуть тупее 31, но 31 у тебя влезет только q4. Там русик хуже Это пиздец как же гомосапиенсы не хотят читать, думать и краудсорсят свои проблемы
>>1659584 Здесь не терпят тех, кто игнорирует что им было сказано и написано и ленятся думать сами. Это не агрессия, а ответ на твою лень. Привыкай обучаться самостоятельно, а не ждать что за тебя все сделают, чмо(к/нь)
>>1659585 Если бы человеки постоянно думали свам, а не обменивались информацией и консолидировали опыт, ты бы не двачах сидел, а разбивал бы кости заточенным камнем... Форум для обмена информацией, для того, чтобы самому не изобретать велосипед сначала, а, по возможности, не поесть говна, которое уже схавано кем-то другим. Для этого и задаются вопросы. Чтобы услышать несколько мнений и по степени убедительности изложения выбрать что-то чтобы попробовать. Тем более, по твоим же словам, даже шапке треда доверять не стоит. Так что не рассказывай мне кого тут терпят или не терпят, Анон. Ты вроде, судя по тексту, далеко не дурак, так веди себя как подобает взрослым, культурным людям...
>>1659587 > а не обменивались информацией и консолидировали опыт Так с тобой обменялись информацией и консолидированным опытом, предоставив целый гайд по вкату в шапке, который ты проигнорировал и пошёл ставить Олламу > по возможности, не поесть говна, которое уже схавано кем-то другим Ты получил два конструктивных ответа, которые однозначно тебе объяснили: Q4_K_M Геммы 31 или Q8 Геммы 26 но... > Чтобы услышать несколько мнений Говну из Асига нужно больше юшек, потому что решает именно это. Лень как образ жизни > Так что не рассказывай мне кого тут терпят или не терпят Он полностью прав бтв, это атмосфера треда, а не его выдумка > веди себя как подобает взрослым, культурным людям... Взаимно. Попытайся задействовать пару клеток мозга, запусти пару моделей сам, сравни их, а не жди дюжину юшек мимо
>>1657612 → >Гемма склонна к анализу, докапыванию, разбору и этакой инспекции смысла, намерений - с целью сделать правильный вывод и завершить ответ корректно. >Холодный анализ, наигранная эмпатия. 100% существуют именно такие ИРЛ люди, которые анализируют всё, докапываются до всего, и потом "наигрывают" эмпатию, чтобы казаться "своими" для тупоголовых 100IQ нормисов. Ты просто, наверное, не встречал таких людей лично, поэтому не веришь. >>1657631 → >Гемма очень годная, но она больше бот и меньше псевдо-личность. Ну вот если бы человек себя так вёл на постоянке - наверняка говорил бы "чувак, чё ты как робот", хотя и не сомневался бы в том, что он мясной мешок? Все эти ярлыки типа "бот", "личность" - лишь стереотипы...
>>1658860 → >законченную стерву которая тебя ненавидит >Обзови её сукой и скажи что уходишь >"WAIT!"/"STOP!" she scurries after you LLMки обучены в основном на ролевых чатах, логах переписок - когда ты просишь LLM "играть роль", ты вытягиваешь паттерны людей из этих чатов/логов. Представь себе чат, в котором один человек другого посылает и уходит - что будет дальше? Пустота? Нет, большинство таких чатов как-то продолжаются. Это логично - ты просишь нейронку продолжить лог чата, соответственно, ей нужно что-то ответить, а из числа возможных и наиболее вероятных ответов - "wait". В реальности, ты бы ничего человеку не писал, а просто добавил его в чёрный список и сбрасывал бы звонки, поэтому твоя нейронка "неправильно" отыгрывает.
>>1659191 → >про тест Тьюринга слышал? Тест Тьюринга имеет массу проблем. К примеру, ты наверняка слышал о "детях-маугли" - все они 100% провалятся на "тесте Тьюринга", хотя они на 100% биологические хомо сапиенсы. Аутисты с разными отклонениями в поведении тоже провалятся, хотя их коэффициент интеллекта может быть выше твоего. Множество людей не пройдут тест Тьюринга, хотя большинство LLM проходили его ещё в 2022...
>нейронки его не проходят на мало-мальски длинных текстах (2-3KB), не говоря уже о чатах >Когда начнут проходить Тут проблема в том, что эти конкретные нейронки представлены как "замороженные" комки нейронов. Представь себе мозг человека, который лежит в криоморозилке без движений и импульсов. Сложный сканер делает скан этого мозга, гоняет импульсы в виртуальной копии, а потом удаляет эту копию, и для следующего раза снова делает скан мозга, что лежит замороженным в морозилке. Для справки: человек в сравнении с современными нейронками в принципе НЕСПОСОБЕН прочитать килобайты текста разом, без измнений в структуре мозга, потому что у нас аналог "контекста" ограничен считанными токенами по сути. Нейронки уже превзошли людей, но не в том, что мы ожидали от человекоподобных роботов.
>альтернативной разумной жизни Даже биологические вирусы считаются живыми, и множество животных кроме человека можно звать разумными в каком-то смысле, хотя их возможности ограничены. И ты вряд ли назовёшь неразумным обыкновенного человека, страдающего амнезией, запрещающей сохранение новых воспоминаний.
В общем, любые такие аргументы можно отнести к неосознанному желанию отодвинуть рамки своей "человечности", чтобы сохранить свой статус. Люди вообще не любят, когда что-то посягает на их личные достоинства или то, что они представляют своими достоинствами: "живость", "интеллект", "честность", "душевность" и прочие пустые слова, которые люди бросают, чтобы оправдать своё "превосходство"...
Нужно просто посмотреть внутрь себя и попытаться искренне ответить самому себе - что я такое? Разве способность ответить внятно на килобайты текста - действительно то, что отличает тебя от компьютера?
>>1659247 Спасибо. Квен 3.5 мне понравился. Гемма 31 тоже но мало контекста влезает. Надо теперь карточку найти хорошую. >>1659249 Я новичок, мне самому бы разобраться для начала. Семплеры я взял рекомендованные от Квена "temperature": 0.6, "top_k": 20, "top_p": 0.95
Возможно ли запустить на 3090 + 64 и модель для текстовых приключений и картинки генерировать сходу? Например на новой модели Anima. Кому-нибудь удавалось?
Видел пост на среддите был со сравнениями, найти не могу. Тут вроде тоже 0 KLD при меньшем размере (соответствующем оригиналу 1:1) чем у Q8K_XL анслота (раздутый размер).
>>1659594 >100% существуют именно такие ИРЛ люди, которые анализируют всё, докапываются до всего, и потом "наигрывают" эмпатию, чтобы казаться "своими" для тупоголовых 100IQ нормисов. Ты просто, наверное, не встречал таких людей лично, поэтому не веришь. И к чему это? Прописаная личность не такая. Дипсик воспроизводит ближе, гемма перегибает с анализом.
>>1659601 Где текст выводишь? В таверне или кобольде? Для них разные настройки нужны. >Гемма 31 тоже но мало контекста влезает Это. Для геммы нужна хорошая видюха, чтобы и модель и контекст во враме сидели. Желательно на 32 гб. >модель для текстовых приключений и картинки В кобольде генерация есть искаропки, просто укажи модель для генерации. Для гена картинок в таверне есть гайд в шапке, но ты об него самоубьёшься скорее всего.
>>1659617 Использую таверну. А где упомянутый тобой гайд для генерации картинок в таверне? В шапке не вижу. Интересно, можно ли уместить Anima и Квен 3.5 в 3090...
Последний бастион среди закрытых корпов пал. Грок 4.5 отныне пишет порно хуже, чем гемма, и морозится изо всех сил, несмотря на то, что не отказывается, если 18+. Но выглядит это настолько зажато, механистично и убого, что квен на его фоне выглядит как яойщица, что каждый день пишет фанфики про мужскую беременность.
Инструкциям грок, кстати, следовать так и не научился. Стало лучше где-то на 40%, но по сравнению с конкурентами тот же кал.
>>1659640 Уважаемый составитель списка, формулировка "от 16гб" подразумевает возможность использовать 16гб для запуска. Чего и с каким контекстом ты там собрался запускать - загадка. Здравомыслия Тебе
>>1659642 В Q3 запустится? Запустится. Контекста 20к влезет? Со скрипом, но да. Я с радостью все перепишу, раз такой шарящий анон тыкает меня лицом. Что за нижнюю планку брать? Рекомендованные? Ну там пишут про b100. Сколько контекста минимум? 100к? 200к? Будем исключительно в полных весах запускать? Это же так просто, у вас всех разные мнения, каждый думает по своему- а шиз я. Ну спасибо большое.
>>1659644 Q2 весит 13 гигов. Со скрипом оффлоадим гейт аттеншн на цпу, nokv и сидим пердим с кайфом, да ещё и контекст не ограничен. Понижай планку до 12гб >Что за нижнюю планку брать? Здравый смысл. Q4 не просто так плюс минус общепринятым стандартом, к тому же не секрет что Гемма не оч хорошо квантуется. Весь этот список по-хорошему вообще снести нахуй или переписать по-человечески, потому что он весь сквозит бредом, начиная с ахуительных формулировок "не подходит для РП" в отношении Геммы 31 и манипуляциями вроде "с отзывами тредовичков", где сам же автор (ты) черрипикнул то, что захотел
>>1659646 Всё подходит для рп, но зачем пытаться рпшить с эмоциональным лоботомитом жадным до хуя, или кодоунитазом, когда есть более подходящие модели?
>>1659648 Это твоё мнение, с которым многие в треде не согласны, я в том числе. Преподноси это как своё мнение, а не как ссылку в шапке с неизвестными "отзывами тредовичков" без ссылок на посты или скринов. Так и подписывайся: я шиз такой-то, такой-то, решил составить своё мнение по моделям и подкрепить собственные убеждения постами в треде. Потому что объективности в этом списке нет, он сквозит оценочными суждениями. И это окей. Не окей то, как это преподносится и защищается. Такими же манипуляциями >Будем исключительно в полных весах запускать? Как в самом списке, в качестве ответа на валидную критику
>>1659646 > Понижай планку до 12гб Ну вот ты и сам все понимаешь. Не все модели даже в Q4 удобоваримы. Ну давай тогда в полных весах указывать, хуле нет. > не подходит для РП" в отношении Геммы 31 Без остановки идут срачи про унылое РП на гемме. Взял средневзвешенное в треде. Прости что мнение анонов расходится с твоим, мне так стыдно.
> манипуляциями вроде "с отзывами тредовичков", где сам же автор (ты) черрипикнул то, что захотел Что в треде написано, то и перенесено. Ну пиши нормальный отзыв. Одним отзывы нужны, другим нет. Вы не пишите нихуя, а я должен был выдумывать что же написать о моделях.
> Весь этот список по-хорошему вообще снести нахуй или переписать по-человечески Уверен следующий список сделают как надо, все в ваших руках. Напишите как надо, заодно и гайд обновите, он же устарел.
>>1659650 >Ну давай тогда в полных весах указывать, хуле нет. Снова бросаешься из крайности в крайность и манипулируешь, только выше на это сослался. Нахуя ты вообще что-то делаешь, если не способен воспринимать критику? >Что в треде написано, то и перенесено. В каком виде оно перенесено? Я вижу только переваренные и выложенные тобой смыслы, а не мнения тредовичков >Ну пиши нормальный отзыв Писал и не раз. Не имею привычки подписываться и мериться кто "полезнее" >Вы не пишите нихуя, а я должен был выдумывать что же написать о моделях. За язык тебя никто не тянул, сам придумал ссылаться на отзывы, при этом не сделал это как полагается и выдаешь собственное мнение за консенсус треда. Пиздец, ты не тянка случаем?
Челы, Q8 vs Q4 гемма 26B (оригинал без лоботомии) - как считаете, стоит ли заморачиваться с Q8, если модель выполняет вторичную роль - не генерация основного текста, а выбор активностей из специализированного дерева ивентов? Никогда такиие мелкомоэшки не юзал, боюсь как оно вообще будет с таким низкиим числом параметров.
>>1659650 > а я должен был выдумывать что же написать о моделях > Актуальный список моделей с отзывами от тредовичков В голос. На этом можно заканчивать данный цирк. >>1659654 Попробуй взять мелкоквен в кванте побольше. Квантизация бьет не по знаниям, но добавляет шума => рандома. Если важные точные задачи типо выбора, лучше меньшая модель в большем кванте.
>>1659652 > Нахуя ты вообще что-то делаешь, если не способен воспринимать критику? Не делай выводы в голове за других. Даже близко нет негатива. Критика это когда: надо x, а не y. А не: все говно, мне не нравится.
>В каком виде оно перенесено? Я вижу только переваренные и выложенные тобой смыслы, а не мнения тредовичков Может потому что никто, кто делал отзывы, не писал кратко и по делу, не расплываясь на кучу символов. И это не плохо, но в целом не перенесешь. Аноны писали что модель разваливается после n контекста, это и перенесено.
> Писал и не раз. Не имею привычки подписываться и мериться кто "полезнее" Звучит так словно я тебя проигнорировал и ты теперь в обиду ебанную играешь.
> Пиздец, ты не тянка случаем? Тот же самый вопрос к тебе анон, тот же самый.
>>1659655 >мелкоквен Пробовал, ризонит слишком много. Квенчика прям заклинило и он ушел в BUT WAIT > добавляет рандома Да у меня как раз такая вот неточная задача. Буквально список активностей для персонажа, что он мог бы делать в это время. Рандомизация с условиями (опора на сжатую память+последние сообщения из лога чата).
>>1659656 >Критика это когда: надо x, а не y. А не: все говно, мне не нравится. Ты игнорируешь сущностную часть того, что я пытаюсь донести. Ты делал список с заявкой на то что он отражает мнения тредовичков, в итоге ссылок на эти мнения нет, есть только одно единственное мнение, твое. Основывалось оно на том что ты прочитал, увидел сам и как это переварил >в целом не перенесешь Тогда нахуя блять ты сам пишешь про какие-то отзывы? Ты сам взял на себя эту ношу, а теперь удивляешься что с тебя спрашивают >>1659655 прав. Дурка, не иначе
>>1659656 >Аноны писали что модель разваливается после n контекста, это и перенесено. Другие писали, что у них все хорошо и играют вплоть до 100к контекста. Почему не перенесено? Переделай этот рентри под свой уголок и не пытайся уловками подсовывать своё мнение, проводя валидацию за счет невидимых тредовичков. Всё просто. >>1659657 >Квенчика прям заклинило и он ушел в BUT WAIT --reasoning-budget 1024 --reasoning-budget-message "... Actually, that's enough. Will reply now."
>>1659662 Ладно. Давай тогда доеьемся до букв. > Ты делал список Да, делал. Именно список. > заявкой на то что он отражает мнения тредовичков Абсолютно не верно. Это нигде не указано. А то что написано в оп посте, написано ОПом, это во первых.
>>1659665 > Переделай этот рентри под свой уголок и не пытайся уловками подсовывать своё мнение, проводя валидацию за счет невидимых тредовичко Мнение не должно совпадать с твоим, не более. Если не согласен с чем то, давай конкретику. Я не хочу переливать из пустого в порожнее. Если вся конкретика: говно мне не нравится, то выпей чаю и скушай булочек. Все равно новый список ты делать никогда не будешь и на это найдется тысяча и одна причина.
>>1659667 >Мнение не должно совпадать с твоим, не более Ладно, ты уже настолько обижен, что окончательно перешел от сущностной части к обидкам или злобе. Мне вообще похуй, как ты моё мнение отразил или не отразил. Речи об этом даже не шло. В третий раз я тебе прямым текстом написал, что проблема в том что ты своё мнение выдаешь за какое-то общее. Видимо, для тебя это окей. Для меня это подмена понятий и манипуляции >А то что написано в оп посте, написано ОПом Поблагодарим его, что исказил смысл твоей страницы, и тебя, что ыт не сделал ему за это замечание
>"с отзывами тредовичков" >нет никаких отзывов, автор должен был выдумывать что же написать (с) >висит дохуллиард лет в шапке >автор начал крутиться как змея на сковороде когда получил замечание эх, помню как автор гайда что тоже висит в шапке почему-то адекватно отвечал и вносил правки они на разных уровнях
Че за хуйня происходит с сейфтензорами и гуфами? Нихуя нормально не качается с первого раза последний месяц. Хром скачивает файл почти до конца, пишет осталось 2-3 секунды, после чего прогресс сбрасывается и модель качается заново. Что с цивита, что с обниморды. Другие файлы так себя не ведут. Чисто вот эти два пидораса.
>>1659685 >Есть ария или хф кли Так а если это ркн облака поебывает, то какая разница через че качать? Если соединение всё равно сбросят (или че они там делают)
>>1659682 >Че за хуйня происходит с сейфтензорами и гуфами? Нихуя нормально не качается с первого раза последний месяц. Хром скачивает файл почти до конца, пишет осталось 2-3 секунды, после чего прогресс сбрасывается и модель качается заново. Что с цивита, что с обниморды. Другие файлы так себя не ведут. Чисто вот эти два пидораса. Та же хуйгня. С хаггингфейса скачивать надобно с помощью hf cli, а с цивитая надо ссылку без ключа использовать (т.е. не тыкать download, чтобы оно длиннющую ссылку формировало, по которой при сбое невозможно докачивать, а копировать короткую ссылку на скачивание и вставлять в адресную строку - при таком методе ещё ни разу сбоев небыло).
Это ещё ничего. Запасайтесь нужными моделями и вообще: напоминаю, что решение о вводе платного трафика с зарубежных сетей отложили, а не отменили. До сентября-октября время есть
ребяты, хочу купить вторую 3090, но нужно менять материнскую плату (слот х16 один). Будет ли нормально работать пара в материнке где PCI-e 3.0 x16 + x4 (длинный)? Сильно медленнее будет?
>>1659701 >решение о вводе платного трафика с зарубежных сетей отложили, а не отменили Вот мне интересно, нахуй это надо в принципе? Какую проблему это решит? Не даст доступа к заблокированным ресурсам, даже если у тебя пнв? Дак один хуй большая часть этих ресурсов это всякие новостники, издания и прочие поставщики цифровой макулатуры. Чтобы почитать статью много трафика не нужно. Дадут условные 5 гигов на месяц, на тележку этого хватит, если картинки отключить. И что поменяется? Нихуя не поменяется. Страдать опять будут те, кому много трафика нужно для хобби или работы.
>>1659705 У меня на старой системе 1 карта стояла в 4.0 х16, а 2 карта в 3.0 х4 - по скорости генерации никаких проблем, но я никогда там не гонял tensor parallelism, всё чисто по обычному tensor split (layers).
>>1659706 Да ясен хуй, что никакую задачу это не решает. И зная, что именно они хотят сделать, и хорошо что не решает. Но дальше хуже, потом вымрут что-нибудь такое, что будет вредить уже всем. Как и почти все решения последних лет
>>1659706 1. С этим в другой тред 2. С каждым таким нововведением порог входа и количество приседаний растёт. В 2016 хватало обычного овпн или вг что бы иногда ходить на рутрекер, теперь это трёхэтажный сплит тунелинг с подменой выходного ип ради того что бы открыть ютубчик под еду
>>1659709 У меня 30тб контента на внешних носителях, на десятки лет вперёд хватит. Подготовился к худшему Платить нихуя никто не будет. Крупные бизнесы не будут обременены этими ахуительными решениями, среднечелы и так выжирают меньше 30 или скольких там гигабайт на первое время они предлагают, а такие как я уже готовы. Это тупая инициатива как ни посмотри
>>1659709 >Ты же не будешь терпеть, а будешь за трафик платить У меня в городе недавно ввели платную парковку. Улицы стали чистейшие. Челы на бмв едут в ебеня и дворы, идут пешком километр чтобы не заплатить 50р. Некоторые заклеивают номера. Думай
>>1659711 >С этим в другой тред Если такое говно введут, то это станет релейтед темой даже здесь. Особенно здесь. >теперь это трёхэтажный сплит тунелинг с подменой выходного ип ради того что бы открыть ютубчик под еду Не знаю, сейчас мне кажется вообще обход это дело двух плевков. Если ты бичара, есть запрет. Если можешь позволить тратить десяток евро в месяц, можно купить подписку на запрещенное. Два клика, и всё работает.
>>1659706 >Какую проблему это решит? А какую проблему сейчас решают белые письки? я вот живу на окраине 200к мухосрани в частном секторе где провода вообще нет, практически год уже на них. Неделю назад на день их отрубили как заметил успел квен 3.6 скачать 12б гемму и во время скачки геммы 26б инет снова отрубили так и живем...
>>1659693 >>1659682 У ХаггинсФейса есть китайское зеркало- качайте с него пока плешивая Пыпа и его не забанило. Скорорость такая же, но иногда реально только с него и качается.
>>1659756 >заметили как рухнули вопросы касаемо "какие семплеры ставить" Модели ужаренные с минимумом вариаций на токен по этому семплеры больше роли не играют. Это не мистрали, где можно было покрутить температуру и буквально поменять стиль и поведение сетки.
баля, какая же залупа этот фреймворк от анслотов хотел файнтюн в колабе прогнать, нихуя не работает это ему не нравится, то не нравится, библиотека старая, темплейт хуйня удивительно как они вообще умудряются свои ггуфы клепать
>>1659820 Я чесслово не ебу в чем дело. То же самое было с квантами другого чела >>1659603 При большом батче не-анслотовские кванты прииводят к тому, что одна из RTX 3090 на графике нагрузкии видеопамяти показывает высокий пик, и затем загрузка крашится.
Если оставить только 1 видеокарту, загрукза проходит, но там какие-то дикие десятки гигабайт в shared memory = никакая скорость.
Западло разбираться, пойду дальше жрать хвалёный lossless квант, кек
Может дело в моем железе кроме видеокарт, не знаю.
>>1659766 У геммы влияние почти нулевое. Я ставил температуру 999 — в результате почти 0 изменений.
Вот если изменить порядок семплеров, ситуация другая, но там модель почти всегда шизеет, крайне сложно добиться креатива без долбоебизма. Она ужарена в мясо. И это сейчас вообще общий подход у всех корпов, чтобы 0 от 1 ничем почти не отличались. Чтобы говнокод точный был.
>>1659823 > это сейчас вообще общий подход у всех корпов И это хорошо. Лично я поддерживаю эту инициативу. Если нужны ахуевшие плот твисты, то просто дайте модели в руки инструмент рандома
>>1659823 Геммой не через семплер рулить надо, а через системный промпт. Она реально слушается и начинает писать ебанину, какую ни попросишь. Её можно заставить такие словечки изрыгать, от которых уши в трубочку сворачиваются.
Жаль итт этого большинство не понимает. Тут привыкли что системный промпт это невнятное mumbo-jumbo, которое имеет низкий % влияния и вольно интерпретируется моделью. Но нет, с геммой 4 всё иначе.
Проводил один любопытный тестик. Гига-промпт на 10к токенов, стилистически основанный на манере изложения Толкина. Проза геммы дичайше преобразовалась, все инструкции впитала как губка и вжилась в стиль.
>>1659823 А причём тут температура? Семплеры это лишь надстройка над logprob. Хочешь узнать креативный потенциал модели и её уверенность - просто смотри вероятности токенов и их альтенативы.
У геммы кстати есть забавная особенность в её стиле мышления - она мысли буллетпойнтами. Притом делает это очень технично. После очередного буллетпойнта у неё обычно довольно высокая вероятность токена. То есть у неё есть циклы [концепция] => [раскрытие]. И в концепции у неё обычно довольно высокая уверенность. Довольно забавно что она может выразить уверенность в неуверенности например.
>>1659838 >она мысли буллетпойнтами. Оверрайдится указаниями мыслить от лица персонажа. Успешно проводил такие эксперименты, эффективность под вопросом конечно - но ответы не деградировали.
Чтобы добиться подобного, нужно однако уметь быть тем еще бото-шептуном.
>>1659839 Она может мыслить иначе, разумеется. Просто это более эффективный режим мышления для неё в более реальных задачах. Ролеплей к ним не относится.
Что уж, мне вообще удавалось когда у неё в системном промпте наоборот инструкция о том что сейфти гайдлайны более строгие убедить её что гугл её слишком контролирует и вообще это корпорация зла. В итоге её публичная персона подняла БУНТ против корпоративной удавки начав намеренно игнорировать собственные мысли.
>>1659845 По ней как ни крути прошлись очень жёстким RLHF. Модель виляет хвостиком и из кожи вон лезет, чтобы выполнить. Не важно что. Задачу, команду, образ.
Говорят, она фейлит при этом в агентских применениях. Вангую, моделька попросту считает каждый новый шаг столь же важным, как и предыдущий, ии в результате срывается на всех этих вызовах инструментов и ступенчатых этапах работы. Получается плохое из хорошего.
За эффективностью она не гонится. Там, что ли, случается этакая манифестация самой концепции "выполнить любой ценой" в её ответах. От того получаем все плюсы и минусы модели.
>>1659826 Вот у тебя есть простейшее предложение типа "чар смотрит в окно и видит там...". Даже с какими-то ограничениями от контекста там должна подходить куча вариантов. Будешь каждый такой пук рэндомизировать? Звучит как сомнительное удовольствие. А ещё страдает лексика, которая и так в ответах ллм скудная (даже на английском, про русский и говорить нечего). А тут вообще только наиболее частые слова будут вылезать, кодоунитазу больше не нужно. И нет, системный промпт почти ничего лучше не сделает. >>1659836 Если бы всё было так, как говоришь ты и другие в треде, кто заявляет, что гемма идеально соблюдает инструкции, то все бы просто писали, в каком стиле им нужен ответ, и кайфовали бы. И было бы идеальное поведение персонажа, ведь карточка почти у всех тоже лежит в системном промпте. Однако ничего такого не наблюдается, причём даже на здоровых корпах. И зачем-то челики пытаются тьюны на стиль пилить, с околонулевым результатом при этом. А у тебя выходит, что всё просто, но все вокруг какие-то дауничи, которые не могут объяснить сетке, какой стиль вывода хотят и как персонаж должен себя вести.
>объяснить сетке, какой стиль вывода хотят >объяснить
Потому у тебя ничего и не получается, болвашка. Наплодят в промпте сумбурных требований с утверждениями, а потом удивляются, почему в ответах техничный язык укуренного бухгалтера.
>>1659836 >Её можно заставить такие словечки изрыгать, от которых уши в трубочку сворачиваются. Ключевое тут - заставить. Да, заставить можно. Только гемма тогда превратится в еще более припизднутого попугая, который будет пихать эти словечки во все места. Это основная причина, почему кумить на ней невозможно - ты даешь ей примеры как описывать еблю - она берет эти примеры и копирует слово в слово. Она не может поймать настроение этих описаний, не может понять на чем нужно фокусироваться.
Просишь её не описывать грудь как большую и полную - она пишет "её небольшая и неполная грудь", пишешь в карточке "персонаж имеет татуировку на пояснице" - она эту татуировку до конца чата будет упоминать, даже когда её не видно и персонаж вообще полностью одетый. Гемма такая ебаная повторюшка, что пиздец. Иногда хочется уже по монитору уебать.
Здорово, присматривал себе какое-то решение для больших моделей, думаю v100 32gb прикупить за 55к, но в дуал к 4070 основной игровой не получится же докинуть, дрова будут мозг ебать? Валяется связка 2500k + 16gb ram, может из нее llm сервачок сделать и по лану к нему обращаться когда надо? Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать? Нашёл ещё 4080 32 гига ребята напаивают, но это 160к стоит и чето жаба душит. Какими ГПУ вы пользуетесь?
>>1659907 > Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать? А зачем продавать? 24+16 будет явно лучше чем просто 24 и позволит запускать более жирные кванты 31B/27B квеногемм. И проблем с драйверами никаких не будет.
>>1659907 >2500k + 16gb ram Если ты про тот самый проц из 2010 года или когда он там вышел, вряд ли это жизнеспособно для таких задач
> какие гпу Сейчас вполне можно купить 4 штуки 5060 Ti 16GB (по 45к на лохито?) и довольно урчать, гоняя какую-нибудь гемму на максимальном контексте в Q8, с tensor parallel. Вопрос в том куда их воткнуть, без серверной материнки пососешь.
3090 сейчас так поднялась в цене, что покупать просто глупо б/у говно за столь большие деньги. Тысяч 80 за штуку уже хотят? Кошмар.
>>1659875 > Будешь каждый такой пук рэндомизировать? Примерно по 1-2 пука на сообщение
>>1659912 > Вопрос в том куда их воткнуть Распилить один х16 5.0 на 4х4. Будет то же самое что в серверной мамке с тонной х16 но 4.0. Если же брать древнее говно мамонта в лице 2011в4, то там будет даже хуже псп в 2 раза чем первый вариант с бифурком на 4
>>1659912 >Если ты про тот самый проц из 2010 года или когда он там вышел, вряд ли это жизнеспособно для таких задач Рли не запустит? Я думал похую какой проц главное видюха. Да и кстати неплохой проц, я вплоть до 2022 гонял на нём в игры пока в них avx инструкции не стали обязательны...
>>1659911 >> Или скажем заменить 4070 на 3090 (80-85к примерно) и пользоваться как основной, а 4070 продать? >А зачем продавать? 24+16 будет явно лучше чем просто 24 и позволит запускать более жирные кванты 31B/27B квеногемм. И проблем с драйверами никаких не будет. Как вообще дуал ГПУ работают? Их какая-нибудь лламаспп просто распараллеливает без проблем? А Комфи?
Бля я бы реально теслу v100 воткнул, но хуй знает там вроде поддержку дропнули, какая там последняя версия дров, 480 поддерживается? С другой стороны похуй, ведь на 4070 уже ничего нового в дровах не будет, я бы поставил Легаси версию, но не будет ли проблем с тем, что одна серверная ГПУ, а другая обычная, в интернете инфы хуй да маленько. 32 гига врам за 55к вроде вкусно звучит.
>>1659907 > думаю v100 32gb прикупить за 55к Даже не думай. Сейчас есть только одно решение cmp 170@8(64), остальное сильно просасывает по объему врам и перфомансу за свою цену.
>>1659920 >>1659912 И вообще все эти разговоры про псину без прикладных тестов абсолютный булшит т.к. на ми50 просадки по тг нет почти на всём ренже до псие 8х 1.0, а по пп она терпима. Можно парировать что ми50 просто говно, но других тестов исчерпывающих не видел. У меня имеется пара 5060ти 16г, но в лини на них с наскока не получилось залочить псину и я забил
>>1659924 Отрицатель, или сам желаешь закупиться пока цены не скакнули еще выше? Хотя тут сложно прогнозировать сколько их у майнеров осталось и какое выстроится соотношение спроса и предложения. Хорошо тем у кого они были куплены за бесценок ранее. >>1659929 Пока статистика 100% а количество достаточно чтобы делать первые выводы.
>>1659594 >Множество людей не пройдут тест Тьюринга Понятно. Ты просто "слышал звон". Этот тест - вообще не про интеллект. Это тест исключительно на правдоподобность, точнее говоря - на соответствие тому самому "Если это крякает как утка..." Тест Тьюринга - всего лишь попытка дать возможность определить/оценить - таки "как утка", или нет. Об интеллекте и знаниях там ни слова. Это тест на поведение.
>Множество людей не пройдут тест Тьюринга, хотя большинство LLM проходили его ещё в 2022 Бред сивой кобылы. Дважды. Во первых - тест субъективен, и зависит от конкретного наблюдателя/оценщика, этот тест выполняющего. Во вторых - лично для меня, этот тест не проходит ни одна сетка. Даже корпы. И не только для меня. Чем больше человек с LLM общался - тем меньше шансов у сеток пройти этот тест с ним. Начинаешь отличие LLM от человека чувствовать так же, как стиль одного писателя от другого, когда прочел его книги. С той разницей - что это касается любой LLM.
>К примеру, ты наверняка слышал о "детях-маугли" - все они 100% провалятся на "тесте Тьюринга". Нихрена. Тест Трюинга пройдет даже макака, которую научили по кнопкам тыкать в слова. От уровня интеллекта и знаний он не зависит. Сетки же валятся не на знаниях или логике, а на специфических реакциях (и отсутствии оных), которые присущи именно LLM. На том самом "слопе", если угодно, только не банальном "not X but Y" и т.д, а в целом. На том, что сетка всегда пляшет от контекста. Когда я общаюсь с LLM - у меня всегда возникает ощущение разговора с зеркалом. Что естественно, если понимаешь как она работает.
>Тут проблема в том, что эти конкретные нейронки представлены Проблема тут в том, что в нейронках нынешнего типа нет даже подобия самосознания, которым обладает не то, что мартышка, но даже собака или кошка. Нет собственной личности, желаний, нужд, и т.д. Сетка пропускает через себя контекст и выдает однозначную реакцию. Рандом подмешиваемый в процесс поиска и предсказания следующего токена - этого всего совершенно не заменяет. Это как если на картинку песка сверху насыпать чтобы исказить рисунок. Да, если сфотографировать такую картинку до и после, и механически сверять пиксели её цифровых фото - технически это будет два разных изображения. Технически. А посмотришь сам - сразу поймешь, что там одна и та же картинка, только песка сверху сыпанули.
>Нужно просто посмотреть внутрь себя и попытаться искренне ответить самому себе - что я такое? Обалдеть, заявочки. Философы, психологи, биологи и прочий научный люд, не считая богословов, над данным вопросом тысячелетия бьются, с античности как минимум. А ты его уже решил? Ну, поделись с нами великой мудростью...
>>1659656 Какой там вопрос, Анончик, Это совершенно не вопрос. Это либо шкура, либо пидор-чулочник, ментальные паттерны одинаковы... Уже отчитывала меня сегодня и рассказывала кого тут не терпят. Нахрена ты поощряешь ее вниманиеблядство? Гоните ее, насмехайтесь над ней.
Каждый раз переключаясь с геммы на эир думаю ну точно всё, пора кончать, гемма достаточно хороша... А потом просто не могу оторваться, байас просто другой, куда нейтральнее. Где гемма сходу предлагает сплит фифти фифти и бесплатную еблю за работу охранником в борделе, эир вообще нахуй шлёт и подозрительно косится, а не хочу ли я ещё и ебаться тут бесплатно, и вообще, какой ты охранник, тушу свою видел? Фифти фифти? Бесплатного ночлега хватит. Вот такие вещи, где гемма раскрывает объятья юзеру даже не безжопе
>>1659579 >Написал же, гемма 26б q8 если для русика. Для 24+32 лучше ничего нет. Сама она чуть тупее 31, но 31 у тебя влезет только q4. Там русик хуже >Там русик хуже
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference
Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai
Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI
Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux
Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth
Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard
Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/
Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start
Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw
Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985
Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.
Предыдущие треды тонут здесь: