К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!
Сортировка: за
Сохранен
350
9 июня 23:47
Сохранен
177
Владимир Крылов: «Считать современные LLM просто предсказателями токенов — это техническая безграмот — Владимир Крылов: «Считать современные LLM просто предсказателями токенов — это техническая безграмотность». Да, внутренний механизм работы современных LLM действительно опирается на выборку из вероятностного распределения. Из-за этого многие утверждают, что в основе всего лежит банальное предсказание следующего токена (Next Token Prediction). Но представьте, что вы смотрите на фрески Сикстинской капеллы и заявляете: то, что мы видим, — это просто специфическое математическое распределение красок на поверхности стены. Технически это, конечно, верно, но ведь суть фресок не сводится к краске на штукатурке. Так же и языковая модель не является просто генератором случайных выборок, работающим алгоритмом Next Token Prediction. По этому поводу отлично высказался Илья Суцкевер. Он отметил, что если вы до сих пор повторяете мантру о том, что модель всего лишь предсказывает следующий токен, то вы не просто скептик, вы технически неграмотны. Сегодня нельзя считать, что ИИ просто обучен угадывать слова. Это лишь грубое начальное приближение. Дальше модель, как принято говорить, «выращивается». Здесь уже уместнее использовать биологические метафоры. Вспомните, как появился метод RLHF (обучение с подкреплением на отзывах людей) и алгоритм PPO (Proximal Policy Optimization). Это было похоже на дрессировку: модель генерирует ответ, а человек-разметчик смотрит и оценивает — «хороший мальчик» или «плохой». Эта эра продлилась недолго. Модели стали вежливыми, безопасными, ориентированными на угождение пользователю, но большого ума у них не прибавилось. Затем произошел переход к методам, направленным на прямую оптимизацию предпочтений, — DPO (Direct Preference Optimization). Оказалось, что DPO настолько глубоко корректирует веса, что у модели меняется фундаментальное понимание языка. Первичный этап мы стали называть просто предобучением (pre-training) — после него модель еще не готова к полноценной работе. А в конце 2024 – начале 2025 года правила игры и вовсе изменились. Когда китайские исследователи опубликовали данные по модели DeepSeek-R1, они перестали просто заставлять сеть давать быстрые ответы. Модели начали обучать рассуждению, появился алгоритм GRPO (Group Relative Policy Optimization). Теперь качество модели во многом зависит от того, как выстроен этот процесс внутреннего логического поиска. По сути, внутри проходит турнир: модель генерирует, скажем, 16 различных путей решения задачи. Причем для оценки не используется внешний алгоритм-критик: модель сама сравнивает эти попытки друг с другом и определяет лучшую. Поэтому сегодня можно смело утверждать: LLM — это не текстовый предсказатель. Это система логического мышления, обернутая в текстовый интерфейс. Да, внутри зашит аппроксиматор, а предсказание токена — это первая грубая настройка сети. Но сейчас мы живем в новом мире, где в эти искусственные архитектуры закладывается «понимание» контекста и сути решаемых задач, основанное на слабо декомпозируемых отображениях в многомерных пространствах.
8 июня 14:45
Сохранен
567
31 марта 18:42
Сохранен
506
24 октября 2024
Сохранен
528
18 сентября 2024
Сохранен
59
17 мая 2024
Сохранен
299
26 июня 2023
Сохранен
14
10 июня 2023
Сохранен
589
10 мая 2023
Сохранен
17
14 апреля 2023
Сохранен
304
15 марта 2023
Сохранен
167
27 декабря 2022
Сохранен
527
21 декабря 2022
Сохранен
586
16 декабря 2022
Сохранен
655
25 ноября 2022
Сохранен
540
16 ноября 2022
Сохранен
546
28 июня 2019
Сохранен
549
28 июня 2019
Сохранен
553
27 июня 2019
Сохранен
290
2 января 2019
Сохранен
534
16 декабря 2018
Сохранен
504
24 марта 2018
Сохранен
47
17 февраля 2018
Сохранен
65
16 августа 2017
Сохранен
452
30 июня 2016