Добавлена поддержка Ежчана (ejchan.net, ejchan.site). Набегаем, тестируем архивацию, сообщаем о замеченных проблемах.
К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (подробности случившегося). Мы призываем всех неравнодушных помочь нам с восстановлением утраченного контента!
Сортировка: за
Сохранен
41
2025-04-30 23:58:12
Сохранен
38
2024-09-28 18:57:24
Сохранен
38
2023-03-21 16:25:40
Сохранен
38
2023-01-24 18:44:19
Сохранен
37
2023-11-15 03:43:17
Сохранен
37
2023-08-21 11:29:08
Сохранен
36
2023-11-16 20:42:36
Сохранен
34
2025-07-05 13:16:45
Сохранен
34
2024-06-17 20:12:44
Сохранен
33
2025-06-04 19:00:57
Сохранен
32
2023-09-27 05:57:29
Сохранен
31
2025-04-12 13:54:34
Сохранен
31
2023-11-14 16:48:51
Сохранен
31
2023-09-22 04:56:00
Сохранен
31
2023-04-04 18:29:54
Сохранен
31
2023-02-23 21:11:48
Сохранен
30
2023-10-31 18:59:34
Сохранен
29
2025-04-25 22:18:36
Сохранен
29
2024-03-29 20:42:20
Сохранен
28
2023-06-06 03:46:38
Сохранен
28
2023-04-22 13:11:09
Сохранен
26
GPT-5.2 не смогла сложить 5+7. Эзотерические языки обнулили передовые модели — ИИ-лаборатория Lossfunk представила EsoLang-Bench — бенчмарк из 80 задач на пяти эзотерических языках программирования: Brainfuck, Befunge-98, Whitespace, Unlambda и Shakespeare. Пять фронтирных моделей — GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B и Kimi K2 — набрали от 0 до 11% точности на задачах, которые в Python решит любой студент за минуты. Ни одна модель не решила ни одной задачи сложнее уровня Easy. Эзотерические языки — это полноценные (Тьюринг-полные) языки программирования, созданные не для практического использования, а как эксперимент или интеллектуальный вызов. На них можно написать что угодно, но синтаксис максимально непривычный: Brainfuck оперирует всего восемью командами на ленте памяти, Befunge-98 — двумерная сетка, где курсор бегает в четырех направлениях, а в Whitespace код состоит только из пробелов, табов и переводов строк. Главное для бенчмарка — эти языки почти не представлены в обучающих данных: на GitHub у них в 1 000–100 000 раз меньше репозиториев, чем у Python. Если модель решает задачу на таком языке — она действительно рассуждает, а не вспоминает паттерны. Результаты оказались жесткими. Модели, набирающие 85–95% на стандартных бенчмарках вроде HumanEval, здесь не преодолели барьер в 11%. Лучший результат без агентов — 11,2% у GPT-5.2 на Befunge-98 с итеративной обратной связью от интерпретатора. На Whitespace все модели показали ровный ноль — ни одна не смогла сгенерировать синтаксически валидный код. Характерный провал: GPT-5.2 не сложила 5 и 7 на Brainfuck, потому что парсинг десятичных чисел в этом языке требует приема, которого почти нет в открытых репозиториях. Единственное, что заметно улучшило результат — прямая обратная связь от интерпретатора: модель генерирует код, получает ошибку, пробует снова. А вот few-shot примеры не дали статистически значимого прироста — в среднем +0,8 процентного пункта. Добавление отдельного LLM-критика и разбиение задачи на этапы (ReAct) тоже не помогли. Агентные системы Codex и Claude Code с полным доступом к терминалу показали лучшие результаты — 13,8% и 12,5% на Brainfuck, — но и они решали только простейшие задачи. Авторы делают вывод: высокие результаты на стандартных бенчмарках все еще отражают запоминание, а не рассуждение. EsoLang-Bench — попытка измерить именно способность переносить вычислительные навыки на незнакомые домены, то есть то, что человек делает, когда осваивает новый язык по документации и экспериментам. Пока у моделей с этим плохо.
2026-03-21 15:16:19
Сохранен
25
2023-02-05 15:29:36
Сохранен
25
2023-02-16 09:54:41
Сохранен
23
2023-04-29 17:42:53