Обучают ли ИИ-лаборатории модели под тест «пеликан на велосипеде»: разбор pelicanmaxxing
Исследователь Дилан Кастильо проверил популярную гипотезу: не обучают ли AI-лаборатории модели специально хорошо рисовать пеликана на велосипеде — ненаучный бенчмарк Саймона Уиллисона. Он прогнал 48 промптов (8 животных × 6 видов транспорта) трижды через 7 моделей и оценил итог ещё двумя. Вывод: следов такой подгонки нет. Ближе всех подошла GLM-5.2, но эффект мал и статистически незначим.
AI-обработка оригинала Simon Willison; редакция Hamidun News
22 июля 2026 года разработчик Дилан Кастильо (Dylan Castillo) опубликовал исследование, проверяющее гипотезу «pelicanmaxxing» — специально ли AI-лаборатории обучают модели красиво рисовать пеликана на велосипеде под ненаучный бенчмарк Саймона Уиллисона (Simon Willison). Кастильо прогнал 48 промптов трижды через 7 моделей и следов такой подгонки не нашёл.
Что такое бенчмарк «пеликан на велосипеде»
Бенчмарк «пеликан на велосипеде» — это личный неформальный тест Саймона Уиллисона, в котором он просит каждую новую языковую модель сгенерировать SVG-рисунок пеликана верхом на велосипеде. Уиллисон сам называет его «глубоко ненаучным», но за пару лет тест стал настолько узнаваемым в сообществе, что возникло подозрение: лаборатории могли начать оптимизировать модели именно под него, чтобы выглядеть выигрышно. Это явление и получило шуточное название pelicanmaxxing (в тексте Кастильо — pelimaxxing).
Как устроен эксперимент
Кастильо построил сетку из 8 животных и 6 видов транспорта — 48 комбинаций-промптов — и прогнал каждую трижды через 7 разных моделей. Такая матрица позволяет сравнить, рисуют ли модели пару «пеликан + велосипед» аномально лучше, чем любые другие сочетания вроде «фламинго на самокате» или «цапля на лодке».
- Дата публикации — 22 июля 2026 года
- 8 животных × 6 видов транспорта = 48 промптов, каждый прогнан 3 раза
- Тестировались 7 моделей: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 и DeepSeek V4 Pro
- Оценивали результаты две отдельные модели — GPT-5.6 Luna и Gemini 3.1 Flash-Lite
- Для просмотра всех генераций автор собрал интерактивную сетку с фильтрами
Нашлись ли следы подгонки?
Следов pelicanmaxxing Кастильо не обнаружил ни по одной из пяти линий проверки. Пеликаны на велосипедах выглядят не лучше других сцен, пеликаны рисуются не аккуратнее прочих животных, велосипеды — не аккуратнее прочего транспорта, а сама комбинация не выходит лучше, чем предсказывают отдельные навыки модели, даже с поправкой на сложность. Пятая проверка показала, что сцены не выглядят заученными наизусть.
Ближе всех к аномалии подошла GLM-5.2: у неё зафиксирован наибольший прирост качества именно на ячейке «пеликан + велосипед», и первый же её образец привлёк внимание автора. Но, по данным Кастильо, эффект остаётся малым и статистически незначимым.
«GLM-5.2 подошла ближе всех: у неё самый большой прирост именно на ячейке «пеликан на велосипеде».
Но эффект мал и статистически незначим, поэтому я бы не придавал ему большого веса», — Дилан Кастильо, автор исследования.
Что это значит
Саймон Уиллисон, чей бенчмарк и породил всю дискуссию, назвал работу Кастильо «отличной» и отметил, что сам раньше проверял модели лишь выборочно, без такой методичности. Вывод исследования успокаивает скептиков: пока нет данных, что лаборатории «читерят» под конкретный вирусный тест — модели рисуют пеликана на велосипеде ровно настолько, насколько позволяют их общие навыки генерации.
Частые вопросы
Что такое pelicanmaxxing?
Это предположение, что AI-лаборатории намеренно тренируют модели хорошо проходить именно тест «пеликан на велосипеде» Саймона Уиллисона. Исследование Дилана Кастильо от 22 июля 2026 года подтверждений этому не нашло.
Какие модели показали лучший результат?
По матрице из 48 промптов ближе всех к «подозрительному» результату оказалась GLM-5.2 — у неё максимальный прирост на паре «пеликан + велосипед». Однако эффект статистически незначим, поэтому автор не считает его доказательством подгонки.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.