Могут ли трансформеры выбирать модель? Байесовский тест arXiv на 2,8M параметров
Трансформер на 2,8 млн параметров научился байесовскому выбору модели — определять, из какого класса гипотез пришли данные — с точностью до 0,01 бита от оптимума. Но как только для различения классов нужна арифметика (сложение или умножение по модулю), модель справляется только с числовыми токенами и полностью проваливается на абстрактных символах. Граница держится даже при росте сети до 316 млн параметров.
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Трансформер на 2,8 млн параметров научился байесовскому выбору модели — определять, из какого класса гипотез сгенерированы данные, — с расхождением всего 0,01 бита от теоретического оптимума. Это показала работа «Bayesian Wind Tunnels for Model Selection», выложенная на arXiv в июле 2026 года.
Что такое «байесовские аэродинамические трубы»
«Байесовские аэродинамические трубы» — это контролируемые среды, где точное апостериорное распределение по классам гипотез известно в закрытой форме, поэтому ответ модели напрямую сравнивается с байесовским оптимумом. Раньше уже было показано, что трансформеры выполняют точную байесовскую фильтрацию внутри одного фиксированного класса гипотез. Новый вопрос авторов — умеет ли модель выбирать сам класс, то есть распознавать, какая структура породила данные.
Задачи построены на инволюциях без неподвижных точек — функциях со свойством f(f(x))=x, которое является чисто реляционным. Трансформер достигает согласия с оптимумом даже тогда, когда символы непрозрачны и их значения меняются в каждом эпизоде. Работа с непрозрачными символами важна: она отсекает подсказки, за которые модель могла бы «зацепиться», и оставляет только структуру задачи.
- Модель — трансформер на 2,8 млн параметров, проверена на 3 seeds
- Согласие по энтропии с байесовским оптимумом — 0,01 бита
- Non-nested сравнение (инволюции против 3-циклов) — ошибка апостериора MAE ниже 0,001
- Граница на арифметических задачах держится при масштабировании в 112 раз (2,8M → 316M параметров)
- Калибровочный разрыв у современных LLM — около 55×
Где выбор модели ломается
Выбор модели полностью проваливается, когда классы различимы только через арифметику — сложение или умножение по модулю: тогда трансформер справляется с целочисленными токенами, но отказывает на непрозрачных символах. По данным аннотации, эта граница сохраняется при росте модели в 112 раз — с 2,8 до 316 млн параметров, поэтому дело не в размере сети.
Диагностика подзадач локализовала сбой: он возникает на композиции инверсии заголовка с арифметикой, а не на самом разборе заголовка.
Дело в стабильной семантике
Причина провала — не в числах как таковых, а в устойчивости значений. Контрольный эксперимент на стационарность показал: непрозрачные токены с фиксированной перемаркировкой дают ошибку всего 0,009 бита, то есть работают не хуже целых чисел.
«Стабильная семантика, а не целочисленная идентичность, позволяет
скомпилировать вычислительную схему», — говорится в аннотации работы на arXiv.
Проверка современных передовых LLM на тех же задачах выявила качественно байесовское поведение, но с большим калибровочным разрывом — около 55×; авторы подчёркивают, что эта оценка получена через «лоссовые» пробы и потому задаёт направление, а не точную величину.
Что это значит
Работа очерчивает конкретную границу способностей трансформеров: выбирать модель они умеют, но только когда у различающего признака есть стабильный доступ к семантике. Это ориентир для механистической интерпретируемости — он показывает, какие вычислительные схемы сеть способна «скомпилировать», а какие остаются ей недоступны, независимо от числа параметров.
Частые вопросы
Что такое байесовский выбор модели?
Это способность определить, из какого класса гипотез пришли данные, а не просто оценить параметры внутри одного класса. В работе трансформер сравнивает, например, инволюции с 3-циклами и выдаёт апостериор с ошибкой ниже 0,001.
Почему модель проваливается на арифметике?
Когда признак для различения классов требует сложения или умножения по модулю, трансформер справляется только с целочисленными токенами и полностью отказывает на абстрактных символах. Контроль показал, что решает стабильность семантики токенов, а не их числовая природа.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.