arXiv cs.LG→ оригинал

Могут ли трансформеры выбирать модель? Байесовский тест arXiv на 2,8M параметров

Трансформер на 2,8 млн параметров научился байесовскому выбору модели — определять, из какого класса гипотез пришли данные — с точностью до 0,01 бита от оптимума. Но как только для различения классов нужна арифметика (сложение или умножение по модулю), модель справляется только с числовыми токенами и полностью проваливается на абстрактных символах. Граница держится даже при росте сети до 316 млн параметров.

AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Могут ли трансформеры выбирать модель? Байесовский тест arXiv на 2,8M параметров
Источник: arXiv cs.LG. Коллаж: Hamidun News.
◐ Слушать статью

Трансформер на 2,8 млн параметров научился байесовскому выбору модели — определять, из какого класса гипотез сгенерированы данные, — с расхождением всего 0,01 бита от теоретического оптимума. Это показала работа «Bayesian Wind Tunnels for Model Selection», выложенная на arXiv в июле 2026 года.

Что такое «байесовские аэродинамические трубы»

«Байесовские аэродинамические трубы» — это контролируемые среды, где точное апостериорное распределение по классам гипотез известно в закрытой форме, поэтому ответ модели напрямую сравнивается с байесовским оптимумом. Раньше уже было показано, что трансформеры выполняют точную байесовскую фильтрацию внутри одного фиксированного класса гипотез. Новый вопрос авторов — умеет ли модель выбирать сам класс, то есть распознавать, какая структура породила данные.

Задачи построены на инволюциях без неподвижных точек — функциях со свойством f(f(x))=x, которое является чисто реляционным. Трансформер достигает согласия с оптимумом даже тогда, когда символы непрозрачны и их значения меняются в каждом эпизоде. Работа с непрозрачными символами важна: она отсекает подсказки, за которые модель могла бы «зацепиться», и оставляет только структуру задачи.

  • Модель — трансформер на 2,8 млн параметров, проверена на 3 seeds
  • Согласие по энтропии с байесовским оптимумом — 0,01 бита
  • Non-nested сравнение (инволюции против 3-циклов) — ошибка апостериора MAE ниже 0,001
  • Граница на арифметических задачах держится при масштабировании в 112 раз (2,8M → 316M параметров)
  • Калибровочный разрыв у современных LLM — около 55×

Где выбор модели ломается

Выбор модели полностью проваливается, когда классы различимы только через арифметику — сложение или умножение по модулю: тогда трансформер справляется с целочисленными токенами, но отказывает на непрозрачных символах. По данным аннотации, эта граница сохраняется при росте модели в 112 раз — с 2,8 до 316 млн параметров, поэтому дело не в размере сети.

Диагностика подзадач локализовала сбой: он возникает на композиции инверсии заголовка с арифметикой, а не на самом разборе заголовка.

Дело в стабильной семантике

Причина провала — не в числах как таковых, а в устойчивости значений. Контрольный эксперимент на стационарность показал: непрозрачные токены с фиксированной перемаркировкой дают ошибку всего 0,009 бита, то есть работают не хуже целых чисел.

«Стабильная семантика, а не целочисленная идентичность, позволяет

скомпилировать вычислительную схему», — говорится в аннотации работы на arXiv.

Проверка современных передовых LLM на тех же задачах выявила качественно байесовское поведение, но с большим калибровочным разрывом — около 55×; авторы подчёркивают, что эта оценка получена через «лоссовые» пробы и потому задаёт направление, а не точную величину.

Что это значит

Работа очерчивает конкретную границу способностей трансформеров: выбирать модель они умеют, но только когда у различающего признака есть стабильный доступ к семантике. Это ориентир для механистической интерпретируемости — он показывает, какие вычислительные схемы сеть способна «скомпилировать», а какие остаются ей недоступны, независимо от числа параметров.

Частые вопросы

Что такое байесовский выбор модели?

Это способность определить, из какого класса гипотез пришли данные, а не просто оценить параметры внутри одного класса. В работе трансформер сравнивает, например, инволюции с 3-циклами и выдаёт апостериор с ошибкой ниже 0,001.

Почему модель проваливается на арифметике?

Когда признак для различения классов требует сложения или умножения по модулю, трансформер справляется только с целочисленными токенами и полностью отказывает на абстрактных символах. Контроль показал, что решает стабильность семантики токенов, а не их числовая природа.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…