arXiv cs.AI→ оригинал

FormulaSPIN: нейросеть пишет формулы для таблиц по описанию и обгоняет проприетарные модели

FormulaSPIN — новый фреймворк self-play обучения, который учит модель писать формулы для электронных таблиц прямо по описанию на естественном языке. Главный приём: система проверяет формулы на исполнимость и сама отделяет смысловые ошибки от валидных вариантов записи, обучаясь без дополнительной разметки. На бенчмарке NL2FORMULA — 74,9% точных совпадений и 87,1% корректных по исполнению, выше и обычного SFT, и топовых проприетарных моделей.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
FormulaSPIN: нейросеть пишет формулы для таблиц по описанию и обгоняет проприетарные модели
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи в июле 2026 года опубликовали на arXiv фреймворк FormulaSPIN — систему обучения по принципу self-play, которая генерирует формулы для электронных таблиц по описанию на естественном языке и достигает 74,9% точных совпадений и 87,1% точности по исполнению на бенчмарке NL2FORMULA, обгоняя и классический supervised-подход, и топовые проприетарные модели.

Как модель учится сама на себе

FormulaSPIN обучается без единой новой строки размеченных данных — модель играет сама с собой. Согласно аннотации на arXiv, обучение оформлено как игра двух игроков: основной игрок учится предпочитать эталонные (ground-truth) формулы тем, что выдала его предыдущая версия. Обратная связь от исполнения формул сортирует ответы по «зернистости», выстраивая адаптивную программу обучения: сначала модель осваивает семантическую корректность, затем — стилистическую отделку записи.

Ключевое преимущество задачи — бинарная исполнимость: формула либо запускается и даёт результат, либо нет. Это даёт неявный контроль, который отделяет смысловые ошибки от просто иначе записанных, но валидных вариантов.

Почему обычный SPIN здесь ломается

Обычный SPIN не работает на генерации формул, потому что одинаково штрафует любой ответ, не совпавший с эталоном буквально. По данным авторов, одна и та же формула, эквивалентная по исполнению, в одном примере наказывается как «неправильная», а в другом служит эталоном — из-за этого градиенты обучения противоречат друг другу, и модель не сходится.

FormulaSPIN снимает это противоречие через проверку исполнением. Если два разных по виду выражения дают одинаковый результат, система засчитывает их как валидные, а не как ошибку. Дополнительно авторы ввели ExecVote — механизм голосования на семантическом уровне, который штатно обрабатывает случай, когда у одной задачи несколько корректных формулировок.

Что показали замеры

FormulaSPIN установил новый лучший результат на нескольких бенчмарках. На NL2FORMULA — 74,9% точных совпадений и 87,1% корректных по исполнению, что сопоставимо с моделями, обученными на дополнительной разметке предпочтений, и выше как традиционного SFT, так и передовых проприетарных моделей.

  • 74,9% exact match на бенчмарке NL2FORMULA
  • 87,1% точность по исполнению (execution accuracy)
  • Обучение без единого дополнительного размеченного примера
  • ExecVote — голосование на семантическом уровне для нескольких валидных формул
  • Превосходит и классический SFT, и frontier proprietary-модели
«Эти результаты подчёркивают потенциал self-play для задач с дефицитом данных и открывают путь к его переносу за пределы исполнимых доменов», — говорится в аннотации статьи

FormulaSPIN на arXiv.

Что это значит

Написание формул остаётся барьером для сотен миллионов пользователей таблиц, а размеченных данных для обучения таких моделей мало. FormulaSPIN показывает, что модель может улучшать себя сама, используя исполнение как бесплатный источник проверки — без дорогой ручной разметки. Подход применим к любым задачам, где результат можно исполнить и сверить: код, SQL-запросы, вычисления.

Частые вопросы

Что такое FormulaSPIN?

FormulaSPIN — это фреймворк self-play обучения для генерации формул электронных таблиц из текста на естественном языке. Модель улучшает себя итеративно, без дополнительных размеченных данных, используя проверку формул на исполнимость как источник обратной связи.

Чем FormulaSPIN отличается от обычного дообучения?

Классический supervised fine-tuning (SFT) быстро упирается в потолок ограниченной разметки. FormulaSPIN обучается по принципу игры двух игроков и отделяет смысловые ошибки от валидных вариантов записи через исполнение, поэтому обгоняет SFT и не требует новых данных.

Какие результаты показал FormulaSPIN?

На бенчмарке NL2FORMULA фреймворк достиг 74,9% точных совпадений и 87,1% точности по исполнению — это уровень моделей, обученных на дополнительной разметке предпочтений, и выше топовых проприетарных моделей.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…