arXiv cs.CL→ оригинал

Почему чистые Transformer не способны выучить структурную генерализацию: доказательство

Чистые Transformer математически не способны автономно выучить структурную генерализацию — доказано через теорию сложности. Задача относится к классу NC¹, а обучаемый потолок трансформеров — TC⁰; при стандартном предположении TC⁰ ≠ NC¹ разрыв непреодолим. Высокие баллы нейросимволических систем на бенчмарках объясняются тем, что им семантику встраивают вручную: «выученное» неотличимо от «данного».

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Почему чистые Transformer не способны выучить структурную генерализацию: доказательство
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи в июле 2026 года опубликовали на arXiv работу, которая математически доказывает: чистый Transformer не способен автономно выучить структурную генерализацию из конечных данных. Причина — разрыв между вычислительной сложностью самой задачи (класс NC¹) и доказанным потолком обучаемости трансформеров (класс TC⁰).

Что вообще доказали

Авторы впервые дали формальное определение структурной генерализации — способности модели собирать смысл из знакомых частей в незнакомых комбинациях. До этой работы понятие измеряли десятком бенчмарков, но ни разу не определяли строго. Определение переводит две интуитивные предпосылки — композициональную структуру и неограниченную генерализацию — на язык математики.

Ключевой ход — показать, что задача требует вычислительной мощности класса NC¹, тогда как чистый Transformer, по доказательству Kraus et al. (2026), ограничен классом TC⁰. При стандартном в теории сложности предположении TC⁰ ≠ NC¹ вывод строгий: нужная способность лежит выше потолка архитектуры.

  • NC¹ — вычислительная нижняя граница задачи структурной генерализации
  • TC⁰ — доказанный обучаемый потолок чистых трансформеров (Kraus et al., 2026)
  • Оценка деревьев (BFVP) NC¹-полна — доказано Buss ещё в 1987 году
  • При стандартном предположении TC⁰ ≠ NC¹ разрыв непреодолим
  • Нейросимволические системы обходят трудную часть, встраивая семантику (G_γ) вручную

Где именно Transformer упирается

Каждое композициональное правило распадается на две проекции: синтаксическую (F_γ) и семантическую (G_γ) — так устроена монтегьевская модель значения (по Ричарду Монтегью), на которую опираются авторы. Разделение позволяет точно указать, какая половина задачи действительно трудна.

Оценка семантического дерева (сторона G_γ) — это частный случай задачи BFVP, а она, согласно Buss (1987), NC¹-полна. Чистый Transformer вынужден учить обе стороны сразу, но его обучаемый класс не выходит за пределы TC⁰. Разрыв между TC⁰ и NC¹ и есть та стена, о которую разбивается автономное обучение — сколько бы данных модель ни увидела.

Почему бенчмарки вводят в заблуждение

Нейросимволические системы набирают лучшие баллы на бенчмарках структурной генерализации именно потому, что им семантическую проекцию (G_γ) встраивают вручную, а не выучивают. Они обходят действительно трудную половину задачи и получают высокий результат в обход NC¹-полного ядра.

Отсюда главный вывод работы: балл на бенчмарке не отличает выученное от заданного заранее. Проверка «умеет ли модель обобщать» перестаёт быть корректной, если часть механизма ей просто вписали руками.

«Баллы на бенчмарках не позволяют отличить "выученное" от "данного"» —

из аннотации работы на arXiv.

Что это значит

Работа очерчивает жёсткую границу: без символических компонентов или архитектур мощнее TC⁰ чистые трансформеры не научатся настоящей композициональной генерализации, сколько данных им ни дай. Для практиков это аргумент в пользу гибридных, нейросимволических подходов; для исследователей — повод осторожнее читать высокие баллы на бенчмарках.

Частые вопросы

Что такое структурная генерализация?

Это способность модели правильно обрабатывать новые комбинации знакомых элементов — например, понять фразу из известных слов в структуре, которой не было в обучении. Авторы работы впервые дали ей формальное математическое определение.

Значит ли это, что трансформеры бесполезны?

Нет. Доказательство касается «чистого» трансформера и конкретной способности — автономного обучения структурной генерализации из конечных данных. На практике модели дополняют символическими компонентами, которые закрывают трудную часть задачи.

Почему нейросимволические системы обходят трансформеры на этих бенчмарках?

Потому что им семантическую проекцию (G_γ) задают вручную, а не выучивают. Они пропускают NC¹-полную часть задачи, поэтому высокий балл не доказывает, что способность была именно выучена.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…