Закон робастности двухслойных нейросетей: доказательство предположения Бубека
Математики доказали предположение Бубека, Ли и Нагараджа: двухслойная нейросеть с m нейронами, обучаемая на n шумных метках, обязательно имеет константу Липшица минимум √(n/m) — без каких-либо ограничений на веса. Результат справедлив для всех кусочно-линейных активаций, включая ReLU. Вместо стандартного покрытия пространства параметров авторы использовали новый метод — покрытие функционального пространства, где ключевую роль сыграла лемма жёсткости кинков (kink rigidity lemma).
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Математики доказали многолетнее предположение Санжива Бубека, Ю Ли и Харинакешана Нагараджа о том, что двухслойные нейросети с произвольными весами, подогнанные под шумные данные, обязательно имеют высокую константу Липшица. Результат опубликован на arXiv в июле 2026 года и преодолевает прежние ограничения на размер параметров, которые считались необходимыми для доказательства.
История гипотезы
Несколько лет назад Санжив Бубек, Ю Ли и Харинакешан Нагараж высказали гипотезу: для типичных данных любая двухслойная нейросеть из m нейронов, которая точно подгоняется под n шумных меток, должна иметь константу Липшица минимум на уровне √(n/m) — независимо от ограничений на веса. Бубек и Селке позже доказали более слабую версию этого закона, но только для ограниченных параметров. На практике это не соответствовало реальности: веса нейросетей часто могут быть произвольными и очень большими.
Что удалось доказать
В новой работе авторы преодолевают это ограничение и доказывают предположение полностью — для двухслойных сетей с неограниченными весами. Результат справедлив для всех непрерывных кусочно-линейных активационных функций, включая популярный ReLU.
- Доказано для данных, равномерно распределённых на сфере S^(d-1) (d ≥ 3) или из гауссова распределения N(0, I_d/d)
- Справедливо для любых весов, смещений и пропусков (skip connections) между слоями
- Результат достаточно точен: погрешность составляет лишь логарифмический множитель
- Теорема связывает константу Липшица с размером ошибки ниже уровня шума (ε), размером сети и размерностью данных
Как удалось преодолеть прежние ограничения
Предыдущие доказательства использовали метод покрытия пространства параметров — разбивали множество всех возможных весов на конечные области и анализировали каждую. Это работало при полиномиальных ограничениях на веса, но становилось невозможным для неограниченных весов, так как таких областей бесконечно много.
Авторы сменили стратегию: вместо покрытия пространства параметров они используют покрытие функционального пространства — анализируют саму реализованную функцию и её геометрические свойства. Центральный инструмент доказательства — лемма жёсткости кинков (kink rigidity lemma): в высокой размерности каждый коэффициент при каждой линейной части кусочно-линейной функции контролируется её Липшиц-константой, потому что кинки (точки разлома) на разных гиперплоскостях не могут взаимно компенсироваться в типичных точках данных.
Что это значит
Закон робастности раскрывает фундаментальный компромисс в машинном обучении: если нейросеть хочет выучить шумные данные с высокой точностью, она вынуждена сохранить высокую чувствительность к малым возмущениям входа — это неизбежный математический закон, а не просто особенность существующих алгоритмов. Результат объясняет, почему regularization и noise injection помогают нейросетям лучше обобщаться: они явно замедляют адаптацию сети к шуму, балансируя между точностью и устойчивостью.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.