arXiv cs.CL→ оригинал

TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год

TriAgent — многоагентный комитет для анализа финансовых настроений: запросы распределяются между тремя уровнями — словарь VADER, трансформер FinBERT и LLM Qwen2.5. Индекс расхождения SDI решает, кому отдать запрос, и дорогой LLM подключается только к спорным случаям. На масштабе 10 млн пользователей это экономит $9,3 млн в год против базы на GPT-4o-mini.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

Группа исследователей в июле 2026 года опубликовала на arXiv работу о TriAgent — многоагентной системе анализа финансовых настроений, которая на масштабе 10 млн пользователей экономит $9,3 млн в год по сравнению с базовым решением на GPT-4o-mini.

Как устроен комитет TriAgent

TriAgent распределяет запросы между тремя уровнями «зрения» на текст, каждый дороже предыдущего. Дешёвые уровни закрывают большинство простых случаев, а дорогой LLM подключается только к спорным. Идея строится на структурной ловушке затрат: большинство запросов классифицируются тривиально, но облачный reasoner обрабатывает их все, и счёт растёт линейно с числом пользователей.

  • Словарь VADER — анализ на уровне отдельных слов
  • Трансформер FinBERT — анализ на уровне предложения
  • Qwen2.5 (от 0.5B до 14B, 4-бит) как reasoner над несколькими предложениями, с перекрёстными проверками Mistral-7B и Phi-3.5-mini
  • Индекс семантического расхождения (SDI) измеряет, насколько уровни расходятся, и решает, кому отдать запрос
  • Экономия — $9,3 млн в год при 10 млн пользователей против GPT-4o-mini
«Большинство запросов классифицируются тривиально, однако дорогие

облачные reasoner'ы обрабатывают их все» — из аннотации к работе на arXiv.

Что такое critic plateau

Главный вывод работы — «плато критика»: когда LLM переназначают ролью критика над выходами меньших агентов, метрика F1 выходит на плато около 0.87 для моделей Qwen от 1.5B до 7B (доверительные интервалы перекрываются). Для сравнения, голосование трёх «персон» того же размера даёт лишь F1=0.66.

Разница, по данным авторов, объясняется разнообразием, заданным разной гранулярностью анализа: три уровня «видят» текст по-разному, и это полезнее, чем три одинаковые модели с разными ролями.

Три побочных результата SDI

Из того же сигнала SDI авторы выводят три следствия. Общий словарь консенсуса на мультиязычном sentence-BERT отвечает на 95% китайских запросов из английского кэша при F1=0.99 — то есть переносит разметку между языками почти без дополнительных затрат.

SDI работает и как детектор галлюцинаций LLM постфактум с AUC=0.90. А в бэктесте на 20 тикерах стратегия на основе SDI дала лучшую доходность с поправкой на риск: Sharpe 3.50 против 1.36 у стратегии «всегда FinBERT» и 0.11 у «всегда LLM».

Что это значит

TriAgent показывает практичный рецепт: не гонять каждый запрос через дорогую модель, а маршрутизировать по сложности. Для продакшена с миллионами пользователей это разница между линейно растущим счётом и экономией в миллионы долларов — без потери качества. Код, словари и словарь консенсуса авторы выложили в открытый доступ.

Частые вопросы

Сколько экономит TriAgent?

По расчётам авторов, при 10 млн пользователей система экономит $9,3 млн в год по сравнению с базой на GPT-4o-mini — за счёт того, что дорогой LLM подключается только к спорным запросам.

Что такое индекс SDI?

Semantic Divergence Index (SDI) — метрика попарного расхождения между тремя уровнями анализа (слово, предложение, несколько предложений). Она маршрутизирует запросы, а заодно служит детектором галлюцинаций LLM с точностью AUC=0.90.

Какие модели использует TriAgent?

Словарь VADER, трансформер FinBERT и reasoner Qwen2.5 (0.5B–14B в 4-бит) с перекрёстными проверками Mistral-7B и Phi-3.5-mini.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…