FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%
Завершился бенчмарк FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на данных сразу на пяти языках. Итоговый набор — 256 вопросов, поровну между простым и экспертным уровнями. В рейтинге 12 систем, а лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1. Участники применяли RAG, кросс-язычную работу с источниками и сжатие ответов.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на мультиязычных данных — подвело итоги: в июле 2026 года организаторы опубликовали финальный рейтинг из 12 систем, где лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1 на наборе из 256 вопросов.
Что проверяет бенчмарк
FinMMEval 2026 Task 2 оценивает, насколько точно AI-системы отвечают на финансовые вопросы, опираясь на документы сразу на пяти языках. Каждый пункт теста связывает вопрос на английском с финансовой отчётностью и новостями на английском, китайском, японском, испанском и греческом, а система должна вернуть один краткий ответ в формате JSONL.
- Финальный набор — 256 вопросов, поровну между уровнями easy и expert
- Каждый уровень — 4 шаблона вопросов, развёрнутых на 32 группах корпоративных отчётов
- Языки исходных данных: английский, китайский, японский, испанский, греческий
- Метрика ранжирования — macro-averaged ROUGE-1 F1 по каждому пункту
- В финальном рейтинге — 12 систем
Как оценивали системы
Организаторы скрыли эталонные ответы на время приёма заявок и ранжировали участников по macro-averaged item-level ROUGE-1 F1 против собственных reference-ответов. Разброс на вершине оказался минимальным: топ-4 системы отделяет менее одного процентного пункта по ROUGE-1 F1 — это значит, что лидеры фактически идут вровень, и выбор архитектуры на этой границе решает доли процента.
«Сильнейшие системы плотно сгруппированы: топ-4 разделяет менее одного процентного пункта по ROUGE-1 F1», — говорится в отчёте организаторов
FinMMEval 2026, опубликованном на arXiv.
Что применяли участники
Команды-участники строили свои решения вокруг работы с разноязычными источниками, а не одной модели. Согласно системным статьям, опубликованным вместе с итогами, участники документировали retrieval-augmented generation (RAG), обработку кросс-язычных свидетельств, структурированный промптинг, сжатие ответов и стратегии валидации. Именно набор из 32 групп корпоративных отчётов и четырёх шаблонов вопросов на каждом уровне заставлял системы вытаскивать факт из документа на китайском или греческом и укладывать ответ в короткую точную формулировку на английском.
Почему это важно для финансового ИИ
FinMMEval 2026 Task 2 показывает, где сегодня проходит граница у языковых моделей в финансах: не в генерации текста, а в точном извлечении факта из отчётности на незнакомом языке. Плотный рейтинг — топ-4 в пределах 1% — сигнал, что мультиязычный financial QA перестаёт быть задачей одной сильной модели и превращается в инженерию пайплайна: поиск, кросс-язычное сопоставление, сжатие. Для банков и фондов, работающих с отчётностью на нескольких языках, это ближайший ориентир качества.
Что это значит
Бенчмарк фиксирует зрелость мультиязычного финансового вопрос-ответа: лидеры уже почти неразличимы по метрике, и дальнейший прогресс будет измеряться долями процента и качеством работы с источниками, а не рывками одной модели.
Частые вопросы
Что такое FinMMEval 2026 Task 2?
Это соревновательный бенчмарк по краткому финансовому вопрос-ответу: система получает вопрос на английском и подборку финансовой отчётности и новостей на пяти языках, а возвращает один сжатый ответ. В финальном наборе — 256 вопросов.
На каких языках представлены данные?
Вопросы сформулированы на английском, а сопровождающие финансовые документы и новости — на английском, китайском, японском, испанском и греческом. Задача системы — извлечь факт из разноязычных источников и дать точный ответ.
Как оценивали и ранжировали системы?
Эталонные ответы были скрыты во время подачи заявок, а итоговый рейтинг из 12 систем строился по macro-averaged item-level ROUGE-1 F1. Топ-4 участника разделяет менее одного процентного пункта по этой метрике.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.