arXiv cs.CL→ оригинал

FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%

Завершился бенчмарк FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на данных сразу на пяти языках. Итоговый набор — 256 вопросов, поровну между простым и экспертным уровнями. В рейтинге 12 систем, а лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1. Участники применяли RAG, кросс-язычную работу с источниками и сжатие ответов.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на мультиязычных данных — подвело итоги: в июле 2026 года организаторы опубликовали финальный рейтинг из 12 систем, где лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1 на наборе из 256 вопросов.

Что проверяет бенчмарк

FinMMEval 2026 Task 2 оценивает, насколько точно AI-системы отвечают на финансовые вопросы, опираясь на документы сразу на пяти языках. Каждый пункт теста связывает вопрос на английском с финансовой отчётностью и новостями на английском, китайском, японском, испанском и греческом, а система должна вернуть один краткий ответ в формате JSONL.

  • Финальный набор — 256 вопросов, поровну между уровнями easy и expert
  • Каждый уровень — 4 шаблона вопросов, развёрнутых на 32 группах корпоративных отчётов
  • Языки исходных данных: английский, китайский, японский, испанский, греческий
  • Метрика ранжирования — macro-averaged ROUGE-1 F1 по каждому пункту
  • В финальном рейтинге — 12 систем

Как оценивали системы

Организаторы скрыли эталонные ответы на время приёма заявок и ранжировали участников по macro-averaged item-level ROUGE-1 F1 против собственных reference-ответов. Разброс на вершине оказался минимальным: топ-4 системы отделяет менее одного процентного пункта по ROUGE-1 F1 — это значит, что лидеры фактически идут вровень, и выбор архитектуры на этой границе решает доли процента.

«Сильнейшие системы плотно сгруппированы: топ-4 разделяет менее одного процентного пункта по ROUGE-1 F1», — говорится в отчёте организаторов

FinMMEval 2026, опубликованном на arXiv.

Что применяли участники

Команды-участники строили свои решения вокруг работы с разноязычными источниками, а не одной модели. Согласно системным статьям, опубликованным вместе с итогами, участники документировали retrieval-augmented generation (RAG), обработку кросс-язычных свидетельств, структурированный промптинг, сжатие ответов и стратегии валидации. Именно набор из 32 групп корпоративных отчётов и четырёх шаблонов вопросов на каждом уровне заставлял системы вытаскивать факт из документа на китайском или греческом и укладывать ответ в короткую точную формулировку на английском.

Почему это важно для финансового ИИ

FinMMEval 2026 Task 2 показывает, где сегодня проходит граница у языковых моделей в финансах: не в генерации текста, а в точном извлечении факта из отчётности на незнакомом языке. Плотный рейтинг — топ-4 в пределах 1% — сигнал, что мультиязычный financial QA перестаёт быть задачей одной сильной модели и превращается в инженерию пайплайна: поиск, кросс-язычное сопоставление, сжатие. Для банков и фондов, работающих с отчётностью на нескольких языках, это ближайший ориентир качества.

Что это значит

Бенчмарк фиксирует зрелость мультиязычного финансового вопрос-ответа: лидеры уже почти неразличимы по метрике, и дальнейший прогресс будет измеряться долями процента и качеством работы с источниками, а не рывками одной модели.

Частые вопросы

Что такое FinMMEval 2026 Task 2?

Это соревновательный бенчмарк по краткому финансовому вопрос-ответу: система получает вопрос на английском и подборку финансовой отчётности и новостей на пяти языках, а возвращает один сжатый ответ. В финальном наборе — 256 вопросов.

На каких языках представлены данные?

Вопросы сформулированы на английском, а сопровождающие финансовые документы и новости — на английском, китайском, японском, испанском и греческом. Задача системы — извлечь факт из разноязычных источников и дать точный ответ.

Как оценивали и ранжировали системы?

Эталонные ответы были скрыты во время подачи заявок, а итоговый рейтинг из 12 систем строился по macro-averaged item-level ROUGE-1 F1. Топ-4 участника разделяет менее одного процентного пункта по этой метрике.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…