arXiv cs.AI→ оригинал

FineServe: датасет реальных нагрузок обслуживания LLM с глобального маркетплейса

Исследователи представили FineServe — открытый датасет реальных нагрузок обслуживания больших языковых моделей, собранный не по прокси-трейсам, а прямо с глобального коммерческого маркетплейса. К нему прилагается генератор нагрузок, который собирает настраиваемые смеси для бенчмарка мультимодельных платформ. Цель — реалистично тестировать маршрутизацию, планирование и расчёт мощностей в системах обслуживания LLM. Датасет опубликован на GitHub.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
FineServe: датасет реальных нагрузок обслуживания LLM с глобального маркетплейса
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи представили FineServe — открытый датасет реальных нагрузок обслуживания больших языковых моделей (LLM), собранный с глобального коммерческого маркетплейса и опубликованный на arXiv в июле 2026 года (arXiv:2607.19349). Вместе с датасетом авторы выложили генератор нагрузок для бенчмаркинга мультимодельных платформ обслуживания.

Что такое FineServe

FineServe — это «in-the-wild» датасет реальных серверных нагрузок, снятый с работающего коммерческого маркетплейса LLM, где параллельно обслуживаются разные модели и задачи. В отличие от синтетики, он фиксирует, как реально приходят запросы и как ведут себя токены на гетерогенных моделях.

  • Тип: мультимодельный датасет нагрузок обслуживания LLM
  • Источник данных: глобальный коммерческий маркетплейс LLM
  • Публикация: arXiv:2607.19349, июль 2026 года
  • Компоненты: сам датасет + генератор нагрузок (workload generator)
  • Доступ: открытый код и данные на GitHub

Почему прокси-трейсы не годятся

Существующие исследования обслуживания LLM опираются на прокси-трейсы или крупноблочные обобщения, которые не улавливают разнородность современных мультимодельных платформ. FineServe закрывает этот разрыв: авторы проанализировали динамику поступления запросов и поведение токенов сразу по трём осям — архитектура модели, её масштаб и тип задачи — и обнаружили принципиально разные режимы колебаний нагрузки.

Это важно для инженеров, которые держат LLM как always-on онлайн-сервис: низкая задержка и высокая пропускная способность при скачущем спросе требуют точного понимания реального профиля трафика, а не усреднённой картинки.

Что даёт генератор нагрузок

Генератор нагрузок FineServe собирает мелкозернистые, «осведомлённые о модели» профили в настраиваемые смеси под конкретный сценарий бенчмарка. То есть команда может воспроизвести нагрузку, близкую к боевой, и на ней прогонять стратегии маршрутизации, планирования и расчёта мощностей.

«Раскрывая эти мелкозернистые динамики нагрузки,

FineServe даёт реалистичную основу для оценки стратегий маршрутизации, планирования и планирования мощностей в системах обслуживания LLM», — говорится в аннотации работы на arXiv.

По формулировке авторов, ключевая ценность — именно heterogeneity: разные модели и типы запросов ведут себя по-разному, и усреднённый бенчмарк это скрывает.

Что это значит

Для тех, кто эксплуатирует мультимодельные платформы (а AlpinaGPT и подобные агрегаторы — ровно этот класс систем), FineServe — повод перепроверить, на каких трейсах тестируется инфраструктура. Реалистичный профиль нагрузки напрямую влияет на выбор роутинга и на то, сколько GPU реально нужно под пиковый спрос.

Частые вопросы

Что такое FineServe?

FineServe — это открытый датасет реальных нагрузок обслуживания LLM плюс генератор нагрузок, представленные на arXiv (arXiv:2607.19349) в июле 2026 года. Данные собраны с действующего глобального коммерческого маркетплейса моделей.

Чем FineServe отличается от прокси-трейсов?

Прокси-трейсы и крупноблочные обобщения не передают разнородность мультимодельных платформ. FineServe снят «в бою» и различает режимы нагрузки по трём осям — архитектуре модели, её масштабу и типу задачи, чего синтетические трейсы не дают.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…