arXiv cs.AI→ оригинал

Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости

Новое исследование на arXiv замерило, во сколько обходится конфиденциальный LLM-инференс. На одной NVIDIA H100 80GB в изолированной среде Intel TDX защищённый режим снижает глобальную пропускную способность на 17,7% для Mistral-7B и на 21,1% для Qwen3-30B-A3B. Время до первого токена растёт на 21,8–27,8%. Под нагрузкой разрыв держится в пределах 11,5–20,2%, но крупные модели упираются в потолок раньше.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи опубликовали на arXiv в июле 2026 года бенчмарк, который замерил цену конфиденциальных вычислений для LLM-инференса: на одной видеокарте NVIDIA H100 80GB внутри изолированной среды Intel TDX защищённый режим снижает глобальную пропускную способность на 17,7–21,1% и замедляет выдачу первого токена на 21,8–27,8%.

Что именно замеряли

Авторы сравнили два режима исполнения на одном GPU NVIDIA H100 80GB, размещённом в конфиденциальной инстанции Intel TDX: обычный (non-confidential) и защищённый (confidential computing). Для теста взяли две представительные языковые модели — Mistral-7B v0.1 и Qwen3-30B-A3B — и измерили пять метрик: время до первого токена (TTFT), сквозную задержку запроса, скорость генерации токенов, глобальную пропускную способность и число обслуженных запросов при росте параллелизма.

  • Железо — одна NVIDIA H100 80GB в конфиденциальной инстанции Intel TDX
  • Модели — Mistral-7B v0.1 и Qwen3-30B-A3B
  • TTFT растёт на 21,8% (Mistral-7B) и 27,8% (Qwen3-30B-A3B)
  • Глобальная пропускная способность падает на 17,7% и 21,1%
  • Под конкурентной нагрузкой разрыв — 11,5–20,2%

Насколько падает производительность?

В экспериментах с фиксированной интенсивностью запросов конфиденциальный режим увеличил среднее время до первого токена на 21,8% для Mistral-7B и на 27,8% для более крупной Qwen3-30B-A3B. Глобальная пропускная способность в токенах при этом просела на 17,7% и 21,1% соответственно.

Разрыв заметнее у большой модели: чем крупнее развёрнутая сеть, тем дороже обходится изоляция вычислений. По данным исследования, оверхед складывается из шифрования памяти и защищённого обмена данными между CPU и GPU внутри доверенной среды.

Почему это важно для планирования ёмкости

Под растущей конкурентной нагрузкой (closed-loop) разрыв в пропускной способности остаётся в диапазоне 11,5–20,2%, но более крупная Qwen3-30B-A3B в защищённом режиме раньше упирается в точку насыщения. То есть один и тот же сервер в конфиденциальном режиме обслужит меньше одновременных пользователей, прежде чем задержки начнут резко расти.

«Конфиденциальный GPU-инференс сохраняет пригодную пропускную

способность под нагрузкой, но планирование ёмкости должно учитывать и постоянный штраф к производительности, и более раннее насыщение крупных моделей», — говорится в статье на arXiv.

Что это значит

Конфиденциальные вычисления перестают быть теорией и становятся практическим требованием для инференса на чувствительных данных или проприетарных моделях. Плата за приватность — около пятой части пропускной способности — измерима и, по выводам авторов, приемлема, если заранее заложить её в расчёт мощностей.

Частые вопросы

Что такое конфиденциальный инференс на GPU?

Это режим, в котором входные данные и веса модели остаются зашифрованными и недоступны даже оператору сервера. Он нужен, когда инференс идёт на чувствительных данных или защищает проприетарные модели от утечки, — именно этот сценарий тестировали авторы на NVIDIA H100 под Intel TDX.

Сколько теряет производительность LLM в защищённом режиме?

По замерам на arXiv, глобальная пропускная способность падает на 17,7–21,1%, а время до первого токена растёт на 21,8–27,8%. Под конкурентной нагрузкой разрыв держится в пределах 11,5–20,2%, причём крупные модели упираются в потолок раньше.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…