Habr: Сбер→ оригинал

Apple Foundation Models SDK for Python: локальная Apple Intelligence в агенте Hermes

Команда Сбера собрала нативный провайдер, который подключает локальную модель Apple Intelligence к автономному Python-агенту Hermes через Foundation Models SDK. Модель грузится прямо в процесс и работает на Apple Silicon без облака: среднее время ответа на короткие запросы — 2,8 секунды, а на бенчмарке из 50 вопросов (MMLU, GSM8K, HellaSwag и др.) адаптер дал 46 правильных ответов.

AI-обработка оригинала Habr: Сбер; редакция Hamidun News
Apple Foundation Models SDK for Python: локальная Apple Intelligence в агенте Hermes
Источник: Habr: Сбер. Коллаж: Hamidun News.
◐ Слушать статью

Инженеры Сбера в блоге на Habr показали нативный провайдер, который подключает локальную модель Apple Intelligence к автономному Python-агенту Hermes через Apple Foundation Models SDK for Python. По их замерам, среднее время ответа на короткие запросы составило 2,8 секунды, а на бенчмарке из 50 вопросов адаптер выдал 46 правильных ответов.

Что такое Foundation Models SDK for Python

Apple Foundation Models SDK for Python — это библиотека, дающая прямой доступ к локальной модели Apple Intelligence прямо из Python-кода. Apple выпустила её в феврале 2026 года: модель грузится в процесс, KV-кеш держится в оперативной памяти, а инференс идёт на чипах Apple Silicon без обращения к облаку.

Библиотека быстро набрала аудиторию среди разработчиков. По данным GitHub, у неё уже 1,2 тыс. звёзд, а последнюю версию 0.2.0 с поддержкой изображений Apple представила на конференции WWDC26.

  • Релиз библиотеки — февраль 2026 года
  • 1,2 тыс. звёзд на GitHub
  • Версия 0.2.0 с поддержкой изображений — на WWDC26
  • Инференс полностью локальный, на Apple Silicon
  • KV-кеш хранится в памяти процесса

Зачем понадобился адаптер для Hermes

Готового нативного провайдера для Python-агентов до этого не существовало. Обёртки над Foundation Models эмулируют интерфейс OpenAI, но не дают локальной модели работать как основной движок агента — со всеми его механизмами: рейт-лимитером, откатом к другим моделям и аудитом. Прямое использование Foundation Models уже было в Swift-агенте iClaw, однако для более универсальных агентов на Python эта возможность оставалась закрытой.

Адаптер к Hermes закрывает разрыв: локальная модель Apple становится штатным инференсом агента, а не внешним сервисом за HTTP-обёрткой. Это значит, что запросы к ней проходят через ту же логику лимитов, фолбэков и логирования, что и обращения к облачным моделям.

Какие результаты показали бенчмарки

На тестовом наборе из 50 вопросов провайдер набрал 46 правильных ответов. Вопросы брали из пяти известных наборов — MMLU, BoolQ, GSM8K, BIG-Bench и HellaSwag, то есть проверяли одновременно знания, логику и арифметику. Среднее время реакции на короткие запросы составило 2,8 секунды — для полностью локального инференса на ноутбуке это ощутимо быстро.

Сочетание скорости и точности — главный аргумент кейса: агент отвечает без сетевой задержки и без расхода токенов на API.

«Почему бы не попробовать добавить к

Hermes адаптер на Foundation Models SDK for Python и получить среднее время реакции на короткие запросы 2,8 секунды, а на бенчмарке из 50 вопросов выбить 46 правильных ответов?» — из статьи команды Сбера на Habr.

Что это значит

Локальные модели вплотную подошли к роли основного движка автономных агентов: без облака, без платы за API и с приемлемой задержкой. Для сценариев, где важны приватность и работа офлайн, связка Apple Silicon и Python из экзотики превращается в рабочий инструмент.

Частые вопросы

Что такое Apple Foundation Models SDK for Python?

Это выпущенная Apple в феврале 2026 года Python-библиотека, которая даёт прямой доступ к локальной модели Apple Intelligence: модель грузится в процесс и работает на Apple Silicon без облака. На GitHub у неё 1,2 тыс. звёзд, актуальная версия — 0.2.0 с поддержкой изображений.

Какие результаты показал адаптер для Hermes?

На бенчмарке из 50 вопросов (MMLU, BoolQ, GSM8K, BIG-Bench, HellaSwag) провайдер дал 46 правильных ответов, а среднее время ответа на короткие запросы составило 2,8 секунды при полностью локальном инференсе.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…