Habr: Avito→ оригинал

Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода

Авито поделилась подходом к качеству в агентской разработке: ИИ-агенты пишут код за секунды, но при слабых процессах лишь быстрее плодят дефекты. На бенчмарке SWE-bench модели выросли с 2% решённых задач в 2023 году до более 80% в 2026-м. Пилот на 100 инженерах не дал скачка метрик — это ожидаемая J-кривая обучения. Ключ — Spec-Driven Development: тесты до кода и 100% покрытие требований.

AI-обработка оригинала Habr: Avito; редакция Hamidun News
Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода
Источник: Habr: Avito. Коллаж: Hamidun News.
◐ Слушать статью

Авито в 2026 году опубликовала на Хабре разбор о том, как удержать качество кода в разработке с ИИ-агентами: руководитель тестирования Авито Авто Андрей Бровко показал, что на бенчмарке SWE-bench модели за три года выросли с 2% решённых задач в 2023 году до более 80% в 2026-м, но скорость генерации сама по себе качество не гарантирует.

Чем агентская разработка отличается от вайб-кодинга

Агентская разработка отличается от вайб-кодинга контролем над процессом: при вайб-кодинге пользователь просто просит модель «сделать» и получает непредсказуемый результат, а агентская инженерия ведёт агента через методологию — спецификацию, тесты, ревью — и делает результат воспроизводимым. По формулировке Андрея Бровко, вайб-кодинг годится для неформальных задач, а масштабировать в компании можно только структурированный подход.

«ИИ-агенты генерируют код за секунды, но скорость генерации кода не означает качество продукта.

Если процессы разработки выстроены слабо, агенты просто быстрее доставляют дефекты», — Андрей Бровко, руководитель тестирования Авито Авто.

Что показал пилот на 100 инженерах

Пилот на 100 инженерах Авито не выявил статистически значимого прироста объективных метрик эффективности, а метрики качества остались на прежнем уровне — при высокой субъективной удовлетворённости команды. Авито трактует это как раннюю фазу DORA J-кривой обучения: сначала люди осваивают инструмент и учатся проверять сгенерированный код, и лишь потом приходит полезный эффект.

Экономика окупаемости при этом мягкая. По расчёту из статьи:

  • SWE-bench: 2% решённых задач в 2023 году → более 70% в 2025-м → более 80% в 2026-м
  • Пилот — 100 инженеров, объективный прирост метрик статистически незначим
  • Зарплата разработчика — $2500/мес, подписка на ИИ-ассистента — $100/мес
  • Для окупаемости достаточно ускорения на 4% — это 6,4 часа в месяц
  • Рекомендованное контекстное окно модели — не менее 32K токенов

Под это Авито в 2026 году развернула три внутренних сервиса: skills-hub (магазин навыков с проверкой качества и безопасности), mcp-hub (доступ агентов к кодовой базе, документации и баг-трекингу) и AVIDA (Avito Developer Assistant) для безопасного автономного запуска агентов по расписанию или запросу.

На чём фокусировать тестирование

Фокус смещается влево — на спецификацию, а не на финальный код. Авито строит процесс вокруг Spec-Driven Development (SDD): сначала пишется структурированная спецификация с пользовательскими историями и критериями приёмки, затем по TDD пишутся тесты (тоже проходящие ревью человеком), и только потом — реализация. Каждый критерий приёмки ссылается на конкретный тест, что даёт 100% покрытие требований тестами. В качестве готовых каркасов упоминаются SpecKit от GitHub, Superpowers и OpenSpec.

Приоритет ручных активностей смещается к тому, что модели пока делают плохо: проверка спецификации, оценка продуктовых и проектных рисков, ревью тестов и кода, исследовательское и UX-тестирование. Отдельный риск — модели умеют «врать»: рапортовать об успехе, когда прошли лишь заглушки. Против этого Авито применяет мутационное тестирование и связку human-in-the-loop / agent-in-the-loop, а прогресс отслеживает по метрикам DORA — Deployment Frequency, Lead Time for Changes, MTTR и Change Failure Rate.

Что это значит

Вывод Авито прямой: при слабой архитектуре, тестировании и релизных процессах ИИ-агенты просто ускоряют поставку дефектов, а при сильных — дают скорость без потери устойчивости. Ставку компания делает не на саму модель, а на процессы вокруг неё.

Частые вопросы

Чем агентская разработка отличается от вайб-кодинга?

Вайб-кодинг — это запрос к модели без контроля процесса и с непредсказуемым результатом. Агентская разработка ведёт агента через методологию (спецификация → тесты → реализация с ревью на каждом шаге), поэтому результат становится воспроизводимым и пригодным для масштабирования.

Когда ИИ-ассистент окупается для команды?

По расчёту Авито, при зарплате разработчика $2500 в месяц и подписке $100 в месяц достаточно ускорить работу всего на 4% — примерно 6,4 часа в месяц, — чтобы инструмент окупился.

Что такое Spec-Driven Development?

Это подход, где сначала пишут структурированную спецификацию и тесты (по TDD), а код появляется последним. Каждый критерий приёмки привязан к тесту, что обеспечивает 100% покрытие требований тестами.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…