Агентская разработка без вайб-кодинга: как Avito удерживает качество, когда агенты пишут код за секунды
AIУправление проектами AI-кейсы #Агентская разработка#Качество#Avito

Агентская разработка без вайб-кодинга: как Avito удерживает качество, когда агенты пишут код за секунды

Опубликовано 19 июля 2026 3 мин чтения

Если агент генерирует код за секунды, это не значит, что он генерирует его правильно. Андрей Бровко, руководитель тестирования Avito Авто, разбирает на Habr ключевое разграничение, которое в индустрии пока плохо усвоено: скорость генерации и качество результата не одно и то же, без процессов первая просто быстрее доставляет дефекты.

Вайб-кодинг против агентской инженерии

Термин “вайб-кодинг” ввёл Андрей Карпаты: так называют режим, когда код генерируется без контроля внутренней логики. Он же предложил альтернативу “агентскую инженерию” (agent engineering), предсказуемый и масштабируемый подход в рамках методологии. Разница не в инструменте, а в наличии или отсутствии процессов вокруг него.

Контекст важен. По бенчмарку SWE-bench (набор реальных GitHub-задач) языковые модели в 2023 году решали около 2% задач, с 2025 года — более 70%, в 2026-м — уже более 80%.

Пилот Avito: что показали метрики

В 2025 году Avito запустил внутренний пилот: 100 инженеров получили доступ к топовым моделям. По объективным метрикам эффективности и качества статистически значимых изменений не зафиксировано. Субъективно инженеры отмечали ускорение.

Бровко трактует отсутствие просадки как позитивный сигнал: при внедрении новых технологий метрики обычно проседают, это J-кривая обучения. То, что показатели качества не ухудшились, он расценивает как признак нормального прохождения этого этапа.

Платформа: три сервиса как контурная защита

В 2026 году Avito централизовало управление агентской инфраструктурой через три сервиса.

skills-hub, магазин навыков с контролем качества и безопасности. Навыки проходят статическое и динамическое тестирование (evals в CI), ревью экспертом домена, живое тестирование на реальных задачах. Каждый навык версионируется и должен быть самодостаточным.

mcp-hub, MCP-сервер для доступа к внутренней инфраструктуре: кодовой базе, документации, баг-трекингу. При проектировании MCP-серверов применяется паттерн Tolerant Reader, используются стандартные имена параметров, минимизируется число инструментов и вызовов, оптимизируется передаваемый контекст. Тестирование рекомендуется проводить на моделях среднего уровня, а не только на топовых: они чаще ошибаются и лучше выявляют слабые места.

AVIDA, среда для автономного запуска агентов на удалённом сервере по расписанию или по запросу.

Отдельно зафиксировано требование к модели: большое контекстное окно обязательно. Локальные модели типа Qwen 32B с 32k токенами признаны непригодными для агентской разработки: эксперимент показал, что модель плохо следует инструкциям.

Spec-Driven Development: тесты до кода, спецификация как ограничитель

Три слоя Spec-Driven Development: спецификация → тесты → код, с точками проверки человеком на первых двух

Бровко описывает подход разработки от спецификации, предполагающий два уровня ограничения модели.

Первый, спецификация: пользовательские истории и критерии приёмки в md-формате. Второй, тесты: они генерируются до кода и проходят ревью человека. Каждый критерий приёмки привязан к конкретному юнит-тесту, что даёт полное покрытие требований. Human-in-the-loop обязателен: человек проверяет спецификацию, дизайн и тесты до генерации кода.

Из готовых инструментов реализации упомянуты SpecKit, Superpowers и OpenSpec, все с открытым исходным кодом.

Как это соотносится с дизайном самих агентов

Бровко рассматривает проблему со стороны QA: как удержать качество, когда агент уже работает. Другие заметки в этой базе разбирают смежные вопросы со стороны дизайна агента: где агент может незаметно сойти с рельсов (тихие отказы) и в каких точках решение стоит передавать человеку (контрольные точки с участием человека). Бровко добавляет к этим вопросам QA-перспективу: что именно проверять и по каким метрикам понять, что процесс идёт нормально. Обе стороны, дизайн и контроль качества, рассматривают разные аспекты одной задачи.

Ещё короче — в Telegram

Оперативные заметки, ссылки и эксперименты.

Подписаться на @ai_pmo