Habr: Avito→ оригинал

Авито устроило турнир uplift-моделей: победил X-learner, а не Causal Forest

Аналитик Авито Гриша Крюков устроил «чемпионат» среди четырёх uplift-моделей: S-learner, T-learner, X-learner и Causal Forest. Формат — групповой этап на синтетике плюс плей-офф на реальных данных, метрика PEHE. Неожиданный итог: X-learner вышел из группы лишь третьим, но выиграл оба полуфинала и финал — PEHE 0.579 против 1.135 у T-learner.

AI-обработка оригинала Habr: Avito; редакция Hamidun News
Авито устроило турнир uplift-моделей: победил X-learner, а не Causal Forest
Источник: Habr: Avito. Коллаж: Hamidun News.
◐ Слушать статью

Аналитик команды доверия и безопасности Авито Гриша Крюков в июле 2026 года устроил «чемпионат» среди четырёх популярных uplift-моделей — S-learner, T-learner, X-learner и Causal Forest — с групповым этапом и плей-офф. Золото неожиданно взял X-learner, который вышел из группы лишь третьим, но выиграл оба полуфинала и финал.

Зачем нужны uplift-модели

Uplift-моделирование оценивает индивидуальный эффект воздействия — насколько изменится поведение конкретного человека от акции, а не среднюю реакцию по группе. Главная сложность в том, что для одного объекта нельзя одновременно наблюдать оба исхода: с воздействием и без.

«Главная проблема: для одного игрока мы никогда не знаем обе ситуации одновременно», —

Гриша Крюков, аналитик команды доверия и безопасности Авито.

Четыре подхода решают эту задачу по-разному: S-learner подаёт флаг воздействия как обычный признак, T-learner обучает две отдельные модели, X-learner добавляет обучение на псевдоэффектах и propensity-взвешивание, а Causal Forest строит деревья, максимизирующие различие в эффекте.

Как устроен турнир

Турнир состоял из группового этапа на синтетических данных и плей-офф на реальных. Качество моделей автор мерил метрикой PEHE (Precision in Estimation of Heterogeneous Effect) — чем она ниже, тем точнее оценка эффекта.

  • Модели: S-learner, T-learner, X-learner, Causal Forest
  • Метрика — PEHE, очки в группе по местам: 3-2-1-0
  • Групповой этап — синтетика, 5000 наблюдений, 10 признаков, разбиение 70/30
  • Полуфиналы — датасет Hillstrom MineThatData, 64 тыс. клиентов e-commerce
  • Финал — датасет FIFA 21, около 10 тыс. футболистов и 26 атрибутов

По итогам трёх групповых раундов Causal Forest шёл первым с 6 очками, S-learner и X-learner набрали по 5, а T-learner замкнул таблицу с 2 очками.

Почему победил X-learner

X-learner выиграл, потому что его архитектура учится именно на разнице между сценариями с воздействием и без, а не на общем уровне отклика. В полуфинале он разгромил S-learner (PEHE 0.215 против 0.747), а в финале обошёл T-learner с результатом PEHE 0.579 против 1.135.

«Архитектура работает по назначению: вместо общего уровня модель учится именно на разнице между мирами с воздействием и без», —

Гриша Крюков.

Причину поражения фаворитов автор объясняет так: на синтетике, где данные распределены идеально, преимущество получал устойчивый Causal Forest, но на «грязных» реальных данных выигрывала более гибкая архитектура. Отдельно досталось T-learner: его две независимые модели не обмениваются информацией, и это стало фатальным в финале.

Что это значит

Универсального победителя в uplift-моделировании нет: на аккуратной синтетике и малых выборках выигрывает Causal Forest, а на шумных реальных данных — X-learner. Выбор модели стоит делать под конкретный датасет, а не по репутации метода.

Частые вопросы

Что такое uplift-моделирование?

Это метод оценки индивидуального эффекта воздействия — на сколько изменится поведение конкретного пользователя от акции или письма, а не средний эффект по всей аудитории. Применяется в маркетинге, retention и антифроде.

Какая модель победила в турнире Авито?

Чемпионом стал X-learner: он вышел из группового этапа лишь третьим, но выиграл оба полуфинала и финал с результатом PEHE 0.579 против 1.135 у T-learner. Причина — архитектура, обучающаяся на разнице эффектов.

Что означает метрика PEHE?

PEHE (Precision in Estimation of Heterogeneous Effect) измеряет, насколько точно модель оценивает индивидуальный эффект: чем значение ниже, тем ближе предсказание к истинному. В турнире по ней распределяли места.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…