ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG
Исследователи представили ProGraph — двухслойную память для LLM-агентов. Она набрала 80,1% на новом бенчмарке multi-hop-памяти MemHop и 78,4% на LoCoMo, обойдя Mem0, A-Mem, HippoRAG и RAG. Вместо явного графа знаний ProGraph использует текстовые профили и совместно извлекаемые точные факты — даты, числа и объекты — без лишних вызовов API.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Исследователи представили ProGraph (Profile-Graph Memory) — двухслойную архитектуру долговременной памяти для LLM-агентов, которая в июле 2026 года вышла препринтом на arXiv и набрала 80,1% на новом бенчмарке MemHop и 78,4% на LoCoMo, обойдя Mem0, A-Mem, HippoRAG и RAG.
Зачем нужен новый бенчмарк
MemHop — это бенчмарк из 1000 вопросов с глубиной связей от 1 до 5 переходов (hops) по 10 сценариям социальных сетей, с разметкой доказательств на каждом переходе. По данным препринта на arXiv, существующие тесты памяти в основном проверяют одношаговое припоминание (single-hop recall) и почти не измеряют multi-hop-ассоциации — связывание фактов через цепочку промежуточных сущностей. MemHop закрывает этот пробел и позволяет отдельно оценивать глубину рассуждения агента.
Как устроена ProGraph
ProGraph работает на двух слоях и не строит явный граф знаний. Первый слой — profile expansion: обход по подстрокам имён сущностей, которые естественным образом встречаются в текстовых профилях, написанных самой моделью. Это минимальная замена ручному построению knowledge-graph. Второй слой — compression residuals: точные даты, количества и названные объекты, которые извлекаются вместе с каждым обновлением профиля без дополнительных вызовов API (zero extra API cost).
Полный перебор конфигураций (full-grid ablation) показал, что механизмы специализированы. Убрать profile expansion — минус 22,6 процентного пункта на MemHop; не извлекать compression residuals совместно — минус 8,6 пункта на LoCoMo. Перекрёстные эффекты внутри одной архитектуры остаются меньше 3 пунктов.
- Бенчмарк MemHop: 1000 вопросов, глубина 1–5 переходов, 10 соцсетевых сценариев
- ProGraph: 80,1% на MemHop (уровень эталона FullContext) и 78,4% на LoCoMo (+11,3 п.п. к FullContext)
- Profile expansion отвечает за multi-hop: −22,6 п.п. на MemHop при удалении
- Compression residuals отвечают за точность: −8,6 п.п. на LoCoMo без совместного извлечения
- Обходит Mem0, A-Mem, HippoRAG и RAG на обоих бенчмарках
Чем результат важен
ProGraph на LoCoMo превзошла эталон FullContext на 11,3 пункта, а на MemHop с ним сравнялась — при этом не держит всю историю в окне контекста и не строит явный граф. Это значит, что агент способен отвечать на цепочечные вопросы, опираясь на сжатые профили и остатки-факты, а не на полную историю переписки.
«Расширение по профилям обеспечивает multi-hop-рассуждение, а
компрессионные остатки — точность извлечения», — говорится в аннотации препринта на arXiv.
Авторы выложили в открытый доступ и сам бенчмарк MemHop, и реализацию ProGraph, и baseline-реализации конкурентов — то есть заявленные цифры можно воспроизвести независимо.
Что это значит
Память для LLM-агентов сдвигается от подхода «затолкать весь контекст» и тяжёлых графов знаний к лёгким текстовым профилям с точечными фактами. ProGraph показывает, что дешёвый метод способен догнать полный контекст на глубоких вопросах — и обойти его там, где важна связь фактов через несколько шагов.
Частые вопросы
Что такое MemHop?
MemHop — это бенчмарк для проверки многошаговой памяти LLM-агентов: 1000 вопросов с глубиной связей от 1 до 5 переходов по 10 сценариям социальных сетей, с разметкой доказательств на каждом шаге.
Чем ProGraph отличается от Mem0 и RAG?
ProGraph использует два слоя — обход по именам в текстовых профилях и совместно извлекаемые точные факты (даты, числа, объекты) — вместо явного графа знаний. На бенчмарках MemHop и LoCoMo она обошла Mem0, A-Mem, HippoRAG и RAG.
Можно ли воспроизвести результаты?
Да. Авторы опубликовали бенчмарк MemHop, реализацию ProGraph и baseline-реализации, так что замеры можно повторить самостоятельно.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.