arXiv cs.AI→ оригинал

ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG

Исследователи представили ProGraph — двухслойную память для LLM-агентов. Она набрала 80,1% на новом бенчмарке multi-hop-памяти MemHop и 78,4% на LoCoMo, обойдя Mem0, A-Mem, HippoRAG и RAG. Вместо явного графа знаний ProGraph использует текстовые профили и совместно извлекаемые точные факты — даты, числа и объекты — без лишних вызовов API.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи представили ProGraph (Profile-Graph Memory) — двухслойную архитектуру долговременной памяти для LLM-агентов, которая в июле 2026 года вышла препринтом на arXiv и набрала 80,1% на новом бенчмарке MemHop и 78,4% на LoCoMo, обойдя Mem0, A-Mem, HippoRAG и RAG.

Зачем нужен новый бенчмарк

MemHop — это бенчмарк из 1000 вопросов с глубиной связей от 1 до 5 переходов (hops) по 10 сценариям социальных сетей, с разметкой доказательств на каждом переходе. По данным препринта на arXiv, существующие тесты памяти в основном проверяют одношаговое припоминание (single-hop recall) и почти не измеряют multi-hop-ассоциации — связывание фактов через цепочку промежуточных сущностей. MemHop закрывает этот пробел и позволяет отдельно оценивать глубину рассуждения агента.

Как устроена ProGraph

ProGraph работает на двух слоях и не строит явный граф знаний. Первый слой — profile expansion: обход по подстрокам имён сущностей, которые естественным образом встречаются в текстовых профилях, написанных самой моделью. Это минимальная замена ручному построению knowledge-graph. Второй слой — compression residuals: точные даты, количества и названные объекты, которые извлекаются вместе с каждым обновлением профиля без дополнительных вызовов API (zero extra API cost).

Полный перебор конфигураций (full-grid ablation) показал, что механизмы специализированы. Убрать profile expansion — минус 22,6 процентного пункта на MemHop; не извлекать compression residuals совместно — минус 8,6 пункта на LoCoMo. Перекрёстные эффекты внутри одной архитектуры остаются меньше 3 пунктов.

  • Бенчмарк MemHop: 1000 вопросов, глубина 1–5 переходов, 10 соцсетевых сценариев
  • ProGraph: 80,1% на MemHop (уровень эталона FullContext) и 78,4% на LoCoMo (+11,3 п.п. к FullContext)
  • Profile expansion отвечает за multi-hop: −22,6 п.п. на MemHop при удалении
  • Compression residuals отвечают за точность: −8,6 п.п. на LoCoMo без совместного извлечения
  • Обходит Mem0, A-Mem, HippoRAG и RAG на обоих бенчмарках

Чем результат важен

ProGraph на LoCoMo превзошла эталон FullContext на 11,3 пункта, а на MemHop с ним сравнялась — при этом не держит всю историю в окне контекста и не строит явный граф. Это значит, что агент способен отвечать на цепочечные вопросы, опираясь на сжатые профили и остатки-факты, а не на полную историю переписки.

«Расширение по профилям обеспечивает multi-hop-рассуждение, а

компрессионные остатки — точность извлечения», — говорится в аннотации препринта на arXiv.

Авторы выложили в открытый доступ и сам бенчмарк MemHop, и реализацию ProGraph, и baseline-реализации конкурентов — то есть заявленные цифры можно воспроизвести независимо.

Что это значит

Память для LLM-агентов сдвигается от подхода «затолкать весь контекст» и тяжёлых графов знаний к лёгким текстовым профилям с точечными фактами. ProGraph показывает, что дешёвый метод способен догнать полный контекст на глубоких вопросах — и обойти его там, где важна связь фактов через несколько шагов.

Частые вопросы

Что такое MemHop?

MemHop — это бенчмарк для проверки многошаговой памяти LLM-агентов: 1000 вопросов с глубиной связей от 1 до 5 переходов по 10 сценариям социальных сетей, с разметкой доказательств на каждом шаге.

Чем ProGraph отличается от Mem0 и RAG?

ProGraph использует два слоя — обход по именам в текстовых профилях и совместно извлекаемые точные факты (даты, числа, объекты) — вместо явного графа знаний. На бенчмарках MemHop и LoCoMo она обошла Mem0, A-Mem, HippoRAG и RAG.

Можно ли воспроизвести результаты?

Да. Авторы опубликовали бенчмарк MemHop, реализацию ProGraph и baseline-реализации, так что замеры можно повторить самостоятельно.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…