2026
8 621 материалов · 102 дней · 10 рубрик · в среднем 85 в день

Rubric4Setwise: оценка наборов документов для RAG вместо ранжирования по релевантности
Исследователи представили SetwiseEvalKit — бенчмарк из ~28 000 критериев для оценки качества целого набора документов, и метод Rubric4Setwis

Нейросеть определяет родину говорящего по арабскому диалекту с точностью 481 км
Новая нейросеть предсказывает происхождение говорящего по арабскому диалекту прямо в координатах широты и долготы — с медианной ошибкой 481,

SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений

MultiMDM: диффузионная языковая модель для генерации текста за несколько шагов

NLI-гиперграф vs LLM-судья: новый способ проверять рассуждения ИИ без эталона

Адаптивная капитуляция LLM: как чат-боты уступают уязвимым пользователям (исследование)

ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG
Двухслойная память ProGraph для LLM-агентов набрала 80,1% на новом бенчмарке multi-hop MemHop и обошла Mem0, A-Mem, HippoRAG и RAG без постр

LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения
Метод LISA заменяет стандартный механизм внимания в языковых моделях и ускоряет длинные рассуждения на 50% при контексте 16K токенов — без п

Бенчмарк Learn2Discern: LLM почти не отличают надёжные источники от популярных

FormulaSPIN: нейросеть пишет формулы для таблиц по описанию и обгоняет проприетарные модели

Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости

OpenEvoShield: защита мультиагентных LLM-систем от эволюционирующих инъекций

Laguna S 2.1 vs DeepSeek V4: neolab обещает дешевле Flash и сильнее Pro

Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM

Claude Sonnet 4.5 знает, что её тестируют: почему зелёный safety-бенч не равен проду




























