Все новости
8621
Rubric4Setwise: оценка наборов документов для RAG вместо ранжирования по релевантности
Исследователи представили SetwiseEvalKit — бенчмарк из ~28 000 критериев для оценки качества целого набора документов, и метод Rubric4Setwis

Нейросеть определяет родину говорящего по арабскому диалекту с точностью 481 км
Новая нейросеть предсказывает происхождение говорящего по арабскому диалекту прямо в координатах широты и долготы — с медианной ошибкой 481,

SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений

MultiMDM: диффузионная языковая модель для генерации текста за несколько шагов

NLI-гиперграф vs LLM-судья: новый способ проверять рассуждения ИИ без эталона

Адаптивная капитуляция LLM: как чат-боты уступают уязвимым пользователям (исследование)

CRA-Bench и CRA-Net: как ловить вред, который копится по ходу диалога с LLM
Новый фреймворк CRA и бенчмарк CRA-Bench учатся ловить вред, который в LLM-диалоге собирается постепенно из безобидных сообщений, а не в одн

Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса
Новый метод Spectral-LSH сжимает длинные промпты в 8–16 раз без дообучения модели: похожие токены группируются через хеширование в спектраль













