MarkTechPost
Источник AI-новостей. Материалы автоматически отбираются и адаптируются редакцией Hamidun News.
Последние публикации

Ant Group представила LingBot-VLA 2.0 — открытую модель для управления роботами любой конструкции
Robbyant (Ant Group) 8 июля 2026 года выпустила LingBot-VLA 2.0 — открытую модель на 6 млрд параметров для управления роботами разных конструкций под лицензией Apache 2.0.

NVIDIA Nemotron-Labs-3-Puzzle-75B: сжатие модели на 37% ускорило сервер в 2 раза
NVIDIA выпустила сжатую версию LLM Nemotron-3-Super — Nemotron-Labs-3-Puzzle-75B. За счёт метода Puzzle (чередование сжатия и дистилляции) модель стала на 37% меньше и ускорила пропускную способность сервера в 2 раза.

Google Research выпустила SensorFM — модель для 35 задач прогноза здоровья
Google Research обучила фундаментальную модель SensorFM на 1 триллионе минут данных от 5 млн пользователей Fitbit и Pixel Watch для предсказания здоровья.

Robbyant выпустила LingBot-World-Infinity — каузальную модель для интерактивных миров
Robbyant представила LingBot-World-Infinity — 14B видеомодель, которая работает как интерактивный симулятор и генерирует 720p видео со скоростью 60 кадров в секунду.

Нейросеть для документов: Datalab Lift против конкурентов
Datalab сравнила свой 9B-инструмент Lift с NuExtract3, LlamaExtract, Marker и Docling — и разобрала, когда schema-first подход выигрывает при извлечении данных из PDF.

Liquid AI выпустила Antidoom: метод FTPO снижает зависания в reasoning-моделях
Liquid AI открыла исходный код Antidoom — инструмента, который находит токен-триггер бесконечного цикла и переобучает только его, снизив частоту doom-loops с 22,9% до 1%.

Google Gemini: импорт репозиториев GitHub в режим разработки Build
Google AI Studio обновил режим Build — теперь любой GitHub-репозиторий можно импортировать напрямую и сразу получить редактируемое, деплоируемое приложение.

Audex-30B: нейросеть NVIDIA для аудио и речи
NVIDIA объединила распознавание речи, перевод, синтез и генерацию аудио в единой MoE-модели на 30 млрд параметров, сохранив текстовые способности Nemotron-Cascade-2.

LingBot-Vision — бесплатная Vision-нейросеть от Ant Group
Robbyant из Ant Group опубликовала LingBot-Vision: 1B ViT-модель, обученная распознавать границы объектов без разметки и превосходящая более крупные аналоги на задачах пространственного восприятия.

ИИ для работы с PDF-документами: гайд по инструментам в 2026
Обзор open-source инструментов для конвертации корпоративных PDF и сканов в структурированный JSON — без которого LLM и AI-агенты не могут работать с реальными корпоративными данными.

Meituan выпустила LongCat-2.0: открытая MoE-модель на 1,6 трлн параметров с контекстом в 1 млн токенов
Китайская компания Meituan открыла LongCat-2.0 — гигантскую MoE-модель с нативным окном в миллион токенов и обучением на отечественных ASIC.

Synthetic Sciences выпустила OpenScience — открытый AI-воркбенч для ML, биологии, физики и химии
OpenScience от Synthetic Sciences — open-source воркбенч под Apache 2.0 с 250+ навыками, совместимый с любой AI-моделью для задач в ML, биологии, физике и химии.

Sakana AI запустила переводчик Sakana Translate для японского, английского и китайского
Sakana AI добавила в Sakana Chat переводчик Sakana Translate на базе моделей Namazu — с тремя режимами: прямой перевод, корректура и диалог с документом.

Как натренировать Gemma-3 на математике с помощью GRPO и LoRA-адаптеров
Пошаговый GRPO-воркфлоу для дообучения Gemma-3 на датасете GSM8K — от настройки среды и LoRA-адаптеров до функций вознаграждения и экспорта финальной модели.

Page Agent от Alibaba управляет веб-интерфейсами через DOM без скриншотов и мультимодальных моделей
Alibaba представила Page Agent — клиентский JavaScript-агент, который понимает текстовые команды и управляет веб-страницами через DOM без скриншотов и серверного кода.

Anthropic запустила Claude Science Beta: многоагентная среда для геномики и протеомики
30 июня 2026 года Anthropic открыла бета-доступ к Claude Science — многоагентной платформе для воспроизводимых пайплайнов в геномике, протеомике и хемоинформатике.

NVIDIA представила ASPIRE — самообучающийся фреймворк роботики с 31% zero-shot на длинных задачах
NVIDIA выпустила ASPIRE — фреймворк для роботов, который пишет и улучшает программы управления, копит проверенные решения в библиотеку навыков и переносит их на новые задачи без дообучения.

NVIDIA HORIZON: автономный агент закрыл 100% RTL-бенчмарков в проектировании чипов
NVIDIA представила HORIZON — агент, который самостоятельно пишет и верифицирует RTL-код проектирования чипов, достигнув 100% выполнения по стандартным бенчмаркам.

Бывший технический лидер Qwen: почему гибридное мышление не сработало и что дальше
Цзуньян Линь, бывший лидер разработки Qwen в Alibaba, объяснил, где динамическое мышление Qwen3 дало сбой — и почему агентный ИИ требует принципиально другого подхода к обучению.

ИИ для поиска документов: LlamaIndex legal-kb бесплатно
LlamaIndex опубликовала справочное приложение legal-kb с файловым доступом агентов к базе знаний через retrieve, find, read и grep на движке Index v2.

NVIDIA выпустила нейросеть Nemotron для текста с открытыми весами
NVIDIA открыла веса диффузионной языковой модели Nemotron-Labs-TwoTower, которая объединяет замороженный AR-бэкбон с диффузионной головой для ускорения текстовой генерации.

Interfaze выпустила открытую диффузионную ASR-модель для распознавания шести языков
Interfaze опубликовала diffusion-gemma-asr-small — первый открытый ASR-адаптер на DiffusionGemma от Google: 42 млн параметров, шесть языков, стоимость инференса — от числа шагов шумоподавления.

Нейросеть для браузера без облака: проект WebBrain
WebBrain — бесплатный MIT-лицензированный агент для Chrome и Firefox, который читает страницы и автоматизирует задачи, работая локально через llama.cpp или Ollama.

Anthropic выпустила Claude Fable 5 и Mythos 5: одна модель, два уровня доступа
Anthropic открыла Fable 5 для всех с классификаторами безопасности, а Mythos 5 со снятыми кибер-ограничениями распространяется только через закрытую программу Project Glasswing.

Как ускорить обучение трансформеров с NVIDIA Apex: FusedAdam, FusedLayerNorm и torch.amp
Пошаговое руководство по сборке NVIDIA Apex из исходников и применению FusedAdam, FusedLayerNorm и смешанной точности — прирост до 2.5× при обучении трансформеров.

JetBrains выпустила Mellum2 — открытую 12B MoE-модель для быстрых задач в AI-пайплайнах
JetBrains открыла Mellum2 под Apache 2.0 — компактную MoE-модель с 12 млрд параметров, обученную на 10,6 трлн токенов для встраивания в многомодельные AI-конвейеры.

Alibaba запустила Qwen3.7-Plus: мультимодальный агент с анализом видео и автономным кодом
Alibaba выпустила на платформе Bailian мультимодальный агент Qwen3.7-Plus — модель видит изображения и видео, вызывает инструменты и самостоятельно итерирует код без участия оператора.

PyGraphistry: граф-аналитика для обнаружения угроз в корпоративных данных
Исследователи опубликовали Colab-воркфлоу PyGraphistry, который превращает корпоративные данные доступа в интерактивный граф с ML-аномалиями и тремя режимами визуализации для расследования инцидентов.

Google DeepMind открыла DiffusionGemma — 26B MoE-модель с генерацией в 4 раза быстрее
Google DeepMind выпустила экспериментальную открытую модель DiffusionGemma на 26B параметров, использующую диффузию текста вместо авторегрессии — генерация ускоряется до 4 раз на GPU.

6 no-code инструментов для AI-разработчиков: от RAG до мультиагентов
Шесть no-code платформ — Flowise, Dify, Stack AI и другие — позволяют строить RAG-системы, мультиагентные воркфлоу и файнтюнить LLM без написания кода.