MarkTechPost
Источник AI-новостей. Материалы автоматически отбираются и адаптируются редакцией Hamidun News.
Последние публикации

Meta FAIR выпустила NeuralSet — Python-пакет для связи нейроданных и ИИ-моделей
Meta FAIR открыла NeuralSet — Python-фреймворк, который объединяет fMRI, M/EEG, спайки и эмбеддинги Hugging Face в один PyTorch-конвейер для Neuro-AI-исследований. *Meta признана экстремистской организацией и запрещена

Команда Qwen выпустила FlashQLA: ускорение линейного внимания до 3× на NVIDIA Hopper
QwenLM выпустила FlashQLA — библиотеку CUDA-ядер для Gated Delta Network, которая даёт до 3× прироста производительности на GPU NVIDIA Hopper при предобучении и агентном инференсе.

OpenAI Privacy Filter: как собрать production-пайплайн для поиска и маскировки PII
В гайде с OpenAI Privacy Filter разбирается полный конвейер для поиска и маскировки персональных данных — от загрузки модели до автоматического редактирования текста.

DeepSeek, Google и Meta: 10 техник сжатия KV-кэша LLM для снижения памяти на инференсе
KV-кэш стал пожирателем GPU-памяти в больших LLM, и новый обзор показывает 10 подходов — от H2O и SnapKV до TurboQuant и MLA DeepSeek — которые уменьшают расход памяти без полной переделки модели.

Poolside выпустила Laguna XS.2 и M.1 — открытые модели для агентного программирования
Poolside показала две модели Laguna для агентного кодинга: открытая XS.2 запускается локально, а более мощная M.1 рассчитана на длинные задачи с правками кода, тестами и работой в терминале.

LlamaIndex ParseBench: как тестировать парсинг документов через Python и Hugging Face
Практический разбор показывает, как на датасете LlamaIndex ParseBench собрать пайплайн оценки парсеров документов: загрузить PDF из Hugging Face, сравнить извлечённый текст и измерить качество.

smol-audio от Deep-unlearning: набор Colab-ноутбуков для дообучения аудио-моделей
Deep-unlearning выпустила smol-audio — коллекцию Colab-совместимых ноутбуков, где можно дообучать Whisper, Parakeet, Voxtral, Granite Speech и другие аудио-модели.

Топ-10 физических AI-моделей, которые управляют реальными роботами в 2026 году
За 18 месяцев разрыв между LLM и реальной робототехникой резко сократился: физические AI-модели уже работают на заводах, складах и в исследовательских лабораториях.

Hugging Face и Gemma 3 1B: как собрать готовый к продакшену пайплайн генерации в Colab
Разбор показывает, как запустить Gemma 3 1B Instruct в Colab через Hugging Face Transformers: с безопасной авторизацией, chat templates и воспроизводимым inference-пайплайном.

Z.ai выпустила GLM-5V-Turbo — нативную мультимодальную модель для визуального программирования
Китайская лаборатория Z.ai выпустила GLM-5V-Turbo — модель, которая видит архитектурные схемы и скриншоты и сразу генерирует по ним рабочий код для агентных инженерных систем.

Google Gemma 4, NVIDIA и OpenClaw: локальные AI-агенты без оплаты за каждый токен
Google и NVIDIA продвигают локальный запуск Gemma 4 на RTX, Jetson и DGX Spark, чтобы всегда активные AI-агенты вроде OpenClaw работали быстрее, дешевле и без облачных счетов за токены.

Talkie-1930: исследователи выпустили 13B-модель без знаний об интернете и Второй мировой
Talkie-1930 — открытая 13B-модель, обученная только на англоязычных текстах до 1931 года, чтобы изучать историческое мышление, утечки данных и способность ИИ обобщать вне эпохи.

MarkTechPost показал, как собрать лёгкого VLA-агента с латентной моделью мира и MPC
В новом туториале MarkTechPost разбирает, как построить упрощённого embodied-агента: он работает по RGB-кадрам, учит латентную модель мира и планирует действия через MPC.

Arcee AI выпустила Trinity Large Thinking — открытую модель рассуждения для ИИ-агентов
Arcee AI открыла веса Trinity Large Thinking по лицензии Apache 2.0 и сделала ставку на длинные агентные сценарии, многошаговое рассуждение и уверенную работу с инструментами.

NVIDIA показала полный пайплайн оптимизации модели с FastNAS pruning и fine-tuning
NVIDIA выпустила практический гайд по Model Optimizer: в одном Colab-ноутбуке показаны обучение ResNet20, FastNAS pruning под лимит FLOPs и восстановление качества через fine-tuning.

TII выпустила Falcon Perception — 0,6B-модель для сегментации и поиска объектов по тексту
TII открыла Falcon Perception — компактную 0,6-миллиардную vision-language-модель, которая ищет и сегментирует объекты по обычному тексту и на сложных запросах обходит SAM 3.

Google DeepMind позволила LLM переписать алгоритмы игровой теории и обойти экспертов
Google DeepMind показала, что AlphaEvolve может переписывать код алгоритмов для игр с неполной информацией и находить решения, которые на большинстве тестов сильнее ручных экспертных вариантов.

Z.AI показала, как собрать production-ready агентные системы на GLM-5 с tool calling
Z.AI выпустила подробный туториал по GLM-5: от настройки SDK и OpenAI-совместимого API до streaming, tool calling, JSON-вывода и multi-turn агента для продакшена.

Netflix открыла Void — модель для удаления объектов из видео с учетом физики сцены
Команда Netflix и INSAIT выложила в open source Void — систему, которая удаляет объекты из видео и одновременно пересчитывает падения, поддержку предметов и другие физические последствия.

Как искусственный интеллект помогает брендам одежды проектировать моду будущего
Алгоритмы уже помогают модным брендам быстрее создавать коллекции, прогнозировать тренды, снижать перепроизводство и персонализировать покупки, но вместе с этим ставят вопросы об авторстве и труде.

Как собрать пайплайн Netflix Void для удаления объектов из видео с помощью CogVideoX
В подробном разборе показано, как развернуть модель Netflix Void, скачать нужные чекпойнты, подготовить входные данные и запустить удаление объектов из видео через CogVideoX.

Gladstone Institutes представили MaxToki — ИИ-модель, предсказывающую старение клеток
Модель MaxToki от Gladstone Institutes учится видеть не «снимок» клетки, а её траекторию во времени, оценивает ускорение старения и подсказывает мишени для вмешательства.

TinyFish запустила единую веб-платформу для AI-агентов с Search, Fetch, Browser и Agent
TinyFish объединила поиск, рендеринг страниц, браузерные сессии и автономные веб-воркфлоу в одной платформе для AI-агентов с единым API-ключом и общим пулом кредитов.

Google добавила Skills в Chrome и превратила AI-промпты в сценарии на один клик
Google запустила в Chrome функцию Skills: пользователи Gemini смогут сохранять часто используемые промпты как повторяемые сценарии и запускать их в браузере одним кликом.

Google DeepMind представила Gemini Robotics-ER 1.6 для автономии и чтения приборов роботами
Google DeepMind обновила Gemini Robotics-ER до версии 1.6: модель для роботов лучше понимает пространство, несколько видеопотоков и умеет читать сложные промышленные приборы.

MarkTechPost разобрал полный цикл обучения больших языковых моделей: от данных до деплоя
MarkTechPost выпустил подробный разбор того, как сегодня строят LLM: от предобучения на огромных корпусах до SFT, RLHF, оптимизации логики рассуждений и продакшен-развертывания.

Google представила Gemini 3.1 Flash TTS — модель речи с управлением, диалогами и 70+ языками
Google запустила Gemini 3.1 Flash TTS в превью: модель озвучивает текст на 70+ языках, поддерживает диалоги с двумя голосами и позволяет управлять подачей через аудиотеги.

Mem0 и OpenAI: как собрать универсальный слой долгосрочной памяти для AI-агентов
Новый туториал разбирает связку Mem0, моделей OpenAI и ChromaDB: из обычных диалогов она извлекает факты, хранит их по user_id, ищет по смыслу и подмешивает в ответы агента.

SmolAgents: как собрать мультиагентную AI-систему с кодом и динамической оркестрацией
Разбор реализации на SmolAgents показывает, как лёгкие AI-агенты исполняют код, вызывают инструменты, работают с памятью и координируют задачи внутри одной системы.

NetKet и JAX: как собрать Transformer-модель для фрустрированных спиновых систем
Гайд показывает, как с помощью NetKet, JAX и архитектуры Transformer собрать исследовательский VMC-пайплайн для моделирования фрустрированной спиновой цепочки J1-J2.