Together AI Blog
Источник AI-новостей. Материалы автоматически отбираются и адаптируются редакцией Hamidun News.
Последние публикации

Together AI и Y Combinator запускают первый GPU-кластер для стартапов YC
Together AI и Y Combinator запустили первый выделенный GPU-кластер для стартапов сообщества YC — без обязательных двухлетних контрактов на аренду вычислений.

Together AI везёт девять исследовательских работ на конференцию ICML 2026 в Сеуле
Together AI объявила, что девять её исследований приняли на ICML 2026 в Сеуле — доклады охватывают весь стек ИИ-инфраструктуры, от агентов до GPU-ядер.

Kimi K2.7 Code против Claude Fable 5: лендинги на 94% дешевле
Together AI сравнила Kimi K2.7 Code и Claude Fable 5 на 12 лендингах: Kimi обошёлся на 94% дешевле и почти не уступил по качеству результата.

Mamba-3: альтернатива трансформерам с линейной сложностью
Исследователи CMU и Together AI представили Mamba-3 — новую архитектуру на основе SSM, оптимизированную для быстрой генерации текста.

Открытые модели с гарантией 99%: Together AI запустила инференс
Together AI представила Provisioned Throughput — зарезервированные инференс-мощности для MiniMax M3 и GLM-5.2 с SLA 99% uptime и экономией до 90% по сравнению с закрытыми API.

Together AI привлекла $800 млн в раунде Series C для развития опенсорс-AI
Together AI закрыла раунд Series C на $800 млн при участии NVIDIA, Aramco Ventures и Vista Equity — платформа делает ставку на опенсорс-модели, которые в 6–20 раз дешевле закрытых аналогов.

Together AI обогнал TensorRT-LLM на 31% в бенчмарках для кодовых агентов
Together Inference Engine показал на 31% больше токенов в секунду и в 2 раза лучший TTFT при пиковой нагрузке — первый честный тест для production-агентов.

Together AI на NVIDIA GTC 2026: Dynamo, мультиагентные модели и голосовой AI
Together AI представила на GTC 2026 интеграцию с NVIDIA Dynamo 1.0, запустила стек NemoClaw для агентов и открыла доступ к 120B-модели Nemotron 3 Super.

Together AI запустила MiniMax M3 с контекстом 1 млн токенов и мультимодальностью
Together AI стала партнёром MiniMax для запуска M3 — флагманской модели с поддержкой 1 млн токенов контекста, нативной обработкой изображений и ускорением инференса до 125%.

Together AI получила сертификат ISO 27001:2022 для корпоративных ИИ-нагрузок
Together AI прошла международный аудит ISO 27001:2022 — независимая проверка подтвердила зрелость системы информационной безопасности для корпоративных клиентов.

Together AI: GPT-5.5, Gemini и Opus не умеют писать быстрые мульти-GPU ядра
Новый бенчмарк ParallelKernelBench показал: лучшие языковые модели справляются менее чем с третью задач на генерацию CUDA-ядер для многопроцессорных систем.

DeepSeek в 4 раза быстрее: как работает система ATLAS для LLM
Новая технология adaptive-learning speculator ATLAS от Together AI ускоряет LLM inference в 4 раза без ручной настройки — автоматически адаптируется к рабочей нагрузке пользователя.

ИИ инфраструктура: облачные GPU-кластеры для бизнеса
Together AI официально запустила Instant Clusters — самообслуживаемые GPU-кластеры на базе NVIDIA H100 и B200, которые развёртываются за минуты и готовы к production без долгих согласований.

Together AI увеличила лимиты Batch Inference API в 3000 раз и снизила цены на 50%
Batch Inference API теперь работает с 30 млрд токенов (вместо 10 млн) и обходится вдвое дешевле, чем real-time API. Поддерживает все 40+ моделей платформы.

Как обучить большую нейросеть под свои задачи: fine-tuning DeepSeek
Платформа fine-tuning Together AI теперь обучает самые мощные открытые модели — DeepSeek-R1, Qwen3-235B и Llama 4 — с поддержкой расширенных контекстов и интеграцией Hugging Face.

Нейросети работают в 2 раза быстрее: FlashAttention-3 от NVIDIA
Together AI выпустила FlashAttention-3 — алгоритм, который ускоряет трансформеры в 1.5-2 раза и использует 75% производительности GPU H100, поддерживая низкую точность FP8.

Together AI добилась 90% ускорения обучения на NVIDIA Blackwell
Together AI анонсировала доступ к GPU-кластерам NVIDIA Blackwell с собственной оптимизацией, достигнув 90% ускорения обучения Llama 70B и 15,264 токена в секунду на GPU.

ThunderKittens от Together AI: новый язык для эффективных GPU kernels
Together AI представила ThunderKittens — язык программирования для GPU kernels, который пишется как PyTorch, но работает как чистый CUDA. На H100 код работает даже быстрее классического FlashAttention2.

ИИ-агенты для анализа данных: фреймворк DSGym
Together AI опубликовала DSGym — единый фреймворк для оценки и обучения LLM-агентов на data science задачах. Включает 90+ биоинформатических задач и 92 Kaggle соревнования, на синтетических данных натренирована 4B модель

Облако для ИИ: почему архитектура отличается от веб-облаков
AI-стартапы типа Cursor итерируют еженедельно и потребляют GPU как веб-приложения 2012-го. Together AI разобралась, какой облако должно быть, чтобы вытянуть скорость AI-native компаний.

Оптимизация нейросетей на GPU: как Together AI ускоряет ИИ
Команда ядерных оптимизаций Together AI создала технологию, которая ускоряет работу GPU на 2–3x. За неделю они адаптировали ядра для новых Blackwell GPU — работу, которую NVIDIA делала год.

FlashAttention-4: как Together AI ускорила внимание на GPU Blackwell
Together AI представила FlashAttention-4 — оптимизацию алгоритма внимания для GPU Blackwell, которая достигает 1605 TFLOPs/s и работает в 2.7 раза быстрее, чем Triton.