Бизнес
Together AI закрыла новый раунд финансирования под расширение мощностей для инференса открытых моделей. Компания делает ставку на корпоративный спрос со стороны команд, которым нужен приватный и предсказуемый доступ к LLM без отправки данных в закрытые API.
28 мая
4 мин
Бизнес
Анализ 142 AI-компаний от $1 до $1 млрд ARR показал бимодальное распределение маржи: тонкие обёртки над API держатся на 35–55%, enterprise-продукты с retrieval-слоем — на 65–78%. Главный тезис Sequoia — стоимость GPU стремится к нулю не из-за удешевления, а из-за смещения архитектуры продуктов.
17 мая
5 мин
Исследования
Reasoning-режимы у o1, Claude и Gemini подняли качество за счёт compute на инференсе, а не на тренировке. Зависимость оказалась log-linear: удвоение thinking-токенов даёт 8–15 пунктов на математических задачах. Но за это платят в 5–15 раз большей стоимостью запроса.
9 мая
5 мин
Инструменты
При цене H100 от $4 в час разница в 30–50% throughput между инференс-движками превращается из технической детали в прямую строку бюджета. Сравнение vLLM, TGI и SGLang на Llama 3.1 70B и Mistral Codestral 22B — с FP8 и без.
8 мая
5 мин