17 мая Sequoia опубликовала второй отчёт по unit-экономике AI-компаний за 2026 год. Фонд проанализировал финансовые модели 142 портфельных и наблюдаемых стартапов с ARR от $1 миллиона до $1 миллиарда. Документ интересен не только цифрами — он последовательно развивает тезис об архитектурном сдвиге, который фонд держит уже несколько кварталов. На этот раз с конкретными данными, а не только с позиционными соображениями.
Два кластера маржи
Валовая маржа AI-приложений в 2026 году распределена бимодально. Первая группа — продукты, где LLM-инференс составляет основную часть COGS: тонкие обёртки над API, AI-копилоты с массовым использованием, генеративные продукты без дополнительного сервисного слоя. Их маржа лежит в диапазоне 35–55%. Это заметно ниже традиционного SaaS-бенчмарка в 75–85% и создаёт структурное давление при масштабировании: каждый новый пользователь пропорционально увеличивает выручку — и пропорционально же стоимость инференса.
Чтобы понять механику: при COGS в 50% от выручки и операционных расходах в 40% компания выходит в ноль только при очень точном контроле роста. Любой агрессивный рост через снижение цен или расширение использования бьёт по марже двойным ударом — падает средний чек, растут переменные расходы.
Вторая группа — AI-приложения, где LLM лишь один из компонентов COGS рядом с retrieval-слоем, кастомными интеграциями и операционными расходами. Их маржа — 65–78%, близко к классическому SaaS. Это enterprise-продукты с дообученными моделями под отраслевые корпуса, сложной интеграционной обвязкой и значимым человеческим сервисным компонентом. Дополнительная сложность снижает маржу относительно чистого SaaS, но зато создаёт защитный ров: клиент платит за решение, а не за доступ к чужой модели.
По оценке Sequoia, именно эта грань определяет долгосрочную защитимость бизнеса. Компании с низкой маржой уязвимы к двум давлениям одновременно: новые участники рынка строят на более дешёвых моделях; собственный рост при котором выручка и COGS движутся параллельно, делает невозможным выход на операционную прибыль без структурных изменений в продукте.
Каскадные архитектуры как практика экономии
Самый показательный статистический факт отчёта: среди компаний с маржой выше 70% более 80% используют каскадные модели. Среди компаний с маржой ниже 50% этот паттерн встречается менее чем у 25%.
Каскадная архитектура — когда большинство запросов обрабатывает маленькая дешёвая модель, а тяжёлая frontier-модель вызывается только при низкой уверенности первой. Реализуется через метрику уверенности: если маленькая модель возвращает ответ с высоким confidence score, запрос не поднимается выше. Только неоднозначные или сложные случаи эскалируются.
Снижение среднего cost-per-query через каскад зависит от распределения сложности запросов в конкретном продукте. На задачах с большой долей рутинных запросов — FAQ, простая классификация, стандартные шаблоны — экономия может быть значительной: дешёвая модель обрабатывает 70–80% трафика, дорогая видит только остаток. Для продуктов с преимущественно сложным трафиком выигрыш меньше. Это объясняет, почему каскады прижились именно в enterprise-продуктах, где запросы чётко структурированы и хорошо поддаются классификации по сложности.
Что Sequoia называет «смещением архитектуры»
Главный аналитический ход отчёта — переинтерпретация тезиса «GPU goes to zero». Sequoia не утверждает, что стоимость токена на frontier-моделях резко упадёт в ближайшие два года. Утверждается другое: значительная часть задач, которые сейчас решаются вызовами Frontier-API, постепенно перейдёт на более дешёвые специализированные модели размером 3–13B, self-hosted-стеки и кеширующие слои.
Это не дешевизна вычислений сама по себе, а смещение того, где именно происходят вычисления. Специализированная 7B-модель, дообученная на корпусе юридических документов конкретной юрисдикции, может превосходить GPT-5o на задачах поиска прецедентов — и стоить в 20 раз меньше в эксплуатации. Команды, которые архитектурно учитывают этот сдвиг, снижают COGS без потери качества для пользователя. Команды, продолжающие строить «всё через лучшую доступную модель», оказываются в позиции, где каждый новый пользователь повышает margin pressure — независимо от того, насколько подешевеют токены.
Capex как новая реальность при масштабировании
Интересный сдвиг в данных отчёта — изменение баланса между капитальными и операционными расходами. Компании, вышедшие на $20+ миллионов ARR, всё чаще делают капитальные инвестиции в собственную GPU-инфраструктуру вместо потокового биллинга от API-вендоров.
Арифметика понятна. При ежемесячном API-счёте свыше $300–500 тысяч точка безубыточности по сравнению с собственным кластером достигается за 14–18 месяцев. После этого собственная инфраструктура дешевле каждый месяц. Но это превращает «оптимизацию операционных расходов» в «стратегическую капитальную инвестицию» — с другим процессом принятия решений, другим источником финансирования и другим уровнем контроля над дорожной картой.
Собственная инфраструктура добавляет операционные сложности: управление железом, обновления драйверов и CUDA-стека, мониторинг отказов. Но она же даёт возможности, недоступные при работе через API: кастомные батчинг-стратегии, тонкая настройка quantization, полный контроль над размещением данных. Именно поэтому Mistral, Cohere и Perplexity в 2026 году строят собственные дата-центры, несмотря на доступность managed-альтернатив.
Маржа как сигнал о ценности продукта
Практический вывод из отчёта Sequoia прост: маржа в AI-бизнесе сейчас — прямой сигнал о том, насколько продукт создаёт ценность помимо оборачивания чужой модели. Компании, добавляющие retrieval-слой, кастомизацию, интеграционную обвязку, накапливающие специфические данные — держат маржу. Компании, чья ценность сводится к удобному интерфейсу поверх GPT или Claude — нет.
Это не суждение о качестве продукта. Хороший UI может быть ценным. Но с точки зрения инвестиционной привлекательности и устойчивости бизнеса тонкая обёртка над API предлагает мало защиты: модели дешевеют, провайдеры сами строят интерфейсы, а барьеры для копирования невысоки. Следующий отчёт Sequoia по теме обещан на осень с углублённым анализом каскадных архитектур и их влиянием на динамику стоимости инференса на горизонте 12–18 месяцев.