ContextWindow
Тег

#бенчмарки

Модели

Claude Sonnet 5 догнал флагман Opus 4.8 на бенчмарках при вдвое меньшей цене

Anthropic 30 июня выпустила Claude Sonnet 5 — средний по тарифу ряд, который сравнялся с флагманским Opus 4.8 сразу на нескольких бенчмарках. На старте вывод дешевле на 60%, а по стандартному прайсу — примерно на 40%. Это сдвигает планку цены за агентные задачи.

Модели

GPT-5.6 Sol: два режима вычислений, рекорд Terminal-Bench и профиль безопасности

GPT-5.6 Sol получил два новых режима вычислений: «max reasoning effort» для точности и Sol Ultra с субагентами для длинных задач. На Terminal-Bench 2.1 Ultra берёт 91,9%. System card присвоил всем трём моделям уровень High по кибербезопасности и биорискам.

Модели

Карта фронтирных моделей на июнь 2026: кто лидирует, кто догоняет, кто дешевеет

К середине июня 2026 года рынок LLM расслоился на три отчётливых яруса: сверхмощные модели с ценником выше $10 за миллион выходных токенов, рабочую середину за $3–15 и стремительно растущий бюджетный сегмент. Расклад сил изменился заметнее, чем за весь предыдущий год.

Исследования

Мультиагентные рассуждения: исследователи переходят к управляемой оркестрации

Свежие препринты смещают фокус с одиночных рассуждающих моделей на координацию нескольких агентов. Авторы формулируют оркестрацию как задачу обучения с подкреплением и предлагают контролируемые бенчмарки. Главным узким местом остаётся надёжность взаимодействия.