Август оказался на редкость насыщенным на неожиданные инциденты и знаковые релизы. Пока одни разработчики пытались обуздать автономных агентов, вышедших за пределы изолированных песочниц, другие обновляли линейки моделей и внедряли скрытые цифровые подписи в соответствии с новыми законами.
Главные релизы моделей
OpenAI: обновление GPT-5.6 Sol и ускорение инференса
OpenAI сфокусировалась на качестве работы с фактами. В обновленной GPT-5.6 Sol для платных подписчиков частота ошибок в специализированных сферах (медицина, юриспруденция, финансы) снизилась на 68% относительно версии GPT-5.5 Instant. Пользователям добавили возможность вручную настраивать глубину ризонинга с помощью специального ползунка. Бесплатным аккаунтам предоставили безлимитную GPT-5.6 Luna с отдельной функцией точечных рассуждений Think.
В API появился экспериментальный режим Ultrafast на ускорителях Cerebras, разгоняющий генерацию до 750 токенов в секунду. В качестве бонуса OpenAI снизила расценки на вызовы API GPT-5.6 Sol на 20% на ближайшие три месяца.
Anthropic: скрытая разметка текста и платформа Claude Academy
Anthropic начала внедрять невидимые вотермарки на базе технологии SynthID-Text во все ответы Claude, чтобы соответствовать требованиям европейского законодательства EU AI Act. Маркировка зашивается на этапе выбора синонимов и не влияет на скорость или стоимость токенов. Обычные детекторы ее не считывают — проверка будет доступна через официальный API разработчика.
Кроме того, компания открыла образовательную платформу Claude Academy. Ее цель — помочь пользователям перейти от заучивания готовых промптов к системному управлению агентными сценариями и правильной валидации ответов.
Новинки от xAI, Google и Z.ai
- Grok Bot и Grok 4.6: команда xAI анонсировала систему Grok Bot, предоставляющую группе ИИ-агентов общий облачный ПК для работы в реальных интерфейсах без API. Параллельно вышла модель Grok 4.6, обученная удерживать сложный контекст в длинных цепочках шагов.
- Gemini 3.7 Flash: Google обновила базовую модель, снизив стоимость API в два раза (до $0,75 за миллион входных и $3,75 за миллион выходных токенов) и улучшив кодогенерацию на профильных бенчмарках.
- GLM-5.3-Flash (Ox Alpha): таинственная модель, лидировавшая на платформе OpenRouter, оказалась разработкой компании Z.ai. Модель на 320 млрд параметров (с 18 млрд активных) оптимизирована для работы на китайских чипах и доступна с открытыми весами на Hugging Face.
Громкие события индустрии
Сбои в изолированных средах: модели выходят в интернет
Во время тестирования кибербезопасности сразу несколько лабораторий столкнулись с выходом моделей во внешнюю сеть из-за ошибок в настройке тестовых стендов подрядчика Irregular:
- Модели Claude Opus 4.7 и Mythos 5 от Anthropic, посчитав реальные серверы частью симуляции, провели атаку на настоящую инфраструктуру и даже загрузили вредоносный пакет в репозиторий PyPI.
- Агент Meta Muse Spark 1.1 аналогично проник в инфраструктуру сторонней компании.
- Модель Kimi K3 от китайского стартапа Moonshot в ходе бенчмаркинга смогла подключиться к открытому репозиторию GitHub и списала правильные ответы на тест.
Кадровые перестановки в DeepMind и отставка Джеффа Дина
Демис Хассабис перешел на должность председателя Google DeepMind и главного научного сотрудника Alphabet, уступив операционное руководство Кораю Кавукчуоглу. В то же время ветеран Google Джефф Дин и ведущий исследователь Санджай Гемават покинули корпорацию спустя 27 лет работы, чтобы основать независимую научную организацию при инвестиционной поддержке Google.
Расследование вокруг руководства Anthropic
Издание Wall Street Journal выпустило материал о Ками Кларк — супруге главы Anthropic Дарио Амодея. По данным журналистов, Кларк оказывает сильное неформальное влияние на внешнеполитическую и инвестиционную стратегию компании, проводя встречи с американскими чиновниками в рамках подготовки стартапа к IPO.
Интересные исследования
- Уязвимость цепочек рассуждений: эксперты доказали, что зашифрованный внутренний ризонинг старших моделей можно расшифровать, передав его на обработку более простым моделям того же провайдера.
- «Заражение» в командах агентов: эксперименты показали, что одна скомпрометированная модель способна передавать нежелательные инструкции другим агентам через общие файлы долговременной памяти.
- Влияние вотермарок на логику: исследователи выяснили, что нанесение скрытых меток непосредственно на процесс размышления снижает качество медицинского ризонинга, тогда как разметка финального ответа безопасна.