ChartModo logo ChartModo logo
Forklog 2026-06-02 11:49:44

Claude Opus 4.6 обошла GPT-5.2 в тестах на логику и получила «команду агентов»

ИИ-стартап Anthropic обновил свою флагманскую модель Claude Opus до версии 4.6. Нейросеть стала лучше планировать действия, справляться с длительными задачами и эффективнее работать с объемными базами кода. Контекстное окно расширили до 1 млн токенов. Такой объем позволяет анализировать массивные документы и вести долгие диалоги без потери логической нити. Обновленные алгоритмы адаптированы для решения рабочих задач: проведению финансового анализа, исследования, использованию и созданию документов, таблиц и презентаций. Opus 4.6 получила наивысшую оценку в тесте по программированию Terminal-Bench 2.0 и опередила конкурентов в сложном междисциплинарном бенчмарке на логическое мышление Humanity’s Last Exam. Сравнение Opus 4.6 с конкурентами в ряде тестов. Источник: Anthropic. В GDPval-AA, который оценивает качество рассуждений и принятия решений, модель превзошла GPT-5.2 от OpenAI. LLM также показала лучшие результаты в BrowseComp, который измеряет способность находить в интернете труднодоступную информацию. Источник: Anthropic. Opus 4.6 эффективно извлекает данные из объемных документов. Благодаря расширенному контекстному окну модель отслеживает и улавливает неочевидные скрытые детали. Команды агентов Ключевое нововведение — возможность создавать группы агентов для совместной работы. В таком режиме несколько ИИ-ассистентов работают параллельно и координируют свою работу автономно. Инструмент подходит для поручений, которые разделяются на независимые и требуют анализа большого количества текста. Замкнутый цикл В Anthropic заявили, что «создают Claude вместе с Claude». Разработчики пишут код с помощью собственной ИИ-модели, а каждый новый продукт перед релизом проходит проверку на внутренних задачах компании. Команда обнаружила, что Opus 4.6 уделяет больше внимания самым сложным частям задачи без дополнительных указаний, быстро выполняет простые поручения, лучше справляется с неоднозначными проблемами и сохраняет эффективность на длинных дистанциях. «Opus 4.6 часто думает более глубоко и тщательно пересматривает свои рассуждения перед принятием решения. Это дает лучшие результаты при решении сложных кейсов, но может увеличить затраты и издержки в случае с простыми», — отметили в компании. Безопасность Автоматизированный аудит выявил у Opus 4.6 низкую склонность к нежелательному поведению: обману, лести, укреплению заблуждений пользователя и содействию в неправомерных действиях. Модель демонстрирует безопасность на уровне Opus 4.5. Источник: Anthropic. Для проверки модели компания провела наиболее полную серию оценок, впервые применив новые методики тестирования и усовершенствовав существующие. Доступность и новые функции Claude Opus 4.6 уже доступна в веб-интерфейсе, через API и на основных облачных платформах. В инструментарий для разработчиков новые функции: адаптивное мышление — нейросеть самостоятельно определяет, когда необходимо задействовать режим глубокого рассуждения; регулировка усилий — предусмотрено четыре уровня интенсивности работы: от низкого до максимального; уплотнение контекста — инструмент автоматически резюмирует и заменяет старый контекст, когда разговор приближается к порогу токенов. Opus 4.6 лучше работает с офисными инструментами вроде Excel и PowerPoint. Напомним, в январе CEO Anthropic Дарио Амодеи предсказал скорое появление AGI и сокращения рабочих мест.

阅读免责声明 : 此处提供的所有内容我们的网站,超链接网站,相关应用程序,论坛,博客,社交媒体帐户和其他平台(“网站”)仅供您提供一般信息,从第三方采购。 我们不对与我们的内容有任何形式的保证,包括但不限于准确性和更新性。 我们提供的内容中没有任何内容构成财务建议,法律建议或任何其他形式的建议,以满足您对任何目的的特定依赖。 任何使用或依赖我们的内容完全由您自行承担风险和自由裁量权。 在依赖它们之前,您应该进行自己的研究,审查,分析和验证我们的内容。 交易是一项高风险的活动,可能导致重大损失,因此请在做出任何决定之前咨询您的财务顾问。 我们网站上的任何内容均不构成招揽或要约