Вышла Claude 5.1 — самая мощная модель в мире
chaincatcherОригинал: Follow AI's Machine Heart
Только что Anthropic запустила модели следующего поколения Claude Fable 5.1 и Claude Mythos 5.1.
Anthropic утверждает, что Claude Fable 5.1 — одна из самых мощных общедоступных моделей, предназначенная для сложных рассуждений, длительных задач и агентных процессов. Claude Mythos 5.1 представляет собой исследование более высоких пределов возможностей.
Важно отметить, что хотя обе модели имеют одинаковые базовые возможности, для разных сценариев использования были приняты разные меры безопасности.
Fable 5.1 открыта для обычных пользователей, разработчиков и предприятий, а Mythos 5.1 предназначена для проверенных партнёров в областях с высоким риском и имеет более строгий контроль доступа.
Другими словами, одна предназначена для реальных задач, а другая содержится в более строго контролируемой среде. Возможно, это также исследование Anthropic будущих форм ИИ-продуктов: самые мощные модели не обязательно предоставляются всем в одинаковом виде.
Официальное заявление указывает, что эти две модели представляют собой значительный прогресс в возможностях серии Claude и демонстрируют, как они продолжают совершенствовать безопасное развёртывание, одновременно улучшая возможности моделей. 
Как самая мощная из доступных моделей, Fable 5.1 по-прежнему впечатляет. Официальные данные показывают, что Fable 5.1 превосходит предыдущий флагман Fable 5 в нескольких бенчмарках. 
Однако, несмотря на возросшие возможности, цена снизилась. Anthropic заявляет, что Fable 5.1 сохраняет ту же базовую цену, а стоимость чтения кэша снизилась на 75% по сравнению с Fable 5. На практике это снижает общую стоимость модели для типичных рабочих нагрузок примерно на 25%; для сильно агентных рабочих нагрузок затраты могут быть снижены до 45%. 
Похоже, даже самые мощные модели теперь уделяют внимание экономической эффективности.
Рассмотрим подробнее.
Младшие модели догоняют предыдущее поколение: Fable 5.1 делает ставку на экономическую эффективность
Вместо простого обновления рейтинга Anthropic хочет подчеркнуть на этот раз: Fable 5.1 может выполнять задачи, которые ранее требовали высоких уровней Fable 5, с меньшими затратами на вывод.
Согласно официальным тестам, Fable 5.1 уже достигла производительности, близкой или даже превосходящей Fable 5 при низкой и средней интенсивности вывода. Claude Code по умолчанию использует высокую интенсивность вывода, а Claude Cowork и Claude .ai по умолчанию используют среднюю интенсивность вывода, позволяя пользователям регулировать баланс между скоростью, стоимостью и эффективностью в зависимости от сложности задачи.
В частности, Fable 5.1 достигла оценки 52,6% в бенчмарке для научно-исследовательских агентов Terminal - Bench - Science 0.1, что более чем вдвое превышает 24,7% у Fable 5; в Terminal - Bench 4.0 Fable 5.1 достигла 55,8%, а более мощная Mythos 5.1 дополнительно достигла 60,9%.
В тестах на работу с знаниями, компьютерные операции и бизнес-процессы новая модель также показала улучшения. Оценки AutomationBench выросли с 17,1% у Fable 5 до 31,4%, а CursorBench 3.2.0 улучшился с 70,5% до 73,4%. 
В нескольких бенчмарках результаты Fable 5.1 превысили результаты Fable 5, причём наиболее значительные улучшения наблюдаются в возможностях научно-исследовательских агентов и бизнес-процессов. 
В тесте Terminal - Bench 4.0 обе модели, Fable 5.1 и Mythos 5.1, превзошли предыдущее поколение Mythos 5 при разной интенсивности вывода. 
В тесте Terminal - Bench - Science 0.1 Fable 5.1 достигла максимального результата 52,6%, что более чем вдвое превышает результат Fable 5.
Anthropic считает, что важным изменением в Fable 5.1 является её большая склонность отслеживать первопричины проблем, что делает её более подходящей для выполнения сложных задач, длящихся часы или даже десятки часов.
Инвестиционная фирма Millennium обнаружила в ходе тестирования, что фрагмент внутреннего кода аварийно завершается примерно один раз на миллион запусков. Эта проблема мучила инженерную команду четыре-пять лет, и другие модели не могли определить причину. Fable 5.1 точно определила проблему как ошибку в сторонней библиотеке, дизассемблировав библиотеку внешнего поставщика и сравнив файлы дампа ядра.
Ramp также запустила Fable 5.1 непрерывно на 38 часов. Обнаружив, что исходные результаты машинного обучения были искажены ошибками разметки, модель автономно исправила проблему и параллельно запустила шесть наборов экспериментов. В итоге она скомпилировала новые результаты и последующие рекомендации.
От написания кода до проведения научных исследований
В этом релизе Anthropic уделила значительное внимание обсуждению производительности Fable 5.1 и Mythos 5.1 в научных исследованиях.
В экспериментах по дизайну белков исследователи попросили Mythos 5.1 использовать инструменты с открытым исходным кодом для дизайна и фолдинга белков, а затем отправили сгенерированные проекты в два внешних учреждения для экспериментальной проверки.
Для трёх целевых белков аффинность связывания лигандов, разработанных Mythos 5.1, в десять раз превысила аффинность лучших решений в конкурсе по дизайну белков Adaptyv Bio. При работе с двенадцатью целевыми белками эффективная частота попаданий лигандов модели приблизилась к 50%, тогда как обычный отраслевой уровень, по данным Anthropic, составляет от 10% до 15%.
Fable 5.1 также использовала радиолокационные изображения, собранные космическим аппаратом NASA «Магеллан» более 30 лет назад. На их основе была создана новая карта высот с высоким разрешением примерно для одной трети поверхности Венеры. 
Радиолокационные изображения Венеры, полученные космическим аппаратом NASA «Магеллан», с небольшим щитовым вулканом диаметром около 15 километров в центре.
Исходная карта позволяла отображать детали только в масштабе от 10 до 20 километров, тогда как новая карта улучшает разрешение до 2–3 километров, при этом точность измерения высоты повышена до 25%. Anthropic планирует публично выпустить эту карту под лицензией на обмен знаниями для будущих миссий, таких как VERITAS NASA и EnVision Европейского космического агентства.
В области вычислительной биологии Mythos 5.1 улучшила скорость работы семи моделей глубокого обучения с открытым исходным кодом для белков и геномики до 2,5 раз. Это было достигнуто за счёт написания пользовательских ядер GPU и кэширования промежуточных результатов, при этом выходные результаты остались согласованными. В некоторых задачах полногеномного анализа ожидается снижение затрат на GPU на 30–60%. 
После оптимизации семи моделей белков и геномики с открытым исходным кодом скорость вывода Mythos 5.1 увеличилась в 1,4–2,5 раза.
Anthropic стремится использовать эти примеры, чтобы продемонстрировать, что модель эволюционирует от организации информации и написания кода к предложению решений, запуску инструментов и предоставлению результатов исследований. Эти результаты можно экспериментально проверить.
Цены на кэш упали на 75%, а агентные задачи стали дешевле до 45%.
Помимо производительности, цена — самое непосредственное изменение в Fable 5.1.
Цены на вход и выход Fable 5.1 не изменились и остаются на уровне 10 и 50 долларов за миллион токенов соответственно, но цена чтения кэша снижена на 75% — до 0,25 доллара за миллион токенов.
Чтение кэша означает повторное использование моделью уже обработанного контекста. Его доля может быть ограничена в обычных вопросах и ответах, но в агентных задачах, требующих повторного чтения кодовых баз, истории диалогов и результатов инструментов, кэширование часто составляет основную часть затрат.
Согласно расчётам Anthropic на основе фактических данных использования за август 2026 года, общая стоимость выполнения типичных задач с Fable 5.1 примерно на 25% ниже, чем с Fable 5. Для сложных агентных задач с более длинным контекстом и частыми вызовами инструментов снижение затрат может достигать примерно 45%. 
После снижения цен на чтение кэша стоимость типичных задач с Fable 5.1 снижается примерно на 25%, а стоимость сильно агентных задач — до примерно 45%.
Fable 5.1 уже доступна на Claude .ai, Claude Code и Claude API, а также предоставляется через AWS, Google Cloud и Microsoft Azure. Разработчики могут вызывать новую модель через claude-fable-5-1.
Усиленный механизм защиты от дистилляции
Fable 5.1 и Mythos 5.1 фактически используют одну и ту же базовую модель, а основное различие заключается в ограничениях безопасности.
Fable 5.1 полностью открыта для обычных пользователей и предприятий. Mythos 5.1 имеет более мягкие ограничения в области кибербезопасности и наук о жизни и в настоящее время доступна только проверенным лицам и учреждениям.
В области кибербезопасности Fable 5.1 уже может помогать пользователям обнаруживать уязвимости программного обеспечения, но по-прежнему не может напрямую генерировать эксплойты. Задачи двойного назначения, такие как тестирование на проникновение, генерация эксплойтов и сканирование уязвимостей на основе бинарных файлов, могут по-прежнему передаваться моделям с более строгими ограничениями.
После корректировок новая версия механизма защиты кибербезопасности снизила количество ложных срабатываний примерно на 60% по сравнению с Fable 5. Частота ложных срабатываний механизмов биобезопасности по базовым биологическим и медицинским вопросам также снизилась на 85%. Продвинутые возможности, связанные с исследованиями в области наук о жизни, в основном открываются через программу проверки Mythos 5.1.
Anthropic также запустила программу Enterprise Frontier Safeguards. Предприятия могут хранить данные в своей контролируемой облачной инфраструктуре, при этом предприятие отвечает за ручные проверки по умолчанию. Это обеспечивает почти «нулевое хранение данных» с точки зрения конфиденциальности при сохранении возможностей мониторинга безопасности. Этот механизм планируется внедрять поэтапно, начиная с этой осени.
Для крупномасштабной дистилляции моделей Fable 5.1 также добавила новые ограничения. Учётные записи API, созданные после этого дня, не смогут вручную изменять предыдущий контекст в многоходовых диалогах, сохраняя при этом исторические записи мыслей Claude. Anthropic заявляет, что это изменение в основном направлено на блокировку общеизвестного метода извлечения возможностей.
Кроме того, для соответствия требованиям Закона Европейского союза об искусственном интеллекте текстовый вывод Fable 5.1 будет содержать невидимые водяные знаки. Anthropic также начала мелкомасштабное тестирование API обнаружения, изначально открытого для регулирующих органов, СМИ, организаций по проверке фактов и исследовательских учреждений.
Наконец, пользователи сети правы: ранняя пташка получает возможность использовать 5.1 первой. 
Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.