Ukrainian

AI Anthropic обходить Muse Code Марка Цукерберга на власних графіках Meta

  • Цукерберг запустив Muse Code, а внутрішні рейтинги Meta ставлять Claude Opus 5 на перше місце.
  • Meta не включила провідну модель кодування OpenAI до своїх порівняльних бенчмарків.
  • Незалежне тестування показує, що справжній лідер має 89,5%, вище за будь-який показник Meta.

Марк Цукерберг 18 листопада 2025 року запустив Muse Code у бета-версії – перший агент Meta для створення програмного коду на основі штучного інтелекту (AI). Однак Claude Opus 5 від Anthropic демонструє перевагу за всіма чотирма критеріями, які Meta опублікувала під час анонсу.

Попри ці результати, Meta все одно представила відповідні графіки. Компанія просуває свій продукт як бюджетне рішення, а не як більш прогресивний інструмент. Дані незалежних тестів свідчать: розрив між опонентами навіть суттєвіший, ніж показано на графіках Meta.

Підписуйтеся на нас у X — оперативна аналітика без затримок

Власні графіки Meta віддають перемогу Anthropic у кожній категорії

Модель Muse Spark 1.2 використовується в Muse Code. На тесті Terminal-Bench 2.1 вона набрала 82,9%.

Claude Opus 5 продемонстрував 86,7% на тому ж тесті. Terminal-Bench розроблено Інститутом Laude разом із дослідниками Стенфордського університету. Методологія оцінює рішення у 89 практичних завданнях – від системного обслуговування до обробки даних і завдань з безпеки.

Друге місце – гідний результат. Muse Code випередив Codex від OpenAI (81,8%) і Grok Build (81,6%).

Графік порівняльних результатів Muse Spark 1.2
Графік порівняльних результатів Muse Spark 1.2. Джерело: Цукерберг

Наступний графік показав ще критичнішу різницю. DeepSWE 1.1 містить 113 задач програмування, доступ до інтернету під час перевірки відключено. Muse Spark 1.2 опинився на третій позиції з результатом 59,3%.

Meta також опублікувала власний тест, сформований на основі 440 реальних pull request розробників компанії. Muse Spark 1.2 отримав тут 70,6%, що майже на дев’ять пунктів менше за Opus 5.

Muse Spark 1.2 виконував задачу оптимізації ядра 24 години на NVIDIA Hopper — понад 1 000 викликів інструменту — і знаходив реальні поліпшення продуктивності навіть після фази початкового пошуку.
Muse Spark 1.2 виконував задачу оптимізації ядра 24 години на NVIDIA Hopper – понад 1 000 викликів інструментів – і знаходив реальні поліпшення продуктивності навіть після ранньої фази дослідження.

Таким чином, різниця становить лише 2,3 пункти порівняно з Muse Spark 1.1, який Meta випустила у липні.

Модель, яку Meta виключила зі своїх порівнянь

Meta порівнювала себе з GPT-5.6 Terra. OpenAI пропонує потужнішу модель Sol, але її Meta не взяла до уваги у жодному з трьох своїх графіків щодо програмування.

Sol очолює незалежний рейтинг Terminal-Bench 2.1 leaderboard із показником 89,5%. Opus 5 – наступний, із 89,1%.

Обидва результати перевищують 86,7%, які Meta зафіксувала для Opus 5. Навіть використавши слабшу конфігурацію конкурентної моделі, Meta поступилася їй за підсумками.

Порівняно з Sol, який наразі утримує лідерство, відставання Muse Spark 1.2 складає 6,6 пункти, а не 3,8.

Разом із цим Sol згадується у ще одному тесті. Під час завдання з оптимізації ядра графічного процесора (GPU) понад 1 000 викликів інструментів, Sol покращив базову продуктивність на 71,2%. Muse Spark 1.2 – на 68,7%, посівши четверту сходинку серед шести моделей.

Зазначимо і протилежний нюанс: Muse Spark 1.2 наразі відсутній у цьому публічному рейтингу, де протестували лише 26 із 183 моделей, що відстежуються. Вказані 82,9% – внутрішня оцінка Meta.

«Muse Spark 1.2 – це черговий етап у нашому просуванні до передових рубежів; вже готуються до запуску масштабніші та функціональніші моделі», – прокоментував Цукерберг у пості.

Цукерберг невдовзі може забезпечити роботу моделі, що випереджає його власну

Існують дані про переговори Meta щодо оренди обчислювальних потужностей для Anthropic. Сума потенційної угоди – до $10 млрд протягом двох років. Якщо контракт укладуть, дата-центри Meta підтримуватимуть роботу моделей Claude – саме з ними Muse Code має конкурувати.

Створення Muse Code обійшлося недешево. У червні 2025 року Цукерберг придбав компанію Scale AI з її засновником Александром Ваном за $14,3 млрд. Сьогодні Ван очолює Meta Superintelligence Labs.

Єдиною важелем впливу для Вана залишилася ціна. Тарифи ідентичні умовам першого платного API Meta: $1,25 за 1 млн вхідних токенів і $4,25 за 1 млн вихідних.

Тариф для контриб’юторів удешевлює користування більш ніж у 10 разів. Претенденти мають погодитися на тренування моделей Meta на власних розробках. Ван не коментує обсяги впровадження лінійки Muse Spark.

Пояснення до знижок Meta містять у звітах. Виторг за минулий квартал зріс на 28% до $60,8 млрд, проте операційний прибуток зменшився на 8% – до $18,8 млрд.

Операційна рентабельність впала до 31% з 43% рік тому. Капітальні витрати за квартал: $31,08 млрд, орієнтир на рік – до $145 млрд.

Muse Code має функціональну інженерію, якої бракує Claude Code. Фонові агенти забезпечують збереження контексту протягом усієї сесії. Окремі підагенти працюють з ізольованими копіями репозиторіїв.

Meta запропонувала професійний кодогенератор із другого ешелону за вартістю бюджетного сервісу. Бета-тест розставить акценти: чи готові розробники поступитися точністю заради економії бюджету у 10 разів.


Щоб прочитати найсвіжіший аналіз криптовалютного ринку від BeInCrypto, натисніть тут.

Дисклеймер

Ця авторська стаття представляє точку зору автора і не обов'язково відображає погляди BeInCrypto. BeInCrypto залишається прихильником прозорої звітності та дотримання найвищих стандартів журналістики. Читачам рекомендується перевіряти інформацію самостійно і консультуватися з професіоналами, перш ніж приймати рішення на основі цього контенту. Зверніть увагу, що наші Загальні положення та умови, Політика конфіденційності та Дисклеймер були оновлені.