Марк Цукерберг 18 листопада 2025 року запустив Muse Code у бета-версії – перший агент Meta для створення програмного коду на основі штучного інтелекту (AI). Однак Claude Opus 5 від Anthropic демонструє перевагу за всіма чотирма критеріями, які Meta опублікувала під час анонсу.
Попри ці результати, Meta все одно представила відповідні графіки. Компанія просуває свій продукт як бюджетне рішення, а не як більш прогресивний інструмент. Дані незалежних тестів свідчать: розрив між опонентами навіть суттєвіший, ніж показано на графіках Meta.
Підписуйтеся на нас у X — оперативна аналітика без затримок
Власні графіки Meta віддають перемогу Anthropic у кожній категорії
Модель Muse Spark 1.2 використовується в Muse Code. На тесті Terminal-Bench 2.1 вона набрала 82,9%.
Claude Opus 5 продемонстрував 86,7% на тому ж тесті. Terminal-Bench розроблено Інститутом Laude разом із дослідниками Стенфордського університету. Методологія оцінює рішення у 89 практичних завданнях – від системного обслуговування до обробки даних і завдань з безпеки.
Друге місце – гідний результат. Muse Code випередив Codex від OpenAI (81,8%) і Grok Build (81,6%).
Наступний графік показав ще критичнішу різницю. DeepSWE 1.1 містить 113 задач програмування, доступ до інтернету під час перевірки відключено. Muse Spark 1.2 опинився на третій позиції з результатом 59,3%.
Meta також опублікувала власний тест, сформований на основі 440 реальних pull request розробників компанії. Muse Spark 1.2 отримав тут 70,6%, що майже на дев’ять пунктів менше за Opus 5.
Таким чином, різниця становить лише 2,3 пункти порівняно з Muse Spark 1.1, який Meta випустила у липні.
Модель, яку Meta виключила зі своїх порівнянь
Meta порівнювала себе з GPT-5.6 Terra. OpenAI пропонує потужнішу модель Sol, але її Meta не взяла до уваги у жодному з трьох своїх графіків щодо програмування.
Sol очолює незалежний рейтинг Terminal-Bench 2.1 leaderboard із показником 89,5%. Opus 5 – наступний, із 89,1%.
Обидва результати перевищують 86,7%, які Meta зафіксувала для Opus 5. Навіть використавши слабшу конфігурацію конкурентної моделі, Meta поступилася їй за підсумками.
Порівняно з Sol, який наразі утримує лідерство, відставання Muse Spark 1.2 складає 6,6 пункти, а не 3,8.
Разом із цим Sol згадується у ще одному тесті. Під час завдання з оптимізації ядра графічного процесора (GPU) понад 1 000 викликів інструментів, Sol покращив базову продуктивність на 71,2%. Muse Spark 1.2 – на 68,7%, посівши четверту сходинку серед шести моделей.
Зазначимо і протилежний нюанс: Muse Spark 1.2 наразі відсутній у цьому публічному рейтингу, де протестували лише 26 із 183 моделей, що відстежуються. Вказані 82,9% – внутрішня оцінка Meta.
«Muse Spark 1.2 – це черговий етап у нашому просуванні до передових рубежів; вже готуються до запуску масштабніші та функціональніші моделі», – прокоментував Цукерберг у пості.
Цукерберг невдовзі може забезпечити роботу моделі, що випереджає його власну
Існують дані про переговори Meta щодо оренди обчислювальних потужностей для Anthropic. Сума потенційної угоди – до $10 млрд протягом двох років. Якщо контракт укладуть, дата-центри Meta підтримуватимуть роботу моделей Claude – саме з ними Muse Code має конкурувати.
Створення Muse Code обійшлося недешево. У червні 2025 року Цукерберг придбав компанію Scale AI з її засновником Александром Ваном за $14,3 млрд. Сьогодні Ван очолює Meta Superintelligence Labs.
Єдиною важелем впливу для Вана залишилася ціна. Тарифи ідентичні умовам першого платного API Meta: $1,25 за 1 млн вхідних токенів і $4,25 за 1 млн вихідних.
Тариф для контриб’юторів удешевлює користування більш ніж у 10 разів. Претенденти мають погодитися на тренування моделей Meta на власних розробках. Ван не коментує обсяги впровадження лінійки Muse Spark.
Пояснення до знижок Meta містять у звітах. Виторг за минулий квартал зріс на 28% до $60,8 млрд, проте операційний прибуток зменшився на 8% – до $18,8 млрд.
Операційна рентабельність впала до 31% з 43% рік тому. Капітальні витрати за квартал: $31,08 млрд, орієнтир на рік – до $145 млрд.
Muse Code має функціональну інженерію, якої бракує Claude Code. Фонові агенти забезпечують збереження контексту протягом усієї сесії. Окремі підагенти працюють з ізольованими копіями репозиторіїв.
Meta запропонувала професійний кодогенератор із другого ешелону за вартістю бюджетного сервісу. Бета-тест розставить акценти: чи готові розробники поступитися точністю заради економії бюджету у 10 разів.









