
Компанія SpaceXAI (колишня xAI) представила нову флагманську модель Grok 4.7, яка за низкою бенчмарків на програмування обійшла GPT-5.6 Sol від OpenAI.
Реліз відбувся менш ніж через місяць після попередньої моделі Grok 4.6, що продовжує незвично щільний графік випусків компанії. Сама xAI позиціонує новинку як найпотужнішу модель компанії для програмування та інтелектуальної роботи — вдвічі швидшу і вдвічі дешевшу за порівнянні за класом рішення.

Більша модель із фокусом на складні задачі
Grok 4.7 побудована на новій, масштабнішій базовій моделі порівняно з Grok 4.6. За офіційними даними xAI, модель пройшла довший прогін навчання з підкріпленням на складнішому наборі задач, зміщеному в бік завдань, виконання яких вимагає багатьох годин роботи. LLM також ретельніше перевіряє власні проміжні результати та ефективніше керує довгим контекстом. Окремо розробники навчили Grok 4.7 «нативно розуміти» упряж (harness) чат-бота Grok, що покращило її роботу в діалогових задачах і загальній інтелектуальній роботі.
Ще до офіційного релізу Ілон Маск анонсував модель на 2,1 трильйона параметрів, наголошуючи, що вона перевершить Grok 4.6 буквально за всіма показниками. За даними The Standard, Маск заявляв, що здивується, якщо якась інша модель обжене Grok 4.7 у реальних інженерних застосуваннях, хоча визнав, що Anthropic найближчим часом також може випустити оновлені моделі.
Офіційні бенчмарки: де Grok 4.7 попереду, а де ні
xAI опублікувала пряме порівняння Grok 4.7 (режим xHigh) із Grok 4.6 (High), GPT-5.6 Sol (Max) і Fable 5.1 (Max) за сімома бенчмарками:
| Бенчмарк | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| Ціна за вхід, $/млн токенів | $2 | $2 | $4 | $10 |
| Ціна за вихід, $/млн токенів | $6 | $6 | $20 | $50 |
| CursorBench 4.0 (розробка ПЗ) | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 (розробка ПЗ) | 71,0%* | 65,2% | 72,7% | 70,0% |
| EEBench (електроінженерія) | 64,0% | 53,0% | 39,4% | 56,4% |
| AA Briefcase v1.1 (багатогодинна офісна робота) | 1657 | 1546 | 1487 | 1678 |
| Terminal-Bench 4.0 (робота в терміналі) | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent Benchmark (юридична робота) | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional (клінічне мислення) | 56,7% | 48,5% | 60,5% | 62,1% |
* — результат отримано в режимі підвищених зусиль (high effort)
Дані показують неоднозначну картину: Grok 4.7 помітно випереджає GPT-5.6 Sol на EEBench, Terminal-Bench 4.0 і Harvey Legal Agent Benchmark, обходить обидві моделі на CursorBench 4.0 і AA Briefcase — але поступається Fable 5.1 практично за всіма показниками, а GPT-5.6 Sol — на DeepSWE v1.1 і HealthBench Professional. Це узгоджується з незалежними даними CursorBench 4.0, за якими Grok 4.7 випередила GPT-5.6 Sol на 4,6 відсоткового пункту, але поступилася Fable 5.1 на 5,5 в. п.
За розрахунками xAI, на графіку співвідношення ціни й продуктивності CursorBench 4.0 Grok 4.7 розташувалася на межі фронтиру — тобто пропонує одні з найкращих показників продуктивності на кожен витрачений долар серед порівнюваних моделей.
Робота з документами та офісними задачами
За бенчмарками GDPval й AA Briefcase, які оцінюють виконання моделлю задач, типових для професіоналів — юристів, медсестер, фінансових аналітиків, — Grok 4.7 покращила результат порівняно з Grok 4.6 і показує результати, порівнянні з іншими фронтирними моделями. За шкалою Ело на GDPval Grok 4.7 набрала 1695 балів — це між показниками Fable 5.1 (1735) і Grok 4.6 (1605), та випереджає GPT-6 Astra (1542).
Оновлена система захисту
У новій моделі повністю переробили систему безпеки. За заявою компанії-розробника, це найстійкіша модель компанії до джейлбрейків і найкоректніша щодо відмов виконувати небезпечні запити з усіх протестованих. У чутливих до подвійного використання сферах, як-от кібербезпека та біологічні дослідження, модель одночасно демонструє високу корисність для легітимних задач і надійні відмови на небезпечні — зокрема, вона очолила біобезпековий бенчмарк LatchBio з результатом 62,4%.
На HackerBench v0.3 — внутрішньому бенчмарку xAI для ризикових і шкідливих кіберзадач — Grok 4.7 показала найвищий рівень безпеки серед протестованих моделей, пропускаючи лише 3,3% ризикових запитів подвійного призначення, і при цьому рідко блокуючи легітимну роботу з безпеки. Компанія також почала надавати окремим партнерам із кібербезпеки доступ до red-team можливостей Grok 4.7 для захисних досліджень за запрошеннями.
Доступність і ціна
Grok 4.7 вже доступна в редакторі коду Cursor і в інструменті для «вайб-кодингу» Grok Build, а також через Grok API, сторонні кодові «упряжі» та маршрутизатори й хмарні платформи. Базова ціна становить $2 за мільйон вхідних токенів і $6 за мільйон вихідних; компанія також пропонує швидкий варіант із удвічі вищою швидкістю видачі за вдвічі вищу ціну.
Нагадаємо, кілька днів тому Microsoft додала Grok до Word, Excel і PowerPoint.
