Grok 4 от xAI, по заявлениям Илона Маска, демонстрирует характеристики, приближающие его к уровню AGI. Модель набрала 87% на GPQA, что является лучшим результатом в своём классе, показала 45% на HLE — это в два раза выше, чем у Gemini 2.5 Pro, и установила новый рекорд на ARC AGI, обогнав Claude Opus 4 более чем в два раза.
Маск утверждает, что Grok 4 способен исправлять программный код лучше, чем Cursor. Пользователю достаточно вставить исходный код в форму на grok.com — модель находит ошибки, объясняет причины сбоев и предлагает более чистое решение. Всё это работает без необходимости установки дополнительных плагинов.
По представленным диаграммам, Grok 4 заметно опережает конкурентов по ключевым метрикам, включая GPQA, AMBES и Humanity’s Last Exam. xAI добился значительного технологического рывка.