MIT Technology Review: SubQ прорыв в архитектуре LLM или новый ИИ-Theranos?

Стартап Subquadratic утверждает, что нашел способ радикально удешевить работу больших языковых моделей. Главная проблема нынешних LLM в том, что механизм внимания сравнивает каждый токен со всеми остальными: если длина текста удваивается, объем вычислений растет примерно в четыре раза. Поэтому длинный контекст требует огромных вычислительных мощностей и электроэнергии.

Subquadratic предлагает заменить плотное внимание динамическим разреженным вниманием: модель сама определяет, какие связи между словами действительно важны, а остальные не рассчитывает. По независимым тестам Appen, модель SubQ оказалась до 56 раз быстрее решений на FlashAttention, набрала 89,7% в LiveCodeBench и сохранила точность поиска информации на уровне 98% при контексте 6–12 млн токенов. Для сравнения, у большинства ведущих моделей контекст составляет около 1 млн токенов.

Самое эффектное заявление касается стоимости. По данным компании, тест RULER 128 на Anthropic Opus 4.6 стоил бы около $2 600, тогда как SubQ выполнила его за $8, то есть более чем в 300 раз дешевле. Во время демонстрации модель за несколько секунд проанализировала 400 документов, тогда как Perplexity не смогла загрузить их все.

Но пока это скорее многообещающая технология, чем доказанная революция. SubQ доступна лишь небольшому числу пользователей, тесты проводились в ограниченных условиях, а модель использует веса китайской Qwen, а не обучена полностью с нуля. Поэтому главный вопрос остается открытым: действительно ли Subquadratic решила фундаментальную проблему трансформеров или просто создала очень эффективную нишевую модель для кода и поиска по огромным массивам данных

Поделиться
Telegram