AI IQ: новая система оценки интеллекта нейросетей вызывает споры

AI IQ: новая система оценки интеллекта нейросетей вызывает споры

На протяжении десятилетий тест IQ служил одной из самых известных, но и оспариваемых, мер человеческого интеллекта. Теперь стартап-проект AI IQ применяет эту же концепцию к искусственному интеллекту, присваивая предполагаемые коэффициенты интеллекта более чем 50 мощным языковым моделям мира и размещая их на стандартной колоколообразной кривой распределения.

Результатом стали интерактивные визуализации на сайте aiiq.org, которые за последнюю неделю активно обсуждались в социальных сетях, получив похвалу от корпоративных технологов, отмечающих, что эти графики делают чрезвычайно сложный рынок понятным. Однако проект также столкнулся с резкой критикой со стороны исследователей и комментаторов, которые предупреждают, что вся эта система может вводить в заблуждение.

По словам технологического обозревателя Тибо Мелена, написавшего на X*, это "суперполезно. Намного легче понять прогресс моделей, когда он представлен таким образом, а не в виде очередной гигантской таблицы лидеров". Бизнес-стратег Брайан Веллмур также выразил поддержку, отметив: "Это полезно. Эмпирически согласуется с личным опытом".

Однако обратная реакция последовала так же быстро. "Это бессмыслица. ИИ слишком неоднороден. Карта — это не территория", — написал аккаунт AI Deeply, специализирующийся на комментариях об искусственном интеллекте. Это сообщение отразило опасения многих исследователей: сведение обширных и неравномерных возможностей языковой модели к одному числу создает опасную иллюзию точности.

Двенадцать бенчмарков, четыре измерения и одно спорное число: как работает AI IQ

Проект AI IQ был создан Райаном Ши, инженером, предпринимателем и венчурным инвестором, наиболее известным как соучредитель блокчейн-платформы Stacks. Ши также является соучредителем Voterbase и инвестировал на ранних стадиях в несколько компаний-единорогов, включая OpenSea, Lattice, Anchorage и Mercury. Он имеет степень бакалавра наук в области машиностроения Принстонского университета.

Методология сайта основана на обманчиво простой формуле. AI IQ группирует 12 тестовых показателей (бенчмарков) в четыре измерения мышления: абстрактное, математическое, программное и академическое. Составной IQ представляет собой прямое среднее этих четырех оценок по измерениям: IQ = ¼ (IQ_Абстрактное + IQ_Математическое + IQ_Программное + IQ_Академическое).

Измерение абстрактного мышления использует тесты ARC-AGI-1 и ARC-AGI-2 — заведомо сложные бенчмарки на распознавание образов, разработанные для проверки общего гибкого интеллекта. Математическое мышление включает FrontierMath (уровни 1–3 и уровень 4), AIME и ProofBench. Программное мышление использует Terminal-Bench 2.0, SWE-Bench Verified и SciCode. Академическое мышление базируется на Humanity's Last Exam, CritPt и GPQA Diamond.

Каждая необработанная оценка бенчмарка преобразуется в предполагаемый IQ с помощью так называемых "вручную откалиброванных кривых сложности". Важно отметить, что методология сжимает верхние границы для бенчмарков, считающихся более простыми или более подверженными загрязнению данными, предотвращая завышение оценок выше 100. Более сложные и менее подверженные "накрутке" бенчмарки сохраняют более высокие верхние границы. Система также консервативно обрабатывает отсутствующие данные: моделям требуются оценки как минимум по двум из четырех измерений, чтобы получить производный IQ, и при отсутствии бенчмарков система целенаправленно занижает оценки, а не завышает их. На сайте указано, что "каждый производный IQ усредняет все четыре измерения, поэтому отсутствие покрытия не может сделать модель лучше за счет упущения".

OpenAI лидирует в колоколообразной кривой, но разрыв между ведущими моделями ИИ никогда не был меньше

По состоянию на середину мая 2026 года, графики AI IQ показывают быструю конвергенцию на вершине передовых моделей и растущее разнообразие на нижних уровнях.

Согласно графику "Frontier IQ Over Time", модель GPT-5.5 от OpenAI в настоящее время находится на пике колоколообразной кривой, с предполагаемым IQ около 136 — это самый высокий показатель среди всех отслеживаемых моделей. За ней следуют GPT-5.4 (примерно 131), Opus 4.7 от Anthropic (примерно 132) и Opus 4.6 (примерно 129). Gemini 3.1 Pro от Google находится около отметки 131, что делает группу лидеров чрезвычайно плотной.

Это сжатие не является уникальным для фреймворка AI IQ. Visual Capitalist, опираясь на отдельный рейтинг TrackingAI, основанный на тестах Mensa, недавно отметил ту же динамику, указав, что "самый важный вывод заключается в том, насколько плотной стала верхняя часть таблицы лидеров". В этом масштабе Grok-4.20 Expert Mode и GPT 5.4 Pro набрали по 145 баллов, а Gemini 3.1 Pro — 141 балл.

Ниже кластера передовых моделей, графики AI IQ показывают плотное "середнячковое" поле. Модели от китайских лабораторий — Kimi K2.6, GLM-5, DeepSeek-V3.2, Qwen3.6, MiniMax-M2.7 — группируются в диапазоне примерно от 112 до 118 баллов, что делает уровень цена-производительность все более конкурентоспособным для корпоративных покупателей, которым не нужна абсолютно лучшая модель для каждой задачи. Один пользователь X* под ником ovsky отметил, что данные "подтверждают опыт использования sonnet 4.6 как абсолютной рабочей лошадки в отличие от opus 4.5" — указывая на то, как графики могут подтверждать интуицию практиков, которую часто упускают из виду заголовки рейтингов.

Почему оценки эмоционального интеллекта становятся новым полем битвы в рейтингах моделей ИИ

Что отличает AI IQ от большинства других бенчмаркинговых усилий, так это включение показателя EQ — эмоционального интеллекта. Сайт преобразует оценки Elo каждой модели по EQ-Bench 3 и Arena Elo в предполагаемый EQ, используя калиброванные кусочно-линейные шкалы, а затем выводит средний взвешенный показатель 50/50 из двух.

Оценки EQ дают значительно отличающийся рейтинг по сравнению с одним лишь IQ. На диаграмме рассеяния IQ против EQ, Opus 4.7 от Anthropic лидирует по EQ с оценкой около 132, что помещает его в верхний правый квадрант — наиболее желаемое положение, сигнализирующее как о высоком когнитивном, так и о высоком эмоциональном интеллекте. Модели GPT-5.5 и GPT-5.4 от OpenAI группируются в зоне высокого IQ, но немного отстают по EQ. Gemini 3.1 Pro от Google занимает сильную среднюю позицию по обеим осям.

Одно заметное методологическое решение привлекло внимание: EQ-Bench 3 оценивается Claude, моделью Anthropic, что, как признает сайт, "создает потенциальную предвзятость в пользу моделей Anthropic". Для коррекции этого, AI IQ вычитает 200 баллов штрафа Elo из компонента EQ-Bench для всех моделей Anthropic перед преобразованием в предполагаемый EQ. Компонент Arena остается без изменений, поскольку он использует судей-людей. Такая самокоррекция необычна в мире бенчмаркинга и предполагает, что Ши осознает методологическое минное поле, на которое он вступил. Тем не менее, измерение EQ отражает то, что один только IQ не может: растущее значение качества диалога, сотрудничества и доверия в моделях, развернутых для работы с пользователями.

Диаграмма "стоимость-производительность" ИИ, которую действительно необходимо увидеть корпоративным покупателям

Пожалуй, наиболее практичной диаграммой на сайте является не колоколообразная кривая, а диаграмма рассеяния "IQ против эффективной стоимости". Она сопоставляет предполагаемый IQ каждой модели с показателем "эффективной стоимости", который определяется как стоимость токена для задачи, использующей 2 миллиона входных токенов и 1 миллион выходных токенов, умноженная на коэффициент эффективности использования.

Диаграмма выявляет знакомую закономерность в корпоративных технологиях: лучшие модели не всегда являются лучшим предложением. GPT-5.5 и Opus 4.7 расположены в верхнем левом углу — высокий IQ, высокая стоимость, с эффективными затратами на задачу, превышающими 30 долларов США и 50 долларов США соответственно. Между тем, такие модели, как GPT-5.4-mini, DeepSeek-V3.2 и MiniMax-M2.7, занимают оптимальное положение посередине: достойные оценки IQ от 112 до 120 при эффективных затратах от 1 до 5 долларов США за задачу. В самой дешевой крайности, GPT-oss-20b (модель OpenAI с открытым исходным кодом) появляется с эффективной стоимостью около 0,20 доллара США и IQ около 107 — потенциально самый экономичный вариант для задач массовой классификации или извлечения данных.

Сайт также предлагает 3D-визуализацию, одновременно отображающую IQ, EQ и эффективную стоимость. Пунктирная линия, проходящая через куб, указывает на идеал: более высокий IQ, более высокий EQ и более низкая стоимость. Модели, находящиеся ближе к "зеленому концу" этой оси, представляют собой более сильные универсальные предложения; те, что ближе к "красному концу", жертвуют возможностями, экономической эффективностью или и тем, и другим. Для директоров по информационным технологиям, изучающих счета за API, вывод очевиден: разрыв в интеллекте между моделью стоимостью 50 долларов США и моделью за 3 доллара США сократился настолько, что маршрутизация — использование дорогих моделей для сложных проблем и дешевых для всего остального — больше не является необязательной. Это доминирующая архитектура для серьезных внедрений ИИ.

Критики утверждают, что "неоднородные" возможности ИИ делают одну оценку IQ опасно вводящей в заблуждение

Самое громкое возражение против AI IQ носит философский характер и затрагивает глубокие вопросы. Критики утверждают, что сведение неравномерных возможностей модели к единому показателю скорее скрывает, чем раскрывает.

"IQ как прокси уходит в прошлое — мы видим всплески плотности рассуждений, которые не соотносятся с g-фактором", — написал Зая, технологический обозреватель, на X*. "GPT-5.5 уже достиг насыщения на MMLU-Pro, но все еще проваливает ClockBench в 50% случаев".

Это наблюдение касается того, что исследователи ИИ называют проблемой "неоднородности": большие языковые модели часто демонстрируют крайне неравномерные возможности, преуспевая в физике университетского уровня, но проваливаясь в задачах, которые может выполнить ребенок. Композитный показатель может скрывать эти пробелы.

Другой пользователь X* под ником Pressureangle опубликовал более детальную критику, указав на "полное отсутствие прозрачности" и утверждая, что сайт никогда полностью не раскрывает, как были созданы или проверены его калибровочные кривые. Справедливости ради, AI IQ действительно перечисляет свои 12 бенчмарков и показывает форму каждой калибровочной кривой в своем методологическом модальном окне. Однако необработанные данные и точные математические преобразования не публикуются в виде открытых наборов данных — это пробел, который важен для исследователей, привыкших к полностью воспроизводимым методам.

Другие ставили под сомнение саму предпосылку. "Так же бесполезно, как тестирование IQ человека", — написал haashim на X*. Шубхам Шарма, писатель в области ИИ и технологий, предложил конструктивную альтернативу: "Почему бы моделям не пройти официальный (уровня MENSA) тест? Разве это не был бы самый точный и наиболее 'сравнимый с человеком' способ оценки интеллекта?" Такой подход уже существует через TrackingAI, который проводит тест IQ Mensa Norway для языковых моделей. Однако тесты в стиле Mensa измеряют только абстрактное распознавание образов, в то время как AI IQ пытается создать более широкий композитный показатель, охватывающий программирование, математику и академическое мышление. Как отметил Visual Capitalist, "бенчмарк в стиле IQ охватывает лишь одну часть возможностей". У каждого подхода есть свои компромиссы — и ни один из них пока не выиграл спор.

Настоящая гонка не за наивысший балл, а за самый умный стек моделей

Несмотря на все дебаты о методологии, наиболее важным сигналом в данных AI IQ может быть не оценка какой-либо одной модели. Это форма рынка, которую раскрывают графики.

Сейчас через API доступно более 50 моделей передового класса от по меньшей мере 14 крупных провайдеров из США, Китая и Европы. Каждый провайдер публикует свои собственные бенчмарки, часто выборочно, чтобы продемонстрировать сильные стороны. В результате получается Вавилонская башня, где ни одна компания не измеряет одно и то же одинаковым образом. Академические исследования показали, что "большинство бенчмарков вводят предвзятость, фокусируясь на конкретном типе домена", и график "Frontier IQ Over Time" на AI IQ показывает, как быстро меняются цели: в октябре 2023 года GPT-4-turbo имел предполагаемый IQ около 75. К началу 2026 года лучшие модели достигали 135 — примерно 60 баллов улучшения за 30 месяцев.

Такой темп поднимает фундаментальный вопрос о том, может ли какая-либо система оценки успевать за прогрессом. Сайт сжимает верхние границы для насыщенных бенчмарков, но по мере того, как модели продолжают максимизировать даже самые сложные тесты — ARC-AGI-2, FrontierMath Tier 4, Humanity's Last Exam — фреймворк столкнется с теми же эффектами "потолка", которые преследовали каждую оценку ИИ до сих пор. Коннор Форсайт указал на эту динамику на X*: "ARC AGI 3 не согласен", — написал он, ссылаясь на бенчмарк следующего поколения, который, возможно, уже подрывает текущие оценки.

AI IQ не идеален. Его методология частично непрозрачна. Его метафора IQ может вводить в заблуждение. И его создатель признает известные предубеждения, вероятно упуская другие. Но альтернатива — пробираться через десятки таблиц бенчмарков, специфичных для каждого провайдера, каждая из которых использует разные наборы тестов и соглашения об оценке — хуже. Сайт предлагает корпоративным покупателям нечто действительно дефицитное: единую систему для сравнения моделей по провайдерам, измерениям и ценовым категориям, регулярно обновляемую, с достаточной детализацией, чтобы показать, что правильный ответ на вопрос "какая модель лучше?" почти всегда звучит как "это зависит от задачи".

Смотрите также:

Microsoft Edge: Copilot теперь анализирует все открытые вкладки http://stroybud.com/microsoft-edge-copilot-teper-analiziruet-vse-otkryityie-vkladki/.

Интересности на тему: Запрет на продажу иностранных роутеров в США: что нужно знать пользователям

Классные советы в статье "Обзор и подсказки к головоломке Connections от The New York Times" здесь.

Как Дебдут Гхош размышлял на X* после просмотра графиков: "Теперь роль человека заключается лишь в оркестровке?". Возможно. Но если данные AI IQ что-то и показывают ясно, так это то, что оркестровка — знание, какую модель развернуть, когда и по какой цене — стала своей собственной формой интеллекта. И для этого пока нет бенчмарка.

* — деятельность компании запрещена на территории РФ