Люди правильно отвечают на 93,1% вопросов нового бенчмарка Humanity's Sixth Sense, лучшая из проверенных мультимодальных моделей, GPT-6 Astra, — на 53,6%. Тест представило исследовательское подразделение Scale Labs вместе с Elorian, сообщает Telegram-канал @ai_machinelearning_big_data.[1][2]
Бенчмарк проверяет, умеет ли ИИ замечать скрытые социальные сигналы и пространственные связи на изображениях и видео. В него входят 522 вопроса по 288 статичным сценам и 234 видеофрагментам.[1][3]
Всего проверили 25 актуальных мультимодальных моделей, и все заметно отстали от человека. GPT-6.1 Sol набрала 46,6%, Claude Opus — 44,6%. Медиана по выборке составила 30,9%.[4][5]
Авторы разобрали более 8,5 тысячи неудачных ответов. В 94% случаев ошибка возникала ещё на уровне первичного машинного зрения: по формулировке источника, «модели пропускают маркеры в кадре и теряют контекст». На логику рассуждений пришлось 5% ошибок.[6]
Дополнительные вычисления не решили проблему. Вычислительный бюджет увеличивали в среднем до 4000 токенов на ответ, и иногда точность от этого даже снижалась. Попытка имитировать фокусировку взгляда через кроп изображения дала минимальный эффект.[7]
Из этого Scale Labs заключили, что масштабирование логического вывода не компенсирует ограничений базовой архитектуры компьютерного зрения.[8]
Исследовательское подразделение Scale Labs в партнерстве с Elorian представило бенчмарк Humanity's Sixth Sense, созданный для проверки способности ИИ интерпретировать скрытые социальные сигналы и пространственные взаимосвязи на изображениях и видео.
Scale Labs и Elorian (по данным Telegram-канала @ai_machinelearning_big_data)открыть источник →
показал, что 94% из них вызваны сбоями первичного машинного зрения - модели пропускают маркеры в кадре и теряют контекст. На ошибки в логике рассуждений пришлось всего 5%.
Scale Labs (по данным Telegram-канала @ai_machinelearning_big_data)открыть источник →
Увеличение вычислительного бюджета (в среднем 4000 токенов на ответ) не решило проблему, а иногда еще и снижало точность. Эмуляция фокусировки через кроп также дала минимальный эффект.
Scale Labs (по данным Telegram-канала @ai_machinelearning_big_data)открыть источник →
Scale Labs по итогу тестов пришли к выводу, что масштабирование логического вывода не компенсирует ограничения базовой архитектуры компьютерного зрения.
Scale Labs (по данным Telegram-канала @ai_machinelearning_big_data)открыть источник →