Международная группа ученых при помощи теста Струпа смогла выявить основную слабость искусственного интеллекта. Оказалось, сложнее всего ему дается решение длинных задач. Материалы исследования приводит издание PNAS Nexus.
Во время теста демонстрировались слова, написанные цветными чернилами. Важно было правильно назвать подобранный для этого тонн, но избегать чтения самого текста. Люди легко справляются с такими задачами.
Аналогичный эксперимент провели для Gemini 2.5, Claude Opus 4.1 и 3.5 Sonnet, GPT-4o и 5. ИИ легко выполнял тест при демонстрации коротких списков, состоявших максимум из пяти слов. Как только они увеличились, точность стала падать. При 10 задачах эффективность ответа снизилась до 57%, при 40 – до 15%.
Авторы работы полагают, что во время выполнения длинных задач ИИ утрачивает связи с первоначальной инструкцией. После этого он возвращается к своим лучшим навыкам, то есть к простому чтению.

















