Децениски психолошки тест откри изненадувачка слабост во способноста дури и на најнапредните системи за вештачка интелигенција (ВИ) да останат фокусирани.
Истражувачите, предводени од Сукету Пател, анализирале како големите јазични модели (LLM), што е технологијата зад системи како ChatGPT-5, Claude и Gemini, решаваат добро познат когнитивен предизвик наречен задачата Stroop. Наодите сугерираат дека иако вештачката интелигенција може да даде импресивни резултати на многу сложени задачи, може да има тешкотии да го одржи фокусот кога се соочува со конфликтни информации подолг временски период, објавува SciTechDaily.
Која е задачата на Строоп?
Задачата Строоп е класичен психолошки експеримент кој се користи со децении за проучување на вниманието и менталната контрола. Во тестот, учесниците гледаат зборови што именуваат бои, како што се „црвена“ или „сина“, прикажани со обоено мастило.
Понекогаш зборот и бојата на мастилото се совпаѓаат. На пример, зборот „црвено“ може да биде напишан со црвено мастило. Други пати тие се во конфликт, како на пример кога зборот „црвено“ се појавува напишан со сино мастило. Од учесниците се бара да ја идентификуваат бојата на мастилото, игнорирајќи го значењето на самиот збор.
Иако ова звучи едноставно, создава ментален конфликт. Повеќето луѓе се високо обучени автоматски да читаат зборови, па затоа потиснувањето на тој инстинкт бара она што психолозите го нарекуваат извршна контрола. Тоа се однесува на способноста на мозокот да се фокусира на цел, да се спротивстави на одвлекувањата на вниманието и да ги замени автоматските одговори.
На луѓето обично им треба малку подолго време да одговорат кога зборот и бојата не се совпаѓаат, феномен познат како Строопов ефект. Сепак, дури и кога задачата одзема многу време, луѓето генерално одржуваат висока точност и остануваат фокусирани на упатствата.
Вештачката интелигенција работи добро на почетокот
За да видат како современите системи со вештачка интелигенција би се справиле со истиот предизвик, истражувачите тестирале неколку водечки јазични модели користејќи листи на зборови кодирани во боја.
Кога им беа претставени кратки листи од пет зборови чии значења се судрија со боите на мастилото, моделите се покажаа изненадувачки добро.
GPT-4o постигна точност од 91% на овие пократки тестови. Claude 3.5 Sonnet исто така покажа одлични резултати. На прв поглед, резултатите сугерираа дека системите со вештачка интелигенција можат успешно да ја следат задачата и да ги игнорираат значењата на зборовите што го одвлекуваат вниманието.
Перформансите паѓаат со продолжување на листот
Сепак, сликата драматично се промени како што истражувачите ја зголемија должината на списоците со зборови. Точноста на моделот GPT-4o падна од 91% за пет зборови на 57% за десет зборови. Додека листата достигна 40 зборови, точноста падна на само 15%. Claude 3.5 Sonnet се покажа како поотпорен, одржувајќи стабилни перформанси на листи од 20 зборови. Сепак, и тој претрпе остар пад, паѓајќи на 24% точност пред листата од 40 зборови. Истражувачите забележаа слични шеми во GPT-5, Claude Opus 4.1 и Gemini 2.5.
Перформансите станаа уште полоши кога складни и нескладни зборови се појавија заедно во истата листа. Под овие услови, точноста на несовпаѓачките ставки падна на речиси нула.
Зошто луѓето и вештачката интелигенција реагираат различно
Резултатите укажуваат на важна разлика помеѓу човековото сознание и начинот на кој големите јазични модели ги обработуваат информациите.
Како и луѓето, системите со вештачка интелигенција практично добиле многу повеќе обука за препознавање и толкување зборови отколку за идентификување бои. Ова создава природна тенденција кај нив да се фокусираат на пишаниот збор. Сепак, луѓето генерално се способни да го потиснат тој автоматски одговор и да останат фокусирани на задачата што ја имаат, дури и преку долги редици предмети.
Спротивно на тоа, јазичните модели сè повеќе се враќаа на читање зборови наместо на именување бои како што напредуваше тестот. Со други зборови, се чинеше како да ја губат од вид првичната цел.
Според истражувачите, ова разложување сугерира дека механизмите за внимание што ги користат системите за вештачка интелигенција базирани на трансформатори се фундаментално различни од биолошките системи за внимание во човечкиот мозок.
Ограничувања на вештачката интелигенција
Големите јазични модели покажаа исклучителни способности во пишувањето, расудувањето, програмирањето и разговорот. Сепак, студии како оваа нагласуваат дека импресивните резултати не мора да значат дека вештачката интелигенција ги обработува информациите на ист начин како луѓето.
Наодите сугерираат дека модерната вештачка интелигенција може да има скриени слабости кога задачите бараат долгорочен фокус, инхибиција на автоматски одговори и долгорочно одржување на специфични инструкции.
Бидејќи системите за вештачка интелигенција стануваат сè поинтегрирани во секојдневниот живот, разбирањето на овие ограничувања може да биде исто толку важно како и мерењето на нивната сила.
