ИИ ошибается в большинстве финансовых ответов: результаты масштабного теста

15:57
1 Анализ этих новостей
ИИ ошибается в 57% финансовых ответов, а на сложных вопросах — до 99%. Самые популярные модели ChatGPT, Claude, Copilot, Grok и Gemini в среднем давали на такие вопросы неверные ответы в 57% случаев.

При наиболее сложных вопросах, например требующих нескольких вычислений, модели ИИ допускали ошибки в 88% случаев. В рамках эксперимента 18 моделям задали более 10 тыс вопросов. Как итог: алгоритмы ошибались в расчетах, не учитывали изменения в налоговых правилах и ссылались на несуществующие нормы. К примеру, ошибка Claude Haiku в налоговых правилах могла обернуться для вкладчика огромным штрафом, а в вопросе о студенческих займах бот изобрел несуществующее правило об отмене выплат при переезде за границу. Наименьшая доля ошибок среди протестированных моделей была у Claude Opus 5 в режиме «рассуждений» — 39%.
При загрузке возникла ошибка!