ИИ все еще плохо считает деньги

вчера 10:39
2 Анализ этих новостей
Исследование Saturn выявило низкую точность популярных моделей искусственного интеллекта (ChatGPT, Claude, Copilot, Grok и Gemini) при решении финансовых задач. В среднем алгоритмы ошибались в 57% случаев, а при выполнении сложных расчетов, требующих нескольких этапов вычислений, частота ошибок возрастала до 88%. В ходе эксперимента 18 моделей получили более 10 тысяч вопросов. Основные проблемы включают ошибки в расчетах, игнорирование изменений в налоговом законодательстве и использование несуществующих норм. В частности, ошибка Claude Haiku в налоговых правилах могла привести к штрафу в размере £17 500, а в вопросе о студенческих займах бот предоставил ложную информацию об отмене выплат при переезде за границу. Наилучший результат среди протестированных показала модель Claude Opus 5 в режиме «рассуждений», допустив ошибки лишь в 39% случаев.
При загрузке возникла ошибка!