Британская технологическая компания Saturn опубликовала отчет с анализом способностей популярных LLM помогать пользователям в финансовых вопросах. Были протестированы 18 ИИ-решений, включая ChatGPT, Gemini, Claude и Copilot. Им задали 121 вопрос по теме финансов. Работа проводилась 6–30 июля 2026 года.
Ключевые выводы:
- в среднем по всем категориям вопросов ИИ-модели ошибались в 57% случаев и давали точный ответ в 43% случаев. Все протестированные типы LLM показали низкую точность при ответах на вопросы всех уровней сложности;
- в сложных вопросах доля правильных ответов снижается до 12%, ошибки допускались в 88% случаев. В легких вопросах доля правильных ответов составляет 54%;
- бесплатные модели ошибались в 63% случаев и давали правильные ответы в 37%. У платных решений показатели составляют 51% и 49% соответственно;
- самый худший результат при тестировании среди бесплатных моделей — 82% ошибок, самый лучший результат — 56% ошибок. Среди платных версий эти показатели равны 55% и 39% соответственно;
- на группе самых сложных вопросов бесплатные модели в среднем ошибались в 93% случаев. Худший результат — 99%. Среди платных решений лучший результат — 39% правильных ответов;
- по оценке авторов, в наиболее серьезных случаях потери для тех, кто воспользовался бы рекомендациями ИИ-моделей, составили бы сотни тысяч фунтов;
- ошибка одной из бесплатных моделей в вопросе правил налогообложения пенсий могла привести к тому, что пользователю пришлось бы выплатить 17,5 тыс. фунтов налоговой службе Великобритании;
- одна из моделей рекомендовала первостепенно выплачивать долги с высокой процентной ставкой, а не аренду жилья, что могло привести к выселению пользователя;
- среди выявленных ошибок — неверные данные, использование устаревших налоговых правил, отсутствие важных предупреждений. Неверные ответы давались с тем же уверенным авторитетным тоном, что и корректные, отмечают авторы.