ГлавнаяХаб аналитикиArtificial Authority: Comprehensive Analysis of the Accuracy of Publicly Available LLMs in Offering Financial Advice

Saturn

Artificial Authority: Comprehensive Analysis of the Accuracy of Publicly Available LLMs in Offering Financial Advice

Британская технологическая компания Saturn опубликовала отчет с анализом способностей популярных LLM помогать пользователям в финансовых вопросах. Были протестированы 18 ИИ-решений, включая ChatGPT, Gemini, Claude и Copilot. Им задали 121 вопрос по теме финансов. Работа проводилась 6–30 июля 2026 года.

Ключевые выводы:

  • в среднем по всем категориям вопросов ИИ-модели ошибались в 57% случаев и давали точный ответ в 43% случаев. Все протестированные типы LLM показали низкую точность при ответах на вопросы всех уровней сложности;
  • в сложных вопросах доля правильных ответов снижается до 12%, ошибки допускались в 88% случаев. В легких вопросах доля правильных ответов составляет 54%;
  • бесплатные модели ошибались в 63% случаев и давали правильные ответы в 37%. У платных решений показатели составляют 51% и 49% соответственно;
  • самый худший результат при тестировании среди бесплатных моделей — 82% ошибок, самый лучший результат — 56% ошибок. Среди платных версий эти показатели равны 55% и 39% соответственно;
  • на группе самых сложных вопросов бесплатные модели в среднем ошибались в 93% случаев. Худший результат — 99%. Среди платных решений лучший результат — 39% правильных ответов;
  • по оценке авторов, в наиболее серьезных случаях потери для тех, кто воспользовался бы рекомендациями ИИ-моделей, составили бы сотни тысяч фунтов;
  • ошибка одной из бесплатных моделей в вопросе правил налогообложения пенсий могла привести к тому, что пользователю пришлось бы выплатить 17,5 тыс. фунтов налоговой службе Великобритании;
  • одна из моделей рекомендовала первостепенно выплачивать долги с высокой процентной ставкой, а не аренду жилья, что могло привести к выселению пользователя;
  • среди выявленных ошибок — неверные данные, использование устаревших налоговых правил, отсутствие важных предупреждений. Неверные ответы давались с тем же уверенным авторитетным тоном, что и корректные, отмечают авторы.
Подробнее
Тематика:

#финтех

Технологии:

#искусственный_интеллект

Компании:

#Saturn

Расскажите знакомым:

121Дата добавления:02.10.2026

Расскажите знакомым:

Похожие исследования:
Подпишитесь, чтобы получать обновления раздела раньше других

Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности

Добавить исследование в каталог ICT.Moscow
Что такое ICT.Moscow?

ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.