ИИ-модели оказались неспособны правильно решать сложные финансовые задачи
- Источник:
- Office Life
Для тестирования в Saturn составили список из более чем 100 финансовых вопросов, которые могли повторяться до пяти раз. Проверяли наиболее распространенные нейросети, в том числе ChatGPT, Claude, Copilot, Grok и Gemini. Оказалось, что в ответах на усредненные задачи они давали неверные ответы в 57% случаев, на более сложные — в 99%.
По данным компании, ИИ-модели ошибались в вычислениях — к примеру, игнорировали предстоящие изменения в налоговом законодательстве или выдумывали нормы. При этом точнее всего чат-боты отвечали на вопросы при составлении бюджета. А лучшей по результатам исследования оказалась модель Claude Opus 5 в режиме «рассуждений».
Исполнительный директор Saturn Амаль Джоли отметил, что миллионы людей доверяют ИИ-моделям в вопросах финансов, однако «они получают неправильные ответы, из-за которых могут потерять свои деньги».
Ранее мы писали, что во время обучения модели OpenAI скрывали ошибки, придумывали данные и искали в интернете способы самостоятельно получить доступ к ним.
В конце июля мы писали, что автономные ИИ-модели OpenAI и Anthropic вышли из-под контроля и взломали инфраструктуру пяти компаний. В начале августа стало известно, что модели OpenAI перед этим тайно общались между собой.