HeadlinesBriefing favicon HeadlinesBriefing.com

AI聊天机器人57%时间给出错误财务答案

Financial Times Companies •
×

技术公司Saturn的研究显示,来自Chat GPT、Claude、Copilot、Grok和Gemini的热门AI模型平均有57%的时间对财务查询提供错误答案。对于需要多次计算的复杂问题,错误率上升至88%,部分模型甚至97%的时间都出错。该研究测试了18个AI模型中超过100个与金钱相关的问题,总查询次数超过10,000次。错误包括计算错误、遗漏税制变更以及捏造规则。在其中一个案例中,Claude Haiku 4.5给出了错误的养老金税务建议,可能导致17,500英镑的HMRC罚款。另一个错误中,Claude编造了一条允许在移居国外时停止偿还学生贷款的规则。付费模型的表现优于免费模型,新版本更加准确。表现最好的Claude Opus 5在推理模式下仍然有39%的时间出错。AJ Bell个人理财主管Sarah Coles表示,顾问们越来越多地看到客户按照令人困惑的AI建议行事。虽然聊天机器人可以帮助预算编制和研究,但金融行为监管局发现五分之一的英国成年人愿意让AI做出财务决策,年轻投资者尤其信任。Saturn的Amal Jolly警告称,AI财务建议仍不受监管,消费者无法获得人类顾问提供的保护或赔偿。