Fable 5.1在模拟工作中表现优越,NeoCognition揭示AI应用潜力
在大模型的评比中,尽管不同模型之间的分数相差不大,实际应用中的表现却截然不同。NeoCognition最新的ApprenticeBench评测显示,Fable 5.1与Opus 5在多个标准测试中相距无几,但在模拟建筑公司的真实工作环境中,两者的完成任务率却分别是72%和36%,差距显著。
ApprenticeBench并非一般的能力测评,它将AI Agent放入一个模拟的建筑公司中,要求其担任新员工,阅读员工手册和历史资料,并使用实际的企业软件,以便在主管的反馈下学习公司业务规则。在这个过程中,Fable 5.1与GPT-6 Astra的通过率分别为72%和68%,均超过了表现最好的人工测试者的51%。
此评测引发一个重要问题:如果AI能够自我适应企业软件和学习业务,那么未来是否可以将本需由前线部署工程师负责的工作转交给AI完成呢?尽管会计知识可以早期学习,但针对特定公司的做账方式和最新政策,Agent必须在入职后独立学习。ApprenticeBench通过模拟真实工作场景,使Agent在入职过程中借助员工手册、软件教程及历史账单,逐步完成100张新账单的处理。 千亿球友会
尽管现有的基准评测往往简化了真实工作中的许多细节,Agent在处理账单时却面临各种潜在问题,这些问题需要通过对历史记录的深入理解来解决。此次评测中的任务由两位具有超过30年经验的专家进行验证,确保问题的真实性与可解性。
例如,建筑行业的财务主管Emilie F.表示,这些场景非常贴近实际,AI若能处理这些复杂的沟通和交叉核对,将在会计部门中成为真正的助力。而企业经营者Austen K.也认为,这样的AI能使他从繁琐工作中解放出来,从而处理更多项目,创造显著的经济效益。
这种“生态效度”展示了AI真正适应工作环境的能力,同时也提出了一个新的可能性:企业是否可以利用现有的资源和带教流程,让AI如同新员工一样高效工作?通过完整的工作流程,Agent不仅要掌握软件的使用,还需理解公司的独特规则、调整工作方式,并与供应商进行信息沟通。这些相互影响的挑战,进一步加大了真实工作中AI的应用难度。 千亿球友会