在一个名为 Brood War Bench 的测试平台上,当前主流的大型模型被聚集到了一起,进行了一场即时战略对战的实验。结果却并不令人满意:所有模型的表现都仅相当于新手水平。这一结果的显著之处在于,《星际争霸:母巢之战》并非一个陌生的名字,它在人工智能研究领域已经有着数十年的历史。这款自1998年问世的经典即时战略游戏,一直以来都是AI学者们关注的热点之一。
回想2019年,DeepMind推出的 AlphaStar曾在这款游戏中击败职业电竞选手,那时无疑是人工智能在即时战略领域取得重大成就的时刻。这次胜利的背后,依托于的是一套专门针对《星际争霸》设计的强化学习系统。与那些能够进行对话、写代码或处理其他多样化任务的通用模型不同,AlphaStar的能力完全聚焦于如何在这款游戏中实现最佳表现。
然而,Brood War Bench所测评的则是一类截然不同的模型——当前流行的多功能大模型。虽然它们能够处理多种复杂的语言任务,展现出色的通用能力,但在实际的即时战略对战环境中,它们却未能突破新手这一基本门槛。这一对比令人深思:一方面是经过专门训练,能够与职业玩家抗衡的强化学习系统;另一方面则是尽管在其他领域表现优异,却在这一特定游戏中显得力不从心的大型通用模型。它们在同样的平台上竞技,却呈现出如此巨大的差距,实在令人咋舌。 吉祥体育下载