Meta已经推出Muse Spark,这是一款新的人工智能模型,标志着其AI战略的重大调整。
该模型是Meta超级智能实验室(Meta Superintelligence Labs)的首款发布产品,将多模态推理与代理式任务执行相结合。
此次发布正值各大科技公司竞相定义超越聊天机器人的下一阶段AI之际。
与早期模型不同,Muse Spark能够在单一框架内处理文本、图像和工具。
它还引入了一个系统,允许多个推理代理同时运行。
Meta表示,这种设置可以提高解决复杂问题的性能,尽管公司承认仍存在一些不足。
Muse Spark反映了行业更广泛的转变趋势,即转向能够解读和应对视觉及现实世界数据的系统。
该模型可以分析图像、解决视觉STEM问题,并根据上下文理解识别对象。
它还支持对视觉输入进行逐步推理,这一功能被Meta称为"视觉思维链"。
这些能力使更多实际应用场景成为可能。
用户可以要求系统通过带注释的视觉内容来排除家电故障或指导他们完成任务。
该模型还可以生成交互式内容,包括根据用户提示构建的简单游戏。
不过,此类功能在行业内仍存在不均衡现象。
尽管各公司强调多模态方面的进步,但一致的实际性能仍落后于受控基准测试。
平行代理,更高风险
一项重要新增功能是Meta所称的"思考模式"(Contemplating mode)。该功能同时运行多个推理代理,旨在更有效地解决更困难的任务。
这种方法与竞争对手通过增加推理时的计算量来扩展推理能力的努力相呼应。
Meta报告称,Muse Spark在"人类最后考试"(Humanity's Last Exam)中得分58%,在FrontierScience研究任务中得分38%。
这些基准测试试图衡量模型在复杂推理问题上的表现。
然而,由于评估方法不同,此类分数在不同模型之间难以进行比较。
公司表示,该系统提高了可靠性,同时不降低其响应的多样性。
它还声称这些优势延伸到训练数据之外的任务。对这些声明的独立验证仍然有限。
扩展效率成为焦点
在这次发布背后,是更大规模的基础设施转变。Meta表示,过去九个月中,公司重建了其训练管道,专注于模型设计、优化和数据整理。
公司声称,这些变化使Muse Spark能够在使用远少于早期系统计算资源的情况下达到相似的性能水平。
据Meta称,与之前的Llama 4 Maverick模型相比,该模型以超过十倍少的计算量实现了相当的结果。
如果准确,这种效率可能会降低开发更大AI系统的成本。
强化学习在该方法中仍居核心地位。
Meta报告称,随着训练规模的扩大,公司取得了稳定进展,在训练和评估任务中均观察到改进。
公司认为,这表明进展比早期方法更具可预测性,而早期方法往往在稳定性方面遇到困难。
Meta将Muse Spark定位为迈向其所谓"个人超级智能"的早期步骤。
这一理念围绕能够理解用户环境并提供定制化协助的AI系统展开。
健康是首批重点领域之一,训练数据与医生共同开发,以改善医学解释。
Muse Spark现已通过Meta的AI平台提供,开发者可获得有限的API访问权限。
此次发布突显了AI竞争格局的变化。公司不再只是构建更智能的模型。
它们正在构建旨在现实世界中运行的系统,尽管可靠性和验证仍是待解决的问题。
【全文结束】

