
字节 Seed 发布全新多模态智能体框架——M3-Agent开云(中国)Kaiyun·官方网站 - 登录入口。
像东说念主类一样能听会看、具备弥远驰念,况且免费开源!?
M3-Agent 的亮点在于,它不仅偶然顾问及时的视觉和听觉输入,以构建和更新其弥远驰念,还发展了语义驰念,偶然跟着技术的推移积聚常识。
此外,为了评估多模态智能体中的驰念有用性和基于驰念的推理,来自字节 Seed、浙江大学和上海交通大学的揣摸团队还开拓了一个新的长视频问答基准:M3-Bench,相似开源。

实验标明,通过强化学习锤真金不怕火的 M3-Agent 在多个基准测试中解析均权臣优于基线模子(包括基于买卖模子如 Gemini-1.5-Pro 和 GPT-4o 的智能体)。

一位眷注网友转头了这篇论文的两个中枢知悉:
以实体为中心的多模态驰念至关遑急。M3-Agent 揣摸标明,通过在东说念主脸、语音和文本中建造具有合手久 ID 的弥远结构化驰念,偶然权臣进步长视频骨子的推理才调。
检索推理优于单次 RAG。锤真金不怕火一个 RL 计谋来决定何时以及怎么查询驰念会产生比盲目检索更强的效果。开拓代理的开拓者应该将检索视为一个迭代的推理轮回,而不是一个一次性要领。

详备骨子及代码可见文末辘集。
M3-Agent 框架

对于多模态智能体而言,达到像东说念主类一样的智能水平根底上依赖于三种才调:
(1)通过多模态传感器合手续感知寰宇;
(2)将造就存储在弥远驰念中,并迟缓构建对于环境的常识;
(3)基于积聚的驰念进行推理,以领导其行径。
为完结这些方针,字节 Seed 团队建议了 M3-Agent,一个配备弥远驰念的新式多模态代理框架。
它通过两个并行历程运作:驰念历程和限制历程。
驰念历程合手续感知及时多模态输入以构建和更新弥远驰念;限制历程则讲明注解外部领导,对存储的驰念进行推理,并实施相应的任务。

在驰念历程中,M3-Agent 会及时顾问输入的视频流,通过生成两种驰念类型来同期拿获细粒度细节和高档抽象信息,雷同于东说念主类解析系统:
事件驰念
纪录视频中不雅察到的具体事件。举例,"爱丽丝提起咖啡说,‘早上莫得这个我无法离开’",以及"爱丽丝将空瓶子扔进绿色的垃圾桶"。
语义驰念
从片断中推导出一般常识。举例,"爱丽丝心爱早上喝咖啡"和"绿色的垃圾桶用于回收"。
生成的驰念随后会被存入弥远驰念库中,该库复古东说念主脸、语音和文本常识等多模态信息存储。
此外,驰念以实体为中心的结构进行组织,举例与兼并个东说念主有关的信息(举例他们的脸、声息和有关常识)会以图的局势辘集起来,跟着智能体不断提真金不怕火和整合语义驰念,这些关联相关会迟缓建造完善。
在限制历程中,M3-Agent 哄骗其弥远驰念进行推理并完成任务。
M3-Agent 并非使用单轮检索增强生成(RAG)将驰念加载到凹凸文中,而是接收强化学习来完结多轮推理和迭代驰念检索,能自主从不同维度(如事件或扮装)的弥远驰念中检索有关信息,从而提高任务得胜率。

M3-Bench 基准

对于多模态智能体而言,驰念酿成与在线视频走漏密切有关,而在线视频走漏是一项需要及时顾问视频流并字据以前的不雅察作念出方案的、具有挑战性的任务。
传统的长视频走漏行径(举例在多模态模子中彭胀凹凸文窗口或压缩视觉象征以增多技术消散界限)对于无尽长的视频流来说,并不具备有用的彭胀性。
为了提高可彭胀性,基于驰念的行径引入了驰念模块来存储编码的视觉特征以供将来检索。这些架构符合在线视频顾问,但它们濒临一个基本章程:难以保合手弥远一致性。
由于它们只存储视觉特征,这些行径难以在长技术内保合手对东说念主类身份或演变事件等实体的连贯追踪。
跟着大型多模态和话语模子的快速发展,苏格拉底模子框架已成为已成为在线视频走漏范畴的一种颇具远景的揣摸方针。
该行径通过哄骗多模态模子生成视频描画手脚基于话语的驰念,有用进步了系统可彭胀性;但它在保合手复杂、演变视频骨子的弥远一致性方面仍然濒临挑战。
为此,揣摸团队建议了 M3-Bench,一个用于评估多模态智能体弥远驰念推理才调的 LVQA 数据集。
M3-Bench 中的每个实例包含一个模拟智能体感知输入的长视频,以及一系列绽开式问答对。
该数据集分为两个子集:
M3-Bench-robot,包含 100 个从机器东说念主第一东说念主称视角录制的实在寰宇视频;
M3-Bench-web,包含 920 个收罗着手的视频,涵盖更庸俗的骨子和场景。
为了全面评估智能体回忆以前不雅察效果和基于驰念进行推理的才调,揣摸团队整理了五种不同类型的问答题,如下图所示。

总体而言,M3-Bench 的特色是:
永劫长的实在寰宇视频,涵盖了与多模态智能体部署有关的种种化试验场景;
具有挑战性的问题,这些问题超过了浅层感知走漏,需要基于弥远凹凸文的复杂推理。

上图为 M3-Bench 基准的统计笼统,每个问题可能对应多种问题类型。
权臣优于基线模子

如上表所示,M3-Agent 在 M3-Bench-robot、M3-Bench-web 和 VideoMME-long 上均优于通盘基线模子。
具体而言,在 M3-Bench-robot 上,M3-Agent 比最强的基线模子 MA-LLM 提高了 6.3% 的准确率;在 M3-Bench-web 和 VideoMME-long 上,它离别比最强的基线模子 Gemini-GPT4o-Hybrid 逾越了 7.7% 和 5.3%。
揣摸团队在 M3-Bench 中针对不同问题类型,将 M3-Agent 与通盘基线进行了进一步评估。效果披露,M3-Agent 在东说念主类走漏和跨模态推理方面解析出色。
具体来说,与 M3-Bench-robot 上解析最好的基线 MA-LMM 比较,M3-Agent 在东说念主类走漏和跨模态推理方面离别进步了 4.2% 和 8.5%;
在 M3-Bench-web 上,M3-Agent 超过了顶尖基线 Gemini-GPT4o-Hybrid,在相应类别均离别得到了 15.5% 和 6.7% 的进步。
这些效果标明,M3-Agent 在保合手扮装一致性、深刻东说念主类走漏以及有用整合多模态信息方面具有超卓才调。
参考辘集:https://x.com/omarsar0/status/1956773240623235076
论文:https://www.arxiv.org/abs/2508.09736
代码:https://github.com/bytedance-seed/m3-agent
一键三连「点赞」「转发」「防御心」
宽待在批驳区留住你的念念法!
— 完 —
� � 但愿了解 AI 居品最新趋势?
量子位智库「AI 100」2025 上半年
「旗舰居品榜」和「立异居品榜」
给出最新参考� �
� � 点亮星标 � �
科技前沿进展逐日见开云(中国)Kaiyun·官方网站 - 登录入口
Powered by 开云(中国)Kaiyun·官方网站 - 登录入口 @2013-2022 RSS地图 HTML地图