SenseNova-MARS 是商汤科技(SenseTime)推出的开源多模态自主推理模型,属于视觉语言模型(VLM)范畴,提供 8B 和 32B 两个参数版本。该模型的核心设计理念是将视觉理解能力与知识检索、逻辑推理深度耦合,构建能够完成复杂闭环任务的智能体式架构。通过 Agentic 架构设计,SenseNova-MARS 将视觉输入、文本理解、信息搜索与工具调用集成于一体,使模型不仅具备跨模态感知能力,更拥有类似智能体的任务规划与自主执行能力。在多项开源多模态基准测试中,该模型在图文搜索与细粒度视觉理解方面表现突出,标志着多模态大模型向自主化、复杂推理方向迈出重要一步。其开源目标是为研究者和开发者提供一个可扩展的自主推理平台,推动多模态 Agent 在真实场景中的落地探索。
架构示意图:SenseNova-MARS 多模态自主推理模型与视觉搜索能力示意(原文配图说明)
主要功能一览
多模态搜索推理:融合视觉输入与文本输入进行跨模态信息检索,动态整合图像搜索、文本搜索等外部知识来源,支持多跳推理闭环任务。
动态视觉细节分析:能够对 4K/8K 高分辨率图像中的微小元素(如占比不足 5% 的标识或文字)进行自动裁剪、放大和深度分析。
自主工具调用:在复杂任务执行过程中,模型可自动规划并调用图像裁剪、文本检索、图像检索等工具,无需外部指令干预即可完成多步骤流程。
Agent 式任务执行:内置任务规划机制,像智能体一样分解复杂任务,协调推理与检索步骤,最终产出解答。
双版本灵活部署:8B 版本适配算力受限环境,32B 版本面向高算力场景,提供更强的逻辑推理与细节理解能力。
知识增强推理:将实时搜索能力与视觉认知紧密集成,在推理过程中借助外部知识扩展理解的广度与深度。
高性能基准表现:在 MMSearch、HR-MMSearch、FVQA、InfoSeek 等多模态综合基准测试中取得较高综合得分,表现出稳定的性能。
技术原理剖析
Agentic VLM 架构
采用 Agentic 视觉语言模型架构,将视觉输入、语言理解与工具调用整合为统一的内在逻辑体系,通过迭代推理与工具执行循环来完成复杂任务。
多模态集成机制
核心设计了动态融合图像信息与文本信息的机制,使视觉输入与文本查询共同影响推理路径与最终输出结果。
工具调用与执行策略
推理过程中,模型可自主选择执行文本搜索、图像搜索、图像裁剪或输出最终答案等操作,每一步均由内部策略自动规划。
BN-GSPO 强化学习优化
利用 Batch-Normalized Group Sequence Policy Optimization(BN-GSPO)算法对工具调用与推理策略进行训练,提升多工具协同的稳定性与有效性。
两阶段训练流程
首先进行有监督冷启动训练,使模型掌握基本推理与工具调用范式;随后通过强化学习方法进一步提升策略稳定性与推理深度。
结构化动作空间
将工具使用行为抽象为结构化动作,以规范化交互模式确保各类操作在推理链路中统一执行。
自动化数据合成
训练阶段引入自动生成的高复杂度场景数据,强化模型在多步骤推理与跨模态理解方面的能力。
使用指南
模型下载:访问官方 GitHub 仓库或 HuggingFace 模型库,下载对应参数规模(8B 或 32B)的模型权重与代码。
环境配置:在本地或云端配置 Python 环境及深度学习框架(如 PyTorch),安装模型运行所需的依赖包。
加载模型与工具接口:在代码中加载 SenseNova-MARS 模型,同时初始化图像裁剪、文本搜索、图像搜索等工具接口。
输入数据处理:按模型规范对图像和文本输入进行预处理(如图像缩放、文本 tokenization 等)。
执行推理:调用模型推理接口传入多模态输入,模型将自动规划推理步骤与工具使用计划。
结果解析:根据模型返回的推理结果与工具调用记录,解析最终答案并处理相应输出。
项目与资源地址
GitHub 仓库:SenseNova-MARS 官方 GitHub 仓库
HuggingFace 模型库(32B):SenseNova-MARS 32B
HuggingFace 模型库(8B):SenseNova-MARS 8B
技术论文(arXiv):SenseNova-MARS 技术论文
典型应用场景
体育赛事分析:在赛事影像中识别微小标识与人物特征,结合检索信息构建运动员成绩对比与赛况分析。
商业情报获取:通过对企业峰会或产品展示图片的视觉理解与文本搜索,自动提取企业背景、产品参数及行业资讯。
新闻事实验证:在新闻图片中识别人物、地点或事件细节,结合跨媒体搜索辅助记者或调查者验证报道真实性。
学术图像理解:分析复杂图表与可视化数据,自动检索相关研究背景文献,加速学术综述与知识整合。
智能地理导览:识别地标图像并结合搜索结果提供文化历史背景信息,提升旅行体验。
医疗影像辅助分析:辅助识别医疗影像中的重要细节,结合医学知识库检索支持初步诊断参考。
现场安防监控:分析高分辨率监控画面中的细小目标,自动识别潜在风险事件并补充背景信息。
教育辅助工具:对教学视觉资料进行深入解析并检索相关知识,为学生提供多模态学习参考。
常见问题解答
SenseNova-MARS 适合哪些用户?
适合 AI 研究者、开发者、数据科学家以及对多模态推理与视觉语言 Agent 感兴趣的技术人员,尤其适用于需要处理视觉与文本混合推理任务的团队和项目。
属于通用模型还是垂直领域模型?
属于通用多模态视觉语言模型,兼顾视觉理解与知识检索,能力可覆盖多个行业场景,不局限于单一垂直领域。
是否开源,支持商用吗?
已向社区开源,代码及权重可在 GitHub 和 HuggingFace 获取。具体商业使用需根据开源协议(如 MIT 等)及相关依赖工具的许可条款进行评估。
硬件有哪些基本要求?
部署需要支持深度学习推理的 GPU 环境(如 NVIDIA GPU 及 CUDA)。8B 版本资源需求相对较低,32B 版本适合高算力环境运行。
与其他通用大模型相比有何定位差异?
与侧重自然语言生成的大模型不同,SenseNova-MARS 强调视觉语言融合与动态工具调用,核心目标是实现视觉输入与知识检索的闭环跨模态推理。
适合个人用户或初学者吗?
适合具备一定机器学习和深度学习基础的用户。初学者需掌握基本模型部署与推理代码集成技能才能有效使用。
主要应用边界是什么?
在高分辨率视觉理解与跨模态推理方面表现突出,但在超长对话生成、纯语言创作等任务上优势不如专用大语言模型。特定领域任务仍需结合领域知识与专用工具。
