行业资讯

3B 参数碾压 Gemini Pro:VLX-Seek开源视觉模型凭什么这么强大?

发布时间:2026/8/20 10:30:34
3B 参数碾压 Gemini Pro:VLX-Seek开源视觉模型凭什么这么强大? 当机器人「看到」了一个杯子它能分清是哪一个杯子吗这看起来是个简单的问题却是当前多模态大模型VLM面临的核心难题之一。英伟达、Google 等巨头的方案依赖云端推理、大参数暴力堆叠而来自 Om AI Lab 的开源项目VLX-Seek用一种截然不同的架构思路给出了一个更优雅的答案。01VLX-Seek 开源视觉模型PART 开源视觉模型VLX-Seek是 Om AI Lab 开源的面向端侧具身视觉embodied vision的细粒度感知视觉语言模型。简单说它不只是「看图说话」而是能精确告诉你图里的目标在哪儿、是哪个、有几个、不存在时也不乱猜。比如如下例子大街上骑电动车的人会把骑自行车的人给屏蔽掉纸盒上面的水瓶会屏蔽不在纸盒上面的水瓶它专为这样的场景设计模型不仅要理解图像中有什么还要识别相关目标在哪里、哪个实例是被指代的以及在目标不存在时如何正确应答。项目已经开源可以直接在 GitHub 上面查看。02为什么现有 VLM 不够用PART 视觉的问题我们先来理解问题所在。主流 VLM比如 GPT-4o、Gemini、Qwen-VL非常擅长全局语义理解——描述图片内容、回答视觉问题、理解复杂指令。但精确定位是另一回事。精确定位要求模型不仅知道「这是什么」还要判断「它在哪里」「它的边界在哪里」「有几个实例」以及「哪个目标匹配给定的描述」。传统方案的通病让语言模型生成坐标绝大多数支持定位的 VLM会让语言模型直接输出边界框坐标比如 [x1, y1, x2, y2]。这看起来简单但实际上很脆弱——坐标不是自然语言。LLM 擅长生成单词、短语和句子而不是精确的数字序列。一个边界框包含四个坐标多个目标就会变成更长的数字序列。一旦坐标顺序、归一化范围、标点格式或目标数量出错结果就可能无法解析或者预测框明显偏离目标。多目标检测会进一步放大这个问题。10 个目标 40 个坐标 token生成路径越长漏检和格式出错的概率就越高推理速度也越慢——这对机器人、无人机等对延迟敏感的端侧设备来说是致命的。停在车位上的汽车03把「生成坐标」变成「选区域」PART VLX-Seek 的核心创新这是 VLX-Seek 最关键的设计哲学用一句话总结不让模型凭空生成坐标而是让模型从候选区域里「选」目标。VLX-Seek 将基于目标的感知任务从坐标生成重新定义为特征检索与区域引用。模型不再只接收全图视觉 token 和文本 token还额外接收一组可寻址的区域 tokenregion token。每个区域 token 对应图像中的一个候选区域模型可以像引用文本实体一样引用这些视觉区域。比如输入中包含 region0、region1、region2 这样的区域索引当用户问「穿红衣服的人在哪里」模型不需要生成坐标只需要输出对应的区域编号——region2。这种方式更符合 LLM 的能力边界。语言模型天然擅长比较、选择、引用、解释和推理。通过将候选区域编码为可处理的 token定位任务被纳入语言模型更擅长的工作方式中。输出格式的变化带来了四重直接收益更稳定输出区域索引而非容易出错的精确坐标数字更清晰先理解描述再匹配区域最后输出可解析的引用更快速多目标场景下区域索引比长坐标序列短得多更统一检测、指代理解、区域 VQA、计数等任务统一在同一框架下04把三步推理流水线PART VLX-Seek 推理过程Step 1候选区域生成OPN系统首先使用「全能提案网络」Omni Proposal Network, OPN检索图像中可能包含前景目标的区域。这一步不负责做最终的类别判断而是尽可能识别更多有意义的目标区域为后续语言模型的推理提供显式的视觉候选。OPN 与 VLM 主干是解耦的实际应用中可以替换为其他检测器或者直接使用人工指定的感兴趣区域。Step 2区域编码HFRE候选框只是几何范围还不知道框里是什么。cite index13-1VLX-Seek 使用混合细粒度区域编码器HFRE提取候选框的区域级视觉特征并将这些特征投影到 LLM 的 embedding 空间中。经过这一步区域不再只是一组坐标而成为语言模型可以读取、比较和引用的视觉表示。HFRE 的核心设计是双路并行语义通路保留基础 VLM 的视觉-语言对齐能力和高层图像理解细节通路提供更高分辨率的局部细节感知空间结构、边界、纹理和小目标另外SimpleFP 模块补充了多尺度视觉特征帮助模型同时处理大物体和小目标。Step 3LLM 基于区域 token 推理模型输入不再只包含全局图像 token 和文本 token还包含编号的区域 token。用户用自然语言描述目标模型通过区域索引完成定位和回答。输出示例...json{The groundpeople/groundobjectregion2region10/object are dancing.}这表明文本中的「people」对应图像中的 region2 和 region10。输出紧凑、易解析且越是多目标场景相比坐标生成方案的优势越明显。05支持哪些任务PART VLX-Seek 任务支持VLX-Seek 支持一系列以区域为中心的感知任务063B 参数跑赢英伟达、谷歌PART VLX-Seek 性能数据以下是 VLX-Seek-3B 在主要基准上的表现与行业顶级模型的对比通用目标检测COCO mAPVLX-Seek-3B 在 COCO 目标检测上达到 45.3 mAP超过 Qwen2.5-VL-7B 的 17.7 和 Gemini 3.1 Pro 的 41.4。这说明 VLX-Seek 不只是在语言推理上更强而是真正解决了 VLM 的区域级定位弱点。开放词汇检测OVDEvalVLX-Seek-3B 在 OVDEval 上达到 43.7。OVDEval 的挑战在于要求模型不仅识别开放类别还要处理更复杂的语言标签和困难负样本——即区分「真正匹配描述的目标」与「看起来相似但实际不匹配的目标」。指代表达理解RefCOCO 系列VLX-Seek-3B 在 RefCOCO 系列上平均得分 88.7高于 Gemini 3 Pro 的 84.1 和 Qwen3-VL-8B 的 88.2。这说明 VLX-Seek 不只能定位普通类别目标还能理解更复杂的自然语言描述。目标计数PixMo-CountVLX-Seek-3B 在 PixMo-Count 上达到 85.0超过 Gemini 2.5 Pro 的 73.8。VLX-Seek 的优势在于先检测实例再聚合计数「先找到再数」比让模型凭整体印象估算数量可靠得多。VLX-Seek 1.5更进一步VLX-Seek 1.5 还引入了目标幻觉指标Object Hallucination专门衡量模型是否会对不存在的目标产生误报。在 RefDrone 目标幻觉评测中VLX-Seek 1.5 的 FP/GT 为 18而 LocateAnything-3B 为 71.3——同等条件下VLX-Seek 1.5 的误报率显著更低。07增强感知不损失通用能力PART VLX-Seek两阶段训练VLX-Seek 采用两阶段训练策略目标是在增强细粒度感知能力的同时尽量减少对原始 VLM 通用能力的损害。第一阶段区域-语言对齐冻结 VLM 主要参数专注训练 HFRE、区域-语言连接器和新增的特殊 token让模型先学会「区域 token 对应什么」。第二阶段感知指令微调引入检测、REC、区域 captioning、区域推理、计数、OCR 等任务同时混入通用 VLM 指令数据防止灾难性遗忘并加入拒绝样本让模型在目标不存在时能够正确回答「不存在」而非强行指向某个区域。易燃易爆物08为什么这对物理 AI 很重要PART VLX-Seek重要性传统 VLM 的工作流摄像头拍照 → 上传云端 → 等待推理 → 返回结果。这套批处理模式有明显短板高延迟、依赖带宽、隐私风险大而且把物理世界的连续感知切割成了一帧帧静态快照。VLX-Seek 的设计哲学正是为了对抗这些问题较小的模型和更快的推理意味着更低的部署成本。对于端侧具身系统来说模型越轻所需算力和内存越低功耗越可控对高端 GPU 或云端推理的依赖越小。这不仅降低了硬件和推理成本还减少了边云传输带来的延迟、带宽占用和隐私风险。更重要的是具身系统在行动之前必须有稳定的空间锚点——它需要知道目标在哪里、是哪一个、是否仍然存在以及它与周围环境的关系。VLX-Seek 正好填补了区域级感知的这个空缺能够为跟随、避障、检测、抓取、导航和多轮交互提供清晰的目标位置和视觉证据。监控摄像头、无人机、机器人、机器狗、移动设备和巡检系统这些端侧设备真正需要的不是云上跑满分的超大模型而是一个在有限算力、内存和功耗预算下能长期稳定运行的感知模块。09如何上手使用PART VLX-Seek实战获取模型​ 模型已在 HuggingFace 开放 ...json { # 3B 版本推荐入门 huggingface-cli download omlab/VLX-Seek-1.5-3B # 10B 版本更强性能 huggingface-cli download omlab/VLX-Seek-1.5-10B 参考项目 ...json { git clone https://github.com/om-ai-lab/VLX-Seek.git cd VLX-Seek ​具体推理脚本和环境配置详见项目 README模型与主流推理框架transformers兼容。10项目对比PART VLX-Seek对比同类模型11小结PART VLX-Seek总结VLX-Seek 的价值不在于「更大更强」而在于用架构创新解决了一个被长期忽视的问题让 VLM 真正能够「看清细节」而不只是「理解大意」。区域引用代替坐标生成HFRE 双路编码加上端到端的两阶段训练——这套组合拳让一个 3B 的小模型在多项定位基准上超过了 Gemini Pro 和 Qwen-VL 7B 级别的大模型。对于关注具身智能、机器人视觉、安防感知、无人机巡检等方向的开发者来说VLX-Seek 是一个值得认真研究的开源项目。更多transformerVITswin tranformer 参考头条号人工智能研究所 v号人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程