JumpScore · 高频动作定位
- 74.9
- 30.1
- 39.6
- 11.0
- 13.1
- 2.1
面向长视频理解、时间定位与空间推理的 8B 级视觉语言模型
Glint-VL-Video-8B 是一款统一处理图像与视频的 8B 级视觉语言模型,能在同一套架构下完成视频问答、事件时间定位、空间推理、视频目标分割跟踪等任务。它的核心能力是把一段很长的视频"看懂、找到、说清楚"——既能回答视频里发生了什么,也能精确指出事件发生在第几秒、目标在画面里的哪个位置。
模型的关键设计是 codec-stream(编解码器流式)输入:直接读取视频压缩流的 I/P 帧结构、运动向量与残差信号,把有限的视觉 token 预算集中在真正有事件、有动作的画面上,从而在长视频和高频重复动作上获得显著优势。
把压缩流当作连续信号处理,按事件密度分配 token,而不是机械地均匀抽帧——长视频里"该看的地方"看得更清。
在高频、密集重复的动作(如跳绳、健身)中能定位到正确的那一次发生时刻,这是大多数视频模型做不到的细粒度能力。
视频问答、时间定位、空间推理、目标跟踪共享同一套参数,不需要为每类任务单独部署模型。
codec-stream 只作用于视觉编码器输入侧,对连接器、语言模型和下游流程零侵入,便于集成进现有视频理解管线。
对比对象为 8B 级开源模型。查看 Glint-VL-Video-8B 与五个同级模型在各 Benchmark 上的相对位置。
Benchmark 得分范围 0 到 100,数值越高越好。
给一段会议录像、监控片段或教学视频,模型能回答"视频里发生了什么"、"主角说了哪些要点"。在 VideoEval-Pro、VideoMME-v2 等真实长视频评测上均达到 8B 同级别最优。
给出一句自然语言描述(如"人把杯子放到桌子上的时刻"),模型返回精确的时间戳。在 Charades-STA、ActivityNet、QVHighlights 等时间定位基准上显著领先 Qwen3-VL-8B。
针对跳绳、健身操、生产流水线等动作高度重复的场景,能区分"第几次"发生——例如 JumpScore 基准上达到 74.9 mAP,远超同级别模型的 30.1。适合运动训练分析、质检计数等。
回答"物体在哪个方位"、"哪边是左/右/前/后"、"几个物体"等空间问题。在 CrossPoint、TraceSpatial-3D 等空间基准上大幅领先同级别模型。
给定一段文字描述,模型在视频全程分割并跟踪对应目标,保持身份一致。适用于视频编辑辅助、目标追踪、机器人感知。在 DAVIS、MeViSU、ReVOS 上平均 J&F 达 48.0,较 Qwen3-VL-8B 提升 +15.6。
保留扎实的图片能力,在 V*-Bench 上达到 85.9(8B 同级别最优),并支持文档、图表、计数等常见图文任务。