DeepGlint AI Studio

Glint-VL-Video-8B面向长视频理解的视觉语言模型

Glint-VL-Video-8B 是首个以“码流(Codec-Stream)”为视觉单元的视频理解大模型,基于自研并开源的 LLaVA-OneVision 技术体系训练,可在长时序视频中识别关键事件、定位发生区间并提取有效证据,适用于视频审核、内容检索与过程分析。

开源技术体系LLaVA-OneVision 2.0

开放研究与自研模型共筑技术底座

研究成果覆盖 VLM、视觉基座、多模态嵌入、多模态 RAG、人脸识别与三维视觉方向。选择研究方向后,可继续查看对应代码、论文与项目主页。

LLaVA-OneVision-1.5

训练测试数据集、训练代码和模型全开源的视觉语言大模型训练框架

ViCToR

利用视觉token重建提升多模态大模型的方法,提升多模态模型在精细视觉理解、图表与文档解析等任务上的表现

StreamingRVOS

基于大语言模型的流式参考视频分割方法,可对长视频进行实时、连续的指代目标分割,适用于视频分析、机器人感知等场景

全栈模型微调服务,让模型适配您的业务

LLaVA 社区LLaVA 社区是全球开源多模态人工智能领域的重要创新力量,持续推动视觉理解与大语言模型的深度融合。社区的重要贡献在于推动了“视觉指令微调(Visual Instruction Tuning)”技术路线的发展,使模型不仅能够识别图像内容,还能够围绕图片、文档和视频进行多轮问答、逻辑分析与任务执行。LLaVA 通过开放模型代码、训练方法、数据构建思路与评测体系,显著降低了多模态模型研究和应用开发的门槛,并为后续视觉语言模型在图像理解、OCR、图表分析、长视频理解、空间推理等方向的持续演进提供了重要基础。依托开放、可复现、可扩展的技术生态,LLaVA 社区正在加速多模态 AI 在智能客服、内容创作、教育、工业检测、机器人等场景中的创新应用。提供从基础训练、参数高效微调到知识蒸馏的全栈模型优化服务,并通过客观评测和生产部署形成完整闭环。数据留在客户现场,能力沉淀在客户模型中。

模型训练

围绕行业数据和目标任务构建训练集、训练配方与版本基线,支持 VLM 4B、8B 模型训练。

  • 数据治理与多模态标注
  • 训练过程监控与断点续训
  • 模型版本与实验记录

模型微调

采用 SFT、LoRA、QLoRA 等方式,让通用模型快速掌握客户任务、行业知识和输出规范。

  • 低成本参数高效微调
  • 私有盲测与 A/B 对比
  • 效果、成本与交付周期可控

模型蒸馏

将大模型知识和业务推理能力迁移到更小模型,兼顾效果、推理速度和私有化部署成本。

  • 支持 32B 以下 LLM 蒸馏
  • 量化编译与推理优化
  • 云端、私有环境与边缘部署

模型优化交付流程

  1. 01
    数据准备
  2. 02
    模型优化训练 / 微调 / 蒸馏
  3. 03
    评测与对齐
  4. 04
    部署与交付

把模型能力,交付到业务现场

城市治理依靠算法编排组合视频、图像与多模态能力;金融领域以云边端一体化重塑运营管控,并在本地完成材料智能处理。

Glint-VL-Video-8BGlint-VL-SE-8B

城市管理视觉智能

融合 CV 模型与多模态大模型,以“感知—理解—研判—预警—治理”为主线,将分散视图资源变成可检索、可研判、可预警的业务信息。

  • Video-8B 负责长视频事件理解、时序定位与证据提取
  • SE-8B 强化重点事件、人员车辆与细粒度属性识别
  • 云边协同,形成时空研判与风险主动发现闭环
了解城市管理方案
Glint-VL-BK-8B

智慧金融

融合 CV 模型与多模态大模型,配合边缘计算节点构建云边端一体化方案,为运营、安防、内控与个人金融四类业务提供统一能力支撑,助力降本增效与数字化转型。

  • BK-8B 持续理解网点、金库与办公楼物理空间
  • 关联人员行为、重点事件、发生区域与关键证据
  • 支持视频巡检、事件检索与过程分析
了解智慧金融方案

现在联系我们,打造您的企业专属大模型

告诉我们您的业务场景、数据条件与部署要求,由原厂团队为您规划模型微调、评测与私有化部署路径。