LLaVA-OneVision 2.0
统一图像视频的全帧率视觉语言大模型
Glint-VL-Video-8B 是首个以“码流(Codec-Stream)”为视觉单元的视频理解大模型,基于自研并开源的 LLaVA-OneVision 技术体系训练,可在长时序视频中识别关键事件、定位发生区间并提取有效证据,适用于视频审核、内容检索与过程分析。
开源技术体系:LLaVA-OneVision 2.0
研究成果覆盖 VLM、视觉基座、多模态嵌入、多模态 RAG、人脸识别与三维视觉方向。选择研究方向后,可继续查看对应代码、论文与项目主页。
应用MLLM-as-a-Judge机制通过软匹配分数进行难负样本挖掘,实现更精细的跨模态语义对齐的通用多模态嵌入模型
多模态大语言模型的通用嵌入学习框架,应用文本判别知识蒸馏与对比学习两阶段训练并解决假负样本干扰
一种多模态交错文档转换范式,能融合真实文本与合成文本构建大规模训练数据形成多模态图文交错数据集
提升图文预训练模型组合理解能力的对齐框架,通过自蒸馏缓解灾难性遗忘并引入图文接地对比损失,增强模型对组合关系的理解
自适应融合原始和生成文本的图文预训练方法,提升CLIP类模型在噪声数据和零样本检索任务上的鲁棒性与泛化能力
基于后Transformer架构RWKV的视觉-语言表征学习模型,兼顾Transformer的并行训练效率与RNN的高效推理特性
应用图像语义平衡策略缓解迁移偏差,高效的将大型视觉语言模型的知识迁移至小模型CLIP蒸馏方法
面向文本行人检索的跨模态对齐框架,可应用于安防监控、跨摄像头行人搜索等场景
面向文档检索增强生成 (RAG) 系统的综合评测基准,贴近真实场景的测试集与评估体系,可用于全面衡量文档级RAG的检索与生成质量
基于重力-视图坐标系的世界基准人体运动恢复方法,可从单目视频中稳定恢复带有绝对地面位置的三维人体运动,适用于动作捕捉、AR/VR等场景
基于扩散自回归模型的流式运动生成框架,可应用于游戏、动画、虚拟人等实时动作生成场景
利用视频扩散模型场景先验进行辐射场重建的统一框架,提升稀疏视图下的三维重建鲁棒性,适用于AR/VR内容创建与数字孪生
利用二维运动数据提升三维运动生成的方法,仅有2D标注的情况下生成多样化三维动作,降低3D动作数据的采集成本
二维数据预训练实现单目多视图三维运动恢复的框架,降低动作捕捉对昂贵设备的依赖
由 LLaVA 社区LLaVA 社区是全球开源多模态人工智能领域的重要创新力量,持续推动视觉理解与大语言模型的深度融合。社区的重要贡献在于推动了“视觉指令微调(Visual Instruction Tuning)”技术路线的发展,使模型不仅能够识别图像内容,还能够围绕图片、文档和视频进行多轮问答、逻辑分析与任务执行。LLaVA 通过开放模型代码、训练方法、数据构建思路与评测体系,显著降低了多模态模型研究和应用开发的门槛,并为后续视觉语言模型在图像理解、OCR、图表分析、长视频理解、空间推理等方向的持续演进提供了重要基础。依托开放、可复现、可扩展的技术生态,LLaVA 社区正在加速多模态 AI 在智能客服、内容创作、教育、工业检测、机器人等场景中的创新应用。提供从基础训练、参数高效微调到知识蒸馏的全栈模型优化服务,并通过客观评测和生产部署形成完整闭环。数据留在客户现场,能力沉淀在客户模型中。
围绕行业数据和目标任务构建训练集、训练配方与版本基线,支持 VLM 4B、8B 模型训练。
采用 SFT、LoRA、QLoRA 等方式,让通用模型快速掌握客户任务、行业知识和输出规范。
将大模型知识和业务推理能力迁移到更小模型,兼顾效果、推理速度和私有化部署成本。
模型优化交付流程
城市治理依靠算法编排组合视频、图像与多模态能力;金融领域以云边端一体化重塑运营管控,并在本地完成材料智能处理。
融合 CV 模型与多模态大模型,以“感知—理解—研判—预警—治理”为主线,将分散视图资源变成可检索、可研判、可预警的业务信息。
融合 CV 模型与多模态大模型,配合边缘计算节点构建云边端一体化方案,为运营、安防、内控与个人金融四类业务提供统一能力支撑,助力降本增效与数字化转型。
告诉我们您的业务场景、数据条件与部署要求,由原厂团队为您规划模型微调、评测与私有化部署路径。