视觉多模态 2026-09-23 · 次阅读
炬观 VL 1.3B
炬观 VL 1.3B 可结合图像与文本指令进行识别、理解和问答。产品矩阵标注模型规模 1.3B,参考资源规格 1.4GB / int4,实际占用会因运行框架和上下文配置而变。
核心能力
支持 OCR 与图像文字识别、文档解析与图文问答,以及移动应用或设备控制界面的可见元素理解。
适用场景
适用于工业 HMI 辅助、移动端图像问答、票据与表单预处理及现场巡检信息提取。
部署说明
准确度受图像清晰度、语言、排版和拍摄角度影响。建议针对目标材料建立测试集,关键字段保留人工确认。
上一篇没有了
下一篇没有了