小参数视觉语言模型(VLM)在工业场景下的可用性评估报告
小参数视觉语言模型(VLM)在工业场景下的可用性评估报告
1. 评估目的与范围
目的:在有限算力(RTX 3060 12GB)条件下,评估小参数量 VLM/VLA 模型在工业安防/现场监管类场景的零样本可用性与上线可行性。
覆盖任务(来自实际业务提问模板):
- 工业仪表读数(指针表、液晶屏/数字表)
- 跌倒检测(Yes/No + 置信度 + 理由)
- 抽烟检测(是/否)
- 工位在岗与是否工作(JSON 输出,规则严格)
- 其他:烙铁距离、睡觉/玩手机/聊天/衣服颜色(来自对 Qwen-vl-plus 的快速验证)
2. 测试环境与资源约束
GPU:NVIDIA GeForce RTX 3060 12GB
驱动/CUDA:Driver 580.95.05 / CUDA 13.0
环境特点:单卡、显存 12GB 是硬约束——决定了2B~3B 级 VLM 更现实,以及推理精度(bf16/fp16)、KV cache、输入分辨率策略会直接影响可用性。
3. 模型选型依据
3.1 外部排行榜参考(<4B VLM)
引用了 OpenVLM Leaderboard(opencompass/open_vlm_leaderboard)中 <4B 的 Top10,选型思路是:优先小参数、综合榜单得分较高、并且可离线部署的模型。
3.2 实际下载清单(候选池)
已下载/准备测试的模型包括:Ovis-U1-3B、Ristretto-3B、SAIL-VL-1d5-2B、Qwen3-VL-2B-Thinking、LFM2-VL-3B、DeepSeek-VL 1.3B/ VL2 tiny、IBM Granite-Vision 2B 等。
从工程角度看,这个池子覆盖了:
- Qwen 系生态(Qwen3-VL-2B、Ovis 等)
- 边缘优化路线(LFM2-VL-3B)
- 更轻量级路线(DeepSeek tiny、1.3B)
4. 已完成测试与结果汇总(任务级)
4.1 工业仪表读数(关键业务任务)
被测模型:Qwen3-VL-2B-Instruct、LFM2-VL-3B
结论:两者在“仪表读数”任务上零样本不可上线,尤其是指针表基本不可用;液晶/数字表在清晰条件下有一定可行性,但可靠性不足。
证据要点:
- Qwen3-VL-2B:
- 对压力表能输出看似合理数值(如 15.6),但对“绝压表/温度计/气压类表盘”等出现格式不遵守(输出解释性文字)、单位/量程混乱、任务漂移。
- LFM2-VL-3B:
- 多次出现“把压力/气压读数答成温度(度)”或“同一句输出两个互相矛盾的值(20度.-20)”,并且对速度表答成“69千瓦”等,反映出:
- 图像语义理解有,但读数任务的结构化约束与量程推断能力不足
- 领域对齐失败:把表盘当成通用仪表,无法稳定区分量纲/单位/刻度体系
- 多次出现“把压力/气压读数答成温度(度)”或“同一句输出两个互相矛盾的值(20度.-20)”,并且对速度表答成“69千瓦”等,反映出:
上线判断:否
业务影响:仪表读数属于“数值正确性强约束”任务,一旦出错会造成误报/漏报甚至安全事故风险,必须走“专用化/可验证”路线。
4.2 跌倒检测
- Qwen3-VL-2B:8 张全对,准确率 100%
- LFM2-VL-3B:8 张对 7,准确率 87.5%,出现 1 张误判(“直立”被判断为摔倒)
解读:
- 这类任务是粗粒度语义分类,对 VLM 来说相对擅长;并且提示词输出结构简单(Yes/No+置信度+理由),可控性较好。
- LFM2 的误判提醒:上线仍需做阈值/拒答策略与边界样本补充(如“弯腰/蹲下/坐地/靠墙/摔倒遮挡”)。
上线建议:
- Qwen3-VL-2B 在当前样本集上表现很好,但样本量仍偏小(8 张),建议扩充到至少 200+ 覆盖现场多姿态再决定“可上线”。
4.3 抽烟检测
- Qwen3-VL-2B:9 张错 2,准确率 77.8%,特点:0 误报、2 漏检
- LFM2-VL-3B:9 张错 1,准确率 88.9%,特点:0 误报、1 漏检
解读:
- 两个模型都呈现“保守”倾向:误报低,但漏检偏高。
- 若用于监管抓拍,通常更关心“漏检”——因为漏检会直接放过违规行为。
- 说明零样本下,“手势+香烟/电子烟小目标+烟雾”对 VLM 仍是弱项,尤其在分辨率不足、遮挡、背光情况下。
上线建议:
- 若要“宁可少报也不冤枉人”,可以做辅助提醒;
- 若要“严格监管”,建议改为:VLM 只做复核解释,前级用专门的检测模型(小目标检测/关键点/手口区域检测)作为主判。
4.4 工位在岗与是否工作
- Qwen3-VL-2B:6 张正确 5,准确率 83.3%,问题:将“饮酒”误判成“喝水”
- LFM2-VL-3B:6 张全对,准确率 100%,且对“在岗/未在岗 + 是否工作”的规则遵守更稳定
解读:
- 这类任务本质是“场景理解 + 行为识别 + 规则推理”,比仪表读数更适合 VLM。
- LFM2 在这组样本里明显更稳,说明它在“办公/工位场景语义”上对齐更好。
- 但样本仍小(6 张),建议扩大,并加入“反光/阴影/屏幕里的人/海报/视频会议投影”等容易误判的负样本。
上线建议:
- 如果后续扩大样本仍保持低误判,可作为“软告警/辅助巡检”模块尝试灰度上线。
4.5 Qwen-vl-plus(在线/云模型)快速结论
测试显示:
- “烙铁距离”“指针读数”:不行
- “睡觉/玩手机/聊天/衣服颜色”:行
这与上面总体规律一致:精确几何/数值类任务弱,语义行为类任务强。
5. 总体结论(是否可上线)
5.1 结论总览(端侧放大模型参数路线)
| 任务 | 当前结论 | 后续技术路线与上线判断 |
|---|---|---|
| 指针/仪表读数(强数值约束) | 小参数模型不可上线 | 在端侧条件允许范围内,优先提升 VLM 参数规模(≥7B 级)后再行复测;若参数放大后仍不稳定,再评估是否引入专用视觉几何模块 |
| 跌倒检测 | 表现稳定,有明显潜力 | 优先通过增大模型参数验证泛化能力上限,在不引入专用检测模型的前提下,评估是否可直接作为端侧主判模型 |
| 抽烟检测 | 小模型偏保守、存在漏检 | 重点观察模型规模扩大后对小目标与细粒度行为的识别提升幅度,暂不以扩充数据集为主要手段 |
| 工位在岗 / 是否工作 | 结果稳定、规则遵守度高 | 在更大参数模型下有望直接达到可上线水平,适合作为端侧多模态规则判断核心任务 |
总体判断:
当前结论仅反映 2B–3B 级 VLM 在端侧条件下的能力下限,并不代表端侧 VLM 在上述任务上的能力上限。
5.2 当前阶段模型结论(作为基线参考)
- LFM2-VL-3B
- 在“工位在岗 / 是否工作”“抽烟检测”等规则驱动、语义判断型任务中表现更稳定
- 在跌倒检测中存在个别误判,推测与模型容量不足导致的姿态理解歧义有关
- Qwen3-VL-2B
- 在跌倒检测任务中零样本表现突出
- 在工位与抽烟任务中对细粒度行为区分能力有限
- 共同结论
- 在 2B–3B 参数规模下,两者在工业指针仪表读数任务上均未达到可用阈值
- 该问题更可能源于模型容量与多模态对齐能力不足,而非单纯的数据规模问题
5.3 技术路线明确声明(端侧优先)
本项目明确采用 “端侧优先 + 模型能力上探” 的技术路线,而非传统的“大数据集 + 小模型微调”路径。
后续工作重点为:
-
在端侧算力允许范围内,系统性提升 VLM 参数规模
- 优先测试 7B / 8B / 9B 级 视觉语言模型
- 对比其在 读数、姿态、细粒度行为、规则遵守 等任务上的能力跃迁情况
-
以当前 2B–3B 结果作为能力下限基线
- 本轮测试结论不作为“否定 VLM 路线”的依据
- 仅用于明确:小模型在工业复杂场景中的能力边界
-
是否引入专用视觉算法,将作为“参数放大后仍失败”的兜底方案
-
即:
先放大模型,再谈专用化;先验证上限,再决定拆系统
-
5.4一句话总结(端侧视角)
当前测试表明,2B–3B 级端侧 VLM 已能较好覆盖跌倒检测、工位行为判断等语义任务,但在工业仪表读数等强数值约束场景中能力不足。
项目将继续沿 端侧模型参数放大路线 验证能力上限,在更大模型测试完成前,不对 VLM 工业落地能力做最终否定结论。
更多推荐


所有评论(0)