小参数视觉语言模型(VLM)在工业场景下的可用性评估报告


1. 评估目的与范围

目的:在有限算力(RTX 3060 12GB)条件下,评估小参数量 VLM/VLA 模型在工业安防/现场监管类场景的零样本可用性上线可行性

覆盖任务(来自实际业务提问模板):

  1. 工业仪表读数(指针表、液晶屏/数字表)
  2. 跌倒检测(Yes/No + 置信度 + 理由)
  3. 抽烟检测(是/否)
  4. 工位在岗与是否工作(JSON 输出,规则严格)
  5. 其他:烙铁距离、睡觉/玩手机/聊天/衣服颜色(来自对 Qwen-vl-plus 的快速验证)

2. 测试环境与资源约束

GPU:NVIDIA GeForce RTX 3060 12GB
驱动/CUDA:Driver 580.95.05 / CUDA 13.0
环境特点:单卡、显存 12GB 是硬约束——决定了2B~3B 级 VLM 更现实,以及推理精度(bf16/fp16)、KV cache、输入分辨率策略会直接影响可用性。


3. 模型选型依据

3.1 外部排行榜参考(<4B VLM)

引用了 OpenVLM Leaderboard(opencompass/open_vlm_leaderboard)中 <4B 的 Top10,选型思路是:优先小参数、综合榜单得分较高、并且可离线部署的模型

3.2 实际下载清单(候选池)

已下载/准备测试的模型包括:Ovis-U1-3B、Ristretto-3B、SAIL-VL-1d5-2B、Qwen3-VL-2B-Thinking、LFM2-VL-3B、DeepSeek-VL 1.3B/ VL2 tiny、IBM Granite-Vision 2B 等。
从工程角度看,这个池子覆盖了:

  • Qwen 系生态(Qwen3-VL-2B、Ovis 等)
  • 边缘优化路线(LFM2-VL-3B)
  • 更轻量级路线(DeepSeek tiny、1.3B)

4. 已完成测试与结果汇总(任务级)

4.1 工业仪表读数(关键业务任务)

被测模型:Qwen3-VL-2B-Instruct、LFM2-VL-3B
结论:两者在“仪表读数”任务上零样本不可上线,尤其是指针表基本不可用;液晶/数字表在清晰条件下有一定可行性,但可靠性不足。

证据要点

  • Qwen3-VL-2B:
    • 对压力表能输出看似合理数值(如 15.6),但对“绝压表/温度计/气压类表盘”等出现格式不遵守(输出解释性文字)、单位/量程混乱任务漂移
  • LFM2-VL-3B:
    • 多次出现“把压力/气压读数答成温度(度)”或“同一句输出两个互相矛盾的值(20度.-20)”,并且对速度表答成“69千瓦”等,反映出:
      • 图像语义理解有,但读数任务的结构化约束与量程推断能力不足
      • 领域对齐失败:把表盘当成通用仪表,无法稳定区分量纲/单位/刻度体系

上线判断:否
业务影响:仪表读数属于“数值正确性强约束”任务,一旦出错会造成误报/漏报甚至安全事故风险,必须走“专用化/可验证”路线。


4.2 跌倒检测

  • Qwen3-VL-2B:8 张全对,准确率 100%
  • LFM2-VL-3B:8 张对 7,准确率 87.5%,出现 1 张误判(“直立”被判断为摔倒)

解读

  • 这类任务是粗粒度语义分类,对 VLM 来说相对擅长;并且提示词输出结构简单(Yes/No+置信度+理由),可控性较好。
  • LFM2 的误判提醒:上线仍需做阈值/拒答策略与边界样本补充(如“弯腰/蹲下/坐地/靠墙/摔倒遮挡”)。

上线建议

  • Qwen3-VL-2B 在当前样本集上表现很好,但样本量仍偏小(8 张),建议扩充到至少 200+ 覆盖现场多姿态再决定“可上线”。

4.3 抽烟检测

  • Qwen3-VL-2B:9 张错 2,准确率 77.8%,特点:0 误报、2 漏检
  • LFM2-VL-3B:9 张错 1,准确率 88.9%,特点:0 误报、1 漏检

解读

  • 两个模型都呈现“保守”倾向:误报低,但漏检偏高
  • 若用于监管抓拍,通常更关心“漏检”——因为漏检会直接放过违规行为。
  • 说明零样本下,“手势+香烟/电子烟小目标+烟雾”对 VLM 仍是弱项,尤其在分辨率不足、遮挡、背光情况下。

上线建议

  • 若要“宁可少报也不冤枉人”,可以做辅助提醒;
  • 若要“严格监管”,建议改为:VLM 只做复核解释,前级用专门的检测模型(小目标检测/关键点/手口区域检测)作为主判。

4.4 工位在岗与是否工作

  • Qwen3-VL-2B:6 张正确 5,准确率 83.3%,问题:将“饮酒”误判成“喝水”
  • LFM2-VL-3B:6 张全对,准确率 100%,且对“在岗/未在岗 + 是否工作”的规则遵守更稳定

解读

  • 这类任务本质是“场景理解 + 行为识别 + 规则推理”,比仪表读数更适合 VLM。
  • LFM2 在这组样本里明显更稳,说明它在“办公/工位场景语义”上对齐更好。
  • 但样本仍小(6 张),建议扩大,并加入“反光/阴影/屏幕里的人/海报/视频会议投影”等容易误判的负样本。

上线建议

  • 如果后续扩大样本仍保持低误判,可作为“软告警/辅助巡检”模块尝试灰度上线。

4.5 Qwen-vl-plus(在线/云模型)快速结论

测试显示:

  • “烙铁距离”“指针读数”:不行
  • “睡觉/玩手机/聊天/衣服颜色”:行

这与上面总体规律一致:精确几何/数值类任务弱,语义行为类任务强


5. 总体结论(是否可上线)

5.1 结论总览(端侧放大模型参数路线)

任务当前结论后续技术路线与上线判断
指针/仪表读数(强数值约束)小参数模型不可上线在端侧条件允许范围内,优先提升 VLM 参数规模(≥7B 级)后再行复测;若参数放大后仍不稳定,再评估是否引入专用视觉几何模块
跌倒检测表现稳定,有明显潜力优先通过增大模型参数验证泛化能力上限,在不引入专用检测模型的前提下,评估是否可直接作为端侧主判模型
抽烟检测小模型偏保守、存在漏检重点观察模型规模扩大后对小目标与细粒度行为的识别提升幅度,暂不以扩充数据集为主要手段
工位在岗 / 是否工作结果稳定、规则遵守度高在更大参数模型下有望直接达到可上线水平,适合作为端侧多模态规则判断核心任务

总体判断
当前结论仅反映 2B–3B 级 VLM 在端侧条件下的能力下限并不代表端侧 VLM 在上述任务上的能力上限


5.2 当前阶段模型结论(作为基线参考)

  • LFM2-VL-3B
    • 在“工位在岗 / 是否工作”“抽烟检测”等规则驱动、语义判断型任务中表现更稳定
    • 在跌倒检测中存在个别误判,推测与模型容量不足导致的姿态理解歧义有关
  • Qwen3-VL-2B
    • 在跌倒检测任务中零样本表现突出
    • 在工位与抽烟任务中对细粒度行为区分能力有限
  • 共同结论
    • 2B–3B 参数规模下,两者在工业指针仪表读数任务上均未达到可用阈值
    • 该问题更可能源于模型容量与多模态对齐能力不足,而非单纯的数据规模问题

5.3 技术路线明确声明(端侧优先)

本项目明确采用 “端侧优先 + 模型能力上探” 的技术路线,而非传统的“大数据集 + 小模型微调”路径。

后续工作重点为:

  1. 在端侧算力允许范围内,系统性提升 VLM 参数规模

    • 优先测试 7B / 8B / 9B 级 视觉语言模型
    • 对比其在 读数、姿态、细粒度行为、规则遵守 等任务上的能力跃迁情况
  2. 以当前 2B–3B 结果作为能力下限基线

    • 本轮测试结论不作为“否定 VLM 路线”的依据
    • 仅用于明确:小模型在工业复杂场景中的能力边界
  3. 是否引入专用视觉算法,将作为“参数放大后仍失败”的兜底方案

    • 即:

      先放大模型,再谈专用化;先验证上限,再决定拆系统


5.4一句话总结(端侧视角)

当前测试表明,2B–3B 级端侧 VLM 已能较好覆盖跌倒检测、工位行为判断等语义任务,但在工业仪表读数等强数值约束场景中能力不足。
项目将继续沿 端侧模型参数放大路线 验证能力上限,在更大模型测试完成前,不对 VLM 工业落地能力做最终否定结论。

更多推荐