同一画面,两种 Agent


人盯屏幕,盯不过来
20 路摄像头、三班倒,凌晨 2 点的装卸区和充电间盲区,巡检员根本覆盖不到。
传统方案换个场景就得重来
传统方案要一万多张手工标注的照片来训练。换厂区得重新标注,低光下 48 个违规案例有 45 个完全没检测到。
每个厂区从头来
采集、标注、训练、调参、上线,一个新厂区典型周期 8-12 周。经验无法复用,成本线性增长。
从 75% 到 96%:12 周的变化
不需要训练数据,从第一天起就能检测。之后在你的现场数据中持续学习,低光、遮挡、新违规类型,逐周覆盖。

75.2%
Accuracy
3
违规类型
无需训练数据,首日即可检测
AI 直接上线,检测安全帽、反光背心、区域闯入三类基础违规,不需要提前标注任何数据。

88.4%
Accuracy
7
违规类型
学会夜班低光场景,漏报清零
Agent 从现场积累的数据中学习夜班低光场景,自动调整检测策略。此前完全检测不到的低光画面,现在 93% 置信度检出。

95.8%
Accuracy
9
违规类型
复杂光照下 6 人全检出
覆盖安全帽、反光背心、区域闯入、分心行走、安全带等 9 类违规。复杂光照下 6 人全识别,1 人未戴安全帽准确标出。
基于 POC 实测
真实画质退化,实测帧
低光、模糊、远距离,传统方案依赖的图像细节消失后,AI 视觉检测仍然读懂整个场景。
LOW-LIGHT + NOISE低光 + 噪点
凌晨 4 点,传感器噪点吞掉所有边缘细节。
MOTION BLUR运动模糊
工人移动中,安全帽轮廓被拖影抹掉。
LOW-RES / DISTANCE低分辨率
远距离俯瞰,每个工人只有几十像素。
画质越差,差距越大
画面清晰时两种方案表现接近,画质退化时差距一下拉开。
45 / 48
低光违规案例中,传统方案有 45 个完全没检测到。我们的 AI 在同样条件下保持 94% 准确率。
VLM 零样本 vs 传统 CV
同样的仓库场景、同样的摄像头,两种方案的实测数据对比。
传统 CV (YOLO)
VLM 零样本
训练数据
13,782 张标注图
0(零样本)
安全帽检测 F1
0.91
0.92
低光环境 F1
0.53
0.94
可解释性
置信度分数
自然语言判据
部署方式
本地 GPU 训练 + 推理
API 调用(可私有化)
新厂区上线周期
8-12 周
首日可用
可落地、可合规、可预期成本
为采购与 IT 部门准备的关键事实。
私有化部署
支持本地或私有云部署,数据不出厂区。AI 推理通过国内合规通道运行,模型自主可控。
数据合规 · 权限可控
细粒度权限与审批,操作可审计,敏感数据可隔离。视频流不落盘,仅保留检测结果。
复用现有基础设施
对接现有 MES / 监控 / 告警系统,复用既有摄像头与网络,不需要换设备。
成本随使用递减
智能调度降低推理开销,检测策略优化后误报减少、人力负担持续下降,单位成本逐月递减。
上线 → 积累经验 → 持续改进
上线
对接现场摄像头,无需训练数据,首日即可检测 3-5 类违规。
积累经验
检测结果连同 AI 的判断依据自动回收,沉淀为厂区专属数据集。
持续改进
系统识别漏检模式并自动调整策略,准确率与覆盖面逐周攀升。