Skip to content

Latest commit

 

History

History
56 lines (41 loc) · 2.74 KB

File metadata and controls

56 lines (41 loc) · 2.74 KB

生产规模验证案例

本案例来自一次私有六分类全量运行,但不公开图片、模型权重、本机路径或数据集名称。目的不是披露业务数据,而是证明人工门控并非只在公开合成样例上运行,而是已经接受生产规模证据流验证。

脱敏生产规模验证汇总

运行规模

项目 结果
数据集图片 29,071
单类别 Teacher 6
图片-模型推理次数 174,426
原始预测证据行 99,696
进入人工审核的行 30,183
可视化失败 0
是否修改源标签
快照时已完成人工决策 0

扫描在 CUDA FP16 下以 832 输入尺寸、batch=32 运行,每次只让一个 Teacher 驻留显存,并对 train、val、test 三个划分执行六类全量检测。

决策分流

终态分组 数量 审核队列占比 处理方式
训练集疑似漏标 18,120 60.03% 人工决定新增或拒绝
评测集疑似漏标 7,951 26.34% 默认禁止写入训练标签
同目标框尺度冲突 3,688 12.22% 替换或拒绝,禁止追加第二个框
跨类别冲突 424 1.41% 人工进行语义判断

生成审核队列前,系统已识别并保留审计记录但不要求人工处理:已有标签预测 60,563 条、模型重复候选 2,050 条、低于审核阈值 6,900 条,共减少 69,513 条无效审核工作。

分类别审核工作量

类别 审核数量 占比
person 25,066 83.05%
helmet 1,823 6.04%
smoking 1,265 4.19%
vest 1,031 3.42%
slipper 886 2.94%
tractor 112 0.37%

person 占据绝大多数审核工作。这说明“完整枚举在技术上正确”不等于“人工成本可接受”。下一轮应结合分类别审核预算或依据真实审核结果校准 person 策略,而不是简单提高全局阈值。

抽查结论

  • 安全帽、背心和拖鞋候选中存在明确的可信漏标。
  • 吸烟高置信候选中出现了“嘴边话筒”等困难反例,直接证明高置信度只能代表证据强度,不能自动获得写标签权限。
  • 同目标框尺度冲突达到 3,688 条,仅使用 IoU 后直接追加会制造有害重复 GT。
  • val/test 疑似漏标共 7,951 条,默认冻结可以防止数据修复过程悄悄改变评测标准。
  • 全部审核图均成功生成,可将审核包直接交给不具备 GPU 环境的标注团队。

可复现边界

GitHub 仅发布聚合后的脱敏证据。私有运行的 manifest、阈值策略、原始 CSV、审核包和图片继续保存在本地;仓库中不提交任何私有图片、标签、权重、主机名或文件系统路径。