FACEREFINE · 从想法到上线
31 张测试通过,我为什么还要重做?
像素有变化,不等于用户看得见。一次看似漂亮的通过率,最终被真实图片上的肉眼检查否定。
40 张固定人像里检测到 37 张,其中 31 张通过自动阈值。但我把 Original、Auto、Left、Right 四组结果排在一起看,几乎看不出补光方向发生了变化。
测试通过,为什么还是看不见效果
旧报告关注左右结果有没有像素差、强度归零时是否回到原图、远离脸部的背景有没有变化。它们能确认功能在运行,却回答不了用户最直接的问题:效果看得见吗?
问题出在三处:
- 旧阈值太宽,左右光位的像素差中位数只有 0.444/255,肉眼几乎不可辨;
- 指标比较的是 Left 和 Right,不是 Auto 和 Original;
- 四宫格被缩小并压成 JPEG,细微差异更难发现。
所以我没有把 83.8% 写成“成功率”,而是把结论改成:程序能运行,补光方向也有差异,但当时的视觉强度没有达到可接受程度。
重新选择测试方法
随后我先重做测试报告:增加 Auto 与原图的人脸区域差异、局部人脸放大、无损 PNG 和 12 倍差异图;远处背景指标只负责查明显漏光,不再替代发际线、眼镜和脸部边缘的人工检查。
新版先用 8 张代表样本复跑,8 张都检出人脸,4 张达到新的可见阈值,其余继续复查。这只是验证新的测试方法,不代表 40 张完整回归已经完成,也不代表这个功能已经可以交付给用户。
先看用户能感知的结果
这次最大的教训是:先定义用户能感知的结果,再决定测什么。自动化适合发现异常,但“自然不自然、看不看得见”仍需要真实照片和人的眼睛。