
验证码技术这些年一直在进化。
从最早的字符验证码:
A7B8K
到后来的:
滑块验证码
点选验证码
语义验证码
再到近年来出现的一类新型验证方式:
拖动滑块出现完整的两个包后松开
最近在测试验证码识别平台时,遇到了这样一种验证码。
页面中同时出现:
手提包
鞋子
花朵
蘑菇
吸尘器
用户需要拖动滑块。
直到两个完整的手提包同时出现。
然后释放滑块完成验证。
这种验证码已经不再是传统OCR问题。
而是一个典型的计算机视觉任务。

很多人以为:
系统是在验证拖动动作。
实际上不是。
真正验证的是:
目标物体是否完整出现
也就是说:
系统希望用户找到:
两个完整的包
对应的位置。
拖动只是交互形式。
核心仍然是视觉识别。

第一步通常是目标检测。
例如:
包
鞋子
花
吸尘器
蘑菇
模型需要判断:
每个区域属于什么类别。
目前最常见方案:
YOLOv8
YOLOv11
RT-DETR
Faster RCNN
模型输出:
[
{
"label":"bag",
"score":0.98
},
{
"label":"bag",
"score":0.97
}
]
系统成功找到两个包。

这才是难点。
拖动过程中。
图片内容会不断变化。
算法通常需要:
逐帧检测
位置1
检测
↓
位置2
检测
↓
位置3
检测
找到:
两个包同时完整出现的位置。

特征匹配
模型预先学习:
完整包
与
被遮挡包
之间的差异。
通过特征分数变化。
寻找最佳位置。

深度学习回归
直接训练模型:
输入:
当前验证码截图
输出:
滑块应移动距离
例如:
{
"offset":214
}
这是目前商业平台常见做法。
速度更快。

因为它对传统OCR几乎无效。
字符验证码:
OCR即可解决。
而目标检测验证码需要:
目标识别
+
空间定位
+
滑块预测
整体复杂度提升很多。
对于普通自动化脚本来说门槛更高。

成熟验证码识别平台通常采用:
降噪
归一化
锐化
识别:
包
鞋
花
蘑菇
等对象。
计算:
最佳滑块坐标
例如:
{
"x":214
}
业务系统直接拖动即可。

最近测试这类验证码时,体验了一下:
https://www.sushibie.com/
平台支持:
OCR验证码
点选验证码
目标检测验证码
滑块验证码
坐标返回API
对于:
自动化测试
RPA机器人
AI Agent
企业自动化流程
接入比较方便。
开发者无需训练目标检测模型。
上传图片即可获得识别结果。

验证码的发展路线其实非常明显:
字符识别
↓
图片识别
↓
语义理解
↓
行为分析
未来验证码可能不再要求用户点击图片。
而是通过:
鼠标轨迹
页面停留时间
设备指纹
AI风控模型
综合判断访问者身份。
但无论如何变化。
其核心问题始终只有一个:
如何区分真人与机器。
而这场攻防战,仍然在持续升级。
咨询电话 17725009201

技术支持
反馈