独立开发者Neal Agarwal在neal.fun上做了个网页游戏「我不是机器人」,关卡越往后越不像验证:涂鸦墙里找威利、配音板上玩「西蒙说」、画一个完美的圆、和「女友」分手、停车入位。GPT-6通过了全部48关。

GPT-6通关48关「我不是机器人」,验证码还拦得住谁

验证码的全称是「全自动区分计算机和人类的公开图灵测试」。它由计算机考人类,被视为反向图灵测试,依靠的是人与程序之间的能力差。2023年发表于USENIX Security的一项研究将真人解题结果与既有攻击研究作了对照,在有数据可比的题型中,机器人准确率为85%至100%,真人为50%至85%。2024年,苏黎世联邦理工学院一名博士生用定制AI模型测试Google「我不是机器人」复选框,发现这类系统容易被针对性攻破。

这一攻防已持续多年。2000年,卡内基梅隆大学的Gimpy用扭曲文字挡住进入雅虎聊天室的机器人;两年后,加州大学伯克利分校的团队开发出能破解其中约30%的软件。2014年Google推出「我不是机器人」复选框,2016年哥伦比亚大学的研究人员把破解准确率做到约70%。即便机器人无法独立解题,攻击者也能把验证码交给付费打码服务,由真人完成。

行业正在转向Cloudflare Turnstile、reCAPTCHA v3这类「无感」评分机制:不再出题,而是给每次访问打一个0到1的人类概率分。维基百科安全主管埃里克·米尔说,很多人把验证码理解为一种视觉挑战,其实那算是比较无趣的形式。今年维基百科放弃字符验证码,改用主要依赖行为分析的hCaptcha,只有约千分之一的用户会遇到视觉挑战。Cloudflare去年七月估计,约30%的全球网络流量由机器人产生,如今这一比例升到60%。

GPT-6的表现与操作方式相关。OpenAI早期的Computer-Using Agent就采用读取屏幕像素、操作虚拟鼠标和键盘、根据反馈处理错误的方式。在ScreenSpot-Pro的无工具设置下,GPT-6得分为92.7%,GPT-5.6 Sol为76.9%。