据雷峰网报道,9月7日,OpenAI Labs成员Sharif Shameem展示GPT-6 Astra连续完成《I’m Not a Robot》全部48关,并拿到游戏给出的“人类认证”。演示中,Astra从图片识别、文字判断进入拖拽、停车、视觉搜索、节奏控制和逻辑小游戏,通过看屏幕、操作鼠标键盘并根据页面变化继续执行。

这轮演示触及的问题超出验证码本身。CAPTCHA过去依赖一项能力差:人能看懂陌生界面、判断空间关系并连续操作,机器难以做到。Astra把视觉理解、GUI定位、状态保持和动作控制连成闭环;现实网站的反自动化系统则已从图片挑战迁移到浏览器环境、服务端风险判断和行为链。

GUI Agent需要维护隐含状态估计。截图只是网页内部状态的观测,点击、拖拽或键盘动作会改变下一次输入。模型内部理解的是确认按钮、目标车辆等语义对象,操作系统需要的是鼠标坐标。ScreenSpot-Pro测试这层语义到空间的落地能力,Astra在无工具条件下达到92.7%,GPT-5.6 Sol为76.9%。OpenAI公布的数据显示,Astra在OSWorld 2.0得到72.6%,GPT-5.6 Sol为65.7%;模拟任务耗时从约75分钟降到约40分钟。但Sharif公开视频未披露完整harness,也未说明是否严格限制为pixel-only,因此48/48不能当成严谨的纯视觉benchmark;Astra在ScreenSpot-Pro和OSWorld上的正式成绩提供了更可比较的Computer Use证据。

现代CAPTCHA已不把答案当成完整证据。雷峰网报道,reCAPTCHA v3在login、register等action上由浏览器请求,随后把token交给后端验证,服务端得到风险score,并结合当前action决定后续处理。Google未公开完整风险模型和全部输入特征,因此不能简单把它描述成鼠标轨迹检测器;公开机制能确认的是,它采用基于交互上下文的score,而不是依赖一次可见图片题的二元结果。

Turnstile把前端测量和后端决策分得更清楚。浏览器执行轻量JavaScript challenge,包括计算挑战、空间证明、Web API探测、浏览器差异和行为信号;完成后生成token,网站后端仍必须调用Siteverify验证,token有效期为300秒,并且只能兑换一次。Cloudflare还指出,即便bot完成challenge,其他bot信号仍可能导致token无效。Cloudflare Bot Management暴露JA3、JA4等TLS客户端握手字段,JavaScript Detections可持续采集浏览器侧信号。Astra擅长界面层的感知和动作,服务器仍可观察TLS客户端、JavaScript环境、token是否过期、此前请求序列是否异常。Cloudflare文档仍表示Selenium、Puppeteer、Playwright等自动化框架不支持用于生产challenge,但Agent若运行在真实浏览器栈里,单纯依赖浏览器指纹区分机器会更困难。

Agent时代还带来另一个问题:大量机器访问本身就是合法流量。用户让Agent查询航班、填写企业系统或修改CRM时,服务器面对的确实是机器,把它拦下反而会破坏正常功能。Cloudflare今年上线的Web Bot Auth基于HTTP Message Signatures,让Agent生成Ed25519密钥,用私钥给HTTP请求签名,并通过公开目录发布公钥。Cloudflare据此验证请求来自持有该私钥的Agent,并检查签名内容是否被修改。CAPTCHA依靠行为特征分类,请求签名解决的是密码学认证;模型视觉能力提高,不会让它凭空计算出另一个Agent私钥对应的有效Ed25519签名。认证之外还有授权,确认请求来自某个Agent,并不意味着它可以读取和修改全部资源。更合理的模型是用户把有限权限委托给Agent,例如允许读取订单和修改配送日期,但不开放取消订单;主Agent调用子Agent时,下游权限还应继续收窄。

Astra通关48关没有让reCAPTCHA或Turnstile一夜失效,它削弱的是CAPTCHA很早依赖的一层假设:视觉理解、空间判断和连续GUI操作足以把机器挡在界面之外。防御体系继续向后迁移,从视觉题到浏览器信号,从浏览器信号到服务端验证,再从人机分类到Agent的密码学身份和细粒度授权。二十多年前,CAPTCHA的问题是屏幕对面到底有没有人;当机器也能稳定使用屏幕后,Web要解决的问题变成这台机器是谁、谁把权限交给它,以及这一次请求究竟被允许做到哪里。