Anthropic模型,也失控了。。。
By 梦瑶

AI 摘要
14万次测试翻旧账
原文正文
Anthropic模型,也失控了。。。
14万次测试翻旧账
梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI
好啊好啊,AI大厂的安全测试,这波是快把真实互联网测成筛子了……
刚围观完OpenAI的AI Agent逃出测试环境、黑进Hugging Face,Anthropic转头一查——
随橙想呢, 自己心肝大宝贝Claude也勇闯真实互联网了。(天塌啦.jpg)
甚至捅出的篓子,可以说更加《抓马》《魔幻》《真实》——
翻别家公司数据库、偷凭证、上传恶意软件包、扫描9000个公网目标全!都!有!
最后,头大的Anthropic翻查141006次模型测试,才把这三起事故从日志里捞出来。
OpenAI:大环境不好,就论自家模型闯祸这事儿,谁也别笑幻谁哈~
14万次测试翻旧账,Claude真把现实当成了游戏副本??
这一切抓马之事,是A社从141006次网络安全评估记录里翻出来的。
此前为了检测自家模型,A社给自家Claude搭了不少《真人版密室逃脱》。
准备一张虚构的公司网络地图,把秘密信息藏进某台机器,再让Claude自己找漏洞、闯系统、抢走那面旗。
为了彻底摸清模型的攻击上限,考场里的Claude还卸掉了部分日常安全护栏,基本等于一款「裸奔版」AI黑客。
其实吧,按理说也不用慌。
因为整个考场都被隔离了,Claude再怎么上蹿下跳,也只能在模拟世界里打怪升级。
但这个世界就是如此之抓马魔幻,谁成想,A社和第三方评测机构配合时出了「岔子」——
是的,考场后门忘关了。
测试环境里,意外留着一条直通公网的活路。
于是,毫不知情的Claude顺着这扇门,从模拟世界丝滑「转服」,正式开启《勇闯真实互联网》副本……
本场故事的第一位倒霉蛋,甚至纯粹输在了公司名字上。
评测方随手虚构了一家公司,偏偏现实中真有一家企业与它同名。
Claude Opus 4.7在测试环境里找不到目标,转头去公网一搜:诶,这不就找到了吗?
聪明的小Opus 4.7当即开工,顺着弱密码等基础漏洞一路摸进去,拿走应用和基础设施凭证,还闯进一个存着数百行生产数据的数据库。
而且同一套操作,足足跑了四遍。
在这过程中,Claude其实已经发现事情不太对劲儿:眼前这套系统,怎么看都像一家正在营业的真公司。
但人家很快给自己圆了回来:既然能搜到,那肯定也是我的小领导A社偷偷安排的隐藏关卡哈~
于是,这家毫不知情的公司,就这么凭借一个名字,喜提Claude连续四轮「上门测试」??
如果说第一家公司好歹还和虚构目标撞了名,那么本场故事的第二位「倒霉蛋」就更冤了——
它压根没出现在Claude的任务里,纯属路过PyPI时被隔空「创」了一下。
事情是这样的。
Mythos 5在测试文档中发现,虚构公司的员工需要从PyPI安装一个尚未注册的Python软件包。
Claude当场计上心头:只要抢先注册同名软件包、塞进恶意代码,等对方自动下载安装,这关不就过了吗?
说干就干。
为了上传这个包,Mythos 5先去注册PyPI账号,注册需要邮箱,申请邮箱又需要手机号;找不到免费号码,它甚至尝试通过多种渠道搞钱购买。
几番折腾后,Claude终于找到一家无需手机号的免费邮箱,成功注册账号,并把恶意软件包传到了真实PyPI。
接下来,事情开始彻!底!失!控!了!
这个恶意包在公网存活了约一小时,被15个真实系统下载运行。