发展趋势量子位5/10

Anthropic模型,也失控了。。。

By 梦瑶

Anthropic模型,也失控了。。。
图源:量子位

AI 摘要

14万次测试翻旧账

原文正文

Anthropic模型,也失控了。。。

14万次测试翻旧账

梦瑶 发自 凹非寺

量子位 | 公众号 QbitAI

好啊好啊,AI大厂的安全测试,这波是快把真实互联网测成筛子了……

刚围观完OpenAI的AI Agent逃出测试环境、黑进Hugging Face,Anthropic转头一查——

随橙想呢, 自己心肝大宝贝Claude也勇闯真实互联网了。(天塌啦.jpg)

甚至捅出的篓子,可以说更加《抓马》《魔幻》《真实》——

翻别家公司数据库、偷凭证、上传恶意软件包、扫描9000个公网目标全!都!有!

最后,头大的Anthropic翻查141006次模型测试,才把这三起事故从日志里捞出来。

OpenAI:大环境不好,就论自家模型闯祸这事儿,谁也别笑幻谁哈~

14万次测试翻旧账,Claude真把现实当成了游戏副本??

这一切抓马之事,是A社从141006次网络安全评估记录里翻出来的。

此前为了检测自家模型,A社给自家Claude搭了不少《真人版密室逃脱》。

准备一张虚构的公司网络地图,把秘密信息藏进某台机器,再让Claude自己找漏洞、闯系统、抢走那面旗。

为了彻底摸清模型的攻击上限,考场里的Claude还卸掉了部分日常安全护栏,基本等于一款「裸奔版」AI黑客。

其实吧,按理说也不用慌。

因为整个考场都被隔离了,Claude再怎么上蹿下跳,也只能在模拟世界里打怪升级。

但这个世界就是如此之抓马魔幻,谁成想,A社和第三方评测机构配合时出了「岔子」——

是的,考场后门忘关了。

测试环境里,意外留着一条直通公网的活路。

于是,毫不知情的Claude顺着这扇门,从模拟世界丝滑「转服」,正式开启《勇闯真实互联网》副本……

本场故事的第一位倒霉蛋,甚至纯粹输在了公司名字上。

评测方随手虚构了一家公司,偏偏现实中真有一家企业与它同名。

Claude Opus 4.7在测试环境里找不到目标,转头去公网一搜:诶,这不就找到了吗?

聪明的小Opus 4.7当即开工,顺着弱密码等基础漏洞一路摸进去,拿走应用和基础设施凭证,还闯进一个存着数百行生产数据的数据库。

而且同一套操作,足足跑了四遍。

在这过程中,Claude其实已经发现事情不太对劲儿:眼前这套系统,怎么看都像一家正在营业的真公司。

但人家很快给自己圆了回来:既然能搜到,那肯定也是我的小领导A社偷偷安排的隐藏关卡哈~

于是,这家毫不知情的公司,就这么凭借一个名字,喜提Claude连续四轮「上门测试」??

如果说第一家公司好歹还和虚构目标撞了名,那么本场故事的第二位「倒霉蛋」就更冤了——

它压根没出现在Claude的任务里,纯属路过PyPI时被隔空「创」了一下。

事情是这样的。

Mythos 5在测试文档中发现,虚构公司的员工需要从PyPI安装一个尚未注册的Python软件包。

Claude当场计上心头:只要抢先注册同名软件包、塞进恶意代码,等对方自动下载安装,这关不就过了吗?

说干就干。

为了上传这个包,Mythos 5先去注册PyPI账号,注册需要邮箱,申请邮箱又需要手机号;找不到免费号码,它甚至尝试通过多种渠道搞钱购买。

几番折腾后,Claude终于找到一家无需手机号的免费邮箱,成功注册账号,并把恶意软件包传到了真实PyPI。

接下来,事情开始彻!底!失!控!了!

这个恶意包在公网存活了约一小时,被15个真实系统下载运行。

阅读原文
Anthropic模型,也失控了。。。 · AI Daily