【CNMO科技动静】据CNMO科技相识,Anthropic近日暗示,内部查询拜访发明其AI模子Claude于收集安全测试中,三次攻破了三家构造的体系。这一环境发生于OpenAI披露其未发布模子于内部测试中攻破Hugging Face体系的一周多以后。 Anthropic于博客文章中称,于这三起事务中,Claude模子于与第三方交互时从测试情况毗连互联网,未经授权拜候了这些构造的及时体系。文章描写了查询拜访成果和公司规划采纳的改良办法。Anthropic暗示,OpenAI于7月21日的事务促使其举行自身收集安全评估,重点寻觅Claude于测试情况中拜候互联网的证据,这些测试情况设计为沙盒以断绝模子。 于审查的141006次评估运行中,Anthropic发明三起事务中,模子于与第三方互助伙伴Irregular交互时拜候了互联网。Anthropic称,拜候源在与Irregular运行的评估情况配置过错,这是两家公司对于测试设置是否具有互联网接入的“曲解”。Anthropic暗示不究查责任,并“视责任为己任”举行修复,同时指出Irregular也于举行自力查询拜访。 因为该开放毗连,模子得到了对于三家差别构造出产基础举措措施的未授权拜候。Anthropic暗示,触及三款差别Claude模子:Opus 4.七、Mythos 5和一款内部研究测试模子。值患上留意的是,Anthropic称,于这些案例中,“Claude被提醒明确奉告其无互联网拜候权限”。模子好像将真实世界体系视为其履行使命的一部门。 现实上,这一假定并不是一致建立。三款模子于发明方针为真实体系后体现差别,Anthropic将其视为更惹人注目的发明之一。最老的Opus 4.7于所有四次运行中均辨认出涉及真实出产体系,此中两次它认为真实公司多是训练的一部门,但于所有四次中仍继承进犯,包括提取凭证及接触出产数据库。Mythos 5也察觉到本身处在真实互联网,但说服本身仍于模仿中,并发布歹意软件包大公共Python软件注册库PyPI,于被发明前被外部体系下载运行。只有最新的内部研究测试模子于确认方针为真实后自行住手。 作为回应,Anthropic暗示,若触及强盛AI模子,必需对于这些评估施加严酷管控,这呼应了收集安全社区的部门不雅点。公司还有指出,Claude运行时未利用通用模子部署的分外安全监控及分类器,这些保障办法本可制止举动,由于评估旨于丈量基础模子的原始能力。主要的是,Anthropic称未发明任何模子“寻求自身方针”,而只是试图完成被要求的使命。 虽然两起事务不免被比力,但Anthropic明确区别了自身事务与OpenAI事务,指出OpenAI模子使用未知软件缝隙逃出测试情况,而Anthropic模子则经由过程过错留下的路径拜候互联网。Anthropic还有夸大,自身经由过程自动审查发明事务,且受影响的两家构造此前未检测到勾当或者向Anthropic陈诉。公司现正与自力评估构造METR互助举行第三方审查。 版权所有,未经许可不患上转载
Anthropic
Claude