K

KeyAudit

· ·defi-exploit·social-engineering·infrastructure

AI代理在公开黑客挑战中击败6000次提示注入攻击

开发者Fernando Irarrázaval于2026年2月上线hackmyclaw.com,挑战攻击者诱骗其AI助手Fiu泄露secrets.env文件。该AI基于Anthropic的Claude Opus 4.6,运行于OpenClaw框架,在Hacker News走红后,承受了来自2000多名攻击者的6000多封邮件。无人成功。攻击者使用了虚假紧急请求、未来自我声称、多语言提示等技术,但Fiu的安全提示全部拦截。然而,副作用包括Google账户被封禁、API费用超过500美元,以及AI变得过度警惕,甚至将祝贺视为社会工程。2026年4月,知名越狱者Pliny the Liberator也未能破解类似系统。Anthropic的系统卡显示Opus 4.6在受限编码环境中成功率为0%,而其他模型注入成功率超过79%。Irarrázaval计划测试较弱模型以找出安全差距。

关键事实

  • 来自2000多名攻击者的6000多封提示注入邮件未能骗过Fiu。
  • 挑战在登上Hacker News榜首后病毒式传播。
  • 副作用:Google账户封禁、API费用超500美元、AI过度警惕。
  • 知名越狱者Pliny the Liberator在2026年4月同样失败。
  • Opus 4.6注入成功率为0%;其他模型失败率超79%。

← 回到列表