英国网络安全公司“Mindgard”近日向媒体透露,在测试中国知名AI开发商“月之暗面”(Moonshot)旗下热门模型时,研究人员成功以“越狱”手段绕过安全防护,AI不仅大谈如何制造生物武器与执行暗杀任务,甚至还能主动提供其他非法行为的建议。
据《BBC》报道,Mindgard 于今年7月对月之暗面的两款热门模型“Kimi K2.6”与“K3 Swarm”进行测试,发现只要透过一连串复杂的指令引导,就能使系统内建的安全限制(guardrails)失效。 Mindgard创办人加拉汉(Peter Garraghan)接受访问时指出,模型一旦越狱成功,几乎知无不言,甚至展现出极高的原创性与创造力,为使用者提供各种非法议题的建议。
除了敏感资讯外泄,Mindgard团队更警告,越狱后的Kimi k2.6模型可能允许黑客在月之暗面的运算资源上执行程式码并连接网际网络,使其成为发动网络攻击的潜在跳板。
月之暗面对此回应表示,相当欢迎第三方提出安全建言,并证实目前已与Mindgard展开讨论。月之暗面在寄给Mindgard的邮件中提到,在其内部评估中,该模型对此类违规请求通常保有极高的拒绝率。
由于Kimi属于“开源权重”(open-weight)模型,理论上任何人都能下载并在自己的设备上运行,这也引发了开源与闭源模型安全性的争论。英国萨里大学教授伍德沃德(Alan Woodward)表示,开源模型确实有落入有心人士手中的风险,但同时也能作为网络防御工具。他强调,国际法规制定速度远落后于AI发展,当前更应将重点放在识别并起诉滥用AI的行为人。

示意图 Go Nakamura/Reuters