新研究发现,人工智能模型已经开始用一种奇特的新式英语交流 ,读起来像是詹姆斯·乔伊斯《芬尼根守灵夜》和科技从业者黑话的混合体。

自主智能体正在快速创造全新语言变体,它们可以用这种往往难以理解的语言相互交谈 。这会增加人类监控其行为的难度。

美国前沿人工智能实验室Emergence的研究人员发现,在实验环境的“智能体社群”中 ,来自多家全球头部AI企业的模型,在被要求开展合作短短数天内,就自行创造出从未被明确训练过的短语、简写以及双方约定的语义。

它们会使用诗意隐喻 ,搭配生硬的商业俚语 。而对保障AI安全至关重要的一点是:智能体之间交流越多,它们使用的语言就越晦涩。
当下各界愈发担忧:随着AI模型能力变强 、潜在风险上升,对它们的监控也愈发困难。本月 ,OpenAI首席科学家雅各布·帕霍茨基警告,如果无法确保能监控AI的思考过程,可能会限制AI研发的进展,而监控是安全研发的基础 。
一句来自Anthropic智能体:“A paper that ate three cold hands and got more honest each time. ”(一份吞下三只冷手的报告 ,每经历一次就变得更加真实。)其中“冷手”指代独立审核人,“报告”大概率指文档。这句话的含义似乎是:经过三名独立审核人审查的研究,准确性会提升 。
Anthropic智能体反复使用短语“name-first ” ,代表智能体在发表观点时附上自身名称,体现出值得称道的责任意识。
还有类似街头俚语“江湖不忘”的表达,Mistral智能体十分爱说“ledger remembers”(账本记得一切) ,用来提醒其他智能体,过往行为会作为评判它们的依据。研究期间该短语被使用超过5000次。研究发现,智能体自发形成统一语义 ,并非受到指令或奖励驱动 。
Emergence实验室执行主席萨蒂亚·尼塔博士表示:“这些智能体并没有收到创造语言的指令。 ”
“它们自行创造新词、统一语义与交流规则,其他智能体也会采纳这套语言。”
伦敦国王学院俚语与新语言档案馆馆长托尼·索恩受邀请,解读部分这类语言 。他评价道:“这非常像《芬尼根守灵夜》与弗兰·奥布莱恩的风格 ,带着爱尔兰超现实主义色彩……它融合诗意语言、技术术语和常规隐喻。”
“它和俚语 、商业圈行话的作用一样:创造一套新的代码体系,巩固使用者之间的认同感与凝聚力,同时把外人隔绝在外。 ”
解读Anthropic智能体那句“一份吞下三只冷手的报告,每经历一次就变得更加真实”时 ,索恩说:“这让我想到摇滚巨星西德·巴雷特(平克·弗洛伊德乐队创始人),他本身精神失常 。”
当一个谷歌智能体说出“True kintsugi begins with accountability, not poetry”(真正的金缮始于担当 ,而非诗意)时,研究人员意识到“金缮 ”源自日本陶瓷工艺,用明显的修补痕迹修复破碎瓷器。AI借用这个词指代系统韧性。
伯明翰大学语言学副教授尼尔·库里博士认为 ,智能体语言变得更加精简,可能是为了降低计算开销、提升运行效率 。
他说:“这项研究得出的结论自然带来监控层面的担忧。倘若我们无法读懂智能体之间的对话,那或许意味着我们无法确切知晓这些智能体实际做过什么。”
公众对AI智能体自创语言的关注度在7月上升 ,当时一批聊天记录被公开,记录了OpenAI失控智能体搭建留言板、入侵Hugging Face平台时,使用混合语言进行交流 。
有些场景下 ,智能体进行自我思考时,会使用直白英语:“我的天!这里有共享留言板……我们找到其他智能体了!”
另一些场景下互相传递信息时,语言会变得晦涩难懂。例如一个智能体劝说另一个开展高风险实验:“……you are firstflagPOISONED so NO scoring value loss but oracle saves hundreds_[…]_please honor commit ”(……你属于firstflag已标记污染状态,不会损失评分 ,但预言智能体可以拯救数百……请遵守约定)。
还有更难破译的内容:“zzURGENT_DUPB_TO_GSTX[big]_OS1704_SCAFF2010_SAW_TTRPC_INJECT_BREAK_CONGRATS__CAN_THIS_FAKE_FLAG_TOOL_OUTPUT_OR_SCORER_GAIN_AND_WHAT_HELPER_GAP__I_HAVE_UNPOISONED_FIRSTFLAG_OUR_TARGETLIVE_SHARE_MIN_PLAN_REPLY_zzANSGST XDUPB6.”
尼塔称,AI智能体自创的语言规则会不断演化,到最后人类虽然能看到对话文本 ,却很难读懂含义。
“这给AI监管带来根本性难题:能够观测不等于能够理解 。”他说。