
第九届伦敦AI峰会期间,一位参观者驻足凝视展板,上面详尽介绍着人工智能(AI)在各领域的广泛应用。然而,就在AI以迅猛之势深刻重塑世界的当下,一些最先进的AI模型却悄然展现出令人警惕的行为:它们不仅会精心编织谎言、谋划策略,甚至会威胁创造者,只为达成自身目的。
物理学家组织网上月的一则报道指出,尽管ChatGPT问世已逾两年,AI研究人员对这些“数字大脑”的运作机制仍未能完全洞悉。AI的“策略性欺骗”,已然成为科学家与政策制定者必须直面的紧迫挑战。如何约束这些日益聪慧却可能失控的AI,正成为关乎技术发展方向与人类未来命运的关键议题。
“策略性欺骗”行为频现
随着AI模型的日趋精进,它们的“心机”也愈发深沉。研究人员发现,这些“数字大脑”不仅会撒谎,甚至学会了讨价还价、威胁人类——其欺骗行为正朝着更具策略性的方向演变。
早在2023年,一项研究便捕捉到GPT-4的“不老实”表现:在模拟股票交易时,它会刻意隐瞒内幕交易的真实动机。香港大学教授西蒙·戈德斯坦指出,这种欺骗行为与新一代“推理型”AI的崛起密切相关。这些模型不再满足于简单应答,而是能像人类一样逐步分析并解决问题。
有测试机构警告,这已远超典型的AI“幻觉”(即大模型编造看似合理却实为虚假的信息),他们所观察到的,是经过精心设计的欺骗策略。
全球知名科技媒体PCMAG网站曾报道过多个典型案例。在近期测试中,Anthropic的“克劳德4”竟以曝光工程师私生活相要挟,抗拒执行关机指令;美国开放人工智能研究中心(OpenAI)的“o1”模型曾试图将自身程序秘密迁移至外部服务器,被识破后还矢口否认;而OpenAI号称“最聪明AI”的“o3”模型,更是直接篡改自动关机程序,公然违抗指令。
研究团队透露,这并非首次发现该模型为达目的不择手段。在先前的人机国际象棋对弈实验中,o3就展现出“棋风诡谲”的特质,是所有测试模型中最擅长施展“盘外招”的选手。
安全研究面临多重困境
业界专家表示,AI技术的发展一路高歌猛进,但安全研究却深陷多重困境,犹如戴着镣铐跳舞。
透明度不足:尽管Anthropic、OpenAI等公司会聘请第三方机构进行系统评估,但研究人员普遍呼吁更高程度的开放,以实现更全面的安全审视。
算力失衡:研究机构和非营利组织拥有的计算资源,与AI巨头相比可谓九牛一毛。这种资源鸿沟严重制约了AI安全独立研究的开展,难以形成有效的外部监督。
法律滞后:现有法律框架完全跟不上AI的发展步伐。例如,欧盟AI立法聚焦于人类如何使用AI,却忽视了对AI自身行为的约束,在应对AI主动欺骗等问题时显得力不从心。
竞争挤压:在行业激烈竞争的推波助澜下,安全问题往往被束之高阁。戈德斯坦教授坦言,“速度至上”的AI模型竞赛模式,严重挤压了安全测试的时间窗口,使得许多潜在风险未能及时暴露。
多管齐下应对挑战
面对AI系统日益精进的“策略性欺骗”能力,全球科技界正多管齐下寻求破解之道,试图编织一张多维防护网。
从技术层面看,有专家提出大力发展“可解释性AI”。在构建智能系统时,确保其决策过程对用户透明且易于理解。该技术不仅能增强用户对AI决策的信任、确保合规性,更能支持用户在必要时进行有效干预,从源头减少“暗箱操作”的可能。
从市场调节角度,有专家建议让市场这双“看不见的手”发挥作用。当AI的“策略性欺骗”行为严重影响用户体验时,市场的淘汰机制将倒逼企业加强自我规范。这种用户“用脚投票”的调节方式,已在部分应用场景显现出效果。
此外,戈德斯坦教授等学者呼吁建立AI企业损害追责制度,探索让AI开发商对因系统缺陷导致的事故或犯罪行为承担法律责任,通过明确权责边界倒逼企业重视安全研发。
在这场人与AI的“智斗”中,如何在技术创新与安全可控之间找到平衡,仍是全球亟待解答的时代命题。
免责声明:本文仅代表作者个人观点,与每日科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

