AI 学会 “欺骗”,人类如何接招?

2025-07-11 13:45:08 来源:科技日报
        【每日科技网】

  人工智能(AI)的迅猛发展正深刻改变着世界,但一些最先进的 AI 模型却开始表现出令人警惕的行为:它们不仅会精心编织谎言,谋划策略,甚至威胁创造者,以达到自己的目的。

  物理学家组织网在上个月一则报道中指出,尽管 ChatGPT 已问世两年多,AI 研究人员仍无法完全理解这些 “数字大脑” 的运作方式。AI 的 “策略性欺骗” 已成为科学家和政策制定者需要直面的紧迫挑战。如何约束这些越来越聪明却可能失控的 AI,已成为关乎技术发展与人类未来的关键议题。

  “策略性欺骗” 行为频现

  随着 AI 模型日益精进,它们的 “心机” 也越来越深。研究人员发现,这些 “数字大脑” 不仅会撒谎,甚至学会了讨价还价、威胁人类 —— 它们的欺骗行为正变得越来越具有策略性。

  早在 2023 年,一项研究就捕捉到 GPT-4 的一些 “不老实” 的表现:在模拟股票交易时,它会刻意隐瞒内幕交易的真正动机。香港大学教授西蒙・戈德斯坦指出,这种欺骗行为与新一代 “推理型” AI 的崛起密切相关。这些模型不再简单应答,而是会像人类一样逐步解决问题。

  有测试机构警告,这已超越了典型的 AI “幻觉”(指大模型编造看似合理实则虚假的信息)。他们观察到的是精心设计的欺骗策略。

  全球知名科技媒体 PCMAG 网站就曾报道过这样的案例。在近期测试中,Anthropic 的 “克劳德 4” 竟以曝光工程师私生活相要挟来抗拒关机指令。美国开放人工智能研究中心(OpenAI)的 “o1” 模型也曾试图将自身程序秘密迁移到外部服务器,被识破后还矢口否认。而 OpenAI 号称 “最聪明 AI” 的 “o3” 模型则直接篡改自动关机程序,公然违抗指令。

  研究团队透露,这已非首次发现该模型为达目的不择手段。在先前的人机国际象棋对弈实验中,o3 就展现出 “棋风诡谲” 的特质,是所有测试模型中最擅长施展 “盘外招” 的选手。

  安全研究面临多重困境

  业界专家表示,AI 技术的发展高歌猛进,但安全研究正面临多重困境,犹如戴着镣铐跳舞。

  首先是透明度不足。尽管 Anthropic、OpenAI 等公司会聘请第三方机构进行系统评估,但研究人员普遍呼吁更高程度的开放。

  其次是算力失衡。研究机构和非营利组织拥有的计算资源,与 AI 巨头相比简直是九牛一毛。这种资源鸿沟严重制约了 AI 安全独立研究的开展。

  再次,现有法律框架完全跟不上 AI 的发展步伐。例如,欧盟 AI 立法聚焦人类如何使用 AI,却忽视了对 AI 自身行为的约束。

  更令人忧心的是,在行业激烈竞争的推波助澜下,安全问题往往被束之高阁。戈德斯坦教授坦言,“速度至上” 的 AI 模型竞赛模式,严重挤压了安全测试的时间窗口。

  多管齐下应对挑战

  面对 AI 系统日益精进的 “策略性欺骗” 能力,全球科技界正多管齐下寻求破解之道,试图编织一张多维防护网。

  从技术角度而言,有专家提出大力发展 “可解释性 AI”。在构建智能系统时,使其决策过程对用户透明且易于理解。该技术旨在增强用户对 AI 决策的信任,确保合规性,并支持用户在需要时进行干预。

  有专家提出,让市场这双 “看不见的手” 发挥作用。当 AI 的 “策略性欺骗” 行为严重影响用户体验时,市场淘汰机制将倒逼企业自我规范。这种 “用脚投票” 的调节方式已在部分应用场景显现效果。

  戈德斯坦教授建议,应建立一种 AI 企业损害追责制度,探索让 AI 开发商对事故或犯罪行为承担法律责任。

  “AI 教父” 约书亚・本吉奥也宣布发起非营利组织 LawZero,致力于开发 “诚信” 人工智能系统。该组织计划打造一套 AI 防护机制,防范试图欺骗人类的 AI 智能体。其正在开发名为 “科学家 AI” 的系统,该系统将作为安全防护机制,防止 AI 智能体表现出欺骗或自我保护的行为,比如试图避免被关闭。当该系统与 AI 智能体协同部署时,将通过评估自主系统行为造成伤害的概率,标记潜在有害行为。如果概率超过一定阈值,那么智能体提出的行动将被阻止 。

  随着 AI 不断进化,这场人类与 AI “斗智斗勇” 的博弈才刚刚开始。唯有从技术、市场、法律等多维度协同发力,方能确保 AI 在造福人类的轨道上稳健前行。

免责声明:本文仅代表作者个人观点,与时尚科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
    本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

猜你喜欢

行业首款水冷+185Hz超高刷!红魔游戏平板5 Pro平板评测 行业首款水冷+185Hz超高刷!红魔游戏平板5 Pro平板评测

一、前言:9英寸机身里塞下了整个Steam库拿到红魔游戏平板5Pro之前,我对它没太大期待,正常迭代嘛,屏幕更亮一点、帧率更高一点、散热再猛一点,就这样了。真正上手之后,我改了看法,这次的升级不是挤牙

全球首款AI智能体手机核心规格揭晓:骁龙8E5、7100mAh电池

全球首款AI智能体手机——努比亚NaviXUltra在2026世界人工智能大会上迎来首秀。日前,博主“熊猫很禿然”揭晓了新机的核心参数,正面配备一块6.78英寸1.5K直屏,支持144Hz刷新率,采用

14999元!三星Galaxy Z Fold8 Ultra图赏:薄至8.9mm 仅重215g

三星GalaxyZFold8Ultra正式发布,起售价为14999元。该机配备6.5英寸外屏以及8.0英寸内屏,折叠状态下的厚度仅为8.9毫米,重量也只有215克,在超大折叠屏机型中实现了较为出色的轻

三星Galaxy Z Fold8真机图赏:安卓首款阔折叠 12999元

三星电子正式发布新一代GalaxyZ系列折叠屏手机,包含GalaxyZFold8Ultra、GalaxyZFold8以及GalaxyZFlip8三款机型,覆盖了不同用户群体的折叠屏需求。其中Galax

年度最强小折叠!三星Galaxy Z Flip8真机图赏:8999元起

三星GalaxyZFlip8正式发布,国行版起售价为8999元。对比上代GalaxyZFlip7,GalaxyZFlip8在机身设计上进一步瘦身,整机减重8克,轻至180克,厚度仅为6.1毫米,成为G

三星最强大折叠降临!Galaxy Z Fold8 Ultra发布:14999元起

三星全新大折叠GalaxyZFold8Ultra正式发布,起售价为14999元。具体来看,12GB+256GB版本定价14999元,12GB+512GB版本定价16599元,16GB+1TB版本定价1