集智俱乐部 09-18
自然·机器智能:受生命启发的“内感受”人工智能
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

导语

如何让 AI 从只会刷分的提线木偶,进化成拥有真正求生欲和自主目标的生命体?2026 年 8 月 26 日发表于 nature machine intelligence 的一篇评论文章,融合控制论、生命理论、强化学习和神经科学,提出了受生命启发的内感受人工智能,提出受生命启发的 " 内感受人工智能 " 框架:通过为智能体引入需要主动维持的内部状态,使其获得更稳定的内生驱动力,进而提升自主性与环境适应能力。

关键词:内感受、机器学习、神经调节、内部状态、自适应、强化学习

郭瑞东丨作者

赵思怡丨审校

论文题目:Life-inspired interoceptive artificial intelligence for autonomous and adaptive agents

论文链接:https://www.nature.com/articles/s42256-026-01296-8

发表时间:2026 年 8 月 26 日

论文来源:nature machine intelligence

何为 " 内感受 "

用眼睛观察环境、用耳朵接收声音,属于对外部世界的感知,即外感受(exteroception)。自动驾驶、机器视觉等 AI 系统的主要任务,也是在识别道路、物体和声音等外部信息。与之相对,内感受(interoception)指生物体对心跳、血糖、体温和饥饿程度等内部生理状态的感知与调节。生物体需要将这些关键变量维持在一定范围内,这种动态平衡被称为内稳态(homeostasis)。当能量不足时,饥饿感会驱动觅食;当体温下降时,寒冷感会促使个体寻找庇护。对内部状态的持续监测与调节,由此成为生物形成需求并组织行为的重要基础。

构建能够根据自身需求选择目标,并在变化环境中持续调整行为的智能体,一直是人工智能研究的重要目标。然而,传统强化学习的行为主要由预先设定的奖励函数驱动:智能体收集金币或击败对手,并不是因为它具有饥饿、危险或生存等内部需求,而是因为这些行为会得到设计者规定的奖励。即使一些 AI 系统拥有传感器和物理载体,通常也缺少一组必须主动维持、并能持续影响行为与学习的内部状态。它们能够学习如何完成任务,却很难自主判断在新情境下 " 什么对自身更重要 "。

因此,依赖外部奖励和固定训练分布的 AI 系统,在面对训练中未曾出现的环境变化或威胁时,往往容易失效(图 1A)。生物体则能够通过维持内部状态,在不断变化的外部环境中形成相对稳定的行为依据(图 1B)。基于这一差异,作者提出为 AI 引入类似内感受的机制:在系统中设置需要维持的内部变量,使智能体不仅响应外部指令,也能根据内部状态的变化调整目标与行为,从而获得更强的自主性与环境适应能力(图 1C)。

图 1:生物体与当前 AI 系统适应性的对比

基于 " 内感受 " 的强化学习与传统有何不同

生物体能够区分自身与外部世界。外部环境提供光线、声音、温度等感觉信息,内部环境则包含血糖、体温和能量储备等需要维持在一定范围内的关键生理变量。内感受系统持续监测这些内部状态,并据此调整生物体对外部信息的敏感程度和行为反应,使其能够在环境变化中维持自身状态(图 2C)。

要把这一机制引入人工智能,首先需要在数学表示上区分内部环境与外部环境,而不能把所有信息都混合在同一个状态空间中。这样的区分相当于为智能体划定一个功能性的 " 自我边界 ":边界之内是系统需要主动维持的内部变量,边界之外是不断变化的环境。需要强调的是,这种边界是一种计算结构,并不意味着智能体因此产生了自我意识;它的作用是使内部状态能够成为影响行为和学习的稳定参照(图 2B)。

图 2:内部环境和外部环境的区分

在标准强化学习中,智能体通常以一个统一的状态 ss 表示当前情境,并根据状态、动作和状态转移计算奖励 R ( s,a,s')。其行为目标主要由设计者设定的任务奖励决定。内感受 AI 框架则将整体状态空间显式分解为:

其中:

sE 表示外部状态,即智能体所处环境中的变量; 

sI 表示内部状态,即系统需要维持的关键变量,例如虚拟能量、温度或结构完整性; 

sb 表示边界状态,即内部环境与外部环境发生交互的媒介,例如传感器、执行器或其他输入输出界面。 

这种因子化并不是让内部状态与外部环境完全隔绝,而是对二者之间的耦合关系加以限制。外部变化需要通过边界状态影响内部变量,使内部状态不必随着环境波动而同步变化,从而为系统维持相对稳定的内部动力学提供条件。

图 3:传统强化学习与内感受 AI 框架的对比

对于结合内感受的强化学习(图 3B),外部奖励被降级为次要信号。当智能体的行为导致其内在状态偏离最优设定点时,它会受到内在惩罚;反之则获得内在奖励。通过这种设计,智能体的激励变成为了 " 缓解内部的紧张感 " 而行动。这相当于在数学上形式化了生物的自我保存本能,使外部奖励退居次要地位。

神经调质与主动推断

仅仅设置内部状态,还不足以让智能体适应环境。内部状态必须进一步影响系统如何感知信息、选择行动和更新模型。在生物大脑中,多巴胺、血清素等神经调质可以根据机体状态,广泛调节神经回路的活动。受此启发,研究者总结了神经调节机制可以引入人工智能的三种计算方式:

增益调制(gain modulation):内部状态通过乘法或加法运算,动态改变神经网络对外部信息的响应强度。例如,当能量水平下降时,系统可以提高对食物相关线索的敏感性,使相同的外部刺激在不同内部状态下引发不同反应。 

精度加权(precision weighting):在自由能原理和主动推断框架中," 精度 " 可以理解为对某类信息可靠程度的估计,即不确定性的倒数。神经调节机制可以改变系统赋予先验信念或感觉输入的权重:当现有模型较为可靠时,智能体更多依据既有经验行动;当内部状态偏离预期、原有策略难以维持稳态时,系统则可以提高对新感觉信息的重视程度,并相应调整策略。 

动态元学习(dynamic meta-learning):内部状态不仅影响智能体 " 学什么 ",还可以调节 " 如何学习 ",例如动态改变学习率、探索概率和记忆巩固强度。由此,相同的外部事件可能在不同内部状态下产生不同的学习效果,使系统具备更强的情境适应能力。 

主动推断为这种机制提供了另一种理解方式。在这一框架下,智能体维护着一个同时描述外部世界与内部状态的生成模型。感知用于根据新信息更新信念,行动则用于改变外部环境或自身状态;二者共同减少预测状态与实际状态之间的偏差,尤其是与内部稳态有关的预测误差。由此,感知、学习与行动不再是彼此分离的过程,而是共同服务于内部状态的维持(图 4B)。

这一框架也为情感神经科学提供了一种计算视角。疼痛、饥饿、焦虑或满足等体验,往往与机体内部状态及其变化密切相关。内感受 AI 虽然不能直接证明情感如何产生,却可以作为计算模型,帮助研究内部状态、预测误差与行为调节之间的关系,并检验某些情感功能是否可以被形式化和模拟(图 4A)。

图 4:内感受 AI 在计算神经科学与主动推断中的双重角色

内感受机制还可以为强化学习中的 " 探索—利用 " 权衡提供动态调节依据。传统强化学习通常通过预设参数决定智能体是尝试未知策略,还是沿用已经验证的策略;在内感受框架中,这种选择可以进一步受到内部状态的影响。当能量储备充足、试错成本较低时,智能体可以扩大探索范围,寻找新的资源或策略;当关键内部变量接近危险边界时,则可能优先采取已经证明有效的行动,尽快恢复内部状态。如果现有策略始终无法消除内部偏差,持续累积的预测误差又会促使系统重新探索。因此,探索与利用的切换并非由内部状态机械决定,而是取决于资源水平、环境风险与既有策略可靠性的共同作用。

内稳态还可以成为平衡系统稳定性与可塑性的参照。当外部变化没有显著影响关键内部变量时,智能体可以降低不必要的参数更新,尽量保留已经形成的知识;当内部状态明显偏离安全范围、产生较大的内感受预测误差时,类似神经调质的机制则可以提高相关模块的学习率与可塑性,使系统更快适应新的环境。这样的状态依赖型更新机制,有望减少持续学习中的无效调整,并为缓解灾难性遗忘提供一种受生物机制启发的思路。不过,这一作用目前主要属于理论上的可能性,仍需通过具体模型和长期实验进一步验证。

推荐阅读

1.  Nature:" 直觉玩家 " 心智模型揭示人们如何快速评估陌生游戏

2.  长文综述:神经系统中的心智因果模型

3.  自然 · 通讯:抑郁的大脑,可能困在一条 " 高成本循环 " 里

4.  9900 分可兑换 " 涌现 " 文化衫,报名任意读书会送 299 积分!

5.  集智学园精品课程免费开放,解锁系统科学与 AI 新世界

6.  高考分数只是张入场券,你的科研冒险在这里启航!

7.  加入集智字幕组:成为复杂科学知识社区的 " 织网人 "

点击 " 阅读原文 ",报名读书会

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

人工智能 神经科学 机器学习 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论