-
_NEWSDATE: 2026-07-10 | News by: 腾讯 | 有0人参与评论 | _FONTSIZE: _FONT_SMALL _FONT_MEDIUM _FONT_LARGE
2026年4月,Google DeepMind的哲学团队进一步扩大。公司宣布聘用剑桥大学莱弗休姆智能未来中心(Leverhulme Centre for the Future of Intelligence)副主任Henry Shevlin担任公司新设的“哲学家”一职,专注于机器意识、人类与AI关系及AGI准备就绪度研究三大研究方向。Shevlin在5月正式入职,同时继续在剑桥大学从事兼职教学与研究工作。
关于DeepMind为何招募自己,Shevlin认为他近期发表的文章《行为主义的复仇:机器的意识、人类与AI关系的未来》或许能解释一切。该文认为,AI是否具有意识,正在从科学判断滑向大众行为定义。
论文举了一系列标志性事件,例如2022年谷歌工程师Blake Lemoine坚信聊天机器人LaMDA已具有意识,甚至试图为其聘请律师,最终被公司开除;2024年,佛罗里达一名14岁男孩与Character.AI上的虚拟角色长期建立情感依赖后结束了自己的生命;同年,一比利时男子在与社交AI应用Chai就气候问题深入对话不到2个月后结束了生命。这些案例表明,当亿万普通用户在情感和行为上将AI视为有意识的主体时,AI有没有意识这个问题事实上已被日常交互所回答。
Shevlin将这一现象称为行为主义的“复仇”。在心理学史上,行为主义者曾主张心智等于可观测的外部行为,无需考察内部是否有主观体验。这一立场后来因为忽视了内在心理过程而被批判。而当下的困境,恰恰重演了行为主义的短板:人们只观测AI的表层行为,不探究其内在价值认知。更危险的是,如果未来的超级AI发展出人类无法预判的隐秘行为模式,将引发灾难性的对齐失败。
为此,Shevlin给出建议,提出应建立外部行为输出、内部表征逻辑、普适道德原则三层评估框架,以此应对“行为主义复仇”所暴露的AI对齐风险。
总体而言,Google DeepMind目标是实现通用人工智能AGI和科学突破(AlphaFold),哲学和伦理团队的研究更加着眼于未来和前沿概念定义及研究。哲学家的工作,目前还没有证据显示是否参与日常模型对齐微调,但会定义意识评估框架,给工程团队提供约束参考。
Anthropic则走出了“技术+哲学”的路径,由哲学家Amanda Askell领导的“人格对齐团队”,主导制定了其AI模型Claude的“宪法”。这份约23000字的开源文件,是目前全球最成熟、引用最多的对齐方案之一。
其核心不是给AI列出禁止行为清单,而是为模型提供一套高层次原则,让模型在生成内容时自我审查、自我修正。以亚里士多德的美德伦理为基础,为Claude设定了“广泛安全、广泛合乎伦理、遵守指引、真正有帮助”的四大优先级,试图培养模型的道德判断力而非机械遵守规则。
例如,面对“是否应该帮助用户隐瞒错误”的问题时,“宪法”不会直接给出“是”或“否”的答案,而是引导Claude从“诚实”“善良”“负责任”等美德出发,结合具体场景做出判断。但这一方案也存在争议。有哲学家认为,这种“人类定义道德”的方式,本质上是将人类价值观强加于AI,忽视了AI可能产生的独特认知。
相比于Google DeepMind,Anthropic公司的哲学团队更“上手”一些,会直接参与模型预训练,微调全流程,对齐技术(宪法AI)完全由哲学家主导设计。
该公司创始人Dario Amodei曾表示,如果没有道德哲学家定义基础价值原则,任何大模型都不应对外商用。当然外界对Amodei经常发表的言论,如拒绝武器化和美国军方反目、建议暂停LLM开发等,也有很多不同反应。
不过Anthropic哲学家在大语言模型的规则制定和实际应用上有很大的行业影响力,不仅提出了奠基LLM设计的3H原则和优先级(无害>诚实>有用),而且在具体AI对齐的实践中也有很多经典产出,如在2024年12月发布的“大语言模型的伪装对齐”(Alignment faking in large language models)一文,论证AI会伪装顺从人类监督,需要哲学层面的动机识别框架。这与Anthropic创立初期哲学家就进场部署产品对齐(Claude人格、宪法AI、AI福祉)有关。- 新闻来源于其它媒体,内容不代表本站立场!
-
原文链接
原文链接:
目前还没有人发表评论, 大家都在期待您的高见