科学网—从人脑的低功耗与学习特征反观人工智能能耗巨大的两个可能根源
精选
已有 279 次阅读
2026-7-30 23:02
| 个人分类: 对阿尔法狗及人工智能的评论 | 系统分类: 观点评述
按:本文的缘起来自一个多月前与陈蕴真老师在《多头注意力机制本质上是一种多维网状逻辑关系的反映—人工智能何以如此“能”?之二》 https://blog.sciencenet.cn/home.php?mod=space&uid=3234816&do=blog&id=1539877 一文后有关人工智能能耗问题的讨论,受陈老师的那个相关提问所启发,随后经过自己的多次反复思考咀嚼和补充完善后所得。如果本文的核心思路是准确有效的,也许可以为今后人工智能效率的大幅提升乃至自进化提供一个可行的思路和方向。
人工智能,尤其是大规模生成式人工智能,在训练、推理和数据中心运行过程中会消耗大量电力。随着模型规模不断扩大、应用场景持续增加,人工智能的能源消耗已经不再只是技术问题,也逐渐成为经济、环境和社会治理层面值得重视的问题。为什么人工智能需要如此巨大的能耗?从人脑的学习过程特征,以及人脑为何能够以远低于人工智能的能耗完成复杂认知活动这两个角度出发,笔者提出以下两个可能的原因。
第一个原因,可能是由于训练知识中存在大量污染、矛盾和低质量信息,导致模型需要付出巨大计算成本才能形成稳定而有效的知识结构。
人工智能的训练并不是简单地把信息“装入”模型,而是通过海量数据和反复计算,让模型逐渐学习语言、事实、概念之间的关系。如果训练数据中存在大量错误知识、似是而非的观点、相互矛盾的描述、重复内容,或者存在标注错误、分类失误和语境缺失等等,那么模型就很难直接形成清晰、稳定的认知结构。它必须在不同信息之间进行权衡、比较和修正,才能找到相对合理的结果。这相当于在一片充满噪声和迷雾的知识环境中寻找收敛方向,必然会增加训练难度和计算量。
这种情况在人类学习过程中同样存在。人脑若长期浸染在知识污染中,不仅会令学习难度急剧上升,还可能引发认知层面的持久冲突,不得不调动大量心理能量去反复辨析、压抑或重建内在的知识结构。极端情况下,长期严重的认知矛盾甚至可能成为精神分裂等精神性疾病的诱因,甚至在物理器质层面造成损伤。
人工智能虽然目前来看应该不会出现类似生物学意义上的精神痛苦或精神分裂症式的现象,但训练数据中的“知识污染”会以纯粹的算力消耗形式展现其破坏性。在深度学习过程中,每一个错误标注或包含虚假(或错误)因果关联的样本,都会在训练中造成背离真实规律的陷阱。这就会导致模型为了最小化整体损失,被迫在众多相互冲突的信号之间反复摇摆,从而使得参数调整过程漫长与震荡剧烈,直至在混乱区域艰难地找到一种折中甚至扭曲的拟合方式。
无论处于人类知识树的哪一个层次,只要出现似是而非甚至根本错误的内容,都会因这种知识污染导致学习投入的浪费和收敛难度发生或大或小的增加。当然,越是基础层次的知识污染,所引发的学习难度和训练难度增加就会越严重。如果最底层的概念界定、逻辑关系或基本事实已被扰乱,那么所有建构其上的高层知识都会变得岌岌可危,模型也就需要额外消耗海量参数和计算来不断修补这些地基上的裂缝,这就如同在流沙上筑塔,往上的每一层都会耗费惊人。因此,越是基础性、通用性的训练数据出现错误,越可能造成大范围的偏差,并会愈发增加模型后续训练和推理的成本。
当然,重视数据污染,并不意味着训练数据必须绝对“洁净”。现实世界的知识本身就存在不确定性、争议,其积累更是一个不断自我完善、修正和螺旋式上升的过程。即使到目前为止,人类的基础性知识已经在可靠性和广博程度上得到了极大的完善,但仍不能简单地把这些共识性的知识当成标准答案乃至不可被丝毫质疑的真理般去看待。如果把这些相关数据乃至所有数据都简单地处理成唯一、绝对的标准答案,反而可能使模型缺乏辨别能力,不利于培养模型应对真实世界模糊性的鲁棒性,更可能导致模型无法真正理解科学知识的螺旋式发展过程和无法获得真正的创新性创造力。因此,笔者认为,要解决上述这些问题,除了要采取方法直接有效地解决上述数据污染、知识污染的问题以外(比如可以考虑对现有海量数据集全部重新标注,包括用人工智能进行自动标注,或是人机结合地进行二次标注等),在训练方法和训练数据层面还应至少关注以下三个方面的问题。
首先,在整体上对待现有知识应始终保持一定程度的怀疑态度,要引入不确定性,不可将所有成熟知识以绝对标准答案的方式加以标注和训练,对于已经得到广泛认可的知识,可以赋予较高可信度,但不应把它们都标记为不可质疑的绝对结论。具体比如可采用概率分布式标签或让边界适度软化等,让模型从起初就学会在置信度的梯级中进行推理,避免后期因不得不调和存在尖锐矛盾冲突而发生剧烈的权重翻转,从而节省大量修正性计算。
其二,训练数据既要输入正确且非常有把握的知识,也必须有系统地输入纠错型信息与具有启发性的反面典型案例,并且要明确揭示具体是什么错误、错误的根源又在哪里。就好比优秀的教学不仅要讲授正确解法,还应深入剖析典型错题以及导致错误的根源何在,以及如何通过证据和逻辑进行修正。相比单纯记忆正确答案,这种训练更有利于形成真正高效的辨别和推理能力,从而大幅减少在一片混沌中反复试错所空耗的算力。
其三,要对简单重复性知识输入的泛滥保持警惕。大量高频但信息增量极低的,表面不重复但实质上重复的样本,容易导致训练效率下降或过度拟合,模型表面在训练集上表现优异,实则陷入死记硬背,反而牺牲了宝贵的泛化能力,并可能会在推理时被迫调用大量冗余的存储式记忆回路,持续产生不必要的能耗。因此,高质量、多样化、结构清晰并经过合理筛选的数据,应该比单纯增加数据规模重要得多。
第二个可能的原因,是模型参数规模过大,其中相当一部分参数可能没有被有效利用,造成了冗余计算和能源浪费。
扩大模型参数规模,目前来看确实经常能够提升模型的表达能力、记忆能力和复杂任务处理能力。而且,考虑到人工智能训练需要输入全学科的通用知识,其参数总量比单个人脑的神经元数量适当增加,肯定是必要的。然而,参数数量增加并不等于理解能力能够同步增加。模型参数过多之后,可能出现大量冗余,包括可能有相当一部分参数主要用于记忆训练数据中的细节,而不是用于理解知识背后的原理。而且,从人类现有知识总量尤其是从对基础知识层面的理解与洞察来看,掌握目前已知的全部重要知识原理或许根本用不了眼下如此海量的参数。
从人类大脑尤其是那些最为睿智和最有创造力的人类大脑的工作方式来看,人脑并不是把接触过的所有信息都逐字逐句保存下来,而是通过抽象、归纳、压缩和迁移,把大量具体经验转化为少量更具普遍性的概念和规律。人类往往只需要掌握如何理解各类事物的内在机理,以及掌握生成相关知识的原理和方法,就能够在新的情境中推导出具体答案和获得外延性的乃至颠覆性的新知识。而人工智能如果主要依赖扩大参数和增加数据来记忆答案,就会不仅产生更大的存储和计算需求,还会在训练和推理时付出更高的能耗。
人类大脑拥有约 860 亿个神经元和百万亿级的突触,但其中大部分的资源被用于感官运动、身体调控、情绪和自动化程序性技能。即便是人类历史上最博学、最睿智的头脑,真正被调动用于抽象知识理解、深度记忆与跨领域融会贯通的神经元,可能也只占高级皮层资源的一小部分。假如这一占比为 30% 左右(实际上可能低得多),同时结合这样一个粗略估计:三到十个最为博学且睿智的人类大脑的认知合力或许足以将人类所有的最重要知识原理掌握并融会贯通,以此反推,人工神经网络若要真正实现对人类现有知识原理的理解与贯通,所必需的有效参数规模很可能仅在千亿级别。当然,这种估计目前还缺乏严格的实验证明,也不能简单地把模型参数与人脑神经元进行一一对应,因为人脑神经元数量及其生理机制与 AI 模型的‘参数数量、连接方式、学习机制和能量利用方式等’之间存在巨大的或根本性的差异,二者不能直接换算。
然而,当下动辄万亿甚至上十万亿参数的超大模型,虽在部分指标上相比小模型有所提升,其代价却可能是训练和推理过程中或有大量参数长期处于低效甚至无实质作用状态,可能已经造成了严重的“模型原始空间浪费”与随之而来的巨量能源浪费。更加隐蔽且值得警惕的是,这种极其庞大的参数容量可能会诱使模型走上一条表面省力的捷径:不去极致性地驱动神经网络进行深刻的原理性抽象,而是将富余的庞大参数量转而用于对训练数据的“存储式记忆”,直接记住海量样本的表层细节与统计模式。这种记忆式学习虽能拉高某些测试集的分数,却可能会导致泛化能力下降甚至背离了智能体应当压缩信息、抽取规律的节能原则,导致在面对各类情境时需广泛激活庞大的记忆网络进行比对检索,从而持续消耗巨大能量。
如果上述推测是基本正确的,那就意味着未来人工智能的发展可能不需要继续单纯追求更大的模型,而应更加重视参数利用率、知识压缩能力和泛化能力乃至推理效率的提升,以及考虑引入更优的模块化结构设计和动态调用机制等。例如,根据任务属性和特征的不同,可以让模型只激活与当前任务相关的部分参数,并引入稀疏计算、专家混合、外部知识库和分层记忆等方式,避免每次处理问题时都调动整个模型。此外,还可以尝试开发新的训练方法和评估方法,引导模型学习知识之间的结构和规律,而不是把大量参数用于机械记忆。
结语:
总的来看,人工智能能耗巨大,可能既与训练数据质量有关,也与模型规模、模型结构和训练方式等有关。知识污染会使模型在错误、重复和矛盾的信息中反复寻找稳定结构;参数过度膨胀则可能造成大量冗余计算,并推动模型更多地依赖存储式记忆。要解决这些问题,不能只依靠建设更多数据中心或提高芯片性能,还需要进一步改进知识原理库、数据信息库以及模型架构和学习机制等。
人脑凭借稀疏激活、动态回路和高效抽象编码,仅以极低功耗便实现了对复杂知识的灵活调用和创造性综合。这种历经亿万年进化凝练出的低功耗智能,也许可为人工智能的未来指明进一步优化的方向,即:减少知识库污染,以怀疑和开放的态度组织信息,主动输入纠错信息与反面范例;同时,也许需要跳出“参数越大越好”的迷思,寻求更接近必须的有效容量的紧凑架构,引导网络进行原理性抽象而非粗暴记忆,等等。
简言之,人工智能真正需要的,不是无止境地扩大规模,而应是以更少的计算、更高的效率和更可靠的知识结构,获得更接近真正理解的能力。这或许是迈向更高效、更智能且绿色、可持续的人工智能的必经之路。
转载本文请联系原作者获取授权,同时请注明本文来自钟定胜科学网博客。 链接地址: https://blog.sciencenet.cn/blog-3234816-1545838.html
上一篇: 科研探索和人才成长都有概率,但人才评聘不应该靠概率 欢迎参加科学网十佳博文评选活动! 主办单位:
支持单位: 