写作绅士,读作丧尸 X岛揭示板
顺猴者昌 逆猴者亡 首页版规 |用户系统 |移动客户端下载 | 丧尸路标 | | 常用图串及路标 | 请关注 官方公众号:【X岛揭示板】 官方微博: 【@X岛极速版】| 人,是会思考的芦苇
常用串:·豆知识·跑团板聊天室·公告汇总串·X岛路标

No.69301086 - 无标题 - 科学


回应模式
No.69301086
名 称
E-mail
标题
颜文字
正文
附加图片
•涵盖各类科学的讨论板块
•可盖棺定论各热门事件/关注后续/谣言粉碎
•干货什么的最喜欢了!
•请注意发言所包含的信息量,信息量过低的内容将移回综一
•引用请注明出处,民科、伪科学退散

无标题 无名氏 2026-08-22(六)21:56:18 ID:lBNsq7w [举报] [订阅] [只看PO] No.69301086 [回应] 管理
上周和chatGPT一起看了1994年版的《现代科学基础知识:干部选读》,以2026的视角回顾,当年这本书虽然不是完全的预言,但几乎可以当做发展中国家如何科技强国的教科书了。所以我决定让ChatGPT仿照当年的旧例写一写2026年的现代科学基础知识,看看是否能成为一个有价值的科普读物。欢迎肥肥们一同阅读和探讨!以及如果嫌ChatGPT写的不够深入浅出,也可以压力他一下让他讲清楚点
…
无标题 无名氏 2026-10-05(一)21:12:40 ID:lBNsq7w (PO主) [举报] No.69569854 管理
四、深度学习改变了什么
早期机器学习已经可以让机器从数据中调整模型,但很多任务仍然需要人先替机器决定“应该看什么”。
识别图像时,工程师可能先设计程序提取边缘、纹理、轮廓和颜色,再把这些人为选择的特征交给后面的分类器。语音识别和其他领域也有类似做法。
深度学习的重要变化之一,是让这种“怎样表示问题”的工作有更大一部分也进入训练过程。
多层神经网络可以让前面的计算先形成某些较简单的内部关系,后面的计算再在这些结果上继续组合。层数增加以后,模型可以逐渐形成越来越适合任务的内部表示,而不必要求工程师预先规定每一种特征应该长什么样。
这并不意味着人退出了设计。网络结构怎样安排,训练目标怎样规定,什么数据进入训练,怎样评价结果,仍然需要大量人为选择。只是其中一部分过去必须直接由工程师写出的表示方法,现在可以通过训练形成。
这件事看起来只是技术路线变化,后果却很大。图像、声音和语言中的大量规律,本来很难逐条写成程序。只要这些规律能够在大量数据中稳定出现,机器就有机会通过训练把它们吸收到内部表示中。
过去一项任务往往需要工程师先理解问题,再把理解翻译成特征和规则;现在,有些原来只能依靠这种人工翻译的步骤,可以交给数据和训练完成。
…
无标题 无名氏 2026-10-05(一)21:45:22 ID:lBNsq7w (PO主) [举报] No.69570101 管理
五、规模为什么会改变能力
许多复杂任务之所以直到近年才取得明显突破,一个重要原因正是机器可以利用的数据规模和计算规模发生了巨大变化。
对于手写数字,几万张图片已经能提供相当丰富的变化。但语言面对的是另一种数量级。
一句话的意思不仅取决于其中有哪些词,还取决于词语怎样组合、前后文说了什么、说话的人默认哪些背景知识。同一个词放进不同领域可能含义不同,同一个问题在不同语境中也可能需要完全不同的回答。
如果希望机器只完成一个很窄的任务,需要学习的范围还比较有限。如果希望同一个模型能够阅读新闻、翻译文章、编写程序、解释科学概念、总结文件并回答开放问题,它就必须接触远为广泛的经验。
数据规模扩大带来的不只是“同样的东西看更多遍”。更重要的是,模型接触到的变化范围扩大了。
一种语言怎样写法律文件,怎样写小说,怎样讨论化学,程序员怎样解释错误,历史学家怎样描述一个事件,这些材料之间有很多不同,也有大量共同结构。模型如果能够同时从这些材料中学习,就可能形成一些不只服务于单一任务的内部关系。
近年的一个重要变化,是同一个大型模型开始能够承担许多原本分开的任务。
过去,机器翻译是一套系统,图像识别是一套系统,语音识别和问答又各自发展。今天,它们中的相当一部分开始建立在共同的大模型能力之上。模型先在极大规模的数据上学习较为通用的表示,再通过指令、示例、进一步训练或者外部工具用于不同任务。
这使人工智能逐渐从“一种任务配一套专门模型”,走向一种更通用的信息处理基础能力。
当然,数据很多并不意味着什么数据都同样有价值。同一批材料重复一千遍,不会产生一千倍新的经验;错误、重复或者极度单一的数据,也可能让模型学得更加狭窄。真正重要的,是模型能够接触到多少彼此不同、又与任务有关的有效经验。
这个问题到了大型模型时代,会变得更加重要。因为这时已经不能只问“有多少数据”,还必须问:这些数据究竟是怎样来到这里的。
…
无标题 无名氏 2026-10-05(一)21:45:37 ID:lBNsq7w (PO主) [举报] No.69570102 管理
六、为什么预测后面的文字会产生这么多能力
大型语言模型常见的一种训练方法,看起来甚至有些简单:给出一段文字,要求模型判断后面最可能出现什么。
如果材料只有几个词,这种任务确实很简单。但文字规模扩大以后,预测后文需要利用的关系会越来越复杂。
一篇历史文章写到某个人物,接下来发生什么,取决于人物、年代和事件之间的关系;一段程序能不能继续写下去,取决于变量、函数和前面代码的结构;一个科学问题如何回答,则需要利用大量概念以及它们之间的联系。
为了在极其广泛的文本中不断预测后续内容,模型不得不形成越来越丰富的内部关系。
这并不等于它在内部保存了一部可以逐页翻阅的百科全书,也不能说明它以和人完全相同的方式理解这些内容。更准确地说,语言中大量反复出现的结构、事实关系和表达规律,被吸收到模型的内部表示中。
这样训练出来的模型,在使用时可以根据新的输入生成此前没有完整出现过的内容。它可以改写一句话,可以根据资料写摘要,可以完成程序片段,也可以把若干概念组合起来回答一个新问题。
“生成”由此成为一种新的计算接口。
过去使用软件,人通常必须知道某个菜单、命令或者程序提供什么功能;生成式模型则允许人直接用语言描述目标,让机器根据已有能力组织输出。
这显著降低了使用复杂计算能力的门槛,也使许多原来相互分开的软件功能开始集中到同一个交互界面中。
…
无标题 无名氏 2026-10-05(一)21:45:56 ID:lBNsq7w (PO主) [举报] No.69570105 管理
七、模型学到的世界,从哪里来
一个模型接触了极其庞大的训练材料,并不意味着它接触了“世界本身”。
现实中的事情首先要发生,然后被人观察、测量或者经历;其中一部分才会被记录下来。记录可能变成书籍、报纸、论文、档案,也可能成为实验数据、病历、企业文件、照片、录音、网页和论坛帖子。记录下来以后,还必须被保存下来;纸质材料可能经过几百年仍然存在,也可能毁于战乱和火灾,数字材料看起来容易复制,却也可能随着网站关闭、数据库迁移或者平台停止维护在几年之内消失。
保存下来的材料还需要能够被机器取得和处理。一部从未数字化的旧书,对今天的模型几乎等于不存在;一批已经扫描但无法可靠识别的档案,也很难直接使用;大量存在于私人组织和企业内部的数据,则可能从来不会进入公共训练材料。
因此,一条知识真正成为人工智能能力的一部分,中间经过的并不是一个简单过程:
事情发生 → 被观察或测量 → 被记录 → 被保存 → 能够取得 → 被转换成机器可处理的形式 → 进入训练
每一步都会留下选择。
哪些事情值得写进正式文件,哪些经验主要靠口传和操作继承;哪些书籍被大量出版,哪些只留下极少副本;哪些语言拥有庞大的出版和网络资料,哪些语言很少数字化;哪些机构愿意长期保存原始数据,哪些只保留最后整理出的报告——这些差异都会影响后来机器能够看到什么。
更重要的是,这些缺失并不是随机发生的。
一个社会怎样生产知识、怎样记录事情、怎样保存档案、什么资料可以长期取得,本身都有稳定的制度和习惯。它们原本并不是为人工智能设计的,但几十年甚至几百年以后,却可能直接决定模型能够从过去学到多少东西。
于是,知识生产、记录、保存和可访问性的制度,会成为人工智能能力的一部分。
这并不是说这些制度被直接写进了模型程序。它们更早地作用于训练材料:决定什么经验留下来了,什么消失了,什么被反复记录,什么几乎没有留下痕迹。模型再从这些材料中形成自己的内部结构。
扩大训练规模可以减少“材料太少”造成的问题,却不能自动恢复没有留下记录的世界。
这也是为什么“读过整个互联网”即使真的能够做到,也不能等同于“读过人类经验”。互联网只是人类记录的一部分;今天还能取得的互联网,又只是过去互联网保存下来的一部分。
…
无标题 无名氏 2026-10-05(一)21:46:14 ID:lBNsq7w (PO主) [举报] No.69570108 管理
八、数据记录的,有时不只是我们想研究的对象
数据还有另一层容易忽略的性质。
医院数据库记录疾病,但它同时记录了哪些人能够到医院、医生怎样诊断、哪些检查被做了以及医院怎样保存病历。犯罪数据记录案件,也同时受到报警、立案和统计制度影响。企业销售数据不仅反映消费者,还反映企业过去怎样定义客户、怎样考核员工、哪些失败交易值得记录。
因此,一套数据常常同时包含两种东西:它想描述的现实,以及产生这套数据的制度和过程。
如果模型直接从其中寻找规律,两者可能一起被学进去。
一个地区登记了更多某种疾病,不一定只说明那里疾病更多,也可能说明检测能力更强;某类事件在数据库中很少,也可能因为它很少被记录。
这并不是人工智能特有的问题。统计学、医学和社会科学长期都要处理类似困难。
人工智能让这个老问题变得更加重要,是因为今天的模型能够吞下远超个人阅读能力的数据规模。数量增加以后,人很容易产生一种错觉:资料足够多,局部偏差就会相互抵消。
有些随机误差确实会随着样本增加而减小。但如果记录机制本身持续朝某个方向筛选,更多同类数据只会更加准确地学习这种筛选结果。
…
无标题 无名氏 2026-10-05(一)21:46:33 ID:lBNsq7w (PO主) [举报] No.69570110 管理
九、更多资料为什么不自动产生更正确的知识
人工智能很擅长从大量材料中发现反复出现的规律。
但资料更多,只能让模型更充分地学习这些材料中存在的规律,并不能保证这些规律本身正确。
例如,如果我们主要用哥白尼以前的欧洲天文学著作训练一个模型,它学到的自然会是一套以地球为中心解释天体运动的知识体系。它可以非常熟练地解释行星为什么有时看起来向后运动,也可以利用当时已经相当精细的计算方法预测天体位置。
如果把这样的资料增加十倍、百倍,它会把这套知识学得更加完整,却不会因为书读得足够多,就自己得到后来建立起来的现代太阳系图景。
这里缺少的并不是更多旧书,而是新的观测和新的证据。
随着天文测量越来越精确,望远镜带来了过去没有的观察结果,原有理论与新的事实不断发生摩擦,人类才逐渐建立起新的天文学。
人工智能面对已有资料时也是如此。
如果历史记录长期重复同一种错误,模型没有一种站在资料之外的特殊能力,能够仅凭“读得足够多”自动把它纠正过来。相反,它完全可能把这种错误学得非常完整,甚至比任何个人都更熟练地解释和运用整套旧知识。
所以,更多数据解决的是“怎样更充分利用已有经验”的问题,却不能单独解决“已有经验本身是否正确”的问题。
新的知识最终仍然要来自世界本身:新的观察、新的测量、新的实验,以及能够让不同解释接受检验的方法。
人工智能能够大幅提高我们利用已有知识的能力,但学习过去留下的记录,不能代替继续向现实世界取得新证据。
…
无标题 无名氏 2026-10-05(一)21:46:55 ID:lBNsq7w (PO主) [举报] No.69570114 管理
十、为什么一个很强的模型仍然不等于一个可用的系统
模型训练完成以后,拥有的是一种处理信息的能力。现实工作却通常要求更多。
一个模型回答企业库存问题,需要取得当前数据库;安排出差,需要访问日历和交通信息;辅助研究,需要读取实验数据;控制设备,则必须接收传感器状态并把结果送给执行机构。
因此,现代人工智能越来越多地和搜索、数据库、普通软件以及其他工具结合。
模型可以负责解释目标、处理非结构化信息、选择下一步操作;传统程序则负责精确计算、查询可靠记录和执行明确动作。
这种组合十分重要。因为模型内部保存的知识可能过时,也可能不够精确。能够实时查询可靠外部资料,就不必要求模型把一切事实永久记在参数中。对于计算、数据库修改和其他需要精确执行的任务,也可以把工作交给更可靠的普通程序。
这使人工智能从“给出一段文字”逐渐走向“完成一项任务”。
但系统越向现实行动靠近,对可靠性的要求也越高。一个模型偶尔把一段广告写错,代价可能很低;如果错误结果直接进入财务系统、生产设备或者医疗决策,完全相同的错误率就可能不可接受。
所以评价一项人工智能应用,不能只问模型是否演示过这种能力。还要继续问:它需要哪些数据?这些数据是否可靠?能否接入现实流程?错误是否容易发现?结果怎样验证?失败以后谁来接管?
这些问题不是给人工智能设置额外障碍。它们本来就是任何技术从“能够工作”走向“成为现实能力”必须经过的过程。
…
无标题 无名氏 2026-10-05(一)21:56:05 ID:lBNsq7w (PO主) [举报] No.69570199 管理
十一、人工智能为什么会出现一些很不像人的错误
现代模型有一个很有意思的特点:它可以完成许多人认为相当困难的任务,却仍然可能在一些简单问题上突然失误。
这和它形成能力的道路有关。
人的知识建立在身体经验、长期教育、社会生活和现实行动中。模型则主要从训练材料中形成内部关系。两者都能表现出语言、推理和分类能力,却不必以同一种结构实现。
因此,用人的直觉预测机器在哪些地方会失败,并不总是可靠。
一个模型可以写出复杂程序,却在一个略微改变的问题上漏掉明显条件;可以生成非常流畅的科学说明,却同时编出一个不存在的引用;也可能在多数情况下表现稳定,在一种训练中很少出现的环境中迅速失效。
这并不意味着模型“完全不懂”,也不能因为它偶尔完成了困难任务,就认为所有较简单任务都已经自动解决。
更实用的评价方式,是看某种能力在什么条件下稳定存在。成功率有多高?输入稍有变化会不会失效?失败容易不容易被发现?能否用外部资料检查?错误的代价有多大?
这种判断方式并不只适用于人工智能。任何复杂技术最终都要从演示能力转向可靠性、边界和使用条件。
…
无标题 无名氏 2026-10-05(一)21:56:23 ID:lBNsq7w (PO主) [举报] No.69570204 管理
十二、机器是否“理解”,不是所有问题的前提
大型模型能够写作、编程、回答问题以后,一个自然的问题是:机器究竟是不是在“理解”这些内容?
这个问题有一部分可以实验,有一部分则取决于我们怎样定义“理解”。
如果所谓理解,是指能够利用概念之间的关系处理新问题,那么现代模型已经表现出相当广泛的这类能力。它们可以把同一件事换一种方式解释,也可以把学到的关系迁移到训练中没有逐项指定的新任务。
但这不能自动推出模型拥有和人一样的主观体验、意图或者自我意识。
前一章已经看到,人类智能形成于神经系统、身体和社会环境的长期相互作用。机器通过数字数据训练形成能力,是另一条完全不同的道路。
在多数实际问题中,我们也没有必要先解决这个哲学问题。
一座桥不需要具有“理解力”,我们仍然可以判断它能否承重;一个模型是否具有和人一样的意识,也不是判断它能否可靠完成某项工作的前提。
真正需要知道的是,它在什么条件下拥有什么能力,以及这种能力能否被验证和使用。
…
无标题 无名氏 2026-10-05(一)21:56:41 ID:lBNsq7w (PO主) [举报] No.69570206 管理
十三、从一种任务一个程序,到一种模型承担许多任务
回头看人工智能的发展,最重要的变化并不只是机器在某几个测试中超过了人。
更深的变化发生在机器获得能力的方式上。
过去,计算机的用途主要来自人写出的程序。机器学习以后,一部分处理方法可以从数据和反馈中形成。深度学习进一步让内部表示本身也更多地由训练塑造。到了大型基础模型,同一套训练得到的能力又开始跨越过去彼此分开的任务。
这并没有使程序、数据库、搜索、测量和传统工程消失。相反,人工智能越进入现实,它越需要同这些系统结合。
模型提供的是一种新的通用能力:从大量经验中形成内部表示,在不可能逐项写出规则的问题上处理新的输入,并利用语言等开放形式与人和其他软件连接。
这项能力有非常明显的限制。它受到训练材料、计算资源和现实数据的约束;从记录中学到的世界并不等于世界本身;能够生成合理结果也不自动意味着结果已经经过验证。
但它已经改变了计算技术的一条基本边界。
过去,人通常必须先知道怎样解决一个问题,才能把解决方法写进机器。现在,在一部分问题上,人可以先提供经验、目标和反馈,让机器形成一套人没有逐条写出的处理方法。
而当这种能力开始集中在能够处理许多任务的通用模型中以后,人工智能就不再只是若干特殊软件的总称。它开始成为现代计算体系中的一个新的基础层。
下一节讨论的,将是另一道边界:当机器不只处理文字、图像和数据,而需要在现实世界中感知位置、控制运动、应对变化时,计算能力怎样真正变成行动能力。
…
无标题 无名氏 2026-10-10(六)20:18:07 ID:lBNsq7w (PO主) [举报] No.69598648 管理
第三节 感知、控制与机器行动

一、固定环境里的精确机器
工业机器人并不是人工智能出现以后才有的。几十年来,汽车、电子、机械加工等工厂里已经有大量机械臂完成焊接、搬运、喷涂和装配。它们可以一天重复成千上万次相似动作,而且位置误差很小。

这样的机器并不一定需要“看懂”周围世界。工程人员可以先规定机械臂应该经过哪些位置:从这里下降,到那里夹紧,再抬起、转动,最后移动到另一个位置。机械臂的每个关节由电机驱动,编码器不断测量关节已经转到了什么角度。控制器比较“现在在哪里”和“应该在哪里”,再调整电机。

因此,一个机械臂即使不知道自己抓的是汽车零件还是一块木头,也可以把动作完成得非常精确。这里有一个重要条件:现实环境也必须配合机器。

工件要每次出现在差不多相同的位置,所以工厂使用夹具把它固定;传送带在规定位置停止;零件尺寸受到公差控制;无关物体不会随意进入工作区域;必要时还会用围栏把人和机器隔开。如果机器难以应付世界的全部变化,一种非常有效的办法,就是先把机器周围的世界变得可预测。

这种方法直到今天仍然十分重要。在大量重复生产中,让环境标准化,往往比制造一台什么情况都能应付的机器人更便宜、更快,也更可靠。

问题出现在环境开始变化以后。把原本固定的零件向旁边挪十厘米,那台机械臂仍然可能准确地伸向原来的位置。它的电机没有坏,控制也没有失灵,只是它不知道世界已经变了。机器要面对这样的变化,首先必须获得关于周围环境的信息。
…
无标题 无名氏 2026-10-10(六)20:18:30 ID:lBNsq7w (PO主) [举报] No.69598650 管理
二、机器怎样知道周围发生了什么
机器可以使用很多种传感器。编码器告诉机器关节转到了哪里;加速度计和陀螺仪反映自身怎样运动;力传感器可以知道是否碰到了东西;温度、压力、声音和化学传感器观察不同的物理变化。摄像头、雷达和激光雷达则可以在较大范围内取得环境信息。

摄像头有一个很特殊的优点:一张画面里可以同时包含物体的位置、大小、形状、颜色、文字、道路标志、人的动作以及物体之间的关系。而且人类环境本来就有大量信息是为视觉准备的。交通标志、标签、仪表、屏幕、指示灯和人的手势,原本都是给人看的。机器一旦能够可靠处理图像,就可以直接利用许多已经存在的环境,而不必给每一件东西重新安装专门接口。

但机器感知并不只依赖视觉。摄像头可以看到机械臂前面有一个杯子,却未必知道杯子有多重;真正接触以后,力和触觉信息才开始变得重要。无人机保持姿态时,陀螺仪和加速度计通常比视觉更直接。自动驾驶汽车还可以利用雷达、轮速、卫星定位等不同来源的信息。

这些传感方式观察世界的物理原理不同,失效方式也不同。黑暗、强光、雨、雾、积雪、遮挡和地面反射,对不同传感器的影响并不相同。因此,现实机器经常把多种信息结合起来。

这也带来新的问题。传感器会有噪声,不同设备需要校准,时间可能不同步,两个传感器还可能给出互相矛盾的结果。信息越多,并不自动意味着机器对世界知道得越准确。

真正的问题是:为了完成这项任务,机器必须知道什么?恒温设备不需要知道房间里桌椅的位置。机械臂抓取一个零件,需要知道零件在哪里、朝什么方向、机械臂自身在哪里,以及是否已经抓牢。汽车则需要知道道路在哪里,周围有哪些物体,它们正在怎样运动,自己又处于什么状态。

这些信息未必由某个传感器直接给出。机器往往需要把许多不完全可靠的测量合在一起,形成对当前状态的估计。它并不需要复制整个现实世界,只需要形成一份足以支持下一步行动的状态。
…
无标题 无名氏 2026-10-10(六)20:18:51 ID:lBNsq7w (PO主) [举报] No.69598652 管理
三、机器怎样把动作稳定下来
知道自己在哪里以后,机器还要让动作真正到达目标。假设机械臂应该移动到某个位置,最简单的办法,是不断测量现在的位置,再和目标比较。如果还差得远,就继续驱动;如果已经接近目标,就减小动作。这种根据结果不断修正行为的方法,就是反馈控制。

但“有误差就纠正”还不够。真实机械结构有质量和惯性,电机产生的力量也不会在发出命令的一瞬间消失。如果机械臂正在高速接近目标,等它真正到达以后才决定减速,往往已经来不及。它会冲过头,再向相反方向纠正,然后又冲回来。如果控制方式不合适,反馈反而会制造振荡。

工业控制中有一类极其常见的方法叫PID控制。它大体同时考虑三件事:现在离目标差多少,偏差是否已经持续了一段时间,以及偏差正在以多快的速度变化。

如果离目标还很远,可以较强地纠正;如果已经快速接近目标,就提前减弱动作;如果长期总是差一点,还可以逐渐补偿这种持续误差。不同系统会使用不同的控制方法,但其中有一个非常普遍的思想:控制不仅要纠正误差,还要考虑这次纠正接下来会造成什么。

无人机保持姿态、汽车控制速度、电机维持转速、工业设备稳定温度和压力,都包含类似的问题。反馈使机器不必事先知道未来会出现的每一个扰动。

无人机受到一阵横风以后,机身开始倾斜。传感器发现姿态变化,控制系统调整几个电机的推力;姿态恢复以后,再减小修正。控制器不必提前知道这阵风什么时候出现。只要偏差能够及时被发现,就有机会在运行中把它纠正回来。
…
无标题 无名氏 2026-10-10(六)20:19:09 ID:lBNsq7w (PO主) [举报] No.69598654 管理
四、现实世界还要求及时反应
反馈控制还有一个容易被忽略的条件:时间。现实中的闭环并不是瞬间完成的。世界发生变化,传感器测到它;数据要传输和处理;计算机作出判断;命令再送到执行机构;电机、液压装置或者其他机构开始动作。每一步都需要时间。

如果整个过程太慢,机器作出的其实是对“过去那个世界”的反应。房间温度变化很慢,晚几秒处理通常没有多大关系。

无人机保持平衡则完全不同。机身正在倾斜时,几百毫秒已经可能很重要。如果所有传感数据都先上传到远方服务器,等复杂计算完成以后再把结果传回来,回来时飞机可能早已处于另一种姿态。高速行驶的汽车也一样。

所以对行动系统来说,计算能力不仅是“能不能算出来”,还包括“能不能及时算出来”。这也是为什么现实机器经常同时存在不同时间尺度的计算。

一些路线规划和复杂判断可以慢一些完成;姿态、速度和电机控制则必须在很短时间内连续运行。很多计算因此必须留在机器本地,而不能全部交给远端。答案是否正确和答案是否及时,在行动系统中往往不能分开。
五、机器进入不断变化的环境
固定工位可以通过夹具、围栏和标准化减少变化,道路却很难这样处理。车辆和行人在运动,光照不断变化,标线可能磨损,道路可能施工,临时障碍随时可能出现。

自动驾驶汽车因此必须一边运动,一边不断感知环境。它需要判断道路在哪里,周围有哪些物体,它们正在怎样运动;还要决定保持速度、减速、停车还是转向。

机器自己的动作又会立即改变下一刻面对的环境。汽车转动方向盘以后,摄像头中的画面会变化;减速以后,与前车之间的距离关系也会变化。于是,一个完整的闭环出现了:感知 → 判断 → 行动 → 世界变化 → 再感知。

自动驾驶之所以成为近年很有影响力的人工智能应用之一,一个重要原因就在这里。它把图像识别、状态估计、预测、规划、控制、计算延迟和安全问题放进了同一个现实系统。这些问题任何一个单独看都不新鲜,真正困难的是它们必须同时工作,而且汽车面对的环境并没有预先替机器整理好。
…
无标题 无名氏 2026-10-10(六)20:19:27 ID:lBNsq7w (PO主) [举报] No.69598657 管理
六、从认识环境到形成行动
传统工程通常喜欢把从感知到行动的过程分得比较清楚。例如汽车可以先从图像中识别车辆,再计算车辆的位置和速度,再预测它可能怎样运动,然后规划路线,最后由控制系统执行。

机械臂也可以先识别一个杯子,测量它的三维位置和朝向,再计算抓取位置,最后控制关节运动。这种结构有明显优点,每一步都比较容易理解,也比较容易单独检查。

机器学习的发展使另一种路线逐渐成为可能。上一节已经看到,神经网络可以从大量输入中形成一些人没有逐项规定的内部表示。这样的表示不一定只用来判断“这是一只猫”或者“这是数字7”,也可以参与形成行动。

例如一个机器人要抓桌上的杯子,它当然可以先明确计算杯子的距离、方向和大小。但通过大量抓取经验,它也可能形成一些更直接服务行动的内部关系:这个位置够不够得到,从哪里抓更稳,需要多大力,向这个方向移动会不会碰到其他东西。

这些内部状态未必能够被人逐项翻译成传统工程量,却仍然可以帮助机器产生正确动作。于是,从计算结构上看,可以出现一种很直接的关系:传感器输入 → 神经网络 → 动作。

这和上一节的“像素 → 神经网络 → 数字判断”在原理上并没有一道无法跨越的鸿沟。机器学习最初大量用于感知,后来逐渐进入预测、规划和动作选择。一些系统还把从感知到行动之间的多个步骤一起训练,这通常称为端到端学习。

现实机器经常采用混合结构。学习模型处理难以写出规则的环境信息,传统控制器负责快速、稳定地执行动作;一些安全限制则仍然可以由独立系统负责。过去必须由工程师事先规定的一部分环境表示和行动策略,现在也可以从经验中形成。
…
无标题 无名氏 2026-10-10(六)20:19:45 ID:lBNsq7w (PO主) [举报] No.69598660 管理
七、机器可以一边行动,一边认识世界
更通用的机器人还会遇到自动驾驶中没有那么突出的一类问题。一个物体离自己多远,可以通过视觉估计;但它究竟有多重、表面有多滑、是否柔软、里面有没有液体,往往不能只靠远距离观察准确知道。

机器人可以先伸手接触。手指碰到物体以后,可以知道表面是否容易滑;稍微抬一下,可以判断它比预计轻还是重;物体开始移动以后,还能发现内部东西是否会晃动。行动本身产生了新的信息。

人也一直这样做。拿起一个不熟悉的箱子时,我们通常不会先测量它的质量,再决定如何发力。我们会先试着提一下,然后根据箱子的反应立即调整力量。

所以机器的感知并不一定在行动以前已经完成。有些信息只能通过行动获得。这使“感知—判断—行动”的关系进一步变成一个连续过程。机器可以为了获得信息而行动,再根据新信息继续调整下一步动作。

对于更通用的机器人来说,环境状态也不一定首先是一份完整的物理说明书。一个机器人未必需要知道某个物体“准确重3.72千克”,才知道它应该双手去拿;也未必需要把所有空间关系换算成一组人能读懂的坐标,才知道一个东西“够得着”或者“过不去”。

机器可以形成直接和行动有关的内部关系。这种能力如果进一步发展,机器面对现实世界的方式就会和传统自动化出现很大差别。传统机械臂要求环境先被整理好;更通用的机器则需要在不断变化的环境中,边感知、边行动、边修正自己对世界的认识。
…
无标题 无名氏 2026-10-10(六)20:20:05 ID:lBNsq7w (PO主) [举报] No.69598663 管理
八、为什么少见情况最难处理
机器进入开放环境以后,会遇到一个很难彻底消除的问题:现实情况的组合几乎没有尽头。正常天气、正常道路、普通车辆可以产生大量数据,也最容易被模型学好,真正困难的往往是少见组合。

强烈逆光下正在施工;货车掉下一件形状奇怪的物体;原有标线和临时标志互相冲突;行人从遮挡物后突然出现;一个熟悉物体以从未见过的姿态出现。每一种情况都很少见,但机器运行得足够久以后,就会不断碰到各种不同的“很少见”。

所以,一个系统在99%的普通场景里表现很好,并不意味着剩下1%的工作也只剩下原来的百分之一。剩下的部分往往更复杂。这些少见、边缘和异常情况,常被称为corner case,或者长尾问题。

一种处理办法,是让真实运行不断产生新的经验。系统一旦在某类场景中表现不好,人们就可以把这些场景收集出来,加入后续训练和测试。自动驾驶尤其容易形成这种循环:大量车辆在真实道路上运行,不断暴露过去没有充分考虑的情况,再把其中一部分变成新的训练材料。

但单靠等待并不够。真正危险的事件往往太少,不能等它自然出现很多次。因此,还可以主动寻找罕见场景,或者在仿真环境中制造强光、暴雨、打滑、传感器故障和突然障碍,让机器反复经历现实中很难大量收集的情况。

无论真实数据还是仿真,都不可能提前列举未来所有组合。因此,可靠系统还需要知道自己的工作边界。如果多个传感器互相严重矛盾,如果输入明显偏离训练中见过的情况,或者系统无法可靠判断接下来应该做什么,就需要进入一种更保守的状态。
…
无标题 无名氏 2026-10-10(六)20:20:27 ID:lBNsq7w (PO主) [举报] No.69598666 管理
九、自主系统怎样真正成为现实能力
一种很自然的想法是:机器负责普通情况,遇到困难以后,把控制权交还给人。这在一些场景中有效,但并不是普遍可靠的安全办法。

如果机器已经连续很长时间自己运行,人可能没有持续保持对当前状态的完整认识。突然要求人在几秒内理解环境、判断机器为什么退出并立即接管,本身就可能很困难。而且机器最希望退出的时候,往往正是环境最复杂的时候。

因此,可靠系统需要预先设计不同的退路。汽车可以减速并寻找安全位置停车;无人机可以先维持稳定姿态;工业设备可以停止动作、释放危险能量;某些系统还可以切换到能力较弱、但行为更容易预测的备用控制方式。

人的接管只是其中一种可能。真正的问题始终是:在当前状态下,哪一个部分拥有足够的信息、能力和反应时间。

开放环境很难,也不意味着所有机器都应该越来越通用。工业机械臂提供了另一条一直有效的路线:继续改造环境。仓库可以规定货架和地面路线;工厂可以使用标准托盘、夹具和定位标记;港口可以限制车辆运行区域。

如果稍微改造环境就能让机器可靠工作,就没有必要要求机器理解无限复杂的世界。道路、家庭、农田、建筑工地和灾害现场则很难完全这样做,这些地方更需要机器自己适应环境。

人形机器人之所以重新受到重视,也可以从这个角度理解。现代建筑、楼梯、门把手、工具和工作台原本就是按照人的身体设计的。如果机器拥有与人相近的身体结构,它理论上可以直接利用很多现成环境。

但人形结构同时带来平衡、能耗、机械复杂度、可靠性和成本等困难。所以现实中的机器发展,很可能长期存在两条并行路线:让机器越来越能适应现实,或者继续把现实设计得更适合机器。

从固定工位上的机械臂,到自动驾驶,再到更通用的机器人,机器行动能力扩展的并不只是“能够做多少种动作”。更重要的是,它能够面对的现实范围越来越大。

固定环境中的机器依靠坐标、反馈和标准化就能获得很高精度;环境开始变化以后,需要更丰富的感知和状态估计;开放环境进一步要求机器在有限时间内判断、行动,再根据结果修正下一步;机器学习又使其中一部分表示和策略可以通过经验形成。

最终,机器行动变成一个持续运行的循环:感知世界,形成足以行动的内部状态,选择动作,改变世界,再从新的世界继续感知。

人工智能正在改变这个循环中越来越多的部分,但物理世界的约束并没有消失。传感器会出错,计算需要时间,控制存在延迟,动作会产生新的扰动,训练数据也不可能覆盖未来的一切情况。

当计算结果不再只是屏幕上的文字和图像,而开始真正变成车辆转向、机械臂运动和机器施加的力量以后,算法最终仍然要回到现实世界接受检验。

下一节将进入另一种更加复杂的对象。计算机和机器人主要处理信息与外部物理世界,而现代生命科学正在使人类获得另一类能力:读取生命系统,并逐步设计、干预和改造其中的一部分。

UP主: