回应模式 - No.69301086


No.69301086 - 科学


无标题无名氏No.69301086 只看PO

2026-08-22(六)21:56:18 ID:lBNsq7w 回应

上周和chatGPT一起看了1994年版的《现代科学基础知识:干部选读》,以2026的视角回顾,当年这本书虽然不是完全的预言,但几乎可以当做发展中国家如何科技强国的教科书了。所以我决定让ChatGPT仿照当年的旧例写一写2026年的现代科学基础知识,看看是否能成为一个有价值的科普读物。欢迎肥肥们一同阅读和探讨!以及如果嫌ChatGPT写的不够深入浅出,也可以压力他一下让他讲清楚点

无标题无名氏No.69547801

2026-10-01(四)21:13:05 ID: wD5Va4l

感觉是量子力学和广相科普

无标题无名氏No.69569838

2026-10-05(一)21:10:59 ID: lBNsq7w (PO主)

第二节 人工智能:机器怎样从经验中形成能力
一、过去的计算机,首先要求人知道规则
上一节讲过,计算机能够按照程序处理数据。长期以来,这种能力有一个很自然的前提:人必须先知道怎样把任务写成规则。
计算工资,可以规定税率、收入和扣除项目怎样计算;数据库检索,可以规定符合哪些条件就返回哪些记录;工厂控制系统,也可以规定传感器读数达到什么范围以后启动什么设备。只要规则足够明确,计算机能够比人快得多,也稳定得多。
但人类长期掌握着另一类能力。
我们能认出一张陌生的脸,听懂一句从未听过的话,判断一张模糊照片里是什么东西,也能从一篇文章中大致把握作者在说什么。这些事情并不是没有规律。问题在于,规律很难被完整写成一张规则表。
例如手写数字“7”。不同人的写法可以粗细不同、倾斜不同、大小不同,有的人中间加一横,有的人不加;笔迹还可能断裂、模糊,甚至和“1”有些相似。人通常仍然能够识别。若要求程序员预先规定“只要满足这些具体条件,就是7”,很快就会碰到大量例外。
早期人工智能曾经大量尝试这种路线:把专家使用的知识和判断规则直接写进机器。它在规则明确、范围有限的问题上取得过成功,但面对图像、语言和复杂环境时,规则数量会迅速增长,而且新的例外不断出现。
机器学习带来的重要变化,是把其中一部分工作倒了过来。
人不再要求先把完整规则写出来,而是给机器许多实例,让它在处理这些实例的过程中形成自己的处理方法。

无标题无名氏No.69569845

2026-10-05(一)21:11:46 ID: lBNsq7w (PO主)

二、机器究竟学到了什么
还是从手写数字开始。
一张28×28像素的灰度图片进入计算机以后,可以表示成784个数,每个数记录一个位置的明暗程度。为了说明方便,我们暂时只看其中几个,把它们叫作a、b、c……
下一层会产生另一批数,例如d、e、f……其中每一个数,都由上一层的许多数按照同一种简单办法算出来。例如:
d = 0.8a − 0.3b + 0.2c + … + 0.1
算完以后再作一个很简单的处理:如果结果小于0,就把它记成0;如果大于0,就保留原来的结果。
e也是这样算,只不过前面的系数换成另一组数;f也是如此。这一层的其他数字,都采用同一种基本计算方法。
到了下一层,还是一样。假如这一层已经得到d、e、f……,下一层的某个数p可以是:
p = 0.4d + 0.7e − 0.2f + … + 0.3
然后同样判断一次正负。
所以,如果某一层是一批数a、b、c……,下一层是另一批数d、e、f……,每一个下一层的数,都是把上一层的许多数分别乘上不同系数,再加起来。基本规则并不会随着层数增加而突然变得神秘,变化的是每个连接使用什么系数。
每层的数字个数也不必相同。一张图片开始时有784个输入,下一层可以变成128个数,再下一层变成64个,最后只留下10个数,分别表示这幅图像更像0、1、2……还是9。哪个数最大,模型就作出相应判断。
单独拿出任何一个节点来看,它所做的事情都只是乘法、加减法,再加一次简单判断。复杂性来自另一件事:这样的节点很多,一层接一层,而且每一条连接前面的系数都可以不同。
这些系数,以及算式最后额外加上的数,就是模型能够通过训练改变的参数。
一个很小的“784—128—64—10”网络,已经有大约11万个这样的参数。怎样理解这个数字所产生的复杂程度?
不妨作一个极端简化:假定每个参数只有10种可能取值。那么整个网络就有10的11万次方种可能的参数组合。这个数字写出来并没有多少帮助,可以换一种想法。
宇宙从大爆炸到今天大约经过了4×10^17秒。可观测宇宙中的恒星数量大约在10^22到10^24这个量级。假定每一颗恒星都变成一台计算机,而且每秒能够试十亿种参数组合,从宇宙诞生一直试到今天,所有恒星加在一起也只能尝试大约10^51种组合。和前面的参数空间相比,这个数量仍然小得几乎没有意义。
甚至可以继续作一个荒唐的想象:把每一颗恒星都换成一整个同样大小的可观测宇宙,再让里面每颗恒星都这样计算;然后再把里面的每颗恒星继续换成一个宇宙,一层一层套下去。要把这个数量级追上,需要套上数千层。
真实训练当然绝不会把所有可能组合逐个尝试。它利用的是另一件事:模型每次犯错以后,可以算出许多参数分别朝哪个方向稍微改变,通常能使误差减小一点。于是它不是在一个不可想象的组合空间里随机试错,而是沿着能够让结果逐渐改善的方向,一点点改变参数。
经过大量训练以后,一批局部看起来极其简单的加减乘法,最后却可以共同完成数字识别这样的任务。神经网络的复杂,并不意味着每一步计算复杂。恰恰相反,每一步可以简单得近乎乏味;复杂能力来自海量简单关系经过训练以后形成的组合。
经过这些层以后,模型内部形成了一批新的数值关系。同一个“7”可以写得很大、很小、很斜,原始像素可能相差很多;经过多层计算以后,它们却可能变成较为接近的内部状态。相反,有些局部相似的“1”和“7”,又可以逐渐被分开。机器学习中所谓“表示”,大体说的就是这种事情:原始数据仍然是那些数据,但模型学会了一种更适合当前任务的组织方式。

无标题无名氏No.69569852

2026-10-05(一)21:12:23 ID: lBNsq7w (PO主)

三、为什么训练样本之外的表现更重要
一个模型如果只会认训练时见过的图片,并没有多少实际价值。
真正有用的是,换一个人写,换一支笔,图片稍微变暗,数字向旁边移动几个像素,它仍然能够作出合理判断。这种把训练中形成的能力带到新情况中的表现,通常称为泛化。
泛化并不会因为模型足够复杂就自动出现。
恰恰相反,一个拥有大量可调参数的模型,很可能把训练材料中的偶然细节也学进去。例如一批训练图片中,猫恰好大多出现在沙发上,狗大多出现在草地上。模型完全可能利用背景完成分类,而不是学会我们真正希望它掌握的动物特征。这样,它在训练材料上的成绩可以非常好,一换环境却迅速失效。
如果模型过分适应了训练材料中的这些偶然特点,通常称为过拟合。
更多而且更多样的训练数据,往往是减少这种问题的重要办法。只看几十张照片时,沙发和猫可能总是一起出现;看过不同环境、不同姿态、不同品种的大量图片以后,这种偶然关系就更难一直成立。模型必须找到能够跨越更多变化仍然有效的关系,才容易在新数据上保持表现。
因此,机器学习真正关心的并不是“能不能把已有材料学得足够熟”,而是学到的东西离开原来的材料以后还能不能用。
这也解释了为什么测试模型不能只看一个最高分数。真正需要知道的是:换一些没有参加训练的数据,它还能不能保持能力;如果环境进一步变化,这种能力又能维持多久。

无标题无名氏No.69569854

2026-10-05(一)21:12:40 ID: lBNsq7w (PO主)

四、深度学习改变了什么
早期机器学习已经可以让机器从数据中调整模型,但很多任务仍然需要人先替机器决定“应该看什么”。
识别图像时,工程师可能先设计程序提取边缘、纹理、轮廓和颜色,再把这些人为选择的特征交给后面的分类器。语音识别和其他领域也有类似做法。
深度学习的重要变化之一,是让这种“怎样表示问题”的工作有更大一部分也进入训练过程。
多层神经网络可以让前面的计算先形成某些较简单的内部关系,后面的计算再在这些结果上继续组合。层数增加以后,模型可以逐渐形成越来越适合任务的内部表示,而不必要求工程师预先规定每一种特征应该长什么样。
这并不意味着人退出了设计。网络结构怎样安排,训练目标怎样规定,什么数据进入训练,怎样评价结果,仍然需要大量人为选择。只是其中一部分过去必须直接由工程师写出的表示方法,现在可以通过训练形成。
这件事看起来只是技术路线变化,后果却很大。图像、声音和语言中的大量规律,本来很难逐条写成程序。只要这些规律能够在大量数据中稳定出现,机器就有机会通过训练把它们吸收到内部表示中。
过去一项任务往往需要工程师先理解问题,再把理解翻译成特征和规则;现在,有些原来只能依靠这种人工翻译的步骤,可以交给数据和训练完成。

无标题无名氏No.69570101

2026-10-05(一)21:45:22 ID: lBNsq7w (PO主)

五、规模为什么会改变能力
许多复杂任务之所以直到近年才取得明显突破,一个重要原因正是机器可以利用的数据规模和计算规模发生了巨大变化。
对于手写数字,几万张图片已经能提供相当丰富的变化。但语言面对的是另一种数量级。
一句话的意思不仅取决于其中有哪些词,还取决于词语怎样组合、前后文说了什么、说话的人默认哪些背景知识。同一个词放进不同领域可能含义不同,同一个问题在不同语境中也可能需要完全不同的回答。
如果希望机器只完成一个很窄的任务,需要学习的范围还比较有限。如果希望同一个模型能够阅读新闻、翻译文章、编写程序、解释科学概念、总结文件并回答开放问题,它就必须接触远为广泛的经验。
数据规模扩大带来的不只是“同样的东西看更多遍”。更重要的是,模型接触到的变化范围扩大了。
一种语言怎样写法律文件,怎样写小说,怎样讨论化学,程序员怎样解释错误,历史学家怎样描述一个事件,这些材料之间有很多不同,也有大量共同结构。模型如果能够同时从这些材料中学习,就可能形成一些不只服务于单一任务的内部关系。
近年的一个重要变化,是同一个大型模型开始能够承担许多原本分开的任务。
过去,机器翻译是一套系统,图像识别是一套系统,语音识别和问答又各自发展。今天,它们中的相当一部分开始建立在共同的大模型能力之上。模型先在极大规模的数据上学习较为通用的表示,再通过指令、示例、进一步训练或者外部工具用于不同任务。
这使人工智能逐渐从“一种任务配一套专门模型”,走向一种更通用的信息处理基础能力。
当然,数据很多并不意味着什么数据都同样有价值。同一批材料重复一千遍,不会产生一千倍新的经验;错误、重复或者极度单一的数据,也可能让模型学得更加狭窄。真正重要的,是模型能够接触到多少彼此不同、又与任务有关的有效经验。
这个问题到了大型模型时代,会变得更加重要。因为这时已经不能只问“有多少数据”,还必须问:这些数据究竟是怎样来到这里的。

无标题无名氏No.69570102

2026-10-05(一)21:45:37 ID: lBNsq7w (PO主)

六、为什么预测后面的文字会产生这么多能力
大型语言模型常见的一种训练方法,看起来甚至有些简单:给出一段文字,要求模型判断后面最可能出现什么。
如果材料只有几个词,这种任务确实很简单。但文字规模扩大以后,预测后文需要利用的关系会越来越复杂。
一篇历史文章写到某个人物,接下来发生什么,取决于人物、年代和事件之间的关系;一段程序能不能继续写下去,取决于变量、函数和前面代码的结构;一个科学问题如何回答,则需要利用大量概念以及它们之间的联系。
为了在极其广泛的文本中不断预测后续内容,模型不得不形成越来越丰富的内部关系。
这并不等于它在内部保存了一部可以逐页翻阅的百科全书,也不能说明它以和人完全相同的方式理解这些内容。更准确地说,语言中大量反复出现的结构、事实关系和表达规律,被吸收到模型的内部表示中。
这样训练出来的模型,在使用时可以根据新的输入生成此前没有完整出现过的内容。它可以改写一句话,可以根据资料写摘要,可以完成程序片段,也可以把若干概念组合起来回答一个新问题。
“生成”由此成为一种新的计算接口。
过去使用软件,人通常必须知道某个菜单、命令或者程序提供什么功能;生成式模型则允许人直接用语言描述目标,让机器根据已有能力组织输出。
这显著降低了使用复杂计算能力的门槛,也使许多原来相互分开的软件功能开始集中到同一个交互界面中。

无标题无名氏No.69570105

2026-10-05(一)21:45:56 ID: lBNsq7w (PO主)

七、模型学到的世界,从哪里来
一个模型接触了极其庞大的训练材料,并不意味着它接触了“世界本身”。
现实中的事情首先要发生,然后被人观察、测量或者经历;其中一部分才会被记录下来。记录可能变成书籍、报纸、论文、档案,也可能成为实验数据、病历、企业文件、照片、录音、网页和论坛帖子。记录下来以后,还必须被保存下来;纸质材料可能经过几百年仍然存在,也可能毁于战乱和火灾,数字材料看起来容易复制,却也可能随着网站关闭、数据库迁移或者平台停止维护在几年之内消失。
保存下来的材料还需要能够被机器取得和处理。一部从未数字化的旧书,对今天的模型几乎等于不存在;一批已经扫描但无法可靠识别的档案,也很难直接使用;大量存在于私人组织和企业内部的数据,则可能从来不会进入公共训练材料。
因此,一条知识真正成为人工智能能力的一部分,中间经过的并不是一个简单过程:
事情发生 → 被观察或测量 → 被记录 → 被保存 → 能够取得 → 被转换成机器可处理的形式 → 进入训练
每一步都会留下选择。
哪些事情值得写进正式文件,哪些经验主要靠口传和操作继承;哪些书籍被大量出版,哪些只留下极少副本;哪些语言拥有庞大的出版和网络资料,哪些语言很少数字化;哪些机构愿意长期保存原始数据,哪些只保留最后整理出的报告——这些差异都会影响后来机器能够看到什么。
更重要的是,这些缺失并不是随机发生的。
一个社会怎样生产知识、怎样记录事情、怎样保存档案、什么资料可以长期取得,本身都有稳定的制度和习惯。它们原本并不是为人工智能设计的,但几十年甚至几百年以后,却可能直接决定模型能够从过去学到多少东西。
于是,知识生产、记录、保存和可访问性的制度,会成为人工智能能力的一部分。
这并不是说这些制度被直接写进了模型程序。它们更早地作用于训练材料:决定什么经验留下来了,什么消失了,什么被反复记录,什么几乎没有留下痕迹。模型再从这些材料中形成自己的内部结构。
扩大训练规模可以减少“材料太少”造成的问题,却不能自动恢复没有留下记录的世界。
这也是为什么“读过整个互联网”即使真的能够做到,也不能等同于“读过人类经验”。互联网只是人类记录的一部分;今天还能取得的互联网,又只是过去互联网保存下来的一部分。

无标题无名氏No.69570108

2026-10-05(一)21:46:14 ID: lBNsq7w (PO主)

八、数据记录的,有时不只是我们想研究的对象
数据还有另一层容易忽略的性质。
医院数据库记录疾病,但它同时记录了哪些人能够到医院、医生怎样诊断、哪些检查被做了以及医院怎样保存病历。犯罪数据记录案件,也同时受到报警、立案和统计制度影响。企业销售数据不仅反映消费者,还反映企业过去怎样定义客户、怎样考核员工、哪些失败交易值得记录。
因此,一套数据常常同时包含两种东西:它想描述的现实,以及产生这套数据的制度和过程。
如果模型直接从其中寻找规律,两者可能一起被学进去。
一个地区登记了更多某种疾病,不一定只说明那里疾病更多,也可能说明检测能力更强;某类事件在数据库中很少,也可能因为它很少被记录。
这并不是人工智能特有的问题。统计学、医学和社会科学长期都要处理类似困难。
人工智能让这个老问题变得更加重要,是因为今天的模型能够吞下远超个人阅读能力的数据规模。数量增加以后,人很容易产生一种错觉:资料足够多,局部偏差就会相互抵消。
有些随机误差确实会随着样本增加而减小。但如果记录机制本身持续朝某个方向筛选,更多同类数据只会更加准确地学习这种筛选结果。