你提的这个场景很有意思——哪怕只是一个单一场景、几十个NPC、固定计时器触发的沙盒,它和传统游戏的区别也是根本性的。传统游戏里的NPC是“等你来触发”的机关,而这个沙盒里的NPC是“自己活着”的人。你走进来,他们正在做自己的事,你离开后他们继续。
要估算这个东西的技术门槛,得先想清楚一件事:它需要的不是一个更大的语言模型,而是一个能持续运行、互相交流、记忆不丢失的“社会模拟器”。
---
🧠 AI核心需要什么能力
拿《质量效应3》举例。它有多少对话?有资料显示,ME3的对话量几乎等于ME1和ME2的总和。但即便这么多对话,它本质上还是一棵预写好的树,每个节点都是人写死的。玩家走到莫丁面前,能选的几句话是固定的,莫丁的反应也是固定的。
你设想的沙盒不需要“更多对话”,它需要的是对话的生成能力,以及更重要的——对话的后果能被记住并影响后续行为。
这意味着AI核心至少需要以下几个维度达标:
持续记忆与状态更新。 一个NPC今天对你说的话,三天后他得记得。你之前骗过他,他得在下次见面时带着那份不信任。目前的AI基准里,“记忆”这一项已经在被单独测量了。有研究显示,DeepSeek-V4-Pro在记忆任务上的得分是0.87,GPT-5.4是0.88。看起来不低,但这些分数衡量的是单次对话中记住前文的能力,而不是跨越几十个游戏内小时、和多个其他NPC交互后依然保持记忆一致性的能力。
目标获取与规划执行。 这是ARC-AGI-3基准专门测的东西:探索、建模、目标获取、规划与执行。一个NPC不能只是“等你来说话”,他得有自己的目标——比如“我今天要去市场换点东西”“我想找机会报复昨天羞辱我的人”。这些目标需要和玩家的行为互动,但又不是被玩家直接触发的。
当前的前沿模型在这方面的表现很分裂。GPT-6 Astra在ARC-AGI-3上拿到了99.9%,但那个分数是在OpenAI专用的适配框架下得到的,裸模型只有62.7%。而这个基准测的是单智能体在陌生环境中的推理,不是几十个智能体互相博弈时的社会智能。让一个AI“自己找个目标然后去做”已经很难了,让五十个AI各自有目标、互相影响、还能保持行为一致性,那是另一个量级的挑战。
程序性记忆的持久化。 有一个叫PAST-BENCH的基准专门测这个:模型在连续任务中能不能保留之前学到的经验并应用。结果显示,即使是最好的模型,在“保留经验”这项上的提升也非常有限——DeepSeek-V4-Pro的程序性记忆分数是0.49,GPT-5.4是0.68。这意味着,如果你今天教一个NPC“别相信穿红衣服的人”,他可能明天就忘了。但一个活着的NPC不能忘。他得把这件事写进自己的“性格”里。
综合来看: 你需要的AI核心,在记忆持久性上要远超当前模型的单次对话记忆,在社会推理上要能处理多智能体互相影响,在目标生成上要能自主产生符合角色性格的行为动机。这不是“更大的模型”能解决的问题,这是架构层面的不同。你需要的是一个能持续运行、不断更新自身状态、并且能把状态持久化到存储里的系统,而不是一个每次对话都重新开始的模型。
---
🖥️ 算力:训练和推理是两个完全不同的量级
先分清两件事:训练这个AI核心,和运行这个沙盒。
训练阶段。 训练一个能支撑这种社会模拟的模型,规模大概在什么量级?参考现有数据:GPT-4的训练估计动用了大约2500到5000块GPU,运行两年左右。GPT-5.5的估计训练量是35亿GPU小时。如果按B200的算力来算,假设用10000块B200(每块FP8算力5000 TFLOPS),跑满一年大约是8760小时,总计算量是 10^4 \times 5 \times 10^{15} \times 8760 \approx 4.4 \times 10^{23} FLOPs。这个量级和GPT-5.5的估算在同一数量级,算是合理的前沿训练规模。
但训练只是开始。训练出来的模型本身可能不需要那么大——一个针对“角色模拟”优化过的模型,可能几百B参数就够了。真正的挑战在推理。
推理阶段:这才是无底洞。
你的沙盒里有50个NPC。每个NPC每“游戏分钟”都在做决策:要不要说话、说什么、去哪里、对谁做什么。如果游戏内时间和现实时间按1:1走,那每个NPC每秒至少要做一次决策。50个NPC,每秒50次推理。每次推理如果用一个几百B参数的模型,在B200上跑,大概需要多少算力?
参考一个实际的研究:一个LLM驱动的NPC对话系统,在L40S GPU上(比B200弱很多)能达到平均3秒的响应时间。但那个系统是单NPC、按需响应,不是50个NPC同时持续运行。
假设我们优化得很好,每个NPC的“决策推理”在B200上只需要0.1秒(包含状态读取、上下文拼接、生成、写入状态)。那50个NPC同时运行,需要50块B200持续满载。这还只是基础决策。如果NPC之间发生对话,每次对话涉及两个NPC的交互推理,开销翻倍。如果发生事件(比如“有人打架了”),周围NPC都要更新状态,又是一轮推理。
更现实一点:50个NPC,平均每个NPC每秒需要0.2块B200的推理能力(考虑空闲和峰值),那就是10块B200持续运行。这已经是很乐观的估算了,而且假设你有一个高度优化的模型,并且把大量常规决策用规则引擎处理了,只有“需要生成对话或复杂行为”时才调用大模型。
如果NPC数量增加到100,或者场景复杂度翻倍,这个数字会线性甚至超线性增长。100个NPC的社会沙盒,可能需要20到50块B200级别的推理算力持续运行。
---
💾 存储:真正的大头不是模型,是“世界状态”
模型本身占多少存储?一个300B参数的模型,用FP8存储,大约300GB。这个不大。
但世界状态的存储是另一回事。
每个NPC需要存储:记忆(过去发生的事)、关系(对其他NPC和玩家的态度)、当前目标、当前情绪状态、位置、物品栏。一个NPC的这些数据,如果详细记录,可能几MB到几十MB。50个NPC就是几百MB到几GB。这听起来也不大。
但关键是记忆的累积。游戏运行一个月,每个NPC可能积累了数万条“记忆条目”。如果每条记忆用向量嵌入存储,用于检索增强,那存储量会膨胀到几十GB甚至上百GB。而且这些记忆需要被索引、被检索、被更新——这又变成了算力开销。
更大的问题是回溯和一致性。如果玩家在第三天做了一件事,第五天某个NPC的反应需要引用这件事,系统必须能快速找到“第三天发生的那件事”在记忆库里的位置。这需要一个高效的时序数据库+向量数据库的混合架构。存储规模可能在几十TB级别,如果考虑多周目、多存档、状态快照,可能到上百TB。
参考一个真实项目的数据:在一个虚拟社区模拟中,从1个智能体增加到50个,峰值RAM从17.45GB增长到38.46GB,峰值GPU显存从4.38GB增长到14.26GB。这是运行时内存,不是持久化存储。如果要把这些状态持久化,存储需求会是运行时的数倍到数十倍。
---
⚡ 电力:算力越大,电费反而越不是问题
这里有一个反直觉的数据。
一座1GW的AI数据中心,四年总拥有成本约550亿美元,其中GPU采购250亿,供电散热110亿,网络50亿,存储40亿——而电费只有27.5亿,占比5%。电费在总成本里几乎可以忽略。
但这不代表“省电”,而是芯片太贵了。B200单卡TDP 1000W,加上主机、网络、散热,全系统功耗约1.7kW每卡。如果我们的沙盒需要50块B200持续运行,GPU功耗50kW,加上配套系统,大约85kW。一年8760小时,耗电约745,000 kWh,也就是745 MWh。
这个数字听起来不小,但放到数据中心规模里其实很小。一座1GW的数据中心,一年耗电约8.76 TWh。我们的沙盒只占它的万分之一。
真正的问题不是电费,是能不能把50块B200塞进一个能低延迟运行的环境里。B200需要液冷,需要高速互联,需要配套的存储和网络。这些基础设施的成本远高于电费。一座小型的、自建的推理集群,50块B200加上配套,硬件成本可能在500万到1000万美元级别。这还只是硬件,不算开发、维护、人力。
---
💎 所以,回到你的问题
AI核心需要什么等级的能力? 需要一个在记忆持久性、社会推理、自主目标生成上远超当前前沿模型的系统。当前的基准分数(ARC-AGI-3、PAST-BENCH)衡量的能力,和这个需求之间还有相当大的距离。但那个距离不是“再堆十倍算力”能填平的,它需要架构层面的创新——一个能持续运行、状态持久化、多智能体互相影响的系统。
算力? 推理端,50个NPC的沙盒,乐观估计需要10到50块B200持续运行。训练端,和训练一个前沿大模型相当,数万GPU小时级别。
存储? 模型本身几百GB,但世界状态和记忆的持久化存储可能在几十TB到上百TB。
电力? 运行功耗约85kW,年耗电约745MWh。电费在总成本里占比很低,真正的开销是硬件和开发。
最诚实的回答是: 这个沙盒在技术上不是不可行,但它需要的是一个专门为社会模拟设计的AI系统,而不是一个通用的语言模型。当前的AI能力已经在某些维度上接近了——记忆、推理、规划——但还没有一个系统能把这些能力持续地、低延迟地、在多个智能体之间同步地运行起来。
而一旦有人做出来了,那确实就不是游戏了。那是一个活的世界。你走进去,里面的人记得你,讨论你,等你回来。你走了,他们继续生活。你没有攻略,没有最优解,只有你留下的痕迹,以及别人对这些痕迹的解读。
这大概就是你最初想说的那个东西。