上海创智学院联合复旦大学、伦敦国王学院、牛津大学等高校联合推出以人为中心的社会科学研究驾驶舱SocioVerse2,支撑长程动态演化模拟实验。SocioVerse2强调社会模拟试验中人机协同演化的重要性,将模拟从横截面式的问卷调查扩展为一段可干预的纵向过程,把研究过程从跑一次出结果扩展为研究者可迭代的树状研究脉络,并把支撑这一切的人群、环境与工作流封装成一套开源的社会科学智能体基础设施。
●论文地址:https://arxiv.org/pdf/2609.24911
●项目主页与在线工作台:https://socioverse.fudan-disc.com/
●代码仓库台:https://github.com/sii-research/SocioVerse2
一、引言:社会模拟在真实社会实验中的局限
社会模拟给社会科学研究提供了现实世界不具备的实验工具:真实世界中,田野实验昂贵、难复现、且受伦理约束,而一个被模拟出来的社会可以把人群、环境和干预都置于直接控制之下。大语言模型驱动的生成式智能体把其又往前推进了一步:智能体作为"硅基样本"(Silicon Samples),既继承了基于规则的智能体建模(Agent-Based Modeling)传统,又能用真实行为数据来对齐,能推理、能用自然语言表达。

图1:现有LLM社会模拟平台的版图。横轴是人与AI的分工,从"人手工搭建一切"到"智能体端到端自动跑完",纵轴是模拟目标,从复现已知现象到探索未知条件。SocioVerse2位于横轴中间、纵轴顶端:研究者掌舵、智能体操作,并支持在模拟内部做干预、在模拟外部做控制。
过去两年,这一方向沿着两条轴快速演进。一条轴是人与AI的分工:从手工搭建的沙盒,到把研究流程全部交给智能体端到端执行的平台。另一条轴是模拟目标:从"能不能复现已知的群体行为",到"从当前条件出发会发生什么"。但社会科学最核心的两个需求,对研究内容长期纵向的实验性干预,以及研究者在人机协同合作中对研究过程的迭代控制,在现有平台里仍缺乏系统性支持。我们把这些考量归纳为人机协同演化范式的三个维度。
纵向干预(Longitudinal Intervention)。社会现象在时间中涌现和演化,要分离变量、检验反事实假设,就必须在同一人群的同一段历史上开出处理组和对照组,而这正是研究者在真实环境中难以开展的。平台因此应当支持在模拟进行时插入设计好的干预,再分叉出可比较的分支。
可控回路(Controllable Loop)。早期沙盒把信息流、智能体框架、交互拓扑全部写死,硅基样本没有演化的余地;近期的自主研究平台又把模拟整个交给智能体端到端跑完,存在编造结果、偏离研究计划,产出论文质量低的问题。逐阶段的人类反馈能显著提升智能体研究的质量,人在回路(Human-in-the-loop)不应只是最后按"同意",而应能在任何阶段、对任何组件发起修改。
基础底座(Foundation Basis)。基座模型的能力之外,模拟质量取决于接地数据和智能体基础设施。生成的行为要与真实人群和真实环境对齐,系统就必须能检索接地信息、把它组装进上下文、映射为动作,并通过一个可适配的智能体框架不断迭代。
SocioVerse2把这三个维度落成一个统一的框架:两条回路、一套基础设施。
二、框架总览:两条回路、一套基础设施
SocioVerse2借鉴了Lewin场论的核心洞见:行为由人与环境共同决定,记作 B = f(P, E)。SocioVerse 1.0把这一关系实现为对齐的四个引擎,SocioVerse 2把它展开到时间维度,并在此之上进一步实现了研究过程本身的迭代。

图2:SocioVerse2的三层架构,以研究树的形式呈现。社会科学智能体基础设施(树根)通过两项数据MCP服务解析真实的P和E,并构建初始研究状态σ₁。纵向模拟循环(树枝)逐步推进模拟,在第t步施加干预δ会生成一个反事实分支,用于对比分析。可控研究循环(树干)根据编辑操作aₖ,将当前研究状态转换为下一研究状态σₖ₊₁。
●纵向模拟回路(longitudinal simulation loop):一次运行内部,固定的人群在不断演化的环境中逐步行动,即Et+1 = g(Et, Bt),每一步为每个智能体记录一行面板数据。研究者声明的干预从同一条回路进入,并向后传播。
●可控研究回路(controllable research loop):把整个研究记作一个可编辑的状态 σ = (P, E0:T, f, Θ),无论是研究者还是智能体提出的编辑a_k,都由映射h作用到σ上,得到一个有谱系记录的新版本:σk+1 = h(σk, ak)。
●社会科学智能体基础设施(social science agentic infrastructure):可组合的技能工作流负责把研究拆成一串带检查点的产物,两个MCP数据服务负责按需提供真实的P和E,治理层负责让每一步可审计、可复现。
三者的关系可以用一次研究的走向来读:研究问题和真实材料进入基础设施,得到σ₁;模拟回路跑出轨迹与对照,作为证据返回给研究者和智能体;任一方提出编辑,研究回路更新到σ₂,从最早受影响的阶段重新进入基础设施;直到研究者确认某个版本,连同它的版本谱系一起输出。
三、纵向模拟回路:从单步迭代到可干预长程循环
单步模拟流程:在第0步,人群组件按声明的随机种子物化P,为每个智能体分配一个永不复用的标识符;环境组件初始化E₀,此后每一步固定按五个阶段执行:外生更新(激活当步的计划事件与广播)、观察(为每个智能体沿"物理/信息×宏观/局部"两根轴组装)、决策(行为函数返回带类型的动作、理由和来源标签)、应用(把所有动作同步折回环境)、记录(每个智能体一行面板、一行指标,并推入记忆窗口)。

图3:纵向模拟回路中单个时间步的运行机制示意图。(1)环境调度机制更新当前时间步Eₜ的事件与广播;(2)每个智能体沿模态和范围两个维度观察环境;(3)智能体根据人口特征、观测结果及自身记忆,通过行为函数决定具有明确类型的动作;(4)根据当前的集体行为Bₜ,将环境更新为下一时间步的状态Eₜ₊₁;(5)研究过程中,每个时间步内的所有信息均被记录为轨迹。
行为函数f是唯一计算决策的组件,且所有实现都返回同一类型的动作。这使得四种f可以在同一动作空间里互换与对比:规则f(经典更新规则,作为一致性基线)、LLM f(把人物设定、四个观察字段与记忆窗口组成提示)、RL f(训练好的策略)以及混合f(少量核心用户用LLM、其余用规则)。
干预与分支:一次干预 δ = (T*, op) 是环境包中的一个条目,要么是对某个物理层的计划事件,要么是带受众和存活时间的广播。它在第 T*步的外生阶段、在任何智能体观察之前被激活,同时写入事件表和当步的指标行。一个分支则是从父运行第K步分叉出来的新运行:前K步不调用任何决策模型,直接从父运行的面板表回放动作,环境到达完全相同的EK,每个智能体恢复到完全相同的记忆窗口,从第K+1步起才正常决策。
|
|
图4:(左)一次声明的干预如何进入一次运行;(右)舆论扩散研究中的回放式分叉。实验组在第5步加入一次媒体宣传,对照组保持不变,分叉之后两条曲线之间的差异归因于这次宣传。
由于两个分支的P、f和种子是同一个对象、历史在第 K 步之前完全一致,处理臂与对照臂之间的差异 Δt(δ) 只能归因于δ本身。这就是现实从不提供的那个"对照组"。同一机制还能零成本地把已完成的运行延长到更长的时间跨度,或从中断处恢复。
四、可控研究回路:研究者可参与的树状研究脉络
可编辑版本:大多数"人在回路"的设计中,人负责对智能体提案的否决权。SocioVerse2给研究者提供了是对任意研究流程、组件、内容的编辑著作权:研究智能体可以从上一次轨迹的推理中提出编辑 ak ,研究者也可以在任何阶段、对任何产物直接发起编辑,形式可以是自然语言指令、补充材料或直接改代码。
把一次编辑记作 ak = (c, u) ,c 是它修改的组件集合,u 是施加的更新,则映射 h 只有三种情况:c 为空,状态不变,回路保持可逆;c = {E} ,只改环境且继承父运行的历史,这就是上一节的分支;其他情况,任何产物都可以改,这是一个新的版本,不继承历史,用于比较研究设计本身。

图5:可控研究回路构成一棵版本树。每个节点是一个研究状态σ,编辑可以由研究者或智能体提出,并触及研究状态的任何组件。每个版本都快照整个工作区,因此父节点永远可以恢复。
每个版本都在版本清单中登记标识符、父版本、说明和创建时间,分支还记录源版本和分叉步;创建版本时快照完整工作区(代码、数据包、轨迹、报告),所以早期结果始终可查、可重跑。因为P、E、f是相互独立的可替换产物,一项研究可以沿一根轴增加版本、固定其余:换一个人群(普查合成人口 vs 开放人物池),换一种环境(换一座城市或交互拓扑),消融行为函数(规则 f 、LLM f、混合 f 作用在同一 (P, E) 上),或只换数据源版本(不同月份的经济指标)。所有版本用同一存储契约,跨版本比较一个指标或一条个体轨迹只需一条查询。
纵向模拟回路和可控研究回路共同组成了SocioVerse2的人机协同演化范式:它处在图1版图的中间,采两端之长。智能体从人类专家那里获得专业经验,补上迁移能力的短板;研究者从高效的智能体基础设施和生成式模拟平台那里获得研究工具的革新。我们认为下一代社会科学模拟将由这一范式、而不是任一极端来承载。
五、社会科学智能体基础设施:技能流水线与人群环境数据服务
工作流层:研究生命周期被拆成init、build-model、build-environment、build-population、run、report、iterate七个可复用技能。每个技能读取前序产物、写出一个经过模式校验的产物,然后暂停等待研究者决定。默认由研究者决定是否推进,也可以开启自动模式,但有四个决定无论如何都会交回研究者:创建研究前的意图确认,改动已有研究前在新版本、原地修改与分支之间的选择,调用大模型前的预期成本,以及需要逐研究确认的数据服务。每个回答都随研究一起记录。

图6:智能体研究流水线。每个技能产出一个经校验的产物,中间是人类检查点。init把一个问题路由到复用已有研究、从零构建或适配遗留模拟器三条路径之一;iterate支持运行后的迭代。
服务层:人群MCP与事件MCP。人群一侧,Population MCP把两个内部真实用户池(X/Twitter与小红书,共1013万条带人口属性的档案)与Nemotron、MatrAIx、PersonaHub三个开放人物池集成在一套统一的人口学词表下,本地索引超过千万条记录。一次调用按目标人群的边际分布跨池路由、采样拼接、用迭代比例拟合对齐联合分布、对无池覆盖的属性做带标签的条件合成,最后装配出带持久标识符和属性来源的研究人群。

图7:Population MCP的一次调用。请求给出目标边际、所需属性、规模与种子,服务在五个注册池之间路由、采样拼接、IPF对齐、合成补全,最终装配出带来源的研究人群P。
环境一侧,Event MCP汇聚宏观/市场、金融、新闻/趋势、人口/调查四类共21个结构化信号源,并提供时点安全保证:查询以(年,月)为参数,只返回当时已经发布的数据版本,杜绝前视偏差。信号在构建时被物化为工作区内的事件包、翻译成绑定到步的广播与计划事件,运行时绝不向外取数,因此一次运行自包含,回放的分支与父运行逐位可比。

图8:Event MCP的一次调用。服务列出目录、按(年,月)取数、盖上来源戳,build-environment技能再把结果物化为事件包并翻译成绑定到步的广播与计划事件。
治理层。每个阶段的产物落盘,每次干预写入事件表,每次运行都有版本,报告中的任何结论都能追溯到产生它的研究定义、数据包与干预计划,再追溯到背后的人物池与信号版本。用户池只暴露人口属性标签与统计画像,不暴露原始内容与个人身份信息。
六、实验:三个案例族,覆盖七项案例研究
七项案例按同一模板实现(研究问题 → 框架映射P/E/f →实验设计),结果从同一组四个角度解读(微观对齐、水平保真、轨迹保真、机制)。每个案例中的对照条件与消融,都是研究回路里的一个版本;每个干预对照,都是模拟回路里的一条分支。在人机协同演化范式下,这些案例不止是系统演示,而是各自学科里针对前沿问题的实质性研究。

图9:案例研究在框架中的实现及其结果进入评测的路径。可控研究回路覆盖三步实现,纵向模拟回路覆盖运行与四个解读角度。
案例族 Ⅰ:模拟机制。在10个经典ABM(Schelling、Sugarscape、SIR、Boids等)上,把手写规则换成LLM决策后,三个LLM的一致性得分为0.885到0.900,而规则模型自身跑次间的一致性上限是0.911,差距约一个百分点,定性动力学(意见簇、传播峰)结果也趋于一致。在社交媒体舆论动态案例中,300个LLM驱动的核心用户与700个规则驱动的普通用户混合,在多个在线平台社会运动的全部15组"混合vs纯规则"行为函数配对中,混合配置的轨迹相关性全部更高,而成本只随核心用户数增长。

图10:10个经典ABM上的一致性得分。对照组0.911反映规则模型自身的随机变异。
案例族II:政策模拟。芝加哥隔离案例把Schelling模型放到真实普查地理上:241个家庭原型、19,235个加权智能体在781个人口普查区上行动,从15%随机扰动的2010年格局出发,15步内黑人–白人相异指数从0.716回升到0.782,亚裔–白人指数收敛到0.435。消融实验显示族裔信息上下文决定了搬迁方向、流动约束决定停点。药品集采案例则把中国国家药品集中采购建模为政府、企业、医疗机构三方的马尔可夫博弈,在7轮集采、325个药品市场上,三方联合学习使政府福利、企业利润、医疗机构效用的中位数同时提升(相对最强基线分别高27.2%、33.9%和0.477),与历史中标集合的F1达0.790。

图11:药品集采案例在325个药品、7轮集采上的结果。三方联合学习的模拟对比仅企业策略的ProcureGym基线(RL、LLM、规则)与随机基线:(a)政府社会福利,(b)企业利润,(c)医疗机构效用,(d)与历史中标集合的F1。
案例族III:宏观指数预测。消费者信心案例用微观数据校准的5,000户核心家庭扩展到25万户,在美国、欧盟27国、日本三地75个月的回测中全面领先12种基线(MAE分别3.45、1.607、1.363),优势集中在COVID、通胀、俄乌战争等高显著性冲击窗口。把官方CCI换成模拟指数后,住房领域短期预测的样本外RMSE下降7.8%。采购经理指数案例用300家持久的模拟企业按月回答ISM问卷,在响应模型知识截止之后的32个月里,月度方向判断准确率58.6%,高于市场共识的51.7%,消融把水平路径归因于企业跨月携带的状态。德国乘用车案例在41个月、533个品牌–月份单元上,模拟份额与KBA注册份额的平均绝对偏差为0.442个百分点,并复现了比亚迪的上升与特斯拉的下跌回升。

图12:美国消费者信心指数的官方序列、模拟序列与代表性基线,2020年1月至2026年3月,高显著性时期已标注。
七、总结
SocioVerse2把SocioVerse 1.0以对齐为中心的设计推进为一个人机协同演化的范式:纵向模拟回路让同一人群在演化的环境中逐步行动,并在干预处分叉出反事实分支;可控研究回路把研究本身当作可编辑、可回溯的状态,研究者与智能体提出的每一次编辑都成为有谱系的新版本;社会科学智能体基础设施用带检查点的技能流水线、两个MCP数据服务和一条审计轨迹承载这两个回路。七项案例从复现经典ABM,到在真实记录上模拟政策过程,再到预测宏观指数,每一项报告的结果都是研究者与智能体协同演化的最终版本。
我们也清楚这一范式的边界:行为的真实感受限于基座模型的能力与偏差;纵向模拟比横截面预测昂贵得多;反事实分支是模型假设下的模拟内对照,对真实世界因果效应的判断仍需外部验证;而研究者的编辑究竟让结果好了多少,本报告尚未量化,需要在未来工作中开展相关评测。
SocioVerse2运行框架现已开源,并提供面向非计算科学研究者的在线工作台。欢迎社会科学、计算社会科学与AI领域的研究者试用、扩展并反馈。


