a tall building lit up at night

微软亚洲研究院

大模型会“扮演人”,但真的懂人吗?一套新框架,给 AI 的“人味”做体检

已发布

当我们让 AI 扮演一位用户时,它通常能够快速给出像模像样的回答。它可以模仿一个影迷挑选电影,模仿一位网友讨论问题,也可以根据历史足迹预测一个人下一站会去哪里。

随着大模型能力的快速提升,智能 NPC、用户模拟器、社会仿真等应用正在变得越来越真实。但一个更关键的问题是:AI生成的行为,真的像人吗?

它是否真的理解了一个人的偏好、思维方式和长期习惯?它能否在多轮交互后依然保持“同一个人”的一致性?当模拟成千上万个用户时,这些 AI 又能否像真实社会一样呈现丰富、多样、甚至彼此不同的人群分布?

近期,微软亚洲研究院的研究员们提出了一套面向大模型类人行为的计算评测框架,尝试回答这个问题。研究发现:大模型已经能够生成不少看似合理的个体行为,但距离真正稳定、可信、丰富的人类行为模拟,仍有很长的路要走。相关论文已被ICML 2026接收

论文信息已整理至文末,欢迎点击相关链接,了解更多技术详情。

一个会聊天的 AI,未必会“生活”

传统图灵测试关注的是,人类能否在短时间对话中分辨出对方是人还是机器。

这类测试很重要,但也存在天然局限。首先,短短几分钟的聊天,只能看到 AI行为的一个切面。一个模型或许能够在一轮对话中显得自然,但未必能在几十轮选择、回答或行动中持续保持人格、偏好和逻辑的一致。

更重要的是,许多真实世界中的行为并不存在唯一正确答案。即使是同一个用户在相似情境下重复进行选择或回答,结果也未必完全一致。他可能在两部都感兴趣的电影间做出不同选择,也可能以不同的措辞、角度或论证路径回答同一个问题。此时,评估的关键不再是“答对了吗”,而是 AI 生成的行为是否仍然符合这个人可能呈现的偏好与行为分布。

用真实世界行为,给 AI 做一次“人味体检”

为此,研究员们没有为模型设计一套人工编写的考题,而是直接从真实世界的公开行为数据中寻找答案。该研究工作覆盖了三类典型场景:

– 在线购物:用户在电商平台中的连续购买与浏览偏好;

– 开放问答:用户在开放社区中的回答、观点与表达方式;

– 城市出行:用户在基于位置服务的平台上留下的时空签到轨迹。

在每个场景中,研究员们都先用用户历史行为构建用户画像,再让大模型模拟该用户后续的多轮行为。随后,系统将AI 的模拟结果与真实用户行为进行对比。

整个框架由四部分组成:真实行为数据、LLM模拟器、用户行为编码器和评测器。其中,真实行为数据提供被模拟用户的历史轨迹,以及用于对照的真实后续行为;LLM模拟器根据用户画像和当前情境,逐步生成该用户可能做出的后续选择、回答或行动;用户行为编码器则从大量真实数据中学习“什么样的连续行为属于同一个人”,将行为序列映射为能够表征偏好、风格与行为模式的高维向量;最后,评测器在这些表征之上,从多个维度判断AI 行为的类人性。

本框架的核心设计不依赖特定任务形式,只要具备足够的真实用户行为数据,便可自然扩展至评论撰写、日记创作、饮食选择等更多开放式行为场景。与“看一条回答像不像人”不同,这套框架希望从个体到群体、从即时行为到长期轨迹,全面评估AI 的类人程度。

diagram
图1:整体评测框架图

判断 AI 是否“像人”,不能只看一个维度

研究员们将“类人性”拆解为三个核心原则:理性(Rationality)、一致性(Consistency)和多样性(Diversity)。

理性:这一刻,它像不像这个用户?

理性并不意味着“绝对正确”,而是指 AI 的行为是否符合该用户的历史偏好与行为模式。例如,一个用户过去持续购买温馨爱情片和圣诞题材的电影,那么AI 后续突然推荐科幻惊悚片、恐怖片或无关音乐视频,显然可能就偏离了这个人的兴趣轨迹。

研究从两个角度衡量这一点:

– 可区分性(Distinguishability):AI 生成的行为是否很容易被识别为机器行为;

– 可预测性(Predictability):AI 后续生成的行为是否与该用户已有画像相匹配。

换句话说,AI 不仅要“说得通”,还要“像这个人会做出的选择”。

一致性:前后还是不是同一个人?

人类的行为会变化,但通常存在稳定的底层模式:长期兴趣、表达风格、知识边界、思维习惯,以及出行和消费中的规律。

如果它刚刚到达了一处餐厅,十几秒后又“瞬移”到二十公里外的办公室,那么这种行为即使单独看似乎合理,放在连续轨迹中也会显得不可信。因此,研究进一步衡量,一段 AI 生成行为序列的前后两部分,是否仍然像同一个用户。

多样性:一群 AI,真的像一群人吗?

这或许是最容易被忽略、却对社会模拟最重要的一点。一个模型可以为某个用户生成合理答案,并不意味着它能模拟一个真实人群。若不同AI 用户最终都表现出相似偏好、相似表达和相似推理路径,那么看似人数很多的模拟社会,本质上可能只是同一种人格的重复复制。

因此,研究从群体层面比较真实用户和 AI 用户的行为分布:真实用户群体中的每一种偏好、风格和行为模式,能否在 AI 模拟群体中找到相近的对应者?

更大的模型更像人,但仍未达到真实人类水平

本研究工作评估了 Phi、Mistral、Qwen2.5、Qwen3、Llama-3.1和 GPT-4o 等 14 个主流模型版本。

总体上,模型规模越大,类人行为模拟能力越强。GPT-4o 在综合表现上领先,Llama-3.1 和 Qwen系列紧随其后。但“最好”并不意味着“足够像人”。在在线购物、开放问答和城市出行三个场景中,表现最好的模型与真实用户相比,综合得分仍分别存在约10%、17% 和 10% 的差距。其中,开放式问答是最难的场景。

这是因为,在候选集内选商品或地点,模型只需要在有限空间中做出选择,而在开放问答中,模型不仅要模仿用户的语言风格,还需要复现其知识范围、价值判断、推理习惯和世界观。“写得通顺”远远不等于“这个人真的会这么想”。

table
表1:三类场景下的主实验结果。Cons、Dist、Pred、Div 和 Avg 分别表示一致性(Consistency)、可区分性(Distinguishability)、可预测性(Predictability)、多样性(Diversity),以及四项指标的平均得分。该研究评估的所有模型均为指令微调版本。对于真实用户,研究员们直接使用其真实行为而非LLMs 生成的模拟行为来计算各项指标。

AI 会不会把千万个用户,模拟成“同一种人”?

在群体层面的可视化分析中,研究员们发现了一个值得关注的现象:分布坍缩。

较小模型在模拟不同用户时,往往会生成较为集中的行为模式。不同AI 用户看似拥有不同画像,但最终却可能给出高度相似的偏好、观点和回答。随着模型规模增大,这种现象会有所缓解:模拟用户在行为空间中的分布变得更广,也更接近真实用户群体。但即使是更强的大模型,依然无法完全覆盖真实人群的丰富性。

chart, scatter chart
图2:真实用户与模拟用户的嵌入分布可视化

而这对于社会仿真、用户模拟和产品测试尤其重要。如果 AI 用户群体缺少真实多样性,那么基于这些模拟人群得到的结论,可能会高估某些偏好、忽视少数群体,甚至导向错误的产品与社会判断。

从答对问题,走向拟合人类行为分布

本篇论文研究的核心意义,不只是提出了一套新的评测指标。它尝试把一个长期被简化的问题重新展开:评估AI 是否像人,不能只看它能否通过一段短对话,也不能只看它能否答对一道题。更重要的是,它能否在真实、开放、长期的行为过程中,表现出稳定、合理且多样的人类特征。这对未来的数字人、智能NPC、个性化助手、用户模拟器和社会仿真系统而言,是一项基础能力。

当然,类人行为模拟的目标并不是让 AI 在所有场景中伪装成人,而是帮助科研人员更清楚地理解,当 AI 被用于模拟、预测或服务人类时,它的能力边界究竟在哪里。

从“像人说话”,到“像人行动”,再到“像一群不同的人共同生活”——大模型距离真正可信的人类行为模拟,仍在路上。

A Computational Framework for Evaluating Human-likeness in LLMs’ Open-ended Human Behaviors (ICML 2026)

论文链接:https://icml.cc/virtual/2026/poster/65092 (opens in new tab)