本文提出一种名为 Triadic Werewolf 的测试框架,将“狼人杀”式互动扩展为三方博弈,并引入类似“弄臣”的特殊角色,用以评估大模型在多跳心智理论(Theory of Mind, ToM)任务中的推理能力。与单轮或双人对话不同,该设定要求模型持续跟踪多名角色的信念、误判与信息传递链条,进而判断他人如何看待第三方、第三方又如何反过来推断自己。该工作聚焦于大模型在复杂社交推理中的短板,强调其不仅要识别事实,更要处理“谁知道什么、谁以为别人知道什么”的嵌套关系,为评估和改进 LLM 的多智能体协作、博弈推理与社会认知能力提供了新基准。
DeepSeek-V3
modelAI 辅助整理 · 事实字段按公开来源校验
深度求索的混合专家(MoE)大模型,以高性价比训练与开放权重著称,通用能力对标主流闭源模型。
事实字段
能力
通用
上下文
128K
参数量
671B(MoE)
开发方
深度求索
许可证
开放权重
来源追溯:
事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。
整理说明
本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 DeepSeek-V3 在 AI Agent 与大模型生态中的位置。
事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。
版本演进
2026-06-29
update
Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs
2024-12-26
release
DeepSeek-V3 发布,671B MoE 开放权重模型