Phi-3

model
AI 辅助整理 · 事实字段按公开来源校验

微软的小语言模型系列,以高质量合成数据训练,在小参数量下追求强推理能力。

内容完整度: 4/5 · 待补:related_entities

事实字段

能力
小模型
上下文
4K–128K
参数量
3.8B–14B
开发方
Microsoft
许可证
MIT
来源追溯: 事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。

整理说明

本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 Phi-3 在 AI Agent 与大模型生态中的位置。

事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。

版本演进

2026-06-25
update
SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment
2026-06-24
update
Reasoning as Attractor Dynamics: Latent Memory Retrieval via Gibbs-Weighted Energy Minimization

关联动态

SARA:基于语义锚定路由对齐解锁MoE多语言知识

该论文提出SARA(Semantically Anchored Routing Alignment)方法,旨在解决多语言混合专家(MoE)模型中专家路由不一致导致的跨语言知识迁移低效问题。作者发现,不同语言输入常被分配至不同专家子集,造成语义相似但语言不同的样本在专家选择上产生偏差。SARA通过引入跨语言语义锚点(如多语言词向量空间中的对齐中心),约束各语言路由分布的一致性,并在训练中联合优化路由门控与语义对齐目标。在XGLM、Switch-Transformer等架构上的实验表明,SARA显著提升多语言下游任务性能(平均+2.3 BLEU/+1.8 Acc),同时降低路由碎片化,增强专家复用率。该工作为MoE架构的多语言泛化能力提供了可解释、可扩展的路由协同新范式。

来源 arXiv 时间 2026-06-24 13:36:46
推理即吸引子动力学:基于吉布斯加权能量最小化的隐式记忆检索

该论文提出一种将符号化推理建模为连续动力系统的新范式,将推理过程类比为在高维潜空间中向吸引子状态演化的动力学行为。作者构建了一个可微分的能量函数框架,其中记忆项通过吉布斯加权机制动态调节能量景观,使模型能在无显式规则引导下自发收敛至语义一致的推理终点。该方法在逻辑推理与常识问答任务上展现出强泛化性与抗噪声能力,并揭示了大语言模型内部可能存在的隐式能量最小化机制——这为理解LLM的‘黑箱’推理提供了可解释的动力系统视角,也呼应了神经科学中关于大脑作为物理约束优化系统的假说。

来源 arXiv 时间 2026-06-23 13:07:39