TREK提出一种面向大模型能力提升的分阶段训练思路:先通过“蒸馏”让模型快速吸收更强教师模型的知识与探索行为,再用强化学习对关键决策过程进行细化和校准。相比直接依赖强化学习的高成本与不稳定性,TREK更强调先建立可泛化的初始策略,再逐步强化高价值行为,从而提升推理、探索与结果一致性。该方法适合用于复杂任务中需要兼顾效率、稳定性和性能上限的场景,也体现了当前大模型训练中“先模仿、后优化”的主流趋势。
深度求索
company 深度求索 DeepSeek中国 AI 公司,以高性价比训练与开放权重的 DeepSeek 系列模型受到全球关注。
事实字段
整理说明
本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 深度求索 在 AI Agent 与大模型生态中的位置。
事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。
版本演进
关联动态
DSpark提出一种面向大语言模型推理加速的新型推测解码框架,将“置信度调度”与半自回归生成结合起来,在尽量保持输出质量的前提下提升解码吞吐。方法会根据模型对下一段候选 token 的置信程度,自适应决定何时并行草拟、何时回退到更保守的逐步生成,从而减少无效试探和验证开销。相比传统 speculative decoding 依赖固定草稿长度或静态策略,DSpark 更强调动态控制生成粒度,适合长文本与不确定性较强的场景。该工作反映了推理阶段通过算法调度继续挖掘大模型效率潜力的趋势。
这篇工作关注智能体在多步任务中的“每一步到底有没有用”。作者提出 Agent Step Value(ASV)框架,用状态转移而非仅看最终结果来衡量单步动作的贡献,并引入 state-grounded 的大语言模型评估器,对前后状态变化进行语义级判断。相比只依赖奖励或成功率,ASV更适合分析复杂环境中的规划、探索与纠错过程,也能为轨迹筛选、训练数据构建和智能体改进提供更细粒度的信号。该方法强调把评估锚定到可观察状态,减少纯文本打分带来的漂移与幻觉。
AutoTrainess 提出一种“自我训练导师”框架:不再依赖人工持续标注,而是让一个语言模型在任务分解、答案评估与反馈生成中扮演教练角色,持续指导另一模型改进表现。该方法强调自动化的训练闭环,结合自生成数据、错误诊断和迭代优化,使模型能够在较少人工介入下提升推理、表达与任务完成能力。论文关注如何让模型从“会回答”进一步走向“会教、会改、会迭代”,为构建可扩展的自治式模型优化流程提供了思路,也反映出大模型训练正从静态数据驱动转向动态协同进化。
这篇论文聚焦大模型 Agent 评估中的一个关键问题:当模型既负责生成方案又参与评价时,反馈回路可能会形成“偏好耦合”,使评估结果越来越偏向某类输出,进而放大系统性偏差。作者围绕评估器的概率校准展开分析,考察把“置信度是否真实反映正确率”这一经典校准问题,引入到 Agent 反馈场景后,能否削弱这种耦合效应。文章从机制层面讨论校准与偏好稳定性的关系,并评估其对自动打分、迭代改进和自反馈流程的影响。该研究对构建更可信的 LLM 代理评测体系具有现实意义。
这篇论文聚焦大语言模型在数值计算场景中的稳定性与可靠性,提出并评测其对浮点误差类型的分类能力。作者围绕舍入误差、上溢、下溢、精度损失等典型数值问题构建基准,用以检验模型是否真正理解浮点运算中的错误成因与表现。研究不仅关注模型对题目表面的语言理解,更强调其在程序、数学与工程语境下识别数值异常的能力。结果可为评估大模型在科学计算、代码分析和自动调试中的实用价值提供参考,也揭示了当前模型在严谨数值推理方面仍存在明显短板。
本文聚焦任务型对话系统中的一个现实故障场景:数据库不可用、查询失败或返回空结果时,LLM驱动的对话智能体如何安全、稳妥地继续服务用户。作者围绕“恢复式提示”设计展开,讨论如何让模型在缺少后端数据支持时,避免胡乱编造、错误承诺或无意义重复,而是转向澄清需求、解释限制、提供可行替代方案,并维持对话连贯性。研究强调在真实部署中,任务型助手不仅要回答得像“会聊天”,更要在系统失效时体现可控性、鲁棒性与安全性,对构建可落地的企业级对话代理具有直接参考价值。
这篇论文探讨了一条不同于单纯放大参数规模的路径:通过扩展智能体可利用的“视野”与推理过程,让一个35B模型逼近万亿参数级系统的表现。作者强调,真正决定复杂任务上限的,未必只是模型大小,还包括上下文长度、工具调用、检索、规划与多步交互等智能体能力。论文围绕这一思路设计了训练与推理框架,使小得多的模型在长程任务、复杂决策和多阶段推理中获得更强效果。其核心启示是,大模型竞争正从“参数军备竞赛”转向“系统能力竞赛”,而智能体化架构可能成为提升性价比和可扩展性的关键路径。
本文提出一种多智能体协同框架,利用开源大语言模型识别、分析并缓解虚假信息传播风险。系统通过分工明确的多个智能体,对可疑内容进行事实核查、来源追溯、语义一致性分析与风险评估,并在推理过程中相互校验结论,以提高对复杂谣言和操纵性叙事的检测能力。与单一模型方案相比,该方法更强调可解释性、可扩展性和对开源生态的适配性,适用于社交媒体舆情监测、内容审核与公共信息安全场景。
EMPATH 是一个面向情感支持聊天机器人的多语种安全评测基准,采用“审计者-裁判”双角色框架,系统检验模型在真实对话场景中的风险回应能力。该基准关注心理安慰、危机干预、依赖诱导与越界建议等高风险问题,覆盖多种语言与文化语境,强调不同语言下安全标准的一致性与可迁移性。论文旨在弥补现有评测多聚焦英语、且难以反映情感支持场景复杂性的不足,为比较不同聊天机器人在安全性、同理性与边界控制方面的表现提供更可靠的工具,也为后续安全对齐与多语种治理研究提供数据基础。