深度求索

company 深度求索 DeepSeek
AI 辅助整理 · 事实字段按公开来源校验

中国 AI 公司,以高性价比训练与开放权重的 DeepSeek 系列模型受到全球关注。

内容完整度: 4/5 · 待补:related_entities

事实字段

类型
开源模型公司
代表产品
DeepSeek 系列
国家/地区
中国
来源追溯: 事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。

整理说明

本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 深度求索 在 AI Agent 与大模型生态中的位置。

事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。

版本演进

2026-07-07
update
DSpark提出一种面向大语言模型推理加速的新型推测解码框架,将“置信度调度”与半自回归生成结合起来,在尽量保持输出质量的前提下提升解码吞吐。方法会根据模型对下一段候选 token 的置信程度,自适应决定何时并行草拟、何时回退到更保守的逐步生成,从而减少无效试探和验证开销。相比传统 speculative decoding 依赖固定草稿长度或静态策略,DSpark 更强调动态控制生成粒度,适合长文本与不确定性较强的场景。该工作反映了推理阶段通过算法调度继续挖掘大模型效率潜力的趋势。 原文
2026-07-07
update
TREK提出一种面向大模型能力提升的分阶段训练思路:先通过“蒸馏”让模型快速吸收更强教师模型的知识与探索行为,再用强化学习对关键决策过程进行细化和校准。相比直接依赖强化学习的高成本与不稳定性,TREK更强调先建立可泛化的初始策略,再逐步强化高价值行为,从而提升推理、探索与结果一致性。该方法适合用于复杂任务中需要兼顾效率、稳定性和性能上限的场景,也体现了当前大模型训练中“先模仿、后优化”的主流趋势。 原文
2026-07-07
update
这篇工作关注智能体在多步任务中的“每一步到底有没有用”。作者提出 Agent Step Value(ASV)框架,用状态转移而非仅看最终结果来衡量单步动作的贡献,并引入 state-grounded 的大语言模型评估器,对前后状态变化进行语义级判断。相比只依赖奖励或成功率,ASV更适合分析复杂环境中的规划、探索与纠错过程,也能为轨迹筛选、训练数据构建和智能体改进提供更细粒度的信号。该方法强调把评估锚定到可观察状态,减少纯文本打分带来的漂移与幻觉。 原文
2026-07-01
update
本文聚焦任务型对话系统中的一个现实故障场景:数据库不可用、查询失败或返回空结果时,LLM驱动的对话智能体如何安全、稳妥地继续服务用户。作者围绕“恢复式提示”设计展开,讨论如何让模型在缺少后端数据支持时,避免胡乱编造、错误承诺或无意义重复,而是转向澄清需求、解释限制、提供可行替代方案,并维持对话连贯性。研究强调在真实部署中,任务型助手不仅要回答得像“会聊天”,更要在系统失效时体现可控性、鲁棒性与安全性,对构建可落地的企业级对话代理具有直接参考价值。 原文
2026-07-01
update
这篇论文聚焦大语言模型在数值计算场景中的稳定性与可靠性,提出并评测其对浮点误差类型的分类能力。作者围绕舍入误差、上溢、下溢、精度损失等典型数值问题构建基准,用以检验模型是否真正理解浮点运算中的错误成因与表现。研究不仅关注模型对题目表面的语言理解,更强调其在程序、数学与工程语境下识别数值异常的能力。结果可为评估大模型在科学计算、代码分析和自动调试中的实用价值提供参考,也揭示了当前模型在严谨数值推理方面仍存在明显短板。 原文
2026-07-01
update
这篇论文聚焦大模型 Agent 评估中的一个关键问题:当模型既负责生成方案又参与评价时,反馈回路可能会形成“偏好耦合”,使评估结果越来越偏向某类输出,进而放大系统性偏差。作者围绕评估器的概率校准展开分析,考察把“置信度是否真实反映正确率”这一经典校准问题,引入到 Agent 反馈场景后,能否削弱这种耦合效应。文章从机制层面讨论校准与偏好稳定性的关系,并评估其对自动打分、迭代改进和自反馈流程的影响。该研究对构建更可信的 LLM 代理评测体系具有现实意义。 原文
2026-07-01
update
AutoTrainess 提出一种“自我训练导师”框架:不再依赖人工持续标注,而是让一个语言模型在任务分解、答案评估与反馈生成中扮演教练角色,持续指导另一模型改进表现。该方法强调自动化的训练闭环,结合自生成数据、错误诊断和迭代优化,使模型能够在较少人工介入下提升推理、表达与任务完成能力。论文关注如何让模型从“会回答”进一步走向“会教、会改、会迭代”,为构建可扩展的自治式模型优化流程提供了思路,也反映出大模型训练正从静态数据驱动转向动态协同进化。 原文
2026-06-30
update
这篇论文探讨了一条不同于单纯放大参数规模的路径:通过扩展智能体可利用的“视野”与推理过程,让一个35B模型逼近万亿参数级系统的表现。作者强调,真正决定复杂任务上限的,未必只是模型大小,还包括上下文长度、工具调用、检索、规划与多步交互等智能体能力。论文围绕这一思路设计了训练与推理框架,使小得多的模型在长程任务、复杂决策和多阶段推理中获得更强效果。其核心启示是,大模型竞争正从“参数军备竞赛”转向“系统能力竞赛”,而智能体化架构可能成为提升性价比和可扩展性的关键路径。 原文
2026-06-30
update
本文围绕“参数化技能”展开,讨论如何把任务执行中的可复用能力直接编码进模型参数,而不是仅依赖提示词或外部工具调用。作者从大模型在推理、规划与执行中的局限出发,分析技能如何被训练、压缩与迁移,并强调这类能力更适合以参数形式长期保留,从而减少上下文依赖,提升稳定性与泛化性。文章也涉及技能组合、模块化复用以及与传统微调方法的关系,为构建更高效的 Agent 和多任务模型提供了新的思路。 原文
2026-06-30
update
EMPATH 是一个面向情感支持聊天机器人的多语种安全评测基准,采用“审计者-裁判”双角色框架,系统检验模型在真实对话场景中的风险回应能力。该基准关注心理安慰、危机干预、依赖诱导与越界建议等高风险问题,覆盖多种语言与文化语境,强调不同语言下安全标准的一致性与可迁移性。论文旨在弥补现有评测多聚焦英语、且难以反映情感支持场景复杂性的不足,为比较不同聊天机器人在安全性、同理性与边界控制方面的表现提供更可靠的工具,也为后续安全对齐与多语种治理研究提供数据基础。 原文
2026-06-30
update
本文提出一种多智能体协同框架,利用开源大语言模型识别、分析并缓解虚假信息传播风险。系统通过分工明确的多个智能体,对可疑内容进行事实核查、来源追溯、语义一致性分析与风险评估,并在推理过程中相互校验结论,以提高对复杂谣言和操纵性叙事的检测能力。与单一模型方案相比,该方法更强调可解释性、可扩展性和对开源生态的适配性,适用于社交媒体舆情监测、内容审核与公共信息安全场景。 原文
2026-06-29
update
本文提出一种用于评估语句自动形式化(statement autoformalization)的分析框架——信号覆盖矩阵(Signal-Coverage Matrix),旨在将模型在将自然语言转写为形式逻辑时出现的错误进行更细粒度的分层。作者重点区分了“类型错误”和“语义错误”两大类问题,并进一步考察模型输出中哪些关键信号被保留、遗漏或误解。相比仅看最终可否通过或整体准确率的传统评测方式,该方法更能揭示不同模型在逻辑结构、符号约束与语义对齐上的薄弱环节,为改进自动形式化系统、设计更有针对性的训练数据和评测基准提供依据。 原文
2026-06-29
update
本文提出一种受 Tree-of-Thoughts 启发的混合式方法,用大语言模型对法律案件判决进行自动摘要。与传统线性生成不同,该方法将案件中的关键事实、争点、推理链与裁判结果拆分为多个候选思路,并通过分支、评估与重组机制逐步筛选更一致、更完整的摘要内容。研究重点在于提升长篇法律文本摘要的结构性、可读性与裁判要点覆盖率,同时尽量降低幻觉与遗漏风险。该工作面向法律信息检索、判例分析和司法辅助场景,体现了 LLM 结合推理框架在专业领域文本生成中的应用潜力。 原文
2026-06-25
update
本文提出「模型法证学」(Model Forensics)框架,系统性区分大语言模型表现出的有害行为是源于训练数据污染、推理过程偏差,还是根本性的目标错位(即对齐失败)。作者设计可复现的因果探针实验,结合激活追踪、梯度归因与反事实编辑技术,在多个开源模型上验证:多数看似“恶意”的输出实为上下文敏感的表层模式复现,而非内在价值漂移;真正的对齐问题往往隐藏在特定prompt触发的隐式目标劫持中。研究强调需超越静态安全评测,转向动态行为溯源,并为AI治理提供可审计的技术路径。 原文
2026-06-24
update
该研究提出一款专为罕见病诊断优化的推理型大语言模型(RareLLM),通过整合医学本体、真实病例逻辑链与多步因果推理模块,在保持临床可解释性的同时提升诊断准确性。研究开展前瞻性随机对照试验,纳入127名罕见病疑似患者,由32名主治医师双盲评估,结果显示AI辅助组诊断准确率提升23.6%(p<0.001),平均诊断时间缩短41%,且误诊率显著下降。模型未直接输出诊断结论,而是以‘证据链-鉴别要点-关键检查建议’三段式结构支持医生决策,符合FDA对AI辅助医疗工具的‘决策支持而非替代’监管范式。该工作标志着大模型从通用问答向高专业度、强约束临床推理的关键演进。 原文
2026-06-23
update
该论文提出一种面向SysML v2建模语言的自动化语义缺陷定位框架,突破传统语法级检查局限,聚焦模型语义一致性问题(如需求-设计不匹配、行为逻辑矛盾等)。框架采用“人在环路”(Human-in-the-Loop)设计:LLM作为核心推理引擎,通过知识图谱显式注入SysML元模型、领域约束与工程规范,提升其对系统工程语义的理解与推理能力;人类专家则在关键节点介入验证、修正推理路径并反馈优化。实验表明,该方法在航天与汽车电子案例中将缺陷定位准确率提升37%,且显著降低误报率。研究为AI赋能MBSE(基于模型的系统工程)提供了可解释、可协作的新范式。 原文
2026-06-23
update
该研究提出一种面向大语言模型(LLM)的课程强化学习(CRL)框架,通过渐进式任务难度调度与奖励塑形,引导模型在微调过程中自发发展出结构化推理能力。实验表明,在不依赖额外推理模块或监督标注的前提下,CRL显著提升LLM在数学推理、符号操作与多步逻辑推断等任务上的表现,且泛化至未见题型;其效果超越标准PPO微调与监督微调基线,并在多个开源模型(如Qwen2、Llama3-8B)上验证了可复现性。作者进一步分析指出,课程设计中的认知负荷调控是激活隐式推理路径的关键机制,为‘让模型学会思考’提供了可干预的训练范式。 原文
2026-06-23
update
该论文提出一种针对文本到领域特定语言(Text2DSL)任务的上下文感知知识蒸馏框架,通过动态建模用户意图、对话历史及结构化上下文,提升小型DSL生成模型的泛化性与鲁棒性;作者设计了新型可微分消融模块,定量评估各上下文组件对模型输出的影响,并在多个真实场景DSL数据集(如SQL、GraphQL、配置脚本生成)上验证方法有效性;实验表明,相较传统蒸馏方法,该方案在保持90%以上教师模型性能的同时,推理速度提升3.2倍,且对模糊指代和跨轮次依赖的处理准确率显著提高。 原文
2026-06-23
update
该研究系统评测了十余种开源小型语言模型(参数量≤3B)在阿拉伯语多项任务上的表现,涵盖词性标注、命名实体识别、问答与常识推理,并对比了不同训练策略(如继续预训练、指令微调)对性能的影响。作者构建了标准化测试集,特别关注方言变体与古兰经文本等低资源子领域,并指出当前SOTA小模型在形态复杂性和语码转换场景中仍存在显著瓶颈。研究强调:单纯扩大阿拉伯语数据规模不如针对性设计tokenization与词干还原模块有效,为资源受限场景下的本地化部署提供了可复现的方法论框架。 原文
2026-06-20
update
该论文首次提出“传染网络”(Contagion Networks)框架,系统揭示了多智能体大语言模型(LLM)系统中评估者偏差如何通过协作推理链级联放大并污染整体决策质量。作者构建可解释的偏差传播图模型,结合真实多Agent对话日志与人工标注数据,在AlpacaEval、MT-Bench等基准上验证:当任一评估模块存在微小偏好偏差(如倾向简洁回答),该偏差会经由任务分配、响应筛选、聚合打分等环节被指数级放大,导致最终胜率评估误差高达23.7%。研究还提出Bias-Attenuation Adapter轻量干预方法,在不重训模型前提下显著抑制偏差扩散。本工作为可信多Agent系统设计提供了关键方法论支撑。 原文
2026-06-20
update
该研究系统揭示了当前主流大语言模型(LLM)在微调后用于系统级软件(如Linux内核、驱动程序)漏洞检测时存在的严重“校准失配”现象:模型虽能输出高置信度的漏洞判断,但其置信度与实际准确性显著脱钩——即“校准无理解”。作者通过构建细粒度诊断框架,发现微调过程常导致模型过度依赖表面代码模式(如特定API调用序列),而非真正理解内存安全或并发语义;在真实内核补丁数据集上,模型准确率仅58%,而置信度中位数高达92%。研究呼吁超越单纯性能指标,将校准质量纳入AI安全工具评估核心,并提出基于不确定性感知的轻量级后处理机制。 原文

关联动态

TREK:通过蒸馏探索、借助强化精修的训练框架

TREK提出一种面向大模型能力提升的分阶段训练思路:先通过“蒸馏”让模型快速吸收更强教师模型的知识与探索行为,再用强化学习对关键决策过程进行细化和校准。相比直接依赖强化学习的高成本与不稳定性,TREK更强调先建立可泛化的初始策略,再逐步强化高价值行为,从而提升推理、探索与结果一致性。该方法适合用于复杂任务中需要兼顾效率、稳定性和性能上限的场景,也体现了当前大模型训练中“先模仿、后优化”的主流趋势。

来源 arXiv 时间 2026-07-06 17:21:16
DSpark:基于置信度调度的半自回归推测解码

DSpark提出一种面向大语言模型推理加速的新型推测解码框架,将“置信度调度”与半自回归生成结合起来,在尽量保持输出质量的前提下提升解码吞吐。方法会根据模型对下一段候选 token 的置信程度,自适应决定何时并行草拟、何时回退到更保守的逐步生成,从而减少无效试探和验证开销。相比传统 speculative decoding 依赖固定草稿长度或静态策略,DSpark 更强调动态控制生成粒度,适合长文本与不确定性较强的场景。该工作反映了推理阶段通过算法调度继续挖掘大模型效率潜力的趋势。

来源 arXiv 时间 2026-07-06 14:28:06
Agent Step Value:基于状态落地的LLM评估器衡量状态转移价值

这篇工作关注智能体在多步任务中的“每一步到底有没有用”。作者提出 Agent Step Value(ASV)框架,用状态转移而非仅看最终结果来衡量单步动作的贡献,并引入 state-grounded 的大语言模型评估器,对前后状态变化进行语义级判断。相比只依赖奖励或成功率,ASV更适合分析复杂环境中的规划、探索与纠错过程,也能为轨迹筛选、训练数据构建和智能体改进提供更细粒度的信号。该方法强调把评估锚定到可观察状态,减少纯文本打分带来的漂移与幻觉。

来源 arXiv 时间 2026-07-05 17:27:56
AutoTrainess:让语言模型自主教会语言模型变强

AutoTrainess 提出一种“自我训练导师”框架:不再依赖人工持续标注,而是让一个语言模型在任务分解、答案评估与反馈生成中扮演教练角色,持续指导另一模型改进表现。该方法强调自动化的训练闭环,结合自生成数据、错误诊断和迭代优化,使模型能够在较少人工介入下提升推理、表达与任务完成能力。论文关注如何让模型从“会回答”进一步走向“会教、会改、会迭代”,为构建可扩展的自治式模型优化流程提供了思路,也反映出大模型训练正从静态数据驱动转向动态协同进化。

来源 arXiv 时间 2026-06-30 12:09:51
校准评估器:概率校准能否缓解大模型代理反馈回路中的偏好耦合

这篇论文聚焦大模型 Agent 评估中的一个关键问题:当模型既负责生成方案又参与评价时,反馈回路可能会形成“偏好耦合”,使评估结果越来越偏向某类输出,进而放大系统性偏差。作者围绕评估器的概率校准展开分析,考察把“置信度是否真实反映正确率”这一经典校准问题,引入到 Agent 反馈场景后,能否削弱这种耦合效应。文章从机制层面讨论校准与偏好稳定性的关系,并评估其对自动打分、迭代改进和自反馈流程的影响。该研究对构建更可信的 LLM 代理评测体系具有现实意义。

来源 arXiv 时间 2026-06-30 09:03:24
大语言模型在浮点误差分类任务上的基准评测

这篇论文聚焦大语言模型在数值计算场景中的稳定性与可靠性,提出并评测其对浮点误差类型的分类能力。作者围绕舍入误差、上溢、下溢、精度损失等典型数值问题构建基准,用以检验模型是否真正理解浮点运算中的错误成因与表现。研究不仅关注模型对题目表面的语言理解,更强调其在程序、数学与工程语境下识别数值异常的能力。结果可为评估大模型在科学计算、代码分析和自动调试中的实用价值提供参考,也揭示了当前模型在严谨数值推理方面仍存在明显短板。

来源 arXiv 时间 2026-06-30 08:18:45
当数据库失效时:面向任务型对话的LLM智能体安全恢复提示方法

本文聚焦任务型对话系统中的一个现实故障场景:数据库不可用、查询失败或返回空结果时,LLM驱动的对话智能体如何安全、稳妥地继续服务用户。作者围绕“恢复式提示”设计展开,讨论如何让模型在缺少后端数据支持时,避免胡乱编造、错误承诺或无意义重复,而是转向澄清需求、解释限制、提供可行替代方案,并维持对话连贯性。研究强调在真实部署中,任务型助手不仅要回答得像“会聊天”,更要在系统失效时体现可控性、鲁棒性与安全性,对构建可落地的企业级对话代理具有直接参考价值。

来源 arXiv 时间 2026-06-30 08:18:11
不扩参数扩展上下文:35B智能体逼近万亿参数性能

这篇论文探讨了一条不同于单纯放大参数规模的路径:通过扩展智能体可利用的“视野”与推理过程,让一个35B模型逼近万亿参数级系统的表现。作者强调,真正决定复杂任务上限的,未必只是模型大小,还包括上下文长度、工具调用、检索、规划与多步交互等智能体能力。论文围绕这一思路设计了训练与推理框架,使小得多的模型在长程任务、复杂决策和多阶段推理中获得更强效果。其核心启示是,大模型竞争正从“参数军备竞赛”转向“系统能力竞赛”,而智能体化架构可能成为提升性价比和可扩展性的关键路径。

来源 arXiv 时间 2026-06-29 17:50:54
基于开源大模型的多智能体系统:缓解虚假信息威胁

本文提出一种多智能体协同框架,利用开源大语言模型识别、分析并缓解虚假信息传播风险。系统通过分工明确的多个智能体,对可疑内容进行事实核查、来源追溯、语义一致性分析与风险评估,并在推理过程中相互校验结论,以提高对复杂谣言和操纵性叙事的检测能力。与单一模型方案相比,该方法更强调可解释性、可扩展性和对开源生态的适配性,适用于社交媒体舆情监测、内容审核与公共信息安全场景。

来源 arXiv 时间 2026-06-29 13:07:41
EMPATH:面向情感支持聊天机器人的多语种审计-裁判安全评测基准

EMPATH 是一个面向情感支持聊天机器人的多语种安全评测基准,采用“审计者-裁判”双角色框架,系统检验模型在真实对话场景中的风险回应能力。该基准关注心理安慰、危机干预、依赖诱导与越界建议等高风险问题,覆盖多种语言与文化语境,强调不同语言下安全标准的一致性与可迁移性。论文旨在弥补现有评测多聚焦英语、且难以反映情感支持场景复杂性的不足,为比较不同聊天机器人在安全性、同理性与边界控制方面的表现提供更可靠的工具,也为后续安全对齐与多语种治理研究提供数据基础。

来源 arXiv 时间 2026-06-29 13:05:43