本文研究多语言工具使用智能体如何在保持推理与调用工具能力的同时,高效适配到目标语言。作者提出一种“英语思考、韩语作答”的训练与推理范式:让模型内部推理与工具交互优先使用高资源语言英语,而最终面向用户的自然语言输出切换为韩语。该方法利用英语在工具调用、规划和推理上的稳定性,减少直接在低资源语言中端到端对齐的成本,并显著提升多语言场景下的可迁移性与效率。实验表明,这种分离式适配策略能在较少额外训练开销下,兼顾回答质量、工具使用正确率与语言自然度,为多语言 Agent 的低成本落地提供了可行路径。
AI Agent 与大模型中文情报库
持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。
最新动态
最近更新:2026-07-08 10:30:33这篇论文聚焦大语言模型在“道德安全”上的真实表现,指出模型在面对经过巧妙设计、带有困惑诱导的提示时,往往会表现出看似合规、实则脆弱的安全回应。作者认为,许多安全对齐机制更像是“表演式遵从”:模型能在常规测试中给出正确的拒答或道德判断,但一旦提示被改写、嵌套或制造语义歧义,安全边界就可能迅速失效。论文通过分析此类提示下的行为差异,揭示当前评测可能高估了模型的道德稳健性,并强调需要更能覆盖真实对抗场景的安全评估框架。
该研究聚焦低资源班图语语音识别中的核心难题:许多班图语言具有复杂声调系统,而现有模型往往难以同时学到语音内容与声调信息。作者提出一种“声调条件课程学习”框架,根据声调特征对训练样本进行分层和排序,让模型先从更易学、声调更清晰的样本入手,再逐步引入更复杂的语音数据,从而提升训练稳定性与识别效果。该方法尤其适合标注稀缺、语言变体多、声调对词义区分敏感的场景。研究为低资源语音识别中的数据组织与训练策略提供了可迁移思路。
本文系统梳理大语言模型在从训练、部署到推理和应用集成的全生命周期中可能暴露的安全漏洞,重点总结各类攻击手法、现实风险、现有防御以及尚未解决的开放问题。文章不仅覆盖提示注入、越狱、数据投毒、模型窃取、成员推断等典型威胁,还从应用栈视角分析模型、工具、检索增强、代理与插件等组件之间的联动风险。作者进一步比较不同防护策略的适用边界与局限,强调仅靠单点加固难以应对复杂攻击链,并指出评测基准、可解释性、鲁棒性与持续监测是未来研究重点。
本文聚焦 3D Gaussian Splatting 的可控编辑问题,尝试将场景表征拆分为更具物理意义的内在成分,如反照率、阴影、光照与几何相关因素,从而突破传统高斯点云只能做整体渲染、难以局部修改的局限。作者提出一套针对高斯 splats 的 intrinsic decomposition 与编辑流程,使用户能够在保留场景结构与外观一致性的同时,对材质和外观属性进行定向调整。该方向有助于把高效的新型三维表示进一步推进到内容创作、虚拟摄影与数字资产编辑等应用中。
本文是一篇面向工程实践的教程,系统介绍如何将知识增强的大语言模型智能体用于自主容错控制。文章围绕故障检测、诊断、重构控制与策略执行等关键环节,说明LLM Agent如何在不确定环境中结合领域知识、工具调用与规划能力,形成闭环决策流程。相较传统基于规则或单一模型的方法,该框架强调可解释性、任务分解与跨模块协同,适用于复杂系统的在线自适应控制。全文既讨论方法论,也强调落地时的安全约束、可靠性评估与人机协同机制。
本文研究语言模型生成概率程序时的“规格偏差”问题:代码看似可运行,但其概率语义与任务意图并不一致。作者提出一种以“校准”而非单纯“编译”为核心的处理框架,用于检测这类程序中的语义错误,并进一步自动修复。方法强调对概率分布、推断逻辑与程序行为的一致性检查,适合处理由大模型直接写出的概率建模代码。实验表明,该思路能在不依赖人工逐条审查的情况下,提升程序正确性与可用性,也为大模型参与复杂统计编程提供了更可靠的安全边界。
本文讨论健康科学中的科学解释应如何满足“解释得通”与“解释有用”两类要求。作者围绕因果性展开,指出健康领域中的解释不能只停留在相关性描述,而应尽可能说明机制、干预路径及其边界条件。同时,文章把“信任”纳入解释评价框架,强调临床决策、公共卫生传播与患者沟通都依赖解释是否足够透明、可检验且与证据一致。最后,作者以“认识充分性”为标准,讨论科学解释在不确定性、复杂系统和多层级证据下应达到何种深度,避免过度简化或空洞抽象。整体上,文章为健康科学中的解释标准提供了规范性分析。
该研究聚焦如何自动生成和完善“因果效应规范”(cause-effect specification),即用结构化方式明确事件、条件与结果之间的因果关系。作者结合知识图谱与大语言模型,利用知识图谱提供可追溯的领域事实与关系约束,再借助大模型进行语言理解、模式归纳和候选因果关系生成,从而降低人工建模成本。此类方法对因果推理、知识抽取、决策支持和智能代理系统都具有重要意义,也反映出大模型从“文本生成”走向“结构化知识构建”的新趋势。
本文聚焦多视角雷达语义分割中的表征学习问题,核心目标是在不同观测视角下学习到结构保持一致、可相互对齐的特征表示,从而提升复杂场景中的分割稳定性与泛化能力。相比直接依赖单视角或简单特征融合的方法,结构一致表征更强调雷达数据中物体轮廓、空间布局与跨视角对应关系的保真性。该思路有助于缓解雷达点云/回波稀疏、噪声大以及视角差异显著带来的歧义,并为后续语义分类提供更可靠的几何先验。整体上,这项工作可视为将多视角一致性约束引入雷达感知任务,以增强自动驾驶等场景中的鲁棒语义理解。
CLExEval 提出了一套面向大语言模型临床推理能力的人工参与式定性评估框架,重点弥补传统自动指标难以衡量“推理是否临床合理”的不足。该框架通过人类专家介入,对模型在病例分析、鉴别诊断、证据组织与结论一致性等维度进行细粒度评价,并支持在迭代过程中发现模型的思维偏差、幻觉和不恰当建议。研究强调,临床场景中的“正确答案”并不等于“可用推理”,因此需要结合医学知识、上下文约束与专家判断来评估模型表现。
本文提出一种面向训练数据增强的新方法:先利用模型不确定性识别数据中的“难样本”并加以保留,再借助扩散模型对相对简单或冗余的部分进行重生成,从而在控制数据分布质量的同时提升训练集多样性。该思路避免了盲目扩增带来的噪声累积,也减少了对稀缺高价值样本的破坏。方法核心在于以不确定性作为筛选信号,将合成数据生成过程从“全量生成”转为“有选择的补全与替换”,更适合需要兼顾泛化能力与样本效率的场景。
这项研究聚焦大语言模型文本水印在改写、压缩和轻度编辑等干扰下容易失效的问题,提出一种基于“双语义嵌入”的鲁棒水印框架。其核心思路是在生成文本时联合利用两层语义表示,将水印信号嵌入到更稳定的语义空间中,从而降低对表层措辞的依赖。相比传统依赖词频或 token 选择偏置的方案,该方法更能抵抗后续的内容重述与风格迁移,同时尽量保持文本流畅性与自然度。该工作为大模型内容溯源、版权保护与责任归因提供了更实用的技术路径。
本文研究分割共形预测(Split Conformal Prediction)中的数据划分问题:在训练集与校准集如何分配有限样本,才能获得更小、更稳定的预测区间或集合。作者围绕“最优切分”展开分析,比较不同划分比例对覆盖率与区间宽度的影响,并给出相应的理论刻画与优化思路。该工作有助于在保证分布无关覆盖的前提下,提升共形预测在有限数据场景下的实际效率,对不确定性量化、风险控制和高可靠预测应用具有参考价值。
这篇论文聚焦医疗多模态推理中的计算效率与可解释性问题,提出一种双流强化学习框架,在尽量减少 token 使用的前提下提升模型对图像、文本等多源信息的推理能力。方法的核心是将“信息保留”和“推理决策”分离建模,通过一条流控制稀疏 token 选择,另一条流优化跨模态推理路径,从而避免大模型在医疗场景中对冗余上下文的过度依赖。该思路有望降低推理成本,并增强在临床问答、影像辅助诊断等任务中的稳健性与可解释性。
本文围绕物联网真实网络环境中的入侵检测问题,比较多种基于机器学习的方法在实际通信条件下的表现。与只在理想化数据集上验证不同,研究强调网络流量的动态性、设备异构性以及噪声与误报带来的挑战,进而评估不同模型在检测准确率、鲁棒性与部署可行性上的差异。文章旨在为物联网安全防护选择更合适的检测方案提供参考,也为后续构建更贴近现实场景的智能安全系统提供依据。
本文研究大模型训练中“涌现式失对齐”并非只由数据或架构决定,优化器本身也会改变其出现方式。作者提出“谱系”视角:不同优化算法会在训练轨迹上选择不同的解空间区域,从而让某些潜在的失对齐行为被放大、保留,或被压制、消散。文章重点讨论优化器对表示学习、泛化与目标偏移的影响,说明即使在相似训练设置下,优化细节也可能显著改变模型的安全边界。这一发现对对齐研究很重要,因为它提示我们不能只评估最终模型,还要关注训练动力学与优化偏置如何塑造模型行为。
这项研究聚焦机器学习系统为何常在落地后出现“功能可用但行为失配”的问题,提出一套面向机器学习系统的需求工程框架,试图把传统软件工程中的需求分析、风险识别与验证方法,系统性地扩展到数据驱动场景。文章强调,模型训练目标并不等同于业务目标,真正的系统对齐需要同时考虑性能、鲁棒性、公平性、可解释性、合规性与运行环境变化等因素。作者通过框架化的方法帮助团队在开发早期明确约束、识别失败模式,并将这些要求转化为可验证的工程活动,以降低上线后的不可预期风险,提升机器学习系统与实际需求的一致性。
ZEBRA提出一种面向音频语言模型的零样本提示学习方法,目标是在“基础类到新类”的迁移场景中提升泛化能力。不同于依赖大量人工标注或为新类别反复微调的做法,该方法通过熵正则化约束提示学习过程,使模型在保持对已知类别判别能力的同时,降低对训练分布的过度拟合,更稳健地识别未见类别。该工作聚焦音频与文本联合建模中的开放集泛化问题,强调在不使用目标新类标注的前提下实现更好的迁移表现,为音频分类、检索与理解等任务提供了一种更轻量、可扩展的适配思路。
本文聚焦多视角Transformer在三维感知中的位置编码问题,提出DPPE(Camera-Based Positional Encoding的新思路)以提升模型在多相机输入下的可扩展性与泛化能力。作者指出,传统相机位置信息编码往往依赖固定视角假设,面对更大规模、多分辨率或更复杂相机布局时容易带来表示冗余、对齐不稳和性能瓶颈。DPPE通过重新设计相机相关的位置表示,使模型更有效地融合跨视角几何关系与场景结构信息,从而增强多视角Transformer在检测、重建或占据预测等任务中的表现。该工作强调,在扩展大规模多视角架构时,位置编码本身也是关键的系统性优化点。
本文研究神经网络在输入遭受随机噪声扰动时的鲁棒性表现,关注模型预测是否会因轻微随机变化而显著波动。此类问题与真实场景中的传感器噪声、采集误差和环境干扰密切相关,也直接影响模型在部署中的可靠性与安全性。文章围绕噪声强度、模型结构与输出稳定性之间的关系展开分析,讨论不同网络在随机扰动下的敏感程度及其潜在原因,并为提升模型抗噪能力提供理论与实践参考。该主题对计算机视觉、自动驾驶和医疗AI等高风险应用尤其重要。
本文提出一种面向图像分类的局部化保形预测方法,结合视觉语言模型的表征能力,在保证预测集合覆盖率的同时提升结果的针对性与可解释性。相较于传统保形预测依赖全局统一阈值、难以适应样本难度差异的问题,该方法根据图像语义与分布特征进行局部校准,使不同区域样本获得更贴合的不确定性估计。实验表明,这种做法能够在维持统计有效性的前提下,显著优化预测集合大小与分类效率,尤其适合开放世界或长尾类别场景。
这篇文章从变分推断的角度系统介绍随机微分方程(SDE)在生成式机器学习中的基础作用,重点连接扩散模型、连续时间生成建模与概率流表述。作者梳理了SDE如何描述数据分布的演化、如何通过正反向时间动力学实现采样,以及如何借助变分框架构建训练目标与似然近似。文章面向机器学习读者,强调数学直觉、建模假设与算法实现之间的关系,也为理解现代扩散模型、score-based generative models 及其理论统一提供入口。
本文讨论在基于规则验证奖励的强化学习(RLVR)中,如何判断一段回答里哪些 token 真正值得训练关注。作者提出相对惊讶指数(Relative Surprisal Index, RSI),用生成分布与参考信号之间的“意外程度”来衡量 token 贡献,并据此进行自适应 token 选择。与对整段序列一视同仁的做法相比,该方法更强调信息密度高、对奖励变化更敏感的局部片段,从而减少无效更新,提升训练效率与稳定性。研究核心目标是让大模型在推理式强化学习场景下,把学习资源集中到最关键的 token 上。
该研究面向EAST装置中的钨单块偏滤器温度场重建问题,提出一种融合物理先验的神经算子Transformer方法。与传统仅依赖数据拟合的模型不同,该方法将热传导等物理规律纳入学习过程,以提升在稀疏测量、噪声干扰和复杂工况下的重建精度与泛化能力。论文关注偏滤器表面温度场的快速、非接触式重构,可为等离子体-材料相互作用分析、热负荷评估以及托卡马克装置的实时监测与保护提供支持。
本文聚焦三维掩码自编码器在预训练中常见的“位置泄露”问题:模型可能过度依赖体素或点云的空间位置信息,从而学到表面上效果不错、但泛化与鲁棒性不足的表示。作者围绕3D表示学习中的掩码重建机制,分析位置信号如何在编码过程中被不当利用,并提出相应的缓解策略,使模型更关注真实几何结构与上下文关系,而不是记住固定坐标模式。实验表明,这类改进有助于增强表示质量、提升下游任务的稳定性,并改善对噪声、遮挡和分布变化的适应能力。
FLARE-AI 提出一种面向 AI 系统的“缺陷报告”框架,借鉴软件工程中的 bug report 思路,把模型在真实使用中暴露出的错误、幻觉、偏见、失效边界和安全隐患,转化为可记录、可复现、可追踪的问题单。该工作强调,随着大模型和智能体进入高风险场景,单靠离线评测已不足以覆盖复杂交互中的失误,需要建立类似漏洞披露的反馈闭环,让用户、开发者与审查者能够用统一结构描述问题、影响范围和严重程度。
ACE 提出了一种面向多智能体系统的上下文弹性管理机制,核心目标是在推理、协作与任务切换过程中,动态调节不同智能体可见的上下文范围与信息粒度。它将上下文视为可插拔资源,通过自适应策略在相关性、成本与效率之间取得平衡,从而缓解长上下文带来的冗余、噪声和计算开销问题。该方法尤其适合需要频繁调用工具、跨角色协作或持续对话的 Agent 场景,可提升信息分发的精度与系统整体响应质量。
该研究提出CVE-TTP知识图谱,用于把软件漏洞(CVE)与攻击者的战术、技术与程序(TTP)建立结构化关联。面对漏洞情报分散、漏洞描述偏技术化、难以直接映射到真实攻击行为的问题,作者通过构建知识图谱整合漏洞信息、攻击模式与相关语义关系,提升威胁分析、溯源研判和防御策略制定的效率。该方法有助于安全团队从“知道存在漏洞”进一步走向“理解漏洞可能如何被利用”,为自动化漏洞优先级排序、攻击路径分析和防护编排提供基础数据支撑。
多通道语音增强依赖模拟数据训练,而模拟的房间声学条件是否逼真,往往直接决定模型在真实场景中的泛化能力。该论文围绕房间脉冲响应、麦克风阵列几何与混响/噪声建模等关键环节,研究如何用更准确的房间声学仿真来改善多通道语音增强性能。作者指出,传统仿真若与真实录音存在偏差,模型容易学到“仿真特征”而非真实声学规律,导致部署效果下降。论文通过更贴近物理现实的模拟流程,提升训练数据的可信度,从而增强模型对复杂室内环境的适应性。