共形预测为机器学习提供带覆盖率保证的不确定性区间,但在高维模型或大规模数据场景中,逐样本重训或精确留一计算往往代价高昂。本文围绕近似留一法(Approximate Leave-One-Out, ALO)展开,利用参数扰动与二阶近似快速估计删除单个样本后的模型变化,从而显著降低共形预测在校准阶段的计算开销。该方法兼顾预测区间的有效性与推理效率,适用于线性模型及部分可微优化模型,可为需要高吞吐、低延迟不确定性估计的应用提供更实用的实现路径。
AI Agent 与大模型中文情报库
持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。
最新动态
最近更新:2026-07-08 10:30:33本文从低维拓扑学视角研究深度神经网络的结构性质,关注网络参数空间、表示空间及训练过程中的拓扑不变量与几何约束。作者尝试用更抽象的数学工具刻画神经网络在不同层级上的连通性、孔洞结构与变形特征,以理解模型为何能在高维非线性空间中形成有效表征。该工作有助于连接机器学习、代数拓扑与几何分析,为解释深度模型的可训练性、表达能力与泛化行为提供新的理论框架。
这篇论文提出 Z-1,一种面向视觉-语言-动作模型(VLA)的高效强化学习框架,目标是在尽量降低训练成本的同时,提升机器人或具身智能系统在复杂任务中的决策与执行能力。与传统依赖大量轨迹或高算力微调的方法相比,Z-1 强调更稳健的奖励驱动优化与更好的样本效率,适合在多模态输入和动作输出耦合较强的场景中使用。该工作关注如何让大模型在感知环境、理解语言指令并生成动作之间形成更有效的闭环,为通用具身智能训练提供了更轻量、可扩展的强化学习路径。
本文面向图结构上的能源时间序列预测不确定性,提出结合基础模型的关系式与序列式保形推断方法。与传统只针对单点或独立样本的保形区间不同,作者同时刻画节点之间的空间相关性,以及时间上的连续依赖,以生成更稳健、可校准的预测区间。该框架适用于电力负荷、可再生能源输出等具有强网络耦合特征的场景,并借助预训练基础模型提升少样本和分布偏移下的泛化能力。研究重点在于兼顾覆盖率、区间紧致性与时序一致性,为能源系统中的风险控制和调度决策提供更可靠的不确定性量化工具。
该文提出 Evo-PI 框架,旨在提升医疗大模型的推理对齐能力。方法核心不是单纯依赖静态标注答案,而是构建“原则驱动”的监督机制:先将医学推理拆解为可执行的判断原则,再在训练过程中持续演化这些原则,使模型在诊断分析、证据引用和结论形成上更贴近临床思维。作者强调,这种逐步优化的监督方式能够缓解医疗任务中常见的幻觉、推理跳步与结论不稳定问题,并提升模型面对复杂病例时的可解释性与一致性。
CHERRY提出一种面向大模型的专家混合新范式,将“分层专家”与“循环表征复用”结合,在尽量压缩参数与计算开销的同时,提升不同层级表示的利用效率。其核心思路不是简单扩充专家数量,而是通过分层路由与反复提炼中间表征,让模型在较少额外开销下获得更高的表示收益。该工作关注稀疏激活、参数效率和推理成本之间的平衡,适合用于需要兼顾性能与部署成本的场景。
SpikeLogBERT 提出一种将脉冲神经网络与 Transformer 结合的日志解析方法,目标是在尽量保持解析精度的同时显著降低推理能耗。该工作针对日志序列中结构化模式与噪声并存的特点,利用脉冲表示的稀疏激活特性,减少传统大模型在长序列建模中的计算开销,并通过 Transformer 捕捉日志模板之间的上下文依赖。相比常规基于深度学习的日志解析方案,SpikeLogBERT 更适合边缘设备、在线监控和资源受限的运维场景,为大规模系统日志分析提供了一条高效、可部署的新路径。
这篇 arXiv 论文聚焦于大模型推理中的一个核心问题:模型在内部“隐式”完成的潜在推理,如何更可靠地转化为可解释、可验证的显式推理过程。作者提出循环式 Transformer(Looped Transformers)作为一种结构化机制,通过在同一模型内部反复迭代计算,让中间表示逐步精炼,从而在效率与推理透明度之间取得平衡。该方法试图弥合当下语言模型“会想但不一定会说清楚”的鸿沟,为构建更具可解释性、可控性和推理稳定性的 AI 系统提供新路径。
本文提出一种自进化的智能体系统,用于自动生成并执行生物学实验流程,目标是把自然语言研究意图转化为可操作、可迭代优化的实验协议。系统通过多智能体协作,将任务规划、步骤生成、工具调用、执行反馈与结果修正整合到统一闭环中,从而提升生物协议自动化的可行性与鲁棒性。与传统静态工作流不同,该框架强调根据执行过程中的反馈持续调整策略,减少人工干预,并增强对复杂实验场景的适应能力。该研究体现了AI Agent在生命科学实验自动化、科研流程编排与实验室智能化方面的应用潜力。
本文提出 JL1-CC&QA,旨在扩展现有 JL1-CD 变化检测基准,使其不仅关注“是否变化”,还进一步评估模型对变化内容的语言理解与表达能力。作者在原有双时相图像变化检测基础上,引入 Change Captioning(变化描述)与 Question Answering(问答)两类任务,用于衡量模型对场景变化的细粒度感知、语义归纳和跨模态推理能力。该基准更贴近实际应用中“发现变化—解释变化—回答相关问题”的完整流程,可为遥感解译、城市监测与多模态视觉理解研究提供统一评测平台。
STEB 是一个面向“文本风格嵌入”的评测基准,用于衡量模型是否能把写作风格而非语义内容有效编码到向量空间中。与传统文本表示不同,风格嵌入更关注语气、句式、文体、作者特征和表达习惯等隐性属性,适用于风格检索、作者归因、文本改写与可控生成等任务。该基准通过系统化任务设计与统一指标,帮助研究者比较不同嵌入模型在风格保持、区分度与泛化能力上的表现,并为后续构建更稳健的风格控制与文本分析系统提供参考。
本文聚焦跨语言关系抽取任务,系统评估大语言模型在罗马尼亚语场景下的表现,比较零样本、少样本提示与微调三种设置。研究关注模型能否借助高资源语言知识迁移到低资源语言,并分析不同范式在抽取实体关系、泛化能力与稳定性上的差异。该工作为理解大模型在多语种信息抽取中的适用边界提供了实证依据,也为低资源语言的关系抽取系统设计与提示策略优化提供参考。
这篇论文聚焦于大模型参数高效微调中的一个关键问题:传统 LoRA 虽然能以低成本适配模型,但在面对非线性强、门控结构复杂的网络层时,表达能力往往受限。作者提出 Nonlinearity-Aware LoRA(NALoRA),将“门控适配”纳入低秩更新框架,在保持参数与计算开销较低的前提下,更有针对性地调整模型中的非线性行为。其核心思路是把结构化门控与低秩分解结合起来,使适配器不仅能修正线性权重,还能更细粒度地影响激活与信息流。实验结果表明,该方法在多种下游任务上相比标准 LoRA 更具效果与稳定性,尤其适合需要精细控制非线性响应的场景。
这篇论文讨论生物学上更可实现的双流神经网络中,如何为不同任务分配“功劳”或“责任”。传统深度学习依赖反向传播进行信用分配,但与真实大脑机制差异较大。作者提出一种“扩散式归责”框架,使网络在视觉等任务中能够依据任务目标,动态决定来自不同通路与模块的更新比例,从而在保持生物可解释性的同时提升学习效率。该工作关注多流结构中的任务依赖性,强调同一输入在不同目标下可能需要不同的归因策略,为构建更接近神经机制、又能支持多任务学习的人工智能系统提供了新思路。
ShopX 是一项面向 Agentic Shopping 的基础模型研究,聚焦“意图到商品履约”这一关键任务:当用户用自然语言提出模糊或多约束的购买意图时,系统不仅要理解需求,还要在商品海量候选中完成匹配、筛选与推荐。该工作强调把购物流程从传统检索式推荐,推进到更具代理能力的多步决策与执行框架,服务于未来可自主协作的购物智能体。论文的核心价值在于将商品选择、约束满足与任务完成统一建模,为电商场景中的大模型落地提供了新的基础能力方向。
本文概述TalentCLEF 2026任务与评测设置,聚焦“技能—职位标题”智能在招聘匹配、岗位画像、人才检索与人力资本管理中的应用。文章介绍该基准如何围绕职位名称标准化、技能抽取与映射、语义检索和分类识别等核心能力构建数据与任务,并讨论面向真实HR场景的挑战,如职位命名不一致、技能表述稀疏、跨行业术语差异及长尾岗位问题。该工作旨在为大模型和信息抽取系统提供统一评测框架,推动更准确的人才理解与岗位匹配技术发展。
本文研究特征排序在子集选择中的“何时停止”问题。传统做法往往先对特征按重要性排序,再逐步加入特征,但排名越靠后,新增特征带来的增益通常迅速下降,甚至引入冗余与噪声。作者提出一种基于“残差重叠”的停止准则:当当前已选子集所解释的残差信息与候选特征的新增信息高度重叠时,就应截断排序、停止继续添加。该方法旨在比固定阈值或交叉验证式的盲目遍历更稳健、更轻量,适用于高维数据、稀疏建模和解释性特征筛选场景。
FARS 是一套面向科研任务的全自动化研究系统,强调从问题定义、信息检索、证据整合到结果产出都尽量由智能体闭环完成,并已在真实场景中实现规模化部署。论文关注的核心不只是“能否做研究”,而是如何让系统在长链路任务中保持稳定、可扩展与可复用,减少人工介入成本。相较于传统单轮问答式工具,FARS 更像一个可持续运行的研究流水线,适用于快速生成资料综述、辅助探索新方向以及支持大规模知识工作。
本文系统梳理大语言模型在从训练、部署到推理和应用集成的全生命周期中可能暴露的安全漏洞,重点总结各类攻击手法、现实风险、现有防御以及尚未解决的开放问题。文章不仅覆盖提示注入、越狱、数据投毒、模型窃取、成员推断等典型威胁,还从应用栈视角分析模型、工具、检索增强、代理与插件等组件之间的联动风险。作者进一步比较不同防护策略的适用边界与局限,强调仅靠单点加固难以应对复杂攻击链,并指出评测基准、可解释性、鲁棒性与持续监测是未来研究重点。
本文提出一种面向训练数据增强的新方法:先利用模型不确定性识别数据中的“难样本”并加以保留,再借助扩散模型对相对简单或冗余的部分进行重生成,从而在控制数据分布质量的同时提升训练集多样性。该思路避免了盲目扩增带来的噪声累积,也减少了对稀缺高价值样本的破坏。方法核心在于以不确定性作为筛选信号,将合成数据生成过程从“全量生成”转为“有选择的补全与替换”,更适合需要兼顾泛化能力与样本效率的场景。
这篇论文聚焦医疗多模态推理中的计算效率与可解释性问题,提出一种双流强化学习框架,在尽量减少 token 使用的前提下提升模型对图像、文本等多源信息的推理能力。方法的核心是将“信息保留”和“推理决策”分离建模,通过一条流控制稀疏 token 选择,另一条流优化跨模态推理路径,从而避免大模型在医疗场景中对冗余上下文的过度依赖。该思路有望降低推理成本,并增强在临床问答、影像辅助诊断等任务中的稳健性与可解释性。
本文聚焦多视角Transformer在三维感知中的位置编码问题,提出DPPE(Camera-Based Positional Encoding的新思路)以提升模型在多相机输入下的可扩展性与泛化能力。作者指出,传统相机位置信息编码往往依赖固定视角假设,面对更大规模、多分辨率或更复杂相机布局时容易带来表示冗余、对齐不稳和性能瓶颈。DPPE通过重新设计相机相关的位置表示,使模型更有效地融合跨视角几何关系与场景结构信息,从而增强多视角Transformer在检测、重建或占据预测等任务中的表现。该工作强调,在扩展大规模多视角架构时,位置编码本身也是关键的系统性优化点。
本文聚焦三维掩码自编码器在预训练中常见的“位置泄露”问题:模型可能过度依赖体素或点云的空间位置信息,从而学到表面上效果不错、但泛化与鲁棒性不足的表示。作者围绕3D表示学习中的掩码重建机制,分析位置信号如何在编码过程中被不当利用,并提出相应的缓解策略,使模型更关注真实几何结构与上下文关系,而不是记住固定坐标模式。实验表明,这类改进有助于增强表示质量、提升下游任务的稳定性,并改善对噪声、遮挡和分布变化的适应能力。
ACE 提出了一种面向多智能体系统的上下文弹性管理机制,核心目标是在推理、协作与任务切换过程中,动态调节不同智能体可见的上下文范围与信息粒度。它将上下文视为可插拔资源,通过自适应策略在相关性、成本与效率之间取得平衡,从而缓解长上下文带来的冗余、噪声和计算开销问题。该方法尤其适合需要频繁调用工具、跨角色协作或持续对话的 Agent 场景,可提升信息分发的精度与系统整体响应质量。
本文从动力学李代数(dynamical Lie algebra)的角度重新审视量子机器学习中的“表达性—可训练性悖论”。作者指出,量子线路越具表达能力,越容易在参数优化时陷入梯度消失的“平坦高原”,但这一关系并非绝对。文章通过分析可达态空间、对称性约束与生成元结构,说明动力学李代数不仅决定线路能够探索的量子态范围,也会显著影响损失景观的几何形态与优化难度。该视角为设计兼具表达性与可训练性的量子模型提供了理论依据,并为缓解平坦高原提出了结构化电路设计与对称性控制思路。
本文研究一种自我改进的在线大模型对齐框架:模型在持续接收人类反馈或偏好信号的同时,利用自身生成的候选策略进行迭代优化。作者重点分析了这类闭环训练在什么条件下能够稳定收敛,以及收敛后是否会朝向更优的对齐状态。文章从理论角度刻画了更新规则、反馈噪声与策略改进之间的关系,并讨论了在线学习过程中可能出现的偏移、震荡与局部最优问题。该工作为理解“模型自己训练自己”能否可靠提升对齐能力提供了数学基础,也对未来构建持续学习型对齐系统具有参考价值。
这篇论文聚焦长上下文大模型推理中的 KVCache 显存瓶颈,提出 RaBitQCache,一种将旋转变换与二值量化结合的缓存压缩方法。其核心思路是在尽量保留注意力所需信息的前提下,把高维 key/value 表示映射到更适合二值化的空间,再以极低比特成本存储,从而显著降低长序列推理时的内存占用与带宽压力。相比传统 KVCache 压缩方案,该方法试图在压缩率、精度损失和推理效率之间取得更好的平衡,适用于长上下文问答、代码生成和文档分析等场景。
本文围绕“Agentic Orchestration”与“Orchestration of Agents”两类概念展开,重点讨论在多智能体系统中,如何把大模型驱动的任务拆解、状态管理、工具调用、路由决策与执行反馈组织成可落地的编排框架。文章强调,真正可用的智能体系统不只是单个 Agent 的能力增强,更在于通过显式工作流、控制策略与协同机制,实现多个智能体在复杂任务中的分工、协作与容错。内容对编排层的职责边界、运行时调度、上下文传递以及可观测性等关键问题进行了系统化梳理,为构建可扩展、可维护的 Agent 体系提供设计参考。
本文围绕“自修复反馈”在冻结的小型代码模型中的真实作用展开实验,采用内部预注册的安慰剂对照设计,将模型在代码修复任务中的改进进一步拆解,以区分真正由反馈带来的能力提升与实验流程、提示偏置或结果解读造成的假象。作者强调研究目标并非单纯展示模型“能修好多少”,而是通过可证伪的设计检验反馈机制是否被高估。该工作对代码模型评测、提示工程归因以及实验可重复性具有参考价值,也为理解小模型在缺少参数更新时的学习边界提供了更严谨的证据。
这篇论文讨论一个常被忽视却极具信息量的内部信号——“惊讶”(surprise)。作者认为,当模型或智能体遇到与既有预测明显不一致的输入时,这种惊讶不仅意味着预测误差,还可以作为是否需要更新知识结构、调整学习速率与重估自身判断的触发器。文章进一步把惊讶与可塑性联系起来:越是意外的经验,越可能推动表征重组与策略修正;同时,它也可作为元认知线索,帮助系统判断自己“知道多少”“该不该相信当前答案”。这一视角对大模型、自适应智能体和持续学习系统尤其重要。