AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
BP-TTA:面向动态场景的平衡与原型引导测试时自适应

该文提出 BP-TTA,一种面向动态场景的测试时自适应方法,旨在解决部署后数据分布持续变化、类别不平衡和伪标签噪声带来的性能退化问题。方法以类别原型为核心,通过原型引导特征对齐与预测更新,增强模型在新环境中的判别稳定性;同时引入平衡机制,缓解长尾类别在在线适应中的被忽视现象。与传统仅依赖熵最小化或单步更新的 TTA 方法相比,BP-TTA 更强调在流式、非平稳数据条件下维持鲁棒性与泛化能力。实验表明,该方法在多种动态场景中能更稳定地提升分类表现。

来源 arXiv 时间 2026-06-30 09:43:27 AI 辅助整理
学习选择而非重学:推理 LoRA 的硬路由混合方法

这篇论文聚焦于大模型推理能力的高效适配问题,提出一种“硬路由”的 LoRA 混合机制:不是让模型在同一参数空间里反复重学,而是先学会根据输入任务特征选择合适的推理 LoRA,再由对应模块完成推理。相比传统的单一 LoRA 或软混合方案,这种方法更强调“选对专家”而不是“融合所有专家”,有助于降低干扰、提升推理稳定性,并在多种任务场景下保持较好的参数效率。论文也反映出当前大模型后训练的一条重要思路:通过模块化、路由化的方式,把推理能力拆分为可组合、可选择的能力单元,从而更适合多任务与持续扩展。

来源 arXiv 时间 2026-06-30 09:40:38 AI 辅助整理
基于梯度反转与变分信息瓶颈的欺骗检测语言偏差缓解

本文聚焦语音欺骗检测中的语言偏差问题:当训练数据在说话语言、口音或文本内容上存在偏斜时,模型容易学到与任务无关的语言线索,导致跨语言、跨域场景下性能下降。作者提出结合梯度反转层与变分信息瓶颈的训练框架,在尽量保留与真假判别相关信息的同时,主动削弱表示中可被语言属性利用的成分,从而减轻模型对特定语言背景的依赖。该方法旨在提升欺骗检测系统的泛化能力与鲁棒性,尤其适用于多语言或分布偏移明显的真实部署环境。

来源 arXiv 时间 2026-06-30 09:36:55 AI 辅助整理
Xiaomi-GUI-0:小米图形界面操作模型技术报告

本文介绍 Xiaomi-GUI-0,一套面向图形用户界面(GUI)任务的基础模型与技术方案,目标是在真实桌面与移动界面中实现更稳定的理解、定位与操作执行。报告围绕界面元素感知、动作决策、任务分解与多轮交互等核心能力展开,强调模型不仅要“看懂”屏幕,还要能根据指令完成点击、输入、滚动和导航等连续操作。该工作通常也反映出大模型从语言理解走向具身式软件操作的趋势,对智能助手、自动化测试和人机协同具有参考价值。

来源 arXiv 时间 2026-06-30 09:36:35 实体 Semantic Kernel AI 辅助整理
视觉语义熵:视觉语言模型能否识别图像歧义

这篇工作围绕一个关键问题展开:视觉语言模型在面对“看起来不止一种解释”的图像时,是否真的能感知到不确定性。作者提出并研究“视觉语义熵”这一思路,借鉴文本生成中的语义熵概念,把模型对图像的多种可能解释及其分布作为歧义度量。通过对视觉问答、图像描述等任务的分析,论文考察模型输出的多样性与置信程度是否能反映图像本身的多义性。结果表明,当前视觉语言模型对视觉歧义的识别仍不稳定,常会给出过于确定的回答,难以可靠地区分清晰图像与模糊、遮挡或多解图像。该研究为评估多模态模型的校准性与不确定性建模提供了新视角。

来源 arXiv 时间 2026-06-30 09:35:20 AI 辅助整理
AI群体智慧:探索大语言模型中的人工群体智能

本文围绕“大模型是否能够像群体一样形成更优决策”展开,考察大语言模型中的人工群体智能(Artificial Swarm Intelligence, ASI)。作者关注多个模型或多个采样结果在协作、投票、迭代反馈与共识形成中的表现,试图验证“智慧众包”在AI系统中的可行性。研究的核心意义在于:单个模型的答案未必最优,但通过群体式交互,系统可能在准确性、鲁棒性和稳定性上获得提升。文章为理解多智能体协作、集体推理与大模型社会化机制提供了实验依据,也对未来构建更可靠的AI代理系统具有参考价值。

来源 arXiv 时间 2026-06-30 09:30:53 实体 Claude AI 辅助整理
世界模型坍缩:一种相变视角下的解析

本文从“相变”角度研究大模型中的世界模型坍缩现象:当训练数据分布、生成反馈或自我强化机制发生细微变化时,模型内部对外部世界的表征可能从相对稳定突然跃迁为失真、退化甚至自我复制的偏置状态。作者尝试用统计物理和复杂系统的语言刻画这一临界行为,解释为何某些训练设置在表面上仅有小幅扰动,却会引发能力和泛化的断崖式下降。该视角有助于理解长链路自训练、合成数据闭环和代理式系统中的失稳风险,也为设计更稳健的数据混合、约束机制与监控指标提供理论线索。

来源 arXiv 时间 2026-06-30 09:28:01 实体 Semantic Kernel AI 辅助整理
面向状态感知的 Transformer 微调:Mixture-of-Control 方法

这篇论文提出 Mixture-of-Control,一种面向 Transformer 模型的状态感知微调方法,核心思路是让模型在不同“控制状态”下采用差异化参数或路由策略,从而更灵活地适配任务、上下文与行为约束。相比传统统一微调,该方法更强调模型在输入状态变化时的响应可控性与稳定性,适合需要精细对齐、条件生成或多场景部署的应用。论文围绕如何把状态信息融入训练与推理流程展开设计,并探讨其在提升模型可控性、泛化能力和任务适配效率方面的潜力。

来源 arXiv 时间 2026-06-30 09:25:37 AI 辅助整理
面向可解释性与跨模态对齐的AI超位置消解方法

本文围绕大模型中“超位置”现象对可解释性和跨模态学习的影响展开,探讨如何在AI内部表征中分离彼此纠缠的语义特征,从而提升模型分析与对齐能力。研究重点面向患者数据与神经影像等多模态场景,尝试通过对潜在表示的解耦与重构,缓解不同模态信息叠加造成的解释困难,并增强图像、临床信息与神经信号之间的对应关系。该工作有助于推动医疗AI中更透明的决策分析,也为多模态模型在复杂生物医学数据上的稳健对齐提供了方法参考。

来源 arXiv 时间 2026-06-30 09:22:35 AI 辅助整理
ReGRPO:面向工具调用智能体的反思增强策略优化

本文提出 ReGRPO,一种面向工具使用型智能体的强化学习优化方法,核心是在策略更新中引入“反思”机制,让模型不仅根据当前轨迹的结果调整行为,还能对失败原因、工具选择和步骤顺序进行更细粒度的自我校正。相比传统只依赖奖励信号的策略优化,ReGRPO 更强调在复杂多步任务中提升规划、调用工具与纠错的能力,从而增强智能体在真实环境中的稳定性与泛化表现。该方法适用于需要多轮推理、检索、执行与反馈闭环的 Agent 场景。

来源 arXiv 时间 2026-06-30 09:19:38 实体 Semantic Kernel AI 辅助整理
低秩矩阵优化的方向-幅度分解:更快收敛与鞍点间动力学

本文研究低秩矩阵优化中的一种新参数化与分析框架,将更新过程分解为“方向”和“幅度”两部分,以更细致地刻画算法在非凸景观中的行为。作者指出,这种分解不仅有助于解释梯度下降为何能在某些低秩问题上获得更快收敛,还能揭示优化轨迹在不同鞍点之间切换时的动力学特征。相较于传统整体分析,方向-幅度视角更适合描述低秩结构带来的几何约束,并为理解逃离鞍点、稳定收敛到目标解提供理论工具。

来源 arXiv 时间 2026-06-30 09:19:16 AI 辅助整理
面向强化学习的阶段迁移稠密奖励建模

这篇论文关注强化学习中“奖励稀疏、训练不稳定、长程信用分配困难”等核心问题,提出一种阶段迁移式的稠密奖励建模方法。作者将任务推进过程拆分为若干可辨识阶段,并围绕阶段之间的转移关系构建奖励信号,使模型不仅能判断当前行为是否有利,还能更细致地刻画状态从低级到高级的演化路径。与依赖终局反馈或单一打分器的方法相比,该思路有望提供更稳定、更可解释的训练信号,尤其适用于复杂序列决策任务。

来源 arXiv 时间 2026-06-30 09:07:19 实体 Semantic Kernel AI 辅助整理
校准评估器:概率校准能否缓解大模型代理反馈回路中的偏好耦合

这篇论文聚焦大模型 Agent 评估中的一个关键问题:当模型既负责生成方案又参与评价时,反馈回路可能会形成“偏好耦合”,使评估结果越来越偏向某类输出,进而放大系统性偏差。作者围绕评估器的概率校准展开分析,考察把“置信度是否真实反映正确率”这一经典校准问题,引入到 Agent 反馈场景后,能否削弱这种耦合效应。文章从机制层面讨论校准与偏好稳定性的关系,并评估其对自动打分、迭代改进和自反馈流程的影响。该研究对构建更可信的 LLM 代理评测体系具有现实意义。

来源 arXiv 时间 2026-06-30 09:03:24 实体 深度求索 AI 辅助整理
ChatGPT 使用范围持续扩大,用户结构与场景更加多元

OpenAI 介绍了 ChatGPT 采用规模的持续增长,以及产品在不同人群和使用场景中的扩展趋势。随着功能迭代与可访问性提升,ChatGPT 已从早期的技术尝鲜工具,逐步走向更广泛的日常应用,包括写作、学习、办公协作、编程辅助和信息检索等。文章强调,用户画像也在不断变化,不同年龄、职业与地区的用户都在加速接入。整体来看,ChatGPT 的增长不仅体现在用户数量上,更体现在使用频率、任务复杂度和实际业务价值的提升,反映出生成式 AI 正加速融入主流数字工作流。

来源 OpenAI Blog 时间 2026-06-30 09:00:00 实体 ChatGPT AI 辅助整理
从材料数据库到材料银行:让数据成为 AI 驱动材料创新的资产

本文讨论材料数据基础设施正在从“可检索的数据库”走向“可运营、可复用、可增值的材料银行”。作者强调,仅仅把实验和仿真数据集中存放并不足以支撑 AI 驱动的材料发现,真正关键的是将数据标准化、语义化并资产化,使其具备可追溯、可组合和可交易的属性。文章围绕数据质量、元数据治理、知识组织、权限与激励机制等问题,分析如何把分散的数据沉淀为面向模型训练和自动化研发的高价值资产,从而提升材料研发效率,加速新材料筛选、设计与验证。

来源 arXiv 时间 2026-06-30 08:58:52 AI 辅助整理
Dualformer:面向复值盲通信信号分析的高效特征提取器

这项工作提出 Dualformer,一种面向复值通信信号的高效特征提取框架,目标是在缺少先验标注或信道信息的情况下,提升盲信号分析能力。与传统仅处理实值表示的方法不同,Dualformer 直接适配复数域特征,能够更好保留相位与幅度等关键信息,从而增强对复杂调制、噪声干扰及信道失真的表征能力。论文重点关注“特征提取效率”和“复杂场景下的鲁棒识别”,适合用于调制识别、信号分类及其他无线智能感知任务。整体思路体现了大模型式表示学习在通信信号处理中的迁移潜力。

来源 arXiv 时间 2026-06-30 08:49:01 实体 Semantic Kernel AI 辅助整理
基于压力引导与跨模态蒸馏的 sEMG 手势识别无监督域适应

该论文面向表面肌电(sEMG)手势识别中普遍存在的跨被试、跨设备和跨场景分布偏移问题,提出 PGUDA 框架。方法利用压力信息作为辅助模态,在目标域缺少标签的情况下,通过无监督域适应缩小源域与目标域差异,并结合跨模态知识蒸馏,将压力模态中更稳定的运动意图线索迁移到 sEMG 表征学习中。作者的核心思路是用“压力”作为引导信号,增强肌电信号在噪声、个体差异和佩戴条件变化下的鲁棒性,从而提升泛化性能。该工作对可穿戴交互、假肢控制和人机接口中的高可靠手势识别具有应用价值。

来源 arXiv 时间 2026-06-30 08:45:55 实体 Semantic Kernel AI 辅助整理
面向大规模电动汽车车队的智能充电:独立多智能体强化学习方法

本文研究大规模电动汽车车队的智能充电调度问题,核心目标是在满足车辆出行需求的同时,尽量降低电网负荷波动与充电成本。作者聚焦独立多智能体强化学习(Independent MARL)框架,将每辆车视为可自主决策的智能体,在共享电网约束下协同学习充电策略。相比传统集中式优化方法,这类方法更具可扩展性,也更适合车队规模大、信息不完全和实时性要求高的场景。论文讨论了不同独立学习策略在稳定性、收敛性和系统效率上的表现,并为车网互动、需求响应与分布式能源管理提供了可借鉴的思路。

来源 arXiv 时间 2026-06-30 08:43:55 AI 辅助整理
用于无界区域偏微分方程的域分解随机神经网络方法

本文研究无界区域上的偏微分方程数值求解问题,针对传统神经网络方法在大域、远场条件与复杂边界下训练不稳定、泛化不足等难点,提出一种域分解的随机神经网络框架。该方法将计算区域划分为若干子域,在每个子域内结合随机特征表示与局部训练策略,并通过接口条件实现跨域耦合,从而提升对无界问题的表达能力与求解效率。作者重点讨论了该框架在处理椭圆型、抛物型或相关无界PDE时的可扩展性与精度表现,展示其在降低训练难度、改善远场近似以及增强数值稳定性方面的优势。

来源 arXiv 时间 2026-06-30 08:41:54 AI 辅助整理
超越二元乐器问答:检验音乐音频语言模型的乐器定位能力

这篇论文聚焦音乐音频-语言模型在“乐器理解”上的真实能力。作者指出,现有乐器问答评测多停留在二元判断层面,难以判断模型是否真正把文字中的乐器概念与音频中的具体声源对应起来。为此,论文提出更细粒度的探测方法,考察模型在多乐器、混音和干扰场景下的乐器定位与指代能力。研究结果显示,部分模型虽然在表面问答上表现不错,但在乐器 grounding 方面仍存在明显偏差,说明当前评测不足以代表模型对音乐语义的深层理解。

来源 arXiv 时间 2026-06-30 08:39:56 AI 辅助整理
面向6G的OFDM波形与RIS联合设计优化:从凸松弛到基础模型

本文围绕6G网络中的联合OFDM波形设计与可重构智能表面(RIS)配置问题展开,重点讨论如何在复杂约束下高效求解非凸优化任务。文章梳理了从传统凸松弛、交替优化到基于学习的方法的演进路径,并进一步探讨基础模型在波形生成、参数初始化与策略泛化中的潜力。研究指出,RIS与波形协同优化可显著提升频谱效率、覆盖范围与链路鲁棒性,但也带来高维、强耦合和实时性挑战。该工作旨在为6G无线资源优化提供统一的算法视角与可扩展框架。

来源 arXiv 时间 2026-06-30 08:34:46 AI 辅助整理
CryoACE:面向冷冻电镜的原子中心自动建模框架

CryoACE提出了一种面向冷冻电镜(cryo-EM)结构解析的原子中心建模框架,旨在提升模型搭建的准确性与自动化程度。传统冷冻电镜建模往往依赖人工经验,面对分辨率不均、局部噪声和侧链辨识困难时效率较低。该方法从原子层面直接组织建模流程,将几何约束与电子密度信息结合,用于更稳健地完成骨架追踪、残基定位与结构细化。相比依赖大量人工校正的工作流,CryoACE更强调端到端的自动推断能力,可为高通量结构生物学研究提供更可靠的建模支持。

来源 arXiv 时间 2026-06-30 08:33:38 AI 辅助整理
基于期望收益的纵向联邦学习升级机制

本文研究纵向联邦学习中的升级决策问题,即在隐私约束下,如何判断是否值得调用更高成本、信息更丰富的计算流程来提升模型效果。作者提出一种基于期望收益的 escalation 机制,用可量化的收益增量来平衡通信、计算与隐私代价,从而避免在不确定场景下过早或过度升级。该方法面向纵向联邦学习中多方持有不同特征、同一批样本的典型设置,强调在训练与推理阶段动态选择更强协同策略。整体思路有助于提高联邦建模效率,并为资源受限或高敏感数据场景提供更稳健的决策框架。

来源 arXiv 时间 2026-06-30 08:32:53 AI 辅助整理
3D HAMSTER:用三维轨迹引导衔接分层视觉语言动作模型的规划与控制

本文提出3D HAMSTER,一种面向分层视觉语言动作模型的改进框架,核心目标是在高层规划与底层控制之间建立更稳定的连接。方法引入三维轨迹引导,让模型不仅理解任务意图,还能结合空间路径进行动作分解与执行,从而减少从语言计划到真实操作之间的偏差。相比仅依赖文本或二维视觉线索的方案,3D轨迹信息能更直接地表达物体相对位置、运动方向与可达性,提升复杂操作中的鲁棒性与可解释性。该工作体现了具身智能中“先规划、再落地”的关键趋势。

来源 arXiv 时间 2026-06-30 08:31:35 AI 辅助整理
HistoriQA-ThirdRepublic:法国第三共和国议会史多跳问答语料库

这篇论文介绍了 HistoriQA-ThirdRepublic,一个面向历史研究的多跳问答数据集,语料来源于法国第三共和国时期(1870—1940)的议会辩论记录。作者将大量历史文献整理为可用于检索、推理和跨文档关联的问答任务,旨在推动大模型在历史文本理解、证据链构建与复杂事实核验方面的能力评测与训练。该数据集特别适合研究需要结合多个段落、多个发言和历史背景才能回答的问题,为数字人文、历史信息检索和长文档推理提供了新的基准。

来源 arXiv 时间 2026-06-30 08:28:42 AI 辅助整理
通过平滑安全结构化策略组合实现安全在线学习

这项研究聚焦于在线学习中的安全约束问题,提出一种“平滑安全结构化策略组合”方法,在探索新策略时尽量避免触发危险行为。其核心思路是将基础控制策略与安全约束策略进行可微、平滑的组合,使系统在学习过程中既能持续优化性能,又能保持对状态与动作空间的安全边界控制。相比传统依赖硬切换或保守回退的方案,该方法更适合连续决策场景,能够减少策略震荡并提升训练稳定性。论文为安全强化学习、机器人控制和自主系统中的在线适应提供了更实用的设计框架。

来源 arXiv 时间 2026-06-30 08:26:50 实体 Semantic Kernel AI 辅助整理
BlockPilot:面向扩散式推测解码的实例自适应策略学习

本文提出 BlockPilot,用于提升基于扩散模型的推测解码效率。与固定策略不同,它根据不同输入实例的难度、自回归模型与草稿模型的协同程度,动态学习何时、如何进行候选块的生成与验证,从而减少无效计算并提高整体吞吐。该方法强调实例级自适应决策,在保持生成质量的前提下,尽量扩大可被接受的token块长度,降低频繁回退带来的开销。研究展示了其在扩散式文本生成场景中的性能优势,为推测解码从静态规则走向数据驱动的策略优化提供了新思路。

来源 arXiv 时间 2026-06-30 08:24:05 实体 通义千问 2.5 AI 辅助整理
从创意到原型:AI辅助的快速VA原型搭建框架

本文提出一种“脚手架式”的AI辅助快速原型流程,目标是在一个下午内把初步想法转化为可运行的VA(虚拟助手)原型。作者强调,单纯依赖大模型直接生成成品往往会在需求澄清、任务拆解、交互设计和调试迭代上失控,因此引入分阶段提示、结构化约束与人工反馈闭环,帮助开发者更高效地完成从概念到可演示系统的过渡。该方法适合快速验证产品设想、收集用户反馈和降低早期试错成本,也反映出AI Agent开发正从“生成代码”走向“协同式构建”的趋势。

来源 arXiv 时间 2026-06-30 08:19:46 实体 Semantic Kernel AI 辅助整理
LOPA:通过潜在序数原型对齐提升口语语言评估

LOPA提出一种面向口语语言评估的新方法,旨在更准确地判断学习者的语言能力等级。与将评分简单视为分类或回归不同,该方法显式利用分数之间的序数关系,把不同等级映射到潜在原型空间中,再通过对齐学习增强模型对“相邻等级更接近、远等级更分离”这一特性的建模能力。这样做可以缓解传统评估模型在细粒度分档、样本分布不均和评分边界模糊等场景下的误差。该工作为自动口语评分、教育测评与智能语言学习系统提供了更符合实际评分逻辑的建模思路。

来源 arXiv 时间 2026-06-30 08:19:32 AI 辅助整理
CSO-LLM:面向大模型的类子空间正交化后训练后门检测与触发器反演

这篇论文提出 CSO-LLM,一种用于大语言模型后训练阶段的后门防护方法,核心思路是利用“类子空间正交化”来分离正常语义表示与后门触发特征,从而实现更稳健的后门检测与触发器反演。相较于依赖少量样本或启发式规则的传统方法,CSO-LLM 试图在模型表示空间中显式识别异常激活方向,并定位潜在触发模式,适用于后训练后门场景下的安全审计与溯源分析。

来源 arXiv 时间 2026-06-30 08:19:00 AI 辅助整理