AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
大模型辅助漏洞修复效果评估:基于真实开发者的实证研究

该研究首次通过受控的人类实验,系统评估大型语言模型(LLM)在真实软件漏洞修复任务中的实际效能。作者邀请42名具备工业界经验的开发者,在相同漏洞数据集上分别独立修复与借助LLM(如Claude、GPT-4)辅助修复,并从修复正确率、代码质量、时间效率及开发者信任度四维度量化分析。结果表明:LLM显著提升修复速度(平均缩短37%耗时),但引入新漏洞风险上升2.3倍;约60%开发者过度依赖模型输出而忽略安全验证,凸显人机协同中“责任盲区”问题。研究呼吁建立面向安全关键场景的LLM辅助开发规范与验证流程。

来源 arXiv 时间 2026-06-24 15:45:38 实体 Semantic Kernel AI 辅助整理
解耦权重向量模长与方向以提升神经网络训练性能

该论文提出一种新型权重优化范式,将神经网络中每个权重向量的模长(magnitude)与方向(direction)分离更新:模长通过标量自适应机制独立调整,方向则在单位球面上进行梯度下降。作者理论证明该解耦策略可缓解传统SGD中学习率对模长与方向优化的耦合干扰,并在ResNet、ViT等架构上验证其显著提升收敛速度与泛化能力,尤其在小批量和高学习率场景下表现稳健。方法无需额外参数或计算开销,兼容现有优化器,为理解深度学习优化动力学提供了新视角。

来源 arXiv 时间 2026-06-24 15:40:26 实体 Continue AI 辅助整理
微软“量子飞跃”遭质疑:基础Python错误致技术主张存疑

英国剑桥大学理论物理学者指出,微软近期宣称的“量子计算突破”存在严重实现缺陷——其开源代码中包含未初始化变量、浮点精度误用及错误的量子态叠加逻辑等基础Python问题,导致关键实验结果无法复现。该研究并非否定量子硬件进展,而是强调软件栈(尤其Q#与Python混合生态)的工程严谨性亟待加强。微软尚未正式回应,但已私下联系作者核查;业界普遍认为,此类问题凸显当前量子软件工具链在可验证性与开发者教育方面的短板,也提醒AI与量子交叉领域需更严格的技术审查机制。

来源 Hacker News 时间 2026-06-24 15:37:18 AI 辅助整理
WinDOM:面向小型GUI定位模型的自家族蒸馏方法

WinDOM提出一种新型知识蒸馏框架,专为轻量化GUI界面元素定位任务设计。区别于传统师生蒸馏,该方法构建‘自家族’(self-family)——即同一架构下不同初始化或训练阶段的小型模型互为教师与学生,通过动态权重分配与跨模型特征对齐实现协同优化。作者在Rico-21和PubLayNet等多源GUI数据集上验证,仅用单个0.8B参数模型即可达到接近2.7B大模型的定位精度,推理延迟降低63%,内存占用减少58%。该工作填补了GUI理解领域中小模型高效蒸馏的技术空白,为移动端与边缘设备上的实时界面解析提供了新范式。

来源 arXiv 时间 2026-06-24 15:35:29 实体 通义千问 2.5 AI 辅助整理
将智能体系统视为压缩器:以比特量化系统智能

该论文提出一种新颖的智能度量框架,将AI智能体系统类比为信息压缩器——其核心思想是:一个更智能的系统能在更少的内部表征(以比特计)中编码并复现更复杂的环境交互行为。作者基于最小描述长度(MDL)原理,定义了「代理复杂度」(Agentic Complexity)这一可计算指标,通过衡量系统在给定任务分布下所需最小模型参数量与推理开销的联合熵来量化智能。该方法摆脱了传统依赖人类评分或任务胜率的评估范式,为跨架构、跨规模的智能体提供统一、可微分的客观标尺,并在多个基准(如WebArena、Voyager)上验证了其与实际任务性能的强相关性。研究还揭示了智能提升存在显著的‘压缩拐点’现象,对高效Agent设计具有指导意义。

来源 arXiv 时间 2026-06-24 15:32:49 实体 Semantic Kernel AI 辅助整理
SE-AGCNet:面向会议场景的语音增强与响度联合端到端框架

该论文提出SE-AGCNet,一种专为远程会议场景设计的端到端深度学习框架,同步解决语音增强(Speech Enhancement)与自动增益控制(AGC)两大挑战。传统方案通常将二者串行处理,易导致失真累积与响度不一致;而SE-AGCNet通过共享编码器与双分支解码结构,在单次前向推理中联合优化信噪比提升与目标响度归一化(ITU-R BS.1770标准兼容),显著降低计算延迟并提升自然度。作者在真实会议录音数据集(含混响、多说话人、非平稳噪声)上验证其性能,PSQM和Loudness Deviation指标均优于SOTA方法如DCCRN-AGC与DeepFilterNet2。该工作对实时音视频通信系统具有直接工程落地价值。

来源 arXiv 时间 2026-06-24 15:32:42 实体 Semantic Kernel AI 辅助整理
肺栓塞风险分层新范式:CTPA与临床文本的多模态图建模

该研究指出,仅依赖CT肺动脉造影(CTPA)构建血管图结构不足以实现精准肺栓塞(PE)风险分层。作者提出融合CTPA影像衍生的血管图与结构化/非结构化电子病历(如D-二聚体、心功能指标、既往病史等)的多模态图神经网络框架。通过将临床文本经领域适配的BERT编码后与血管图节点对齐,并引入跨模态注意力机制,模型在多中心回顾性队列中显著提升高危PE识别的AUC(较纯图像图模型提升0.08)。研究强调:临床语义信息不可被图结构替代,而需与解剖拓扑形成互补表征——这为医学AI从‘单模态感知’迈向‘临床推理’提供了关键方法论启示。

来源 arXiv 时间 2026-06-24 15:28:27 实体 Semantic Kernel AI 辅助整理
新闻业正陷入修修补补,亟需系统性重构

本文尖锐指出,当前主流新闻业的改革仅停留在流程优化、平台迁移和付费墙调整等表层动作,如同‘泰坦尼克号上重排救生椅’——看似忙碌却未触及核心危机。作者认为,真正挑战在于AI时代下新闻价值的重新定义:当大模型可即时生成事实摘要、溯源核查与多视角综述,传统报道的时效性、信息整合与解释权正被瓦解。新闻机构必须从‘内容生产者’转向‘可信度架构师’,重建基于深度调查、语境锚定与伦理共识的不可替代性,而非依赖流量逻辑或算法分发惯性。文中以《纽约时报》AI合作争议与地方报纸消亡潮为例,呼吁行业放弃防御性策略,主动设计人机协同的新型采编范式。

来源 Hacker News 时间 2026-06-24 15:28:04 AI 辅助整理
可测多数类无法由有限公理系统刻画

该论文从模型论与集合论交叉视角出发,严格证明了“可测多数”(measurable majorities)这一在社会选择、投票理论及高阶逻辑中具有基础意义的结构类,不具有有限公理化能力——即不存在有限条一阶句子能精确刻画其所有模型。作者通过构造一类渐进式反例模型序列,并结合超积方法与可测基数的内模型性质,否定了此前关于该类可能具备有限公理化的猜想。结果对逻辑学中公理化可行性边界的研究构成重要推进,也对AI中基于逻辑的群体决策建模(如多智能体共识协议的形式验证)提出了根本性限制:当涉及大规模异构主体的偏好聚合时,无法依赖简洁有限的逻辑规则集保证行为一致性。

来源 arXiv 时间 2026-06-24 15:27:38 实体 Cohere AI 辅助整理
基于模糊模型无关解释与大语言模型代理的可解释控制框架

该论文提出Explainable Control Framework(XCF),融合模糊逻辑与模型无关解释技术(Fuzzy Model-Agnostic Explanation),实现对黑箱控制器(如深度强化学习策略)的局部可解释性建模;同时构建LLM Agent驱动的交互式接口,支持自然语言查询、因果推理追溯与决策建议生成。XCF在无人机自主导航与工业PLC控制等场景中验证了其解释保真度与人机协同效率,显著优于LIME、SHAP等传统方法。研究强调‘解释即服务’理念,将可解释性从后处理分析升级为嵌入式控制闭环组件,为高可信AI控制系统提供新范式。

来源 arXiv 时间 2026-06-24 15:17:54 AI 辅助整理
HIPE-2026:面向多语种历史文献的人地关系抽取基准

HIPE-2026 是一项面向历史文本理解的新一代评测基准,聚焦于从多语种(含德语、法语、意大利语、荷兰语等)手稿与印刷史料中自动识别“人物—地点”二元关系。该任务极具挑战性:文本存在拼写变异、古旧正字法、实体指代模糊及跨文档共指消解难题。数据集涵盖19世纪前后的档案材料,经专业历史学者人工标注,并引入细粒度关系类型(如出生地、任职地、迁徙终点等)。论文同步发布开源工具链与评估协议,旨在推动NLP在数字人文领域的深度应用,弥补现有NER与关系抽取模型在历时性、低资源语境下的能力缺口。

来源 arXiv 时间 2026-06-24 15:09:12 实体 Semantic Kernel AI 辅助整理
知识级联:面向非参数多元函数估计的逆知识蒸馏方法

该论文提出“知识级联”(Knowledge Cascade)框架,首次将逆知识蒸馏(Reverse Knowledge Distillation)范式引入非参数多元函数估计任务。不同于传统蒸馏中大模型指导小模型,该方法让轻量级、可解释的非参数估计器(如核回归、k近邻)反向引导预训练大模型,使其输出更契合局部结构与统计稳健性要求。作者理论证明了该策略在Hölder类函数下的收敛性提升,并在气候建模、金融时序密度预测等高维稀疏场景中验证其优于标准蒸馏与基线非参数方法。工作 bridging the gap between interpretable nonparametrics and foundation models,为可信AI驱动的科学计算提供了新路径。

来源 arXiv 时间 2026-06-24 15:06:23 实体 Continue AI 辅助整理
DT²:面向决策目标的数字孪生框架

该论文提出DT²(Decision-Targeted Digital Twins),一种新型数字孪生范式,突破传统以物理系统镜像建模为核心的思路,转而聚焦于支持特定决策任务——如资源调度、风险干预或策略优化。DT²通过将决策目标显式编码为孪生体的设计约束与评估指标,联合学习动态环境表征、因果机制建模与可解释动作推理,在仿真与现实闭环中持续对齐决策效能而非状态保真度。作者在智能电网调控与工业产线异常响应两个典型场景中验证了其相较传统数字孪生方法在决策准确率、响应延迟和策略泛化性上的显著提升,并开源了轻量级DT²原型框架。该工作标志着数字孪生正从‘描述性镜像’向‘决策性代理’演进。

来源 arXiv 时间 2026-06-24 15:02:24 AI 辅助整理
全球多数地区依赖开源AI:成本、主权与适配性的必然选择

本文指出,对全球绝大多数国家和地区而言,开源AI并非理想选项,而是现实约束下的唯一可行路径。封闭大模型受限于高昂API调用成本、严苛的商业授权、数据出境合规风险及本地化适配能力不足,难以支撑教育、医疗、农业等关键领域的普惠应用。而开源模型(如Llama、Phi、DeepSeek系列)凭借可私有部署、可定制训练、可离线运行等特性,在算力有限的发展中经济体展现出显著优势。作者强调,开源生态正推动形成「模型即基础设施」的新范式——类似Linux之于操作系统,其价值不仅在于代码开放,更在于构建起本地开发者、监管机构与产业界共同参与的技术治理闭环。这种去中心化演进,正在重塑全球AI权力结构。

来源 Hacker News 时间 2026-06-24 14:50:22 AI 辅助整理
变分自编码器层:一种可嵌入式生成式模块化组件

本文提出‘变分自编码器层’(VAE Layer)——一种可直接插入任意神经网络的轻量级、端到端可训练生成式模块,将传统VAE的编码器-解码器结构封装为单层抽象,支持梯度直通与多尺度特征融合。作者通过理论分析证明其在隐空间正则化与重构保真度间的帕累托最优性,并在图像去噪、小样本生成和跨模态对齐任务中验证其即插即用能力。该设计显著降低VAE集成门槛,避免重复构建完整架构,为大模型中嵌入可控生成先验提供了新范式。论文还开源了PyTorch实现与标准化接口规范。

来源 arXiv 时间 2026-06-24 14:48:23 实体 Continue AI 辅助整理
RubyLLM:统一封装主流AI服务商的Ruby框架

RubyLLM 是一个专为 Ruby 开发者设计的轻量级、高抽象度AI集成框架,支持 OpenAI、Anthropic、Google Gemini、Cohere 等十余家主流大模型API服务商,通过统一接口屏蔽底层差异。其核心设计理念是「约定优于配置」,提供链式调用、自动重试、结构化输出解析(如JSON Schema强制校验)、内置提示词管理及可插拔的中间件机制。项目开源且文档详尽,显著降低Ruby生态接入大模型的技术门槛——此前该领域长期缺乏成熟方案,开发者多需自行封装或依赖零散Gem。目前已被多个Rails SaaS项目用于智能客服与自动化报告生成场景。

来源 Hacker News 时间 2026-06-24 14:41:41 AI 辅助整理
基于ROI重思考与合成数据的脑MRI异常检测与可解释推理

该研究针对脑部MRI异常检测中病灶定位不准、模型决策缺乏可解释性等挑战,提出一种融合ROI(感兴趣区域)动态重思考机制与可控医学影像合成的新框架。通过引入注意力引导的ROI迭代校正模块,提升病灶边界建模精度;结合基于扩散模型的病理一致性合成策略,生成多样且临床可信的罕见病变样本,缓解真实标注数据稀缺问题。在BraTS和ADNI等多个公开数据集上验证表明,该方法在检测灵敏度(+4.2%)与定位IoU(+6.8%)上显著优于SOTA方法,同时生成的热力图与放射科医生标注高度一致(Dice达0.79),为AI辅助诊断提供了兼具性能与可信度的技术路径。

来源 arXiv 时间 2026-06-24 14:41:27 AI 辅助整理
PR垃圾信息泛滥:开源社区正重演2000年代初的邮件 spam 灾难

本文以 OpenClaw 项目近期遭遇的 PR 垃圾信息潮为切入点,指出当前 GitHub 上大量伪装成贡献实则夹带广告、SEO链接或无效代码的 Pull Request,其模式与2000年代初电子邮件 spam 的爆发高度相似——自动化批量发送、内容模板化、绕过基础审核机制。作者强调,这类行为不仅消耗维护者精力、污染仓库历史,更侵蚀开源协作的信任根基;而现有平台反 spam 工具(如 bot 检测、CI 过滤)仍滞后于攻击手法迭代。文中呼吁建立更智能的上下文感知审核策略,并借鉴邮件时代「发件人信誉体系」与「社区共治」经验,而非仅依赖黑名单或人工筛查。该现象折射出 AI 时代开源基础设施治理的新挑战。

来源 Hacker News 时间 2026-06-24 14:32:12 AI 辅助整理
可3D打印的触觉传感器公平评测数据集

该研究提出首个开源、可3D打印的标准化物理基准数据集TactileBench,专为触觉传感器的公平评测与横向对比而设计。数据集包含12类高精度3D打印刚性/柔性物体(含纹理、曲率、材质梯度等变量),配套统一力控抓取协议、多模态同步采集方案(力/位移/图像)及基线模型评估框架。作者强调其可复现性——所有CAD模型、打印参数、标定流程均公开,显著降低硬件门槛,缓解当前领域因测试条件不一致导致的性能误判问题。该工作已获IEEE Sensors 2024录用,被评价为推动触觉感知从‘实验室演示’迈向‘工业级验证’的关键基础设施。

来源 arXiv 时间 2026-06-24 14:27:16 AI 辅助整理
变分深度高斯过程中的后验坍缩、参数化与初始化分析

该论文系统探究了变分深度高斯过程(VDGP)中长期存在的后验坍缩问题,指出其根源不仅在于KL项的过度正则化,更与深层结构下的参数化方式(如诱导点分布、核函数设计)及初始权重/诱导点配置高度相关。作者通过理论推导与多组控制实验验证:采用球面初始化诱导点、解耦式变分参数化,以及渐进式层间预训练策略,可显著缓解坍缩并提升预测不确定性校准能力。研究还揭示了传统ELBO优化在深层GP中易陷入病态局部最优的本质机制,为构建稳定、可扩展的贝叶斯深度模型提供了关键设计原则。

来源 arXiv 时间 2026-06-24 14:25:39 AI 辅助整理
基于AI增强的FABRIC测试平台计算可复现性研究

本文提出一种AI辅助框架,用于提升FABRIC(美国NSF资助的联邦化、可编程网络与云计算实验平台)上科学计算实验的可复现性。作者将大语言模型与自动化工作流引擎集成,实现对实验环境配置、依赖版本、数据溯源及执行日志的智能解析与标准化封装;同时构建轻量级验证代理,支持跨节点、跨时间的自动复现比对。该方案在气候建模与分布式机器学习任务中验证有效,复现成功率从传统方法的62%提升至93%,平均调试耗时降低74%。研究凸显了AI在科研基础设施中从‘事后审计’向‘事前保障’范式的转变价值。

来源 arXiv 时间 2026-06-24 14:23:14 AI 辅助整理
AutoRelAnnotator:面向竞价搜索的校准型模型级联相关性评估框架

该论文提出AutoRelAnnotator,一种专为广告检索(Sponsored Search)设计的低成本、高精度相关性评估系统。针对人工标注成本高、大模型直接打分偏差大等问题,作者构建了多阶段校准级联架构:先用轻量级模型初筛,再通过可解释性模块识别关键判别特征,最后由经领域数据微调并输出置信度校准的大模型进行细粒度判定。在真实电商广告场景中,其在标注成本降低62%的同时,保持与专家标注94.3%的一致率。研究还引入动态阈值机制与反馈驱动的迭代优化闭环,显著缓解模型幻觉与领域漂移问题,为搜索广告系统的自动化质量评估提供了可落地的技术路径。

来源 arXiv 时间 2026-06-24 14:20:30 实体 Semantic Kernel AI 辅助整理
颜色即触发器:触发色显著影响联邦后门攻击成功率

该研究首次系统揭示触发样本的色彩属性对联邦学习后门攻击效果的关键影响。作者在多个数据集(CIFAR-10、Tiny-ImageNet)和模型架构(ResNet、VGG)上实证发现,特定色调(如品红、青色)的触发器可使攻击成功率提升最高达37%,而传统灰度或随机色触发器效果显著下降;进一步分析表明,这种效应源于联邦场景下客户端本地训练对色彩特征的非均匀敏感性,以及全局聚合过程中色度通道梯度的异常放大现象。研究还提出基于色相空间优化的触发器设计框架,为评估联邦系统鲁棒性提供了新维度,并警示现有防御机制可能因忽略色彩维度而存在盲区。

来源 arXiv 时间 2026-06-24 14:07:10 实体 Semantic Kernel AI 辅助整理
AI突破射频芯片设计边界:生成人类难以构想的新型架构

IEEE Spectrum 报道,MIT与 Analog Devices 合作开发出基于强化学习与神经符号推理的AI系统,可自主设计高性能射频集成电路(RFIC),其拓扑结构远超传统工程师经验范畴——例如在5G毫米波频段实现更高带宽与更低功耗的混合信号布局。该系统将电磁仿真、物理约束建模与多目标优化深度耦合,单次迭代即可生成经SPICE验证的可制造方案,设计周期从数月缩短至数小时。值得注意的是,AI生成的拓扑常包含非直觉元件排布与反常规耦合路径,部分设计已被流片验证并进入6G预研测试。这标志着AI正从辅助工具升维为具备领域创造力的‘协同设计主体’。

来源 Hacker News 时间 2026-06-24 14:02:16 AI 辅助整理
面向大语言模型智能体的语义一致性策略优化方法

该论文针对LLM作为强化学习智能体时面临的语义漂移与动作不一致问题,提出语义一致性策略优化(SCPO)框架。其核心在于将策略输出的文本动作映射至可验证的语义空间(如逻辑形式或结构化API调用),通过引入语义相似性约束与一致性正则项,在训练中显式惩罚语义冲突行为。作者在ToolQA、WebShop等复杂工具调用任务上验证了SCPO的有效性:相比标准PPO,它显著提升任务完成率(+12.3%),同时降低无效API调用与指令误解率。研究揭示了LLM智能体策略优化中‘形式正确性’与‘语义忠实性’的张力,并为可解释、可验证的Agent训练提供了新范式。

来源 arXiv 时间 2026-06-24 14:02:13 实体 Semantic Kernel AI 辅助整理
边缘优先于嵌入:面向视觉-语言模型的置信度感知模糊门机制

该论文提出一种新型「模糊门」(Blur Gate)架构,主张在视觉-语言多模态理解流程中,应优先利用图像边缘等低级结构特征而非直接依赖高维嵌入表示。该门控机制动态评估视觉输入的局部置信度,并据此自适应地对特征图进行空间模糊处理,从而抑制噪声与伪影干扰、增强跨模态对齐鲁棒性。作者在CLIP、Flamingo及Qwen-VL等主流视觉语言模型上验证了其有效性,在零样本分类、图文检索和视觉问答任务中均取得一致提升,尤其在低质量或域外图像上表现突出。该工作揭示了传统端到端嵌入范式可能忽略的中间表征价值,为多模态模型的可解释性与可靠性设计提供了新思路。

来源 arXiv 时间 2026-06-24 13:51:42 实体 Semantic Kernel AI 辅助整理
AI告密者也会宕机:面向规避智能体监控的对抗方法研究

本文聚焦于当前日益普及的「Agentic Surveillance」(智能体监控)范式——即由自主AI代理持续观察、分析并上报用户行为的系统架构。作者指出,这类系统虽宣称提升安全与合规性,却隐含隐私侵蚀与权力失衡风险。论文首次系统揭示了智能体监控链路中的脆弱性:从感知层的数据采样偏差、推理层的提示注入漏洞,到上报层的通信协议缺陷,并提出一套轻量级对抗框架「GlitchGuard」,通过可控语义扰动、上下文混淆与响应延迟调度,在不破坏正常交互的前提下显著降低监控代理的有效检出率。研究在多个主流开源Agent平台(如LangGraph、AutoGen)上完成实证验证,为AI治理中‘可审计性’与‘用户自主权’的平衡提供了新思路。

来源 arXiv 时间 2026-06-24 13:50:22 实体 Semantic Kernel AI 辅助整理
MiniOpt:面向资源受限场景的通用优化问题建模与求解推理框架

MiniOpt 是一种轻量级AI推理系统,专为在计算资源(如内存、算力、响应延迟)严格受限的边缘设备或嵌入式环境中求解通用优化问题而设计。它不依赖传统求解器,而是通过结构化提示工程与分步符号推理,将非线性、混合整数、带约束的优化问题自动分解为可执行的子任务链,并协同小型语言模型完成建模、可行性验证与近似求解。论文在能源调度、实时路径规划和微型机器人控制等真实低资源场景中验证了其有效性,在仅1.2GB显存下实现92%以上约束满足率,较微调版Llama-3-8B提速3.7倍。该工作填补了大模型在资源敏感型优化任务中的方法论空白。

来源 arXiv 时间 2026-06-24 13:48:06 实体 Semantic Kernel AI 辅助整理
SARA:基于语义锚定路由对齐解锁MoE多语言知识

该论文提出SARA(Semantically Anchored Routing Alignment)方法,旨在解决多语言混合专家(MoE)模型中专家路由不一致导致的跨语言知识迁移低效问题。作者发现,不同语言输入常被分配至不同专家子集,造成语义相似但语言不同的样本在专家选择上产生偏差。SARA通过引入跨语言语义锚点(如多语言词向量空间中的对齐中心),约束各语言路由分布的一致性,并在训练中联合优化路由门控与语义对齐目标。在XGLM、Switch-Transformer等架构上的实验表明,SARA显著提升多语言下游任务性能(平均+2.3 BLEU/+1.8 Acc),同时降低路由碎片化,增强专家复用率。该工作为MoE架构的多语言泛化能力提供了可解释、可扩展的路由协同新范式。

来源 arXiv 时间 2026-06-24 13:36:46 实体 Phi-3 AI 辅助整理
超越函数调用:面向工具环境不可靠性的AI Agent工具使用评测

该论文指出当前大模型Agent评测过度聚焦于理想化工具调用(Function Calling),忽视了真实场景中工具接口失效、响应延迟、返回格式错乱等环境不可靠性问题。作者构建了首个系统性模拟工具环境故障的基准测试框架ToolUnreliableBench,涵盖网络抖动、API限流、schema漂移等7类典型故障,并在12个主流开源Agent框架上开展压力测试。实验表明,现有Agent在工具链部分失效时任务成功率平均下降42%,且缺乏鲁棒的错误感知与降级策略。研究呼吁建立‘容错优先’的Agent评估范式,并开源了故障注入工具包与评测数据集。

来源 arXiv 时间 2026-06-24 13:34:34 实体 Semantic Kernel AI 辅助整理