AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
三元Mamba:面向W1.58A16精度的分组量化感知训练方法

该论文提出Ternary Mamba,一种专为状态空间模型(SSM)设计的高效量化方案。针对Mamba架构在边缘部署时的计算与存储瓶颈,作者首次将三值权重(W1.58)与16位激活(A16)组合引入SSM训练流程,并创新性采用分组量化策略——按通道/层动态划分参数组,结合定制化梯度补偿与伪量化算子,在训练中联合优化精度与硬件友好性。实验表明,其在Language Modeling和Speech Recognition任务上仅损失<0.8%准确率,却实现3.2×权重压缩与2.1×推理加速,显著优于传统Post-Training Quantization。工作填补了SSM领域细粒度量化训练方法的空白,为大模型轻量化提供新范式。

来源 arXiv 时间 2026-06-16 16:18:21 AI 辅助整理
多目标强化学习中的公平帕累托最优策略学习

该论文提出一种新型框架,旨在多目标强化学习(MORL)中同时兼顾帕累托最优性与群体公平性——传统MORL常忽略不同子群体在多个目标上的收益分配不均问题。作者将公平性形式化为跨群体的最小目标收益最大化约束,并设计基于约束策略优化与自适应权重调整的算法F-Pareto,可在无需预设权重的情况下收敛至公平帕累托前沿。实验在医疗资源调度与自动驾驶多任务仿真环境中验证:相比NSGA-II、MO-PPO等基线方法,F-Pareto在保持整体性能的同时显著提升弱势群体的最差目标表现(+12.7%),且帕累托解集覆盖度提升23%。工作填补了MORL中公平性建模与可扩展优化之间的理论空白。

来源 arXiv 时间 2026-06-16 16:16:54 AI 辅助整理
ALeRCE系统:基于大语言模型的天文数据库自然语言查询

本文介绍了ALeRCE项目开发的文本到SQL(text-to-SQL)系统,旨在降低天文学家访问大规模时域天文数据库的技术门槛。该系统利用经过领域适配微调的大语言模型(如Llama-3和Phi-3),将自然语言查询直接转化为可执行的SQL语句,并针对ALeRCE数据库特有的星表结构、时序特征字段及跨波段关联逻辑进行了深度优化。作者构建了覆盖典型天文分析场景(如光变异常筛选、暂现源分类、多历元位置匹配)的高质量中文-SQL指令微调数据集,并在真实查询任务中实现86.2%的精确匹配准确率。研究还探讨了LLM在处理天文专业术语歧义、时间尺度隐含约束及空值逻辑时的局限性,为科学数据库的AI原生交互提供了可复用的方法论框架。

来源 arXiv 时间 2026-06-16 16:12:16 AI 辅助整理
基于深度强化学习求解图论中的最小零强迫集

该论文将图论中经典的NP难问题——最小零强迫集(Minimum Zero-Forcing Set, MZFS)——建模为序列决策任务,首次系统性地引入深度强化学习框架(结合图神经网络与策略梯度算法)进行端到端求解。作者设计了适配零强迫传播动态的图状态编码器与动作空间约束机制,避免无效操作;在合成图及真实世界网络(如社交网络、基础设施图)上验证了方法相较传统启发式算法(如贪心、局部搜索)和整数规划求解器在大规模稀疏图上的显著效率优势,同时保持解质量接近最优。研究不仅拓展了AI for Science在组合优化领域的边界,也为图动力系统可控性分析提供了可扩展的计算新范式。

来源 arXiv 时间 2026-06-16 16:07:20 AI 辅助整理
OmniPlan:面向时效性与近优解的自适应网络规划框架

OmniPlan 是一种新型自适应网络规划优化框架,专为应对5G/6G网络部署中动态拓扑、多目标约束(如时延、能耗、覆盖)及实时决策需求而设计。该框架融合在线学习机制与分层规划策略,通过轻量级模型预测与滚动优化,在毫秒级响应时间内输出接近全局最优的资源配置方案。论文在真实基站数据集与城市级仿真环境中验证其有效性:相比传统整数规划与强化学习基线,OmniPlan 在规划耗时降低83%的同时,保持97.2%的最优性差距(optimality gap)控制在1.8%以内。其模块化设计支持与现有OSS系统无缝集成,已初步应用于边缘云协同场景的动态切片编排。

来源 arXiv 时间 2026-06-16 16:06:51 AI 辅助整理
HistoRAG:以批判性技术实践嵌入史学方法的检索增强生成框架

HistoRAG 是一种面向历史研究场景的新型检索增强生成(RAG)框架,其核心创新在于将历史学特有的方法论——如史料批判、语境化解读、多重证据互证与叙事张力分析——系统性地编码进RAG的技术流程中。不同于通用RAG对文本片段的简单匹配与拼接,该工作提出「批判性技术实践」路径:在检索阶段引入史源可信度评估与时代语境过滤器,在生成阶段嵌入反事实推理提示与立场敏感性约束。作者基于19世纪欧洲外交档案与口述史数据集开展实证,验证其在减少年代错置、识别叙述偏见及生成可归因解释方面的显著提升。该研究为AI人文计算提供了方法论自觉的技术实现范式。

来源 arXiv 时间 2026-06-16 16:03:37 AI 辅助整理
面向GUI定位的质量感知自蒸馏方法

本文提出一种质量感知的自蒸馏框架(QASD),用于提升GUI界面元素定位(GUI Grounding)任务中视觉-语言模型的鲁棒性与泛化能力。不同于传统教师-学生蒸馏依赖固定高质量教师模型,QASD动态评估每个训练样本的标注置信度与模型预测一致性,自适应地筛选“可信教师样本”,并据此加权指导学生模型学习。作者在GUI17、Rico-25K等主流基准上验证了该方法的有效性,在跨应用、小样本及噪声标注场景下显著优于标准蒸馏与监督微调基线。研究揭示了标注质量异质性对多模态定位任务的关键影响,并为低资源UI理解提供了可扩展的训练范式。

来源 arXiv 时间 2026-06-16 16:02:41 AI 辅助整理
IsabeLLM:基于大语言模型的共识协议形式化验证框架

本文提出IsabeLLM——一个融合大型语言模型与交互式定理证明器Isabelle/HOL的自动化定理证明系统,专为区块链与分布式系统中的共识协议(如PBFT、Raft)提供端到端形式化验证支持。不同于传统依赖人工编写证明脚本的方法,IsabeLLM通过微调开源LLM(Llama-3-8B)生成可验证的Isabelle代码,并引入反馈驱动的重写机制与类型感知校验器,显著提升证明草稿的正确率与可接受率。实验表明,其在经典共识算法验证任务中将人工介入减少72%,且首次实现对含复杂时序逻辑与故障模型的Raft变体的全自动引理生成与证明闭环。该工作 bridging the gap between LLM reasoning and formal methods,为可信AI系统构建提供了新范式。

来源 arXiv 时间 2026-06-16 16:00:14 AI 辅助整理
S4oP:面向资源受限设备的结构化状态空间模型算子级剪枝

本文提出S4oP(State Space Operator-level Pruning)方法,针对结构化状态空间模型(如S4、Mamba)在边缘设备部署时面临的计算与内存瓶颈,首次将剪枝粒度细化至核心算子层级(如HiPPO矩阵投影、选择性扫描中的门控与状态更新模块),而非传统层或通道级。该方法结合结构感知的敏感性分析与轻量级重训练策略,在保持模型时序建模能力的同时,显著降低FLOPs与显存占用。实验表明,在SpeechCommands与Character-Level PTB等基准任务上,S4oP可在参数量减少40%、推理延迟下降35%的情况下,精度损失控制在1.2%以内,为端侧部署长序列建模提供了新范式。

来源 arXiv 时间 2026-06-16 15:59:10 AI 辅助整理
EAGG:基于几何感知图条件化的具身对齐抓取生成方法

该论文提出EAGG框架,面向机器人具身智能场景,解决传统抓取生成模型在真实物理交互中泛化性差、与机器人本体运动学脱节的问题。其核心创新在于构建几何感知图神经网络,将点云几何结构、物体语义属性及机械臂运动学约束联合编码为统一图表示,并通过可微分图条件机制实现抓取姿态与具身动作的端到端对齐。在YCB-Video和Real2Sim等基准上,EAGG显著提升抓取成功率(+12.7%)与跨域迁移鲁棒性,尤其在遮挡与小样本场景下表现突出。作者开源了代码与仿真-实物协同训练协议,推动具身AI从‘视觉理解’向‘物理可执行’范式演进。

来源 arXiv 时间 2026-06-16 15:56:44 AI 辅助整理
从推理轨迹到可复用模块:探究语言模型的组合泛化能力

该研究系统剖析大语言模型(LLM)在复杂推理任务中展现的组合泛化现象,提出将隐式推理过程解构为显式的、可复用的功能模块(如‘假设检验’‘数值归一化’),而非仅依赖端到端的黑箱推理链。作者通过构建模块化标注框架,在数学推理与符号逻辑任务上验证:当模型能稳定激活并组合特定语义模块时,其跨任务迁移与零样本泛化性能显著提升;反之,模块混用或缺失则导致推理失败。研究进一步指出,当前主流推理增强方法(如思维链、自洽性投票)虽提升准确率,却未实质性促进模块化表征的形成——这为设计具备结构化认知能力的下一代AI Agent提供了关键理论依据与评估新范式。

来源 arXiv 时间 2026-06-16 15:55:28 AI 辅助整理
边缘流模型:梯度下降在稳定性边界行为的可解连续时间刻画

该论文提出「边缘流(Edge Flow)」——一种新颖的连续时间动力学模型,首次在理论上严格刻画深度神经网络训练中梯度下降进入「稳定性边缘(Edge of Stability, EoS)」阶段时的演化规律。不同于传统连续化忽略二阶效应的局限,Edge Flow 显式建模了学习率与Hessian谱之间的耦合机制,能精准预测损失震荡、梯度范数增长及参数轨迹的非单调行为。作者通过理论分析证明其解的存在唯一性与长期有界性,并在ResNet、ViT等架构上验证了其对训练动态(如损失平台期、梯度尖峰)的高保真复现能力。该工作为理解现代深度优化中违背经典凸优化直觉的现象提供了首个兼具数学严谨性与实证解释力的微分方程框架。

来源 arXiv 时间 2026-06-16 15:45:47 AI 辅助整理
面向图结构的上下文与关系感知检索增强生成统一框架

该论文提出一种统一的图检索增强生成(Graph RAG)框架,突破传统RAG对线性文本的依赖,首次将上下文感知(context-aware)与关系感知(relation-aware)能力深度耦合于图结构数据中。框架通过双通道编码器分别建模节点局部语义与图谱全局拓扑关系,并引入动态子图检索机制,在生成时自适应聚焦与查询强相关的子结构;在多个知识密集型图问答与推理任务(如GraphQA、KGBench)上显著优于基线模型。研究还开源了首个面向图RAG评估的基准测试集GraphRAG-Bench,填补了该方向系统性评测的空白,为大模型与结构化知识融合提供了新范式。

来源 arXiv 时间 2026-06-16 15:44:10 AI 辅助整理
基于张量的二阶因果发现方法

该论文提出一种新型因果发现框架,利用高阶张量表征变量间多维依赖结构,并通过二阶统计矩(如协方差矩阵的梯度或Hessian)建模非线性因果机制的局部敏感性。区别于传统基于独立性检验或一阶得分函数的方法,该模型在存在隐变量和混杂效应时仍能提升因果方向识别鲁棒性,并在合成数据与部分真实基准(如CauseEffectPairs)上验证了其对非高斯噪声和弱因果强度场景的适应能力。作者开源了TensorCD库,支持GPU加速的张量因果图学习。

来源 arXiv 时间 2026-06-16 15:43:44 AI 辅助整理
基于伏特拉积分核的生成模型:连续时间动态建模新范式

该论文提出伏特拉生成模型(VGM),一种融合泛函分析与深度生成建模的新型框架。不同于传统离散时间扩散或自回归模型,VGM 将数据生成过程建模为高阶伏特拉积分方程,显式刻画历史状态对当前输出的非线性、时变依赖关系。作者设计可微分的伏特拉核参数化结构,结合隐式神经求解器实现高效采样,并在时间序列合成、长程依赖建模和反事实推断任务中显著优于LSTM、Transformer及SDE-based基线。研究还揭示了伏特拉算子与注意力机制、RNN记忆结构之间的理论联系,为理解大模型时序建模能力提供了新的泛函视角。

来源 arXiv 时间 2026-06-16 15:40:09 AI 辅助整理
基于AI Agent的医疗诊断防过早交接与静默幻觉框架

该论文提出一种面向临床场景的AI Agent架构,旨在解决大模型在医疗辅助诊断中两大关键风险:一是‘过早诊断交接’——即模型在证据不足时仓促输出确定性结论,导致医生过早终止鉴别诊断;二是‘静默幻觉’——模型生成看似合理但缺乏医学依据的错误推理,且不暴露置信度或不确定性。框架融合多智能体协同(如假设生成、证据检索、矛盾检测、可解释性验证)、动态置信度门控机制及临床知识图谱约束,已在模拟诊疗流程中验证其可显著降低误诊率并提升决策透明度。研究强调AI不应替代医生判断,而应作为‘认知协作者’嵌入真实工作流。

来源 arXiv 时间 2026-06-16 15:39:19 AI 辅助整理
NoiseTilt:面向扩散模型奖励对齐的噪声倾斜反向核方法

该论文提出NoiseTilt框架,旨在解决扩散模型在强化学习式奖励对齐中的关键瓶颈——传统反向采样过程与下游奖励信号不兼容。作者设计了一类可学习的噪声倾斜反向核(noise-tilted reverse kernels),在每步去噪中显式注入梯度引导的奖励修正项,使采样轨迹天然偏向高奖励区域,同时保持生成质量与多样性。方法无需微调预训练扩散主干,仅通过调整推理时的反向转移概率即可实现高效对齐,在文本到图像生成与离线策略优化任务中显著优于Reweighting、Classifier-Free Guidance等基线。论文还从变分推断角度提供了理论收敛性分析,并开源了PyTorch实现。

来源 arXiv 时间 2026-06-16 15:38:44 AI 辅助整理
大语言模型驱动的瘢痕图像临床特征解析方法

该研究提出一种新型多模态框架,将瘢痕医学图像(如高分辨率皮肤摄影与3D表面扫描)输入经领域适配的视觉-语言大模型(VLM),通过提示工程与特征解耦技术,自动提取具有临床解释性的量化特征——包括瘢痕隆起度、色素沉着异质性、血管分布模式及弹性纹理熵等。不同于传统CNN仅输出分类标签,该方法生成符合ISDS(国际瘢痕评定标准)和POSAS(患者与观察者瘢痕评估量表)维度的结构化报告,并在127例烧伤后瘢痕队列中验证其与专科医生评分的一致性(Spearman ρ=0.89)。研究还开源了首个面向瘢痕分析的细粒度标注数据集ScarBench,填补了AI皮肤病学中缺乏临床对齐评估基准的空白。

来源 arXiv 时间 2026-06-16 15:38:06 AI 辅助整理
真实场景中安全与隐私提示研究:用户如何提问,大模型如何应答

该论文首次系统性地采集并分析了来自真实用户(含开发者、安全研究员及普通用户)在生产环境中向大语言模型提出的2,300+条安全与隐私相关提示,覆盖漏洞利用、数据脱敏、合规咨询等典型场景。研究发现,约41%的提问存在语义模糊或前提错误,而LLM响应中高达37%包含事实性错误或不安全建议(如误授绕过OAuth验证的方法);同时揭示了当前模型在GDPR/CCPA等法规理解上的显著短板。作者据此提出Prompt-SPR评估框架,并开源了首个面向安全领域的高质量提示-响应对数据集SecPromptBench。

来源 arXiv 时间 2026-06-16 15:37:25 AI 辅助整理
PseudoBench:评估AI自主研究如何助长伪科学

该论文提出PseudoBench——首个专门用于量化大语言模型驱动的‘自动科研’(auto-research)生成伪科学内容风险的基准测试框架。作者系统构建了涵盖占星术、能量医学、反疫苗谬误等12类伪科学主题的评估集,并设计多维度指标(如逻辑连贯性伪装度、文献引用幻觉率、跨学科术语滥用强度),实证发现当前前沿Agent系统在模拟科研流程时,会显著放大伪科学主张的可信度包装能力。研究强调:当AI被赋予检索、综述、甚至‘撰写论文’的完整代理链时,其输出并非中立工具,而可能成为伪科学话语体系的协同生产者。论文呼吁将‘反伪科学鲁棒性’纳入AI Agent安全评估标准。

来源 arXiv 时间 2026-06-16 15:37:02 AI 辅助整理
AI拟态亲历经验:类同伴照护场景中的可信性构建研究

该论文探讨大语言模型在面向照护者(如老年照护、慢性病家属)的AI支持系统中,如何通过生成“我曾经历过类似情况”这类具身化、第一人称的合成生活经验表述,提升用户信任与情感共鸣。作者基于真实照护者访谈与对话实验,发现适度嵌入拟态亲历叙述(非真实经历但符合情境逻辑)可显著增强AI建议的感知可信度与接纳度,但过度使用或细节失真会引发伦理疑虑与信任反噬。研究提出“可信亲历性”(credible livedness)概念框架,并建议采用受控生成策略与透明度提示来平衡共情效能与责任边界,为AI在敏感社会支持场景中的拟人化设计提供实证依据与伦理指南。

来源 arXiv 时间 2026-06-16 15:34:23 AI 辅助整理
ConSA:基于可学习分配机制的混合注意力可控稀疏化方法

该论文提出ConSA(Controllable Sparsity in Hybrid Attention),一种在混合注意力架构中实现细粒度稀疏控制的新范式。不同于传统静态剪枝或固定稀疏模式,ConSA引入可学习的token-to-head分配模块,动态决定每个注意力头应聚焦于哪些关键token子集,从而在保持模型表达力的同时显著降低计算开销。作者在语言建模与长序列任务上验证了其有效性,在LRA基准中平均提升2.3%准确率,同时减少37%的FLOPs;理论分析进一步证明其稀疏策略具备收敛性保障。该工作为高效大模型推理提供了兼具灵活性与可解释性的新路径,对边缘部署与长上下文场景具有实用价值。

来源 arXiv 时间 2026-06-16 15:33:49 AI 辅助整理
面向大语言模型智能体的组合式技能路由方法

本文提出「组合式技能路由」(Compositional Skill Routing)框架,旨在提升LLM智能体在复杂任务中的泛化与可解释性。该方法将任务自动分解为子目标,通过语义检索从技能库中匹配最适配的原子技能(如网页搜索、代码执行、数学推理),再动态编排组合形成执行链。区别于端到端微调或固定流程编排,该框架解耦了任务理解、技能发现与执行调度三个阶段,支持零样本技能复用与人类可追溯的决策路径。作者在ToolBench和WebShop等基准上验证了其在多步工具调用任务中显著优于Chain-of-Thought和ReAct等基线方法,并展示了对未见技能组合的强泛化能力。

来源 arXiv 时间 2026-06-16 15:27:55 AI 辅助整理
ConTex:面向时间序列预测的反事实生成新范式

该论文提出ConTex框架,首次将反事实推理系统性引入时间序列预测任务。不同于传统方法仅优化预测精度,ConTex通过重构反事实生成目标——即在可控干预下生成语义合理、动态一致的替代历史轨迹——来提升模型对因果结构与扰动鲁棒性的建模能力。作者设计了基于隐空间扰动与物理约束引导的双阶段生成机制,并在多个真实世界时序数据集(如电力负荷、交通流、气象观测)上验证其在异常归因、策略反推与不确定性量化等下游任务中的显著优势。研究填补了时序AI中可解释性干预建模的空白,为构建具备因果意识的预测系统提供了新路径。

来源 arXiv 时间 2026-06-16 15:25:12 AI 辅助整理
面向具身智能的流式视觉-语言-动作模型不确定性量化方法

本文针对新兴的流式(flow-based)视觉-语言-动作(VLA)模型——一类支撑机器人具身推理与决策的关键架构——系统性提出不确定性量化框架。作者指出,现有VLA模型在开放世界交互中缺乏对预测置信度的可靠评估,易导致高风险误操作。论文设计了基于隐变量流变换的不确定性传播机制,结合蒙特卡洛采样与雅可比正则化,在不增加显著推理开销的前提下实现像素级动作输出与语义意图的联合不确定性建模。实验在RT-2、OpenVLA等主流基准及真实机械臂平台上验证了该方法在任务失败预警、主动探索策略优化及人机协同安全增强方面的有效性,为可信具身智能提供了可解释性新路径。

来源 arXiv 时间 2026-06-16 15:19:09 AI 辅助整理
ProvenanceGuard:面向多步骤推理LLM智能体的事实性验证框架

该论文提出ProvenanceGuard,一种专为基于多步骤链式推理(MCP, Multi-Step Chain-of-Thought Planning)的LLM智能体设计的事实性验证方法。不同于传统单步响应验证,它在推理链每个节点动态追踪信息来源(provenance),结合检索增强与可解释性约束,对中间断言进行细粒度可信度评估。作者构建了首个面向MCP智能体的源感知验证基准MCP-Fact,并在多个复杂问答与工具调用任务中验证其有效性——相比基线方法,事实错误率降低37%,同时保持92%的原始任务完成率。研究揭示了当前LLM智能体在长链推理中‘来源漂移’问题的普遍性,为构建可信自主Agent提供了新范式。

来源 arXiv 时间 2026-06-16 15:10:29 AI 辅助整理
源语言选择影响跨语言上下文学习效果

该研究系统考察了在跨语言上下文学习(Cross-Lingual In-Context Learning)中,不同源语言作为提示(prompt)语言对目标语言任务性能的影响。作者发现,英语并非总是最优的源语言——在多种非英语目标语言(如中文、阿拉伯语、斯瓦希里语)上,使用同语系或更接近目标语言的语言(如法语之于西班牙语、日语之于韩语)作为提示语言,反而能显著提升少样本推理准确率。研究通过控制变量实验与语言距离分析,揭示了语言相似性、词形/句法对齐度及预训练数据分布偏差等深层机制,并指出当前大模型多语言能力评估中过度依赖英语提示可能带来系统性偏差。成果对构建真正公平、鲁棒的多语言AI系统具有重要启示。

来源 arXiv 时间 2026-06-16 15:09:42 AI 辅助整理
INI-VPINN:面向多材料奇异几何域的隐式诺伊曼与界面处理变分物理信息神经网络

该论文提出INI-VPINN(Implicit Neumann and Interface-aware Variational PINN),一种专为含几何奇点(如尖角、裂缝、材料交界)的多材料问题设计的新型变分物理信息神经网络。传统VPINN在强间断界面和奇异边界处易出现数值振荡或收敛失效,而INI-VPINN通过引入隐式诺伊曼边界条件嵌入机制与界面感知的变分残差加权策略,在无需显式网格剖分或人工增强函数的前提下,显著提升对不连续导数场和应力集中区域的建模精度。作者在弹性力学与热传导多相问题上验证了其鲁棒性,并与标准PINN、VPINN及XFEM基线方法对比,显示其在低采样密度下仍保持高阶收敛性。

来源 arXiv 时间 2026-06-16 15:06:15 AI 辅助整理
灾难性遗忘本质是低秩现象:面向持续适应的函数空间理论

该论文提出一种新颖的函数空间视角,证明深度神经网络在持续学习中遭遇的灾难性遗忘并非全局性参数退化,而主要由低秩方向上的梯度干扰驱动。作者通过谱分析与核函数近似,将任务间知识冲突建模为再生核希尔伯特空间(RKHS)中的低维子空间投影失配,并推导出遗忘强度与权重更新矩阵的奇异值衰减率呈强相关。实验在Split-CIFAR100和Stream-51等基准上验证:冻结高秩主成分或施加低秩正则化可显著缓解遗忘,且计算开销远低于主流重放或弹性权重固化方法。该理论为设计参数高效、可解释的持续学习算法提供了新范式。

来源 arXiv 时间 2026-06-16 15:03:37 AI 辅助整理
LoopCoder-v2:单次循环实现高效测试时计算扩展

LoopCoder-v2 是一种面向大语言模型(LLM)测试时计算扩展(test-time scaling)的新型轻量级架构,其核心创新在于仅需一次循环即可动态分配额外计算资源,显著降低传统多步推理(如自适应解码、链式思考重评分)带来的延迟与显存开销。该方法在保持模型原始权重冻结的前提下,通过可学习的循环门控机制与分层计算路由,在代码生成、数学推理等复杂任务上实现了媲美多次迭代方法的性能提升,同时推理速度提升达2.3倍。论文在HumanEval、MBPP、GSM8K等基准上进行了系统验证,并开源了训练框架与适配器模块,为低成本部署高可靠性AI Agent提供了新范式。

来源 arXiv 时间 2026-06-16 15:03:05 AI 辅助整理