AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
噪声信道下的最小贝叶斯风险解码方法

本文围绕神经机器翻译中的解码与重排序问题,探讨如何将噪声信道模型与最小贝叶斯风险(MBR)准则结合,以提升生成结果的整体质量。作者从“源句经噪声信道生成目标句”的经典框架出发,分析了在候选空间受限时,如何用期望损失最小化来选择更稳健的输出,而不仅仅依赖最大似然或单一得分最高的候选。方法强调利用多个候选的集合信息,缓解解码偏置,并在翻译质量、流畅度与语义保真之间取得更平衡的结果。该工作对大模型时代的生成式解码、重排序与风险控制也具有参考价值。

来源 arXiv 时间 2026-07-06 15:14:13 实体 Semantic Kernel AI 辅助整理
编码智能体中的潜在编程视野:从上下文到长期规划

这篇 arXiv 条目聚焦编码智能体在完成软件开发任务时,如何从单步补全走向更高层级的“潜在编程视野”——即在生成代码之前,先形成对任务结构、依赖关系与后续步骤的隐式规划。文章讨论了当前 coding agents 在多文件修改、工具调用、调试迭代和长程任务执行中的能力边界,并强调仅靠局部上下文往往不足以支撑可靠的软件代理。其核心意义在于提示:未来的编码智能体需要把程序语义理解、任务分解与执行策略更紧密地结合起来,才能提升复杂工程场景下的稳定性与可扩展性。

来源 arXiv 时间 2026-07-06 15:08:26 实体 Semantic Kernel AI 辅助整理
ClassicLogic:面向组合泛化评测的经典解谜游戏知识驱动基准

ClassicLogic 提出一个知识驱动的基准,用经典解谜游戏来评测大模型与智能体的组合泛化能力。与只看最终得分的传统游戏基准不同,它强调从规则、物体属性、动作约束到解题步骤的系统性推理,能够检验模型是否真正掌握任务结构,而非依赖记忆或试错。该基准通过整理经典谜题中的显式知识与隐含关系,构建可复用的评测任务,覆盖多种组合变化与新情境迁移,适合观察模型在陌生关卡、规则重组和多步规划中的表现。

来源 arXiv 时间 2026-07-06 15:02:23 实体 Semantic Kernel AI 辅助整理
EdgeBench:揭示真实环境中学习的规模定律

EdgeBench 提出一个面向边缘与真实环境交互的新型基准,用于研究智能体从现实世界数据和反馈中学习时的规模定律。与传统离线数据集不同,它强调任务难度、环境噪声、交互成本与模型规模之间的系统关系,帮助回答“数据、算力、环境复杂度增加后,性能如何变化”这一核心问题。该工作为评估具身智能、边缘智能与在线学习系统提供了统一框架,也为设计更高效的训练策略、数据采样机制和部署方案提供了实验依据。

来源 arXiv 时间 2026-07-06 14:39:22 实体 Semantic Kernel AI 辅助整理
PDEFlow:面向神经算子学习与免求解推理的自治式 PDE Agent 管线

PDEFlow 提出了一套自治式、具备代理协同能力的偏微分方程处理管线,目标是把传统依赖数值求解器的 PDE 工作流,转化为更自动化、可组合的神经算子学习与推理流程。该方法强调从问题建模、数据生成到训练与推断的端到端编排,使模型能够在缺少显式求解器或求解代价过高时,仍然完成近似高效的预测。相较于单点模型,PDEFlow 更关注“流水线”层面的自动决策与任务分解,适用于复杂 PDE 场景中的批量实验、快速模拟与 solver-free inference。

来源 arXiv 时间 2026-07-06 14:18:30 实体 Semantic Kernel AI 辅助整理
局部化 LoRA-MoE:具自适应路由的分块低秩专家

本文提出 Localized LoRA-MoE,将 LoRA 的低秩适配能力与 MoE 的稀疏路由机制结合,但不再沿用传统“整层共享专家”的做法,而是把权重矩阵切分为多个块,并为不同块配置低秩专家。模型通过自适应路由为不同输入动态选择激活的专家,从而在尽量控制参数量和计算开销的同时,提升不同子空间的表达能力。作者强调这种块级局部化设计更适合捕捉层内异质性,可在微调场景下兼顾效率与效果,尤其适用于资源受限部署和多任务适配。

来源 arXiv 时间 2026-07-06 14:06:18 实体 Semantic Kernel AI 辅助整理
用户评价大模型时更看重“包装话术”而非真实表现

这篇论文研究用户在评价大语言模型时,究竟是在评估模型真实能力,还是被产品演示方式与先验期待所影响。作者指出,当用户面对不同的介绍方式、品牌暗示或功能叙述时,给出的反馈往往更多反映他们对产品“应该有多好”的预期,而不是模型在客观任务中的实际表现。也就是说,用户评价会明显受到“推介方式”影响,容易把营销表达、界面设计和身份标签误当成能力本身。该发现提醒 AI 产品评测不能只看用户满意度,还要结合可重复的性能测试与盲测设计,以避免高估模型真实实力。

来源 arXiv 时间 2026-07-06 14:05:41 实体 Semantic Kernel AI 辅助整理
Grokking并非普适规律:条件性与脆弱性的12K参数多随机种子研究

这项工作围绕“grokking”现象展开,即模型在长时间记忆训练后突然转向更强泛化的行为。作者在一个完全可控、仅约12K参数的小模型上进行多随机种子实验,系统检验了grokking是否稳定可复现。结果显示,grokking并不是自动出现的普遍规律,而是依赖训练设置、初始化和优化轨迹的条件性现象;即便在同一任务中,不同随机种子也可能导致完全不同的训练结局。研究进一步说明,grokking对超参数与实验细节高度敏感,具有明显脆弱性,这为理解模型从“记忆”到“泛化”的转变提供了更谨慎的实证基础。

来源 arXiv 时间 2026-07-06 13:58:31 实体 Semantic Kernel AI 辅助整理
面向表格分类的并行异构集成方法选择研究

本文围绕表格数据分类中的并行异构集成方法选择问题展开研究。表格任务常同时面临特征类型混杂、数据量有限、类别不平衡以及模型泛化不稳定等挑战,单一算法往往难以在不同数据集上保持最优表现。作者比较多种并行组合思路,关注不同基学习器在准确率、稳定性与训练成本之间的权衡,并探讨如何为具体数据集选择更合适的异构集成方案。研究结果可为传统机器学习场景中的模型选型与自动化建模提供参考,也有助于提升表格分类在实际业务中的落地效率。

来源 arXiv 时间 2026-07-06 13:58:19 实体 Semantic Kernel AI 辅助整理
AIFS-SUBS:将数据驱动预报扩展到次季节时间尺度

该论文提出 AIFS-SUBS,将原本面向短中期天气预报的数据驱动方法扩展到次季节尺度(通常指两周到两个月)。相较于传统数值模式,次季节预报更依赖大尺度环流、海气耦合与低频振荡等缓慢演变信号,难点在于可预报性下降、误差累积更快。作者围绕这一问题构建了适配次季节任务的数据驱动框架,强调从历史再分析和预报数据中学习时空演变规律,以提升长时效预测能力与实用性。该工作体现出大模型/机器学习方法正在向更长时间跨度的地球系统预测延伸。

来源 arXiv 时间 2026-07-06 13:56:41 实体 Semantic Kernel AI 辅助整理
线性时间计算货币风险度量的新方法

本文研究金融风险管理中的货币型风险度量计算问题,重点关注如何在大规模数据场景下高效求解。作者针对一类常见风险度量给出线性时间算法,相比传统方法显著降低了计算复杂度,使其更适合实时定价、风险监控与大规模组合分析。文章不仅讨论算法设计与理论正确性,还分析了其在不同输入分布和应用场景中的可扩展性。该工作对量化金融、随机优化以及需要快速风险评估的决策系统具有直接参考价值。

来源 arXiv 时间 2026-07-06 13:39:45 实体 Semantic Kernel AI 辅助整理
扩散引导的不确定性感知延迟策略优化

该研究围绕强化学习中的策略更新稳定性与安全探索问题展开,提出一种结合扩散模型引导与不确定性感知机制的延迟策略优化方法。作者利用扩散过程生成更平滑、覆盖更充分的候选动作或策略改进方向,同时通过不确定性估计识别高风险决策区域,并将策略更新延后到更可靠的信号出现时再执行,从而降低错误估计带来的性能波动。方法特别适合样本有限、环境噪声较强或价值评估偏差明显的任务场景,有望提升训练稳定性、鲁棒性与最终策略质量。

来源 arXiv 时间 2026-07-06 13:33:17 实体 Semantic Kernel AI 辅助整理
迈向医疗领域可信赖的大语言模型智能体

本文聚焦大语言模型智能体在医疗场景落地时的可信性问题。相较于一般对话模型,医疗智能体往往需要在临床知识检索、病历理解、辅助决策与流程执行中与真实世界系统交互,因此更容易暴露出事实幻觉、推理不稳定、工具调用失误、隐私泄露与责任边界不清等风险。文章围绕安全性、可靠性、可解释性、鲁棒性与合规性等维度,讨论当前评估与治理方法的不足,并强调需要结合临床工作流、任务分级和人类监督机制来设计更稳妥的智能体架构。

来源 arXiv 时间 2026-07-06 13:29:07 实体 Semantic Kernel AI 辅助整理
CollabEval:基于矩阵补全的高效协作模型评测

本文提出 CollabEval,一种面向大模型与多模型场景的协作式评测框架,核心思路是把“模型-任务”表现矩阵视为待补全的低秩结构,仅需少量样本评测即可推断其余模型在更多任务上的相对表现,从而显著降低全面跑分的成本。该方法强调统计效率,适合模型数量快速增长、基准任务持续扩张的现实环境。通过矩阵补全与协同信息共享,CollabEval 在有限预算下仍能获得较稳定的性能排序与能力刻画,为模型选型、横向对比和持续监控提供更经济的评测方案。

来源 arXiv 时间 2026-07-06 13:22:04 实体 Semantic Kernel AI 辅助整理
基于混合 Mamba 的查询引导支持掩码细化与不确定性融合少样本脑肿瘤分割

这篇论文提出 RUFNet,用于少样本脑肿瘤分割。方法核心是在原型式分割框架中,引入查询引导的支持掩码细化机制,缓解少样本条件下支持集标注噪声和类别对齐不稳定的问题;同时结合不确定性融合模块,对不同特征分支的预测置信度进行建模与加权,从而提升分割边界的鲁棒性。模型还采用混合 Mamba 结构,将状态空间模型的长程建模能力与卷积/局部表征优势结合,以增强医学图像中的多尺度上下文捕获。整体上,该方法面向脑肿瘤分割中的小样本、强异质性与边界模糊等难点,兼顾精度与泛化性。

来源 arXiv 时间 2026-07-06 13:16:51 实体 Semantic Kernel AI 辅助整理
多大语言模型协同编排的临床病历严重程度评估框架 MOSAIC

该论文提出 MOSAIC,一种面向临床病历严重程度评估的多大语言模型协同编排方法。不同于单一模型直接给出结论,MOSAIC 通过多个大模型分工协作、交叉核验与一致性汇总,提升对病历关键信息的识别、风险判断和严重程度分级能力。该方法特别适用于临床文本中信息冗长、表述不规范、隐含风险多的场景,有助于减少单模型在复杂医疗语境下的漏判与偏差。整体上,论文探索了以“多模型协同”增强医疗文本自动理解与临床决策支持的可行路径。

来源 arXiv 时间 2026-07-06 13:15:21 实体 Semantic Kernel AI 辅助整理
你的智能体记忆并不属于它:面向 LLM Agent 记忆的伪造推理攻击与防御

这篇论文聚焦大模型智能体(LLM Agent)的记忆安全问题,指出许多智能体依赖长期记忆来持续积累用户偏好、任务状态和历史推理,但这些记忆并不天然可信。作者提出“伪造推理攻击”(Forged Reasoning Attacks),即攻击者通过构造看似合理的对话或中间推理,诱导智能体将错误内容写入记忆,进而在后续任务中持续污染决策与行为。论文同时分析了该类攻击的传播路径与风险,并讨论了相应防御思路,包括记忆写入前的真实性校验、推理链一致性检查、记忆隔离与回滚机制等。

来源 arXiv 时间 2026-07-06 13:10:13 实体 Semantic Kernel AI 辅助整理
PAST-TIDE:面向立场识别的原型锚定陈述调优与话题不变归一化

这篇工作聚焦立场识别中的“话题偏置”问题:模型往往会把观点内容与特定主题强绑定,导致跨话题泛化能力不足。作者提出 PAST-TIDE 框架,通过“原型锚定”的陈述调优机制,让模型围绕代表性立场原型学习更稳定的表达,同时引入话题不变归一化,削弱主题词汇对表示空间的干扰,促使模型更多关注真正的立场信号。整体思路是把样本的立场判断从具体话题中解耦出来,从而提升在不同议题上的鲁棒性与迁移表现。该方法对社交媒体舆情分析、公共议题监测等场景具有参考价值。

来源 arXiv 时间 2026-07-06 05:33:27 实体 Semantic Kernel AI 辅助整理
URSA:面向实用逆合成评估的化学感知基准

URSA 是一个面向逆合成任务的新基准,重点不只看“能否合成”,更强调路线是否具有实用价值。与传统仅评估结构匹配或单步命中率的方法不同,URSA 引入化学感知视角,对候选逆合成方案在可行性、反应合理性与整体合成效用等方面进行更细粒度的衡量。该基准旨在帮助研究者更真实地比较不同模型在真实药物与精细化学合成场景中的表现,也为训练更符合化学规律的大模型和智能体提供标准化测试环境。

来源 arXiv 时间 2026-07-06 05:32:09 实体 Semantic Kernel AI 辅助整理
面向可解释青光眼诊断的生物标志物中心眼底知识图谱

该研究提出 GlaKG,一个以生物标志物为核心的眼底知识图谱,用于支持青光眼的可解释诊断与风险评估。作者将眼底影像中的关键结构特征、临床指标及其关系进行系统化建模,把原本分散在图像与病历中的信息转化为可推理的知识网络,从而提升模型输出的透明度与临床可用性。与单纯依赖黑箱分类器的方法相比,GlaKG 强调“为什么判定为高风险”的证据链,能够帮助医生理解青光眼相关风险因素之间的关联,并为后续个体化随访与干预提供支持。

来源 arXiv 时间 2026-07-06 04:56:39 实体 Semantic Kernel AI 辅助整理
基于昼夜节律评分的抑郁筛查与干预机器学习方法

本文围绕抑郁症的早筛与干预展开,提出一种基于昼夜节律评分(circadian rhythm score)的原创方法,将个体的睡眠、活动与日常行为节律特征转化为可量化指标,并结合机器学习模型识别抑郁风险。该思路旨在补足传统量表在连续监测、客观性与个体差异刻画上的不足,为抑郁症的早期预警和个性化干预提供技术路径。研究强调将生理节律信号纳入精神健康评估框架,体现了可穿戴数据与AI辅助心理健康管理的交叉趋势。

来源 arXiv 时间 2026-07-06 04:04:32 实体 Semantic Kernel AI 辅助整理
SILO:面向多阶段线缆布线的仿真闭环 Sim-to-Real 迁移方法

本文提出 SILO(Simulation-in-the-Loop),用于解决多阶段线缆布线任务中的仿真到真实世界迁移问题。线缆布线兼具长时序、多接触、强几何约束等特点,传统单次仿真训练往往难以适应真实环境中的偏差。SILO 的核心思路是在训练过程中持续引入真实执行反馈,让仿真策略在循环中修正轨迹与动作分布,从而缩小 sim-to-real gap。该方法面向多阶段操作流程,将复杂布线拆解为若干可控阶段,并通过仿真闭环提升策略鲁棒性与泛化能力。研究显示,这种“边仿真、边校正”的训练范式能更稳定地迁移到真实机器人系统,适用于柔性物体操控与工业装配场景。

来源 arXiv 时间 2026-07-06 02:48:10 实体 Semantic Kernel AI 辅助整理
G2VD:通过反事实干预与因果解耦实现可泛化AI生成视频检测

本文聚焦AI生成视频检测在跨模型、跨数据分布场景下泛化不足的问题,提出G2VD框架。方法核心是将视频中的伪造线索与内容语义、运动模式等因素做因果解耦,并通过反事实干预显式削弱与生成器特定风格相关的偏置特征,从而迫使模型学习更稳定的判别依据。相较依赖表面纹理或局部伪影的传统检测器,G2VD更强调可迁移的因果特征表示,提升对未知生成模型和后续编辑手段的鲁棒性。该工作为深度伪造视频检测提供了一种更具泛化能力的因果学习思路。

来源 arXiv 时间 2026-07-06 02:25:18 实体 Semantic Kernel AI 辅助整理
LCPNet:面向红外小目标检测的潜在一致近端展开网络

红外小目标检测常面临目标尺寸极小、背景杂波强、信噪比低等难题,传统方法往往难以兼顾检测精度与鲁棒性。LCPNet 提出一种“潜在一致近端展开”框架,将优化算法中的近端迭代思想与深度网络结合,在特征潜空间中逐步恢复目标信息,并通过一致性约束提升多阶段迭代的稳定性与可解释性。该方法旨在更好地区分目标与复杂背景干扰,在细粒度结构保留和弱目标增强方面具有优势,适用于红外监测、预警和远距离感知等场景。

来源 arXiv 时间 2026-07-06 02:15:09 实体 Semantic Kernel AI 辅助整理
TORINO:通过可解释概念重叠实现视觉语言模型的Token压缩

本文提出TORINO,一种面向视觉语言模型的Token Reduction方法,核心思路是利用图像与语言之间可解释的“概念重叠”来筛减冗余token,而不是单纯依赖注意力权重或启发式剪枝。该方法希望在尽量保留语义信息的前提下,降低视觉token数量,从而提升推理效率、减少计算开销,并更适合长上下文和资源受限场景。与常见的黑盒式压缩不同,TORINO强调压缩过程的可解释性,使模型保留的内容能对应到更明确的概念层面。

来源 arXiv 时间 2026-07-06 01:43:09 实体 Semantic Kernel AI 辅助整理
MTEB-PT:面向巴西葡萄牙语的文本嵌入评测基准

MTEB-PT 是一个面向巴西葡萄牙语的文本嵌入评测基准,旨在系统衡量向量表示模型在语义检索、聚类、分类与相似度计算等任务上的表现。相较于主要服务英语的通用基准,该工作补足了葡萄牙语,尤其是巴西葡语场景下评测资源不足的问题,为本地化 embedding 模型的开发、比较与选型提供统一标准。该基准有助于推动多语言表示学习在拉美语言环境中的应用落地,也为后续构建更具语言覆盖度和任务多样性的评测体系提供参考。

来源 arXiv 时间 2026-07-06 01:19:30 实体 Semantic Kernel AI 辅助整理
语义概念空间中的可解释新类别发现

本文聚焦于新类别发现(Novel Category Discovery, NCD)中的可解释性问题:在已知类别标注稀缺、未知类别不断涌现的场景下,模型不仅要把未见样本自动聚类,还要说明这些新簇“为何成立”。作者引入语义概念空间,将视觉或文本表征映射到更具人类可读性的概念维度,并据此构建可解释的类别发现流程。方法旨在同时提升发现质量与解释质量,使模型输出的不只是簇标签,还包括支撑该归类的关键语义概念。该方向对开放世界识别、智能检索和可审计AI系统具有现实意义。

来源 arXiv 时间 2026-07-05 23:36:36 实体 Semantic Kernel AI 辅助整理
Mask2Real-WM:以分割掩码搭建可控灵巧操作世界模型的仿真到现实桥梁

这篇工作聚焦灵巧机器人在仿真到现实迁移中的核心难题:视觉外观差异会让世界模型难以稳定预测真实操作结果。作者提出 Mask2Real-WM,将语义分割掩码作为中间表征,把复杂的像素级视觉输入转化为更稳定、可控的结构信息,从而在仿真训练与真实部署之间建立桥梁。该方法面向可控灵巧操作世界模型,不仅关注未来状态预测,还强调动作条件下的可编辑性与泛化能力。通过以掩码弱化域偏移、保留物体布局与交互关系,模型更容易学习接触、抓取和操作过程中的关键动态,为机器人在真实场景中的规划、预测与策略优化提供更可靠的世界模型基础。

来源 arXiv 时间 2026-07-05 23:29:23 实体 Semantic Kernel AI 辅助整理
Auto:面向通用智能的编译器式框架

该文提出 Auto——一种将高层目标、约束与工具调用“编译”为可执行智能流程的框架,尝试把 AGI 的构建从经验式提示工程推进到更系统的工程化路线。其核心思路是把复杂任务分解为可组合的中间表示,再由模型、检索、规划与外部工具协同执行,以提升稳定性、可控性和可复用性。文章强调通过标准化接口与自动化调度,减少手工链路设计成本,并为多步骤推理、长任务执行和跨工具协作提供基础。

来源 arXiv 时间 2026-07-05 23:09:24 实体 Semantic Kernel AI 辅助整理
CRISP:基于预测式世界模型预训练的时空摄像头-雷达驾驶骨干网络

CRISP提出一种面向自动驾驶的时空多模态骨干网络,将摄像头与雷达信息统一建模,并引入基于未来预测的世界模型预训练策略。相比只做当前帧感知的方法,它强调对场景演化、目标运动和时序上下文的理解,从而提升在复杂道路环境中的表示能力与下游驾驶任务泛化性。论文核心思路是先通过预测式预训练学习“如何理解并预判世界”,再将得到的通用表征迁移到检测、跟踪与规划相关任务中,适合应对遮挡、弱光和远距离目标等自动驾驶难点。

来源 arXiv 时间 2026-07-05 23:07:45 实体 Semantic Kernel AI 辅助整理