AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
MESA:优先保护多智能体系统中的脆弱通信通道

随着多智能体系统在协作推理、自动化工作流和工具调用中的应用增多,智能体之间的通信链路也成为攻击者最容易下手的环节。本文提出 MESA,一种面向多智能体系统安全防护的优先级方法,核心思路是识别并优先加固最脆弱、最关键的通信通道,而不是对所有链路平均投入防御资源。该方法结合通道风险、传播影响与系统依赖关系进行评估,帮助在有限成本下最大化整体安全收益。论文强调,多智能体安全不应只关注单个模型能力,还要把消息传递、协调机制与跨代理信任边界纳入统一防护框架。

来源 arXiv 时间 2026-06-29 17:40:45 实体 LangGraph AI 辅助整理
多址信道语义通信中的无线后门攻击与防御

本文研究多址信道上的语义通信系统在无线环境中面临的后门风险与防护机制。作者从攻击者可通过空口注入隐蔽触发信号、诱导接收端语义解码偏移这一角度,分析后门攻击对语义传输可靠性与任务结果的破坏方式,并进一步讨论其与传统图像/文本后门在通信场景中的差异。针对多用户叠加传输、信道噪声与资源共享带来的复杂性,论文提出相应检测与缓解思路,以提升系统对恶意无线干扰的鲁棒性。该工作为语义通信安全、空口对抗与6G智能通信防护提供了新的研究视角。

来源 arXiv 时间 2026-06-29 17:36:09 实体 Semantic Kernel AI 辅助整理
语言比代码更会“说服”模型:LLM代码漏洞检测中的认知启发式研究

这篇论文聚焦大模型在代码漏洞检测中的判断偏差,探讨其是否会像人类一样受到“认知启发式”影响,即更容易被代码周边的文字描述、上下文措辞或表面特征左右,而非真正理解程序逻辑。作者围绕 LLM 进行漏洞识别任务设计实验,分析模型在面对相似代码但不同语言包装时的稳定性与可靠性。研究表明,文本线索可能比代码本身更强地影响模型结论,暴露出当前 LLM 在安全分析场景中的脆弱性。这一发现对 AI 辅助代码审计、漏洞扫描与安全评测都具有重要警示意义。

来源 arXiv 时间 2026-06-29 17:31:10 实体 Semantic Kernel AI 辅助整理
面向企业共享存储的加密勒索软件混合检测框架

本文提出一种用于企业共享存储环境的加密勒索软件检测混合框架,针对传统单一方法在海量文件访问场景下误报高、响应慢、难以捕捉早期异常等问题进行改进。该框架结合静态特征、行为模式与存储访问上下文,对文件加密、批量重命名、异常写入等可疑活动进行联合分析,并通过多阶段判定提升检测准确率与实时性。研究重点面向企业共享存储中多用户并发、权限复杂和业务连续性要求高的实际场景,为数据保护、入侵发现与自动化响应提供了可落地的防御思路。

来源 arXiv 时间 2026-06-29 17:30:51 AI 辅助整理
面向模糊环境的不确定性感知生成与决策方法

本文聚焦在信息不完整、分布漂移或语义含混的场景中,模型如何同时生成可靠内容并做出稳健决策。核心思路是不把不确定性当作噪声简单忽略,而是显式建模其来源、传播与影响,从而让生成结果更可控、决策过程更审慎。该方向对医疗、金融、搜索问答和智能体规划尤为重要,因为这些任务往往既要求输出流畅结果,又要求在证据不足时能识别风险、表达置信度并触发保守策略。

来源 arXiv 时间 2026-06-29 17:20:43 实体 Semantic Kernel AI 辅助整理
超越二维匹配:面向几何感知跨视角目标地理定位的统一单阶段框架

跨视角目标地理定位旨在将地面视角中的目标精准映射到俯视或空中视角中的真实位置,但传统方法多依赖二维外观匹配,容易受视角差异、遮挡和尺度变化影响。本文提出一个统一的单阶段框架,从几何关系出发联合建模目标外观与空间位置,直接完成跨视角目标的地理定位。该方法强调几何感知与端到端推理,减少对复杂多阶段匹配与后处理的依赖,从而提升定位稳定性与泛化能力。对需要在城市导航、机器人感知和遥感场景中进行跨视角对齐的任务具有参考价值。

来源 arXiv 时间 2026-06-29 17:19:49 实体 Semantic Kernel AI 辅助整理
有效运输映射估计的基本极限研究

本文研究在最优传输与生成建模中核心的“有效运输映射”估计问题,重点回答:在给定样本数量、维度与正则条件下,学习从源分布到目标分布的合法映射究竟能做到多精确。作者从统计下界与信息论角度刻画该任务的基本极限,分析了维度灾难、分布平滑性以及映射可识别性对误差收敛率的影响。结果为运输映射学习、分布对齐和基于OT的生成方法提供了理论参照,也提示了在高维场景中单纯依赖有限样本拟合可能面临的不可逾越瓶颈。

来源 arXiv 时间 2026-06-29 17:17:55 实体 Semantic Kernel AI 辅助整理
SWE-INTERACT:把软件工程基准重塑为用户驱动的长周期编程会话

这篇论文提出 SWE-INTERACT,重新定义传统软件工程基准的评测方式,不再只看模型能否一次性修复单个缺陷,而是将任务组织成更贴近真实开发的、由用户需求驱动的长周期交互式编程会话。作者强调,现实中的软件开发往往涉及多轮澄清、持续修改、上下文积累与目标演化,因此现有 SWE Bench 类基准对 Agent 的真实能力刻画仍不充分。SWE-INTERACT 旨在评估模型在长期任务规划、交互式调试、需求理解和连续代码演进中的表现,为面向软件工程的 Agent 研究提供更贴近生产环境的新基准。

来源 arXiv 时间 2026-06-29 17:17:45 实体 Semantic Kernel AI 辅助整理
Ornith-1.0:面向智能编程代理的自我进化开源模型

Ornith-1.0 是一个面向 agentic coding 的开源模型项目,核心卖点是“自我改进”能力:模型不仅用于生成代码,还尝试在真实编程任务中通过反馈持续迭代,提升解决问题的稳定性与执行效果。该项目由 deepreinforce-ai 发布,目标是让大模型更适合承担代码理解、修改、调试与任务分解等代理式开发工作。对于关注 AI 编程助手、开源大模型训练路径以及强化学习式优化的人来说,这类项目代表了从“会写代码”走向“能在循环中变得更会写代码”的新方向。

来源 Hacker News 时间 2026-06-29 17:16:17 AI 辅助整理
面向恶意软件分类、加壳检测与家族归属的多任务专家混合框架

这项研究提出一个面向恶意软件分析的多任务专家混合(Mixture of Experts, MoE)框架,将恶意软件分类、加壳检测与家族归属三类相关任务统一建模。相较于分别训练多个独立模型的方法,该框架通过共享表示学习与任务特定专家协同工作,既能利用任务间的共性特征,又能保留各自的判别能力,从而提升整体检测与细粒度归因效果。该思路尤其适合恶意软件领域中标签层级复杂、样本分布不均、加壳技术干扰强的现实场景。研究结果表明,多任务与专家路由机制结合,有望增强模型对不同恶意样本变体的泛化能力,并为安全分析流程提供更高效的自动化支持。

来源 arXiv 时间 2026-06-29 17:15:25 实体 Semantic Kernel AI 辅助整理
多轮大模型对话中会涌现“吸引子”状态

这篇论文研究了大语言模型在多轮对话中的动态行为,发现模型并非每轮都在独立生成回复,而是会逐渐收敛到少数稳定的“吸引子”状态:无论对话如何推进,模型输出在语义、风格或决策倾向上都可能反复回到相近模式。作者从对话轨迹、状态转移和稳定性角度分析了这一现象,说明多轮交互会放大模型内部偏置与上下文惯性。这一发现对智能体记忆、对话控制、提示设计和安全对齐都具有启发意义,因为它提示我们需要关注模型在长上下文中的长期动力学,而不仅是单轮性能。

来源 arXiv 时间 2026-06-29 17:14:29 实体 Claude AI 辅助整理
面向代理记忆投毒检测的轨迹取证签名方法

该论文聚焦大模型智能体中的“记忆投毒”风险:攻击者通过污染长期记忆或交互历史,诱导代理在后续任务中持续做出错误决策。作者提出一种取证式轨迹签名思路,从智能体执行过程中的行为序列、状态转移与记忆调用模式中提取可辨识特征,用于发现异常记忆污染迹象。相较单次响应检测,这种方法更强调跨轮次、跨任务的一致性分析,能够在不完全依赖已知攻击样本的情况下识别潜在投毒。该研究对构建更可靠的 Agent 安全防线、提升记忆系统可审计性具有现实意义。

来源 arXiv 时间 2026-06-29 17:09:03 实体 GPT-4o AI 辅助整理
走向混合注意力模型:结构融合的新路径

本文围绕“混合注意力模型”的演化展开,讨论如何将不同类型的注意力机制与网络结构进行融合,以兼顾全局建模能力、计算效率与参数利用率。相较于单一注意力范式,混合设计通常试图把局部归纳偏置、稀疏计算或多尺度表征引入统一框架,从而提升模型在长序列、复杂视觉模式或多模态任务中的适应性。文章标题中的“morphing”暗示了从传统注意力架构向更灵活的混合形态转变,反映出大模型时代对效率与表达力并重的持续探索。

来源 arXiv 时间 2026-06-29 17:02:34 AI 辅助整理
人类创造力基准:评估大模型创意生成能力的新框架

该文提出“人类创造力基准”,旨在为人工智能系统提供一个更贴近真实创作过程的评测框架。与只考察事实问答或固定答案不同,这一基准聚焦新颖性、适切性与可解释性,强调模型在开放式任务中的构思、联想与组合能力。研究动机在于:当前大模型虽能生成流畅文本,却未必真正具备稳定的创造力评估标准。作者希望通过标准化任务与评分方式,补足现有基准对创意、原创与人类式发散思维的覆盖不足,为后续比较不同模型的生成质量、创造潜力与人机协作价值提供参考。

来源 arXiv 时间 2026-06-29 16:59:46 实体 Semantic Kernel AI 辅助整理
TraceLab:面向大模型服务的编码智能体工作负载特征分析

TraceLab 研究编码智能体在真实开发场景中的工作负载特征,重点分析其对大模型推理服务的影响。论文通过收集和剖析智能体在代码生成、编辑、调试与多轮工具调用中的轨迹,刻画请求长度、上下文变化、响应节奏和交互复杂度等关键指标,帮助理解这类应用与传统聊天式负载的差异。研究结论可为推理系统的吞吐优化、延迟控制、缓存策略和资源调度提供依据,也为面向 Agent 的 LLM 服务设计更贴近真实需求的基准与评测方法。

来源 arXiv 时间 2026-06-29 16:59:05 实体 Claude AI 辅助整理
同质深度网络中持续学习的收敛性研究

本文讨论持续学习在同质深度网络中的收敛行为,即模型在按任务顺序不断接收新数据时,参数更新能否稳定趋于某种解。研究重点在于分析连续任务带来的分布漂移与遗忘效应如何影响优化过程,以及在特定网络结构假设下,训练动态是否仍具备可证明的收敛性。该工作有助于理解大模型和深度网络在增量式学习场景中的理论边界,为缓解灾难性遗忘、设计更稳定的在线更新机制提供基础。

来源 arXiv 时间 2026-06-29 16:55:45 实体 Semantic Kernel AI 辅助整理
Poller:大模型是否适合评估诗歌理解任务

这篇论文围绕“诗歌理解”这一带有强主观性和文化语境的任务,讨论大语言模型是否能够充当可靠评测者。作者通过构建或整理相关评估场景,考察 LLM 在理解诗歌意象、隐喻、情感与多层含义时的判分一致性、稳定性与人类偏好对齐程度。研究重点不只在于模型能否答对,更关注其作为“裁判”时是否会受到措辞、提示方式和生成风格影响,从而产生偏差。论文结论旨在为文学类、开放式理解任务中的自动化评测提供参考,也提醒人们:并非所有语义判断都适合直接交给 LLM 自动评分。

来源 arXiv 时间 2026-06-29 16:51:31 实体 Semantic Kernel AI 辅助整理
语言防火墙:以几何结构守护多智能体路由安全

这篇论文提出“语言防火墙”思路,关注多智能体系统在路由与协作过程中如何抵御恶意输入、越权转发和策略污染。作者强调,不应只依赖规则或内容过滤,而是利用表示空间中的几何结构,将可信指令与风险信息在向量空间中分离、约束和重定向,从而在路由层面建立防护边界。该方法将安全机制嵌入智能体通信与任务分发流程,兼顾可扩展性与鲁棒性,为构建更安全的多智能体编排与代理网络提供了新的研究视角。

来源 arXiv 时间 2026-06-29 16:51:06 实体 Semantic Kernel AI 辅助整理
连接 NISQ 与容错时代的生成式机器学习辅助量子选定 CI 分子模拟

本文面向分子量子模拟中的经典-量子混合工作流,提出一种将生成式机器学习与量子选定组态相互作用(selected CI)结合的方法,尝试在 NISQ 设备可承受的计算规模下逼近更高精度的电子结构结果。其核心思路是利用生成模型辅助筛选重要电子组态,减少传统 CI 搜索空间过大带来的计算瓶颈,并为未来容错量子计算中的更高精度模拟预留可扩展路径。该工作聚焦于如何在当前受噪声、比特数和电路深度限制的量子硬件条件下,逐步桥接到更稳健的容错方案。

来源 arXiv 时间 2026-06-29 16:48:44 AI 辅助整理
按下 Tab 还是不按:用行为信号评估 AI 代码补全中的批判性参与

这项研究聚焦 AI 代码补全工具是否真正提升了开发者的“批判性参与”,而不只是让人更快接受机器建议。作者结合行为信号与注意力检查设计实验,观察开发者在使用代码补全时的接受、修改、拒绝与审视模式,并据此衡量用户对生成内容的警觉性和判断力。研究表明,不能仅用点击率或采纳率评价此类工具,开发者是否主动校验、重构和纠错同样关键。该工作为评估 AI 编程助手的真实使用质量提供了更细粒度的方法,也为设计更可靠、可解释的人机协作界面提供了参考。

来源 arXiv 时间 2026-06-29 16:47:46 实体 GitHub Copilot AI 辅助整理
从因子化转移效应中学习潜在动作:面向代理歧义

本文研究在多智能体或交互式决策场景中,如何从观测到的状态转移中反推出“潜在动作”。当外部行为存在歧义、无法直接对应明确动作时,作者提出利用因子化的转移效应来分解环境变化,把混杂在一起的影响拆开建模,从而更稳健地识别动作背后的意图与结构。该方法强调在代理行为不确定、观测不完整的条件下,仍可通过学习状态变化中的可分离因子,获得更具解释性的动作表示。相关思路有助于提升对复杂智能体行为的理解、模仿学习与协同决策能力。

来源 arXiv 时间 2026-06-29 16:45:04 AI 辅助整理
TRACE:面向双人对话语音的时序关系感知语言同步检测

本文提出 TRACE 方法,用于在双人对话语音中检测“语言同步”或“对话趋同”现象,即说话人在词汇、句法或韵律层面逐渐向对方靠拢的过程。与只看局部相似性的传统做法不同,TRACE 强调对话中发言顺序与时间依赖关系,建模行为在连续轮次中的演化轨迹,从而更准确地区分偶然相似与真实的互动适应。该研究面向 dyadic speech 场景,适合分析人类对话中的互动机制,也可为对话系统、社交信号分析和人机交互建模提供参考。

来源 arXiv 时间 2026-06-29 16:42:24 AI 辅助整理
亚马逊充斥 AI 生成的游戏攻略“水文”,连未发售作品也不放过

Kotaku 指出,亚马逊上出现大量疑似 AI 生成的游戏攻略书,内容空泛、重复、错误频出,甚至连尚未发售的游戏也被提前“编写”成了指南。这些低质量书籍借助热门游戏名引流,包装成可售卖的攻略或百科,却缺乏真实玩法验证与编辑把关。文章将其视为生成式 AI 低成本批量生产内容后,平台内容生态被迅速污染的一个典型案例,也反映出电商和自出版渠道在审核机制上的漏洞。

来源 Hacker News 时间 2026-06-29 16:39:38 AI 辅助整理
从错误中学习:面向自动驾驶的回放检索式终身策略学习

这篇工作聚焦自动驾驶中的终身策略学习问题,核心目标是在持续遇到新场景、新道路规则和新驾驶分布时,仍能稳定提升决策能力,而不是在后续学习中遗忘旧经验。作者提出一种结合 rollout 与 retrieval 的学习框架:通过滚动采样积累失败与边界案例,再从历史经验中检索相似轨迹或关键片段,辅助策略更新,从“错误”中提炼可复用知识。该方法强调在长期部署环境下的适应性、鲁棒性与持续改进能力,尤其适合处理自动驾驶中高风险、长尾且不断变化的真实驾驶情境。

来源 arXiv 时间 2026-06-29 16:37:50 AI 辅助整理
工具增强型智能体中的实体绑定失效问题

本文聚焦工具增强型智能体在多步推理与外部工具调用中的“实体绑定”失效:模型虽然能生成看似合理的计划,却常把人名、对象、任务状态或工具返回结果错误关联,导致指代混乱、跨步骤信息串线和最终决策偏差。作者从这一类错误出发,分析其在检索、代码执行、工作流编排等场景中的表现,并指出问题不只是事实幻觉,而是智能体在“谁、什么、属于谁、当前处于何状态”上的结构性对齐失败。该研究对构建可靠 Agent、提升工具调用一致性与状态管理能力具有现实意义。

来源 arXiv 时间 2026-06-29 16:34:30 实体 Semantic Kernel AI 辅助整理
μFlow:利用平均图像提升深度伪造人脸检测器泛化能力

这篇论文聚焦深度伪造人脸检测在跨数据集、跨生成方法场景下泛化不足的问题。作者提出 μFlow 方法,将人脸样本的平均图像作为额外信息引入检测流程,用以强化模型对身份、光照和内容偏差的鲁棒性,从而更关注伪造痕迹而非数据集特有特征。该思路旨在缓解当前检测器在训练集上表现良好、但面对新型 deepfake 技术时性能迅速下降的现象。实验表明,结合平均图像后,模型在多个评测设置中展现出更稳定的泛化能力,说明“平均表征”可作为一种轻量且有效的先验,帮助深伪检测器学习更具迁移性的判别特征。

来源 arXiv 时间 2026-06-29 16:31:57 实体 Semantic Kernel AI 辅助整理
ITSPACE:单调高斯最优传输更新方法

这篇论文提出 ITSPACE,一种面向高斯分布的单调最优传输更新框架,用于在分布逐步演化时高效计算新的映射与参数更新。作者围绕高斯最优传输的结构性质,设计了保持单调性的增量式更新规则,使得每次迭代无需从头求解完整 OT 问题,就能稳定追踪目标分布变化。该方法兼顾理论可解释性与计算效率,适合分布自适应、在线学习和连续优化等场景。论文还分析了更新过程中的稳定性与误差传播,为高维概率建模中的可扩展 OT 算法提供了新思路。

来源 arXiv 时间 2026-06-29 16:29:19 AI 辅助整理
面向视觉量子强化学习的分阶段混合方法:基于知识蒸馏

本文提出一种用于视觉量子强化学习的分阶段混合化训练框架,核心思路是先利用经典模型或经典-量子协同方式完成稳定表征学习,再通过知识蒸馏将能力迁移到更紧凑的量子强化学习策略中。该方法针对量子电路训练难、噪声敏感以及直接端到端优化不稳定等问题,设计了循序渐进的训练流程,以提升在视觉输入场景下的样本效率与收敛稳定性。论文关注如何把经典感知模块的表示优势与量子策略网络的表达能力结合起来,为量子机器学习在复杂感知任务中的落地提供了可操作路径。

来源 arXiv 时间 2026-06-29 16:28:57 AI 辅助整理
面向异构知识冲突的稳健RAG:基于状态感知的同伴专长分工

这篇论文聚焦检索增强生成(RAG)在多源知识互相矛盾时的稳定性问题。作者指出,现实应用中检索到的文档往往并不一致,甚至会因领域差异、时间滞后或来源偏差而产生冲突,导致大模型在回答时出现误判。为此,论文提出一种“状态感知的同伴专长分工”机制:系统会先识别当前检索环境所处的冲突状态,再动态选择更擅长处理相应知识分布的“同伴”模块参与推理与生成,从而降低噪声检索对答案的干扰。该方法强调在不同冲突情境下进行适配,而不是用单一固定策略处理所有输入,目标是在复杂异构知识场景中提升RAG的鲁棒性与回答可靠性。

来源 arXiv 时间 2026-06-29 16:25:13 AI 辅助整理
神经流形中的信息挫折:香农瓶颈与可学习性的边界

本文围绕神经网络在低维流形上学习时的信息传递问题展开,讨论“信息挫折”如何在表示压缩、噪声与结构约束共同作用下形成香农意义上的瓶颈。作者从神经流形的几何与信息论视角出发,分析模型可获取、保留并利用的数据有效信息上限,指出某些任务即使在参数规模扩大或训练更充分的情况下,仍可能因信息通道受限而难以学到稳定解。该工作为理解大模型与深度网络的可学习性边界、表示退化以及泛化失败提供了理论框架。

来源 arXiv 时间 2026-06-29 16:20:02 AI 辅助整理