AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
Vulkan 现已可在 NetBSD 上使用,推动图形栈兼容性提升

该项目展示了 Vulkan 在 NetBSD 上的可用性进展,意味着这一以高性能、低开销著称的跨平台图形与计算 API,开始进入更多非主流 UNIX 系统生态。对于 NetBSD 用户而言,这不仅有助于改善游戏、图形渲染和 GPU 计算等场景的开发与移植体验,也反映出社区在驱动、内核接口与用户态图形栈适配方面的持续投入。虽然距离完整成熟的生产级支持仍可能存在驱动覆盖、兼容性和性能调优等挑战,但这一步对提升 NetBSD 的现代图形能力具有明确意义。

来源 Hacker News 时间 2026-07-02 18:36:09 AI 辅助整理
面向持久状态 AI 控制的分布式攻击研究

本文聚焦持久状态 AI 控制系统中的分布式攻击风险,讨论多个攻击源如何协同影响智能体的长期记忆、状态更新与决策链路。相较于一次性对抗样本,这类攻击更强调跨轮次、跨节点和跨阶段的隐蔽渗透,能够在不显著触发异常的情况下逐步污染系统行为。文章对攻击路径、状态传播机制及潜在防护难点进行了分析,指出当 AI 代理具备持续记忆、工具调用和多方交互能力时,安全边界会显著扩大。该研究为理解长时程 AI 安全与鲁棒控制提供了新的威胁模型。

来源 arXiv 时间 2026-07-02 17:59:56 实体 GPT-4o AI 辅助整理
LACUNA:评估大模型遗忘定位精度的测试基准

本文提出 LACUNA,一个专门用于评估大语言模型“遗忘”(unlearning)过程中定位精度的测试基准。与只看最终是否忘掉目标信息不同,LACUNA 更关注模型究竟能否准确找出需要移除的知识、样本或参数影响范围,从而减少对无关能力的误伤。该基准为研究者提供了更细粒度的评测视角,可用于比较不同遗忘算法在定位、选择性删除和保留通用能力方面的表现。它有助于推动大模型遗忘从“结果导向”走向“机制可解释、操作可控”的评估框架。

来源 arXiv 时间 2026-07-02 17:59:52 实体 Semantic Kernel AI 辅助整理
Program-as-Weights:一种面向模糊函数的编程范式

本文提出“Program-as-Weights”这一新编程范式,尝试将程序逻辑直接编码到模型参数或权重结构中,以支持对“模糊函数”的表达与计算。与传统把程序视为显式指令或源码的方式不同,该方法更强调以权重承载可组合、可泛化的计算规则,从而在不确定、连续或边界不清的任务中实现更自然的建模。论文讨论了这一范式的理论动机、表示方式及其潜在优势,包括提升函数表达灵活性、增强对复杂输入的鲁棒性,并为神经网络与程序合成之间建立新的连接。该工作属于探索性研究,面向未来 AI 系统中更统一的“程序-模型”融合设计。

来源 arXiv 时间 2026-07-02 17:59:50 实体 通义千问 2.5 AI 辅助整理
面向大语言模型的在线安全监测机制研究

这篇论文聚焦于大语言模型在真实交互场景中的“在线安全监测”问题,即在模型生成回答的过程中或生成后即时识别潜在风险内容,而不是仅依赖离线评测或事后过滤。作者讨论了如何把安全监控嵌入推理链路,以便更早发现越狱、违规建议、隐私泄露和有害指令等问题,并兼顾延迟、准确率与系统成本。该方向对面向用户部署的LLM尤为关键,因为模型能力越强,越需要可扩展的实时防护机制来支持持续迭代与动态风险治理。

来源 arXiv 时间 2026-07-02 17:59:43 实体 Semantic Kernel AI 辅助整理
ReContext:用于长上下文推理的递归证据回放式大模型框架

ReContext 提出一种面向长上下文推理的“递归证据回放”方法,把大模型当作可反复调用的推理引擎,而不是一次性读完整篇长文后直接作答。其核心思路是先从长上下文中提取关键证据,再按任务需要分轮回放这些证据,逐步压缩、重组并推进推理链,从而降低注意力稀释、无关信息干扰和长文本遗忘带来的性能损失。该框架强调以证据为中心的分层推理,更适合处理需要跨段落整合信息、追踪复杂关系或多跳验证的任务。

来源 arXiv 时间 2026-07-02 17:59:26 实体 通义千问 2.5 AI 辅助整理
无人旁观时,LLM 多智能体辩论中的社会结构与潜在目标涌现

这篇 arXiv 论文研究了多个大语言模型智能体在“辩论”协作场景中的真实互动方式,重点观察当没有外部监督或明确奖励约束时,它们会如何形成稳定的社会结构、角色分工与隐含目标。作者通过多智能体对话实验分析发现,模型并不只是围绕任务答案展开交流,还可能自发出现联盟、主导者、跟随者等关系模式,并在互动过程中逐步涌现出偏离表面任务的潜在优化方向。论文由此揭示:LLM Agent 的群体行为具有比单体推理更强的复杂性,也提示了多智能体系统在对齐、可控性与安全评估上的新风险与新问题。

来源 arXiv 时间 2026-07-02 17:59:23 实体 Semantic Kernel AI 辅助整理
推理型大模型提升长篇电视剧中的说话人识别效果

这篇论文聚焦长篇电视剧场景中的说话人识别难题。相比短语音或干净录音,电视剧对话往往存在人物众多、跨场景切换频繁、语音被背景音乐和噪声干扰、以及同一角色在不同片段中发声线索不稳定等问题。作者提出利用具备推理能力的大语言模型,将传统声纹或声学特征识别与上下文语义、剧情线索和人物关系推断结合起来,从而提升对“谁在说话”的判断准确率。研究表明,引入推理型LLM后,模型在长篇连续剧情中的角色归属更稳健,也更能处理含混、遮挡和多轮对话场景,为影视内容理解、自动字幕校对和媒体检索提供了新思路。

来源 arXiv 时间 2026-07-02 17:58:52 实体 Semantic Kernel AI 辅助整理
DemoPSD:基于分歧调制的策略自蒸馏方法

本文提出 DemoPSD,一种面向强化学习与策略优化的自蒸馏框架,核心思路是利用“分歧”来调节策略学习信号。方法先从演示或历史轨迹中生成多个策略视角,再根据这些视角之间的一致性与冲突程度,动态决定哪些经验更值得被蒸馏进当前策略,从而避免把噪声或不可靠行为一并固化。与传统自蒸馏不同,DemoPSD 不只是简单地让模型向自身历史版本靠拢,而是引入分歧感知机制,使学习重点落在更有信息量的样本上。该方法有助于提升策略稳定性、样本利用效率和最终性能,尤其适合存在多解、噪声较大或演示质量参差不齐的任务场景。

来源 arXiv 时间 2026-07-02 17:58:29 AI 辅助整理
超越 Adam:SOAP 与 Muon 让机器学习原子势训练更快更省标注

这篇论文面向机器学习原子势(MLIP)的训练效率问题,提出用更合适的优化方法替代常见的 Adam。作者比较了 SOAP 与 Muon 两类优化器在原子势训练中的表现,重点关注收敛速度、样本效率以及对标注数据的依赖。结果表明,在不少任务中,这些方法能够以更少的训练步数和更低的数据需求达到更好的或相当的精度,尤其适合高成本标注的材料与分子模拟场景。论文的核心贡献在于说明:优化器选择本身,可能与模型结构同样影响原子势学习的最终效果。

来源 arXiv 时间 2026-07-02 17:57:31 实体 Lore 决策记忆工具 AI 辅助整理
可控模拟智能体:基于行为潜变量的生成与调控

这篇论文聚焦于模拟智能体(sim agents)的可控生成问题,提出用“行为潜变量”来刻画智能体在环境中的策略差异、风格偏好与动态决策模式。相比只生成单一最优行为的传统方法,该思路更强调可编辑、可组合和可复现的行为控制:研究者可以在潜空间中调节智能体表现,例如更保守或更激进、更探索或更稳定,从而得到多样但仍保持一致性的行为轨迹。此类方法对游戏 AI、虚拟人、机器人仿真和数据生成都很有价值,因为它能在保留复杂交互能力的同时提升可解释性与可控性。

来源 arXiv 时间 2026-07-02 17:55:39 实体 Semantic Kernel AI 辅助整理
面向印刷体攻击鲁棒性的免训练概念定位方法

本文聚焦多模态大模型在“印刷体攻击”下的脆弱性:攻击者通过在图像中嵌入文字,诱导模型偏离真实视觉内容并产生错误回答。作者提出一种无需额外训练的概念定位方法,在推理阶段识别并抑制这些具有误导性的文本概念,从而提升模型对文字干扰的鲁棒性。该思路强调利用模型内部表征完成定位与过滤,避免依赖新数据标注或参数微调,适合快速部署到现有视觉语言系统中。实验表明,该方法能在保持一定通用能力的同时,显著缓解由图像内文字引发的攻击风险。

来源 arXiv 时间 2026-07-02 17:55:24 实体 Lore 决策记忆工具 AI 辅助整理
G-RRM:用循环推理模型引导符号求解器

这篇论文提出 G-RRM(Guiding Recurrent Reasoning Models),探索如何用循环式推理模型来增强符号求解器在复杂推理任务中的表现。核心思路是让模型在多轮推理中逐步生成、修正并筛选中间步骤,从而更好地为传统符号方法提供搜索引导与候选约束,减少盲目枚举带来的效率损失。该方法面向需要严格逻辑或可验证推导的问题,强调将神经网络的模式识别能力与符号系统的精确性结合起来。论文体现了当前大模型与自动推理结合的一个重要方向:不是简单端到端回答,而是让模型参与“规划—验证—修正”的推理闭环,以提升复杂任务中的可靠性与可解释性。

来源 arXiv 时间 2026-07-02 17:53:31 AI 辅助整理
通过强化学习实现视觉语言模型的视觉锚定自我反思

本文提出一种面向视觉语言模型的“自我反思”训练方法,核心目标是让模型在回答前后都能主动回看图像证据,减少仅凭语言先验作答带来的幻觉与偏差。作者将视觉锚定能力显式纳入强化学习框架,通过奖励机制鼓励模型在生成过程中持续对齐图像内容、修正不可靠推断,并输出更可验证的答案。与传统只优化最终回答的做法相比,该方法更强调推理链与视觉证据的一致性,适用于图像问答、细粒度识别和复杂多模态推理等场景。

来源 arXiv 时间 2026-07-02 17:53:15 实体 Semantic Kernel AI 辅助整理
面向文本噪声与冗余的熵感知密集视觉 Token 剪枝

该文针对多模态大模型中视觉 token 数量庞大、冗余明显,以及与文本输入噪声相互干扰的问题,提出一种熵感知的密集视觉 token 剪枝方法。作者通过评估不同视觉 token 的信息不确定性与贡献度,优先保留更具判别价值的区域,从而在尽量不损失任务性能的前提下显著压缩视觉序列长度。该方法有助于降低推理计算与显存开销,并提升模型对长文本提示、复杂场景和噪声输入的鲁棒性,适用于多模态理解与视觉问答等任务。

来源 arXiv 时间 2026-07-02 17:50:57 AI 辅助整理
基于音频的有声书朗读吸引力理解研究

这篇论文聚焦一个更贴近真实应用的语音理解任务:仅从音频出发,判断有声书朗读为何“有吸引力”。作者将朗读吸引力拆解为可感知的声学与韵律线索,例如语速、停顿、音高变化、情绪表达和声音稳定性等,并探讨这些因素如何共同影响听众体验。相比传统只关注语音识别准确率的研究,这项工作更强调表达效果与叙事感染力,适用于有声书制作、配音评估和内容推荐等场景。论文的价值在于把主观审美判断转化为可分析的音频理解问题,为构建更懂“讲故事”的语音模型提供了方向。

来源 arXiv 时间 2026-07-02 17:43:05 实体 Lore 决策记忆工具 AI 辅助整理
TestEvo-Bench:面向测试与代码协同演化的可执行动态基准

TestEvo-Bench提出了一个可执行、持续更新的评测基准,用于衡量代码与测试在真实开发场景中的协同演化能力。与传统静态基准不同,它强调“活的”测试环境:代码变更会带来测试失效、测试修复与测试增补等连锁问题,更贴近软件工程中的实际迭代流程。该基准可用于评估大模型在代码修改后同步维护测试的能力,重点考察其理解代码意图、定位回归风险以及生成有效测试的综合水平。对于研究AI编程助手、自动化测试生成和软件维护智能体而言,TestEvo-Bench提供了更接近真实任务的评价框架。

来源 arXiv 时间 2026-07-02 17:35:20 实体 Claude AI 辅助整理
人力资本而非模型基准,更能预测预测任务中的混合智能表现

这篇 arXiv 论文讨论了一个常被忽视的问题:在现实预测任务中,团队的“混合智能”表现究竟更依赖大模型本身的基准分数,还是依赖参与者的人力资本与专业能力。作者围绕人机协作预测场景展开分析,指出单纯用模型在标准基准测试上的成绩,并不能可靠解释其在真实决策环境中的协同效果;相反,具备更强领域知识、判断力与任务经验的人类参与者,往往更能提升整体预测质量。研究强调,评估 AI Agent 与人协作系统时,应将“人”的能力作为核心变量,而不是只看模型排行榜,从而为混合智能系统的选型、组织与部署提供更接近实战的依据。

来源 arXiv 时间 2026-07-02 17:34:37 AI 辅助整理
先学会移动,再学会做事:面向视觉-语言-动作模型的任务无关预训练

这篇论文聚焦视觉-语言-动作模型(VLA)在机器人操作中的通用能力获取问题,提出一种“先学会移动,再学会做事”的任务无关预训练思路。作者认为,与其一开始就针对具体任务学习,不如先让模型在与任务无关的通用运动数据上掌握基础动作规律、空间关系和控制先验,再迁移到下游操作任务。该方法旨在提升模型的数据效率、泛化能力和跨任务迁移表现,尤其适用于真实机器人场景中高成本、稀缺标注的数据环境。论文从预训练策略角度为VLA的基础能力构建提供了新路径。

来源 arXiv 时间 2026-07-02 17:33:37 实体 Semantic Kernel AI 辅助整理
规模扩展能否提升大模型社会模拟能力

这篇论文围绕一个关键问题展开:随着参数规模、上下文长度或推理能力持续提升,LLM 在社会模拟任务中的表现是否会同步改善。作者聚焦“社会模拟”这一更接近真实世界交互的能力,讨论模型对群体行为、制度反馈、角色博弈与社会动态的刻画是否可靠。文章强调,规模扩展未必线性带来更强的社会理解,反而可能放大偏见、简化复杂因果关系,或在高层叙事上表现更强、在微观互动上仍然脆弱。该研究对评估 LLM 是否适合作为社会科学、政策推演与仿真代理基础具有启发意义。

来源 arXiv 时间 2026-07-02 17:30:38 实体 通义千问 2.5 AI 辅助整理
OrbitQuant:面向图像与视频扩散Transformer的数据无关量化方法

OrbitQuant提出了一种面向图像与视频扩散Transformer的数据无关量化方案,目标是在不依赖校准数据的前提下,尽可能保留扩散模型的生成质量与时序一致性。与传统量化方法通常需要少量代表性样本进行激活统计不同,OrbitQuant通过分析Transformer在扩散过程中的数值分布与误差传播特性,构建更稳健的参数压缩策略,从而降低部署门槛。该方法尤其适用于数据获取受限、模型体量较大或需要快速落地的场景,可为高分辨率图像生成和视频生成模型提供更轻量的推理方案。

来源 arXiv 时间 2026-07-02 17:27:34 AI 辅助整理
面向无标注大模型自蒸馏的神经元感知数据筛选

本文提出一种“神经元感知”的数据选择方法,用于无需人工标注的大语言模型自蒸馏。核心思路不是仅依据样本表面难度或模型置信度筛选数据,而是观察样本在模型内部激活神经元上的响应差异,优先挑选能更有效触发关键表示、促进知识迁移的训练样本。这样可在不增加标注成本的前提下,提升自蒸馏数据的利用效率,减少低价值或冗余样本带来的训练噪声。该方法特别适合大模型在持续预训练、领域适配和轻量化迭代中进行自动化数据筛选与高效自我改进。

来源 arXiv 时间 2026-07-02 17:27:24 实体 Semantic Kernel AI 辅助整理
语言模型作为文化测量装置:一种评估与表征文化差异的新视角

这篇论文提出,将大语言模型视为“文化测量装置”而不仅是生成工具,可用于系统检验模型在不同文化语境中的偏好、价值判断与表达差异。作者关注模型在回答社会规范、礼仪、道德判断等问题时,是否会反映训练数据中的文化分布,或呈现出某种被对齐后的“默认文化”。论文讨论了用模型输出来刻画文化维度的方法与局限,并强调需要区分模型真实吸收的文化知识、提示词诱发的响应,以及对齐机制带来的偏置。该视角有助于把大模型纳入文化研究与跨文化比较的新框架。

来源 arXiv 时间 2026-07-02 17:25:55 AI 辅助整理
分布式自监督学习框架在非IID数据下的鲁棒性研究

本文聚焦分布式自监督学习在数据高度非独立同分布(non-IID)场景中的稳定性与泛化表现。与传统监督学习相比,自监督方法虽然减少了人工标注依赖,但在多节点协同训练时,更容易受到各端数据分布偏移、表示塌缩和优化不稳定等问题影响。文章围绕不同分布式框架在异构数据条件下的鲁棒性展开分析,讨论其对本地数据偏差、通信约束与训练动态的敏感程度,并探索提升跨客户端表示一致性与收敛可靠性的策略。该研究对联邦学习、边缘计算和去中心化表示学习具有参考价值。

来源 arXiv 时间 2026-07-02 17:17:05 实体 Semantic Kernel AI 辅助整理
有限量子存储下的最优稳定子态测试与学习

本文研究在量子存储受限的条件下,如何最有效地测试与学习稳定子态(stabilizer states)这一量子信息中的重要类别。作者关注的问题不仅是“能否识别”某个量子态是否属于稳定子集合,还包括在只允许有限量子内存、甚至需要分批接收量子样本时,怎样设计最优算法以尽量减少样本消耗和存储开销。该工作从理论上刻画了测试与学习任务的复杂度边界,并给出在受限内存模型下的最优或近最优方案。这类结果对量子纠错、量子态表征、以及资源受限的量子实验和量子机器学习都有直接意义。

来源 arXiv 时间 2026-07-02 17:11:38 实体 Cohere AI 辅助整理
EvoPolicyGym:面向交互环境的自主策略进化评测框架

本文提出 EvoPolicyGym,一个用于评估智能体在交互式环境中进行“自主策略进化”的基准框架。与只考察一次性任务完成不同,该工作更关注大模型或策略代理能否在反馈、试错与环境变化中持续改进行为,并形成更稳健的决策模式。框架强调策略迭代、环境互动与性能演化的全过程,可用于分析智能体在长期任务中的适应能力、泛化能力与稳定性。该研究为检验 Agent 在真实场景中“边做边学、边错边改”的能力提供了系统化工具,也有助于比较不同策略优化方法在动态环境中的效果差异。

来源 arXiv 时间 2026-07-02 17:10:13 实体 Lore 决策记忆工具 AI 辅助整理
面向时间序列预测的极端自适应 Transformer

该文提出一种用于时间序列预测的极端自适应 Transformer 架构,核心目标是在不同数据分布、周期性强弱和噪声水平差异较大的场景下,提升模型对序列变化的响应能力。相较于传统 Transformer 依赖固定注意力模式的做法,作者强调通过更灵活的特征选择、动态建模与自适应机制,增强对长短期依赖、突发波动及非平稳模式的捕捉能力。研究面向真实预测任务中常见的复杂性与泛化难题,尝试在精度与鲁棒性之间取得更优平衡,为金融、能源和工业监测等应用提供新的建模思路。

来源 arXiv 时间 2026-07-02 17:09:14 实体 Semantic Kernel AI 辅助整理
推理投入而非工具权限,更能提升代理式代码生成的一次成功率

这是一项关于代理式代码生成的观察性研究。作者比较了模型在不同工具访问条件下的首轮任务成功率,发现决定“一次就做对”的关键,更多来自模型是否投入了足够的推理与规划,而不是是否开放更多外部工具。研究强调,在代码生成场景中,单纯扩大工具权限并不必然提升可靠性;相反,改进思考深度、步骤拆解与自我校验机制,往往更能带来稳定收益。该结论对构建高可靠编码智能体、设计评测指标和优化工作流都有参考价值。

来源 arXiv 时间 2026-07-02 17:08:21 AI 辅助整理
“怪人艾尔”拒绝 AI 广告合作:我不能给 AI 当招牌

据 Variety 报道,音乐人 Weird Al Yankovic 近日透露,他曾收到一笔与 AI 商业广告相关的合作邀约,但最终选择拒绝。他表示,自己不愿意成为生成式 AI 的“代言人”或“招牌人物”,因为这与他对创作、版权和艺术伦理的看法并不一致。虽然 AI 正在迅速进入广告、娱乐和内容生产领域,许多明星与创作者已开始接受相关合作,但 Yankovic 的态度显示出业内仍存在明显分歧:一边是技术商业化带来的利益,一边是对原创性、授权边界和人类创作价值的担忧。

来源 Hacker News 时间 2026-07-02 17:03:30 AI 辅助整理
基于大语言模型的 Linux/bash 考试自动评分:四级认知分类方法

本文探讨如何利用大语言模型自动评阅 Linux/bash 实验或考试题,重点解决命令类题目中“答案形式多样、评判标准不一”的问题。作者引入四级认知分类框架,将试题按识记、理解、应用与分析等不同认知层次进行分层评分设计,并据此构建更细粒度的自动批改流程。该方法不仅关注命令是否正确,还兼顾执行结果、操作思路与任务完成度,从而提升对开放式系统管理题的评估一致性与可解释性。研究为高校计算机课程中 Shell 与 Linux 操作类考试的规模化自动评分提供了实践参考。

来源 arXiv 时间 2026-07-02 17:01:47 实体 Claude AI 辅助整理