AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
用于组合优化问题的神经证书定价方法

本文研究组合优化中的“证书定价”问题,即如何为可验证的解质量证明分配合理价格,从而支持更高效的求解、验证与决策流程。作者提出一种基于神经网络的定价框架,将优化实例的结构信息编码进模型,学习不同证书在不同问题场景下的边际价值。该方法面向典型组合优化任务,强调在保证可验证性的同时提升对复杂实例的适应能力。与传统依赖人工规则或静态启发式的方式相比,神经证书定价能够更细粒度地反映实例难度与解的质量差异,为近似求解、算法评测以及下游自动化决策提供新的工具。

来源 arXiv 时间 2026-07-01 17:17:55 AI 辅助整理
以可验证奖励与人类示范训练语言模型的新方法

本文探讨如何在语言模型训练中同时利用可验证奖励和人类示范,提升模型对“正确答案”与“正确方式”的双重对齐能力。作者强调,单纯追求结果正确并不足以保证生成过程可靠、可解释或符合人类偏好;而引入可验证奖励后,模型能够在有明确判定标准的任务上获得更稳定的训练信号,再结合高质量人类示范,进一步学习更自然、更符合规范的推理与表达方式。该研究面向大模型对齐、强化学习与监督微调的交叉场景,旨在减少训练噪声、提升泛化表现,并为构建更可信的智能体提供方法参考。

来源 arXiv 时间 2026-07-01 17:13:35 实体 Semantic Kernel AI 辅助整理
QuasiMoTTo:基于准蒙特卡洛的测试时扩展方法

QuasiMoTTo提出一种面向大模型推理阶段的测试时扩展思路,将准蒙特卡洛采样引入生成与搜索过程,以更低方差、更均匀的采样覆盖提升答案质量。相较于依赖随机多次采样的传统做法,该方法强调在固定计算预算下提高推理效率与结果稳定性,适用于需要多步思考、候选重排和答案聚合的任务。论文关注测试时扩展这一近年受到重视的方向,即通过增加推理阶段计算而非重新训练模型,进一步挖掘模型能力。

来源 arXiv 时间 2026-07-01 17:10:08 实体 Lore 决策记忆工具 AI 辅助整理
面向决策优化的样本生成模型训练方法

这篇论文讨论的是“生成得像”与“生成得有用”之间的差异。作者指出,许多基于样本的生成模型主要以拟合数据分布为目标,但在实际应用中,模型输出往往要服务于下游决策,例如推荐、调度、控制或风险评估。为此,论文提出一种决策感知训练思路,将最终决策效果纳入训练目标,而不是只优化传统的似然或重建误差。这样做的核心收益是:生成样本不一定在统计意义上最逼真,但能更好地支持后续任务的性能提升。该工作对生成模型在运筹优化、机器学习决策系统和任务导向生成等场景具有启发意义。

来源 arXiv 时间 2026-07-01 17:02:23 实体 Semantic Kernel AI 辅助整理
Diffusion-GR2:用于重排序的扩散式生成推理框架

Diffusion-GR2 提出一种面向重排序任务的扩散式生成推理方法,将候选结果选择从传统的判别式打分,转向在多步去噪过程中逐渐逼近更优答案。该框架把“推理”和“重排”统一到生成式建模中,通过扩散过程显式利用上下文与候选之间的关系,提升对复杂语义、长程依赖和歧义样本的辨别能力。相比单次前向打分,Diffusion-GR2 更强调迭代修正与全局一致性,适用于需要精细排序或高质量候选筛选的场景,体现了生成式模型在检索后重排中的新潜力。

来源 arXiv 时间 2026-07-01 17:02:20 实体 Semantic Kernel AI 辅助整理
Show HN:用对比式语言-音频预训练识别机械故障

这是一个用 Contrastive Language-Audio Pretraining(CLAP,对比式语言-音频预训练)来做机械故障分类的项目,目标是把设备运转时采集到的声音转化为可识别的故障信号。项目思路借鉴了多模态表示学习:先让模型理解“正常”“异响”“摩擦”“松动”等描述与音频之间的对应关系,再用于诊断汽车等机械系统的异常状态。相比传统依赖人工特征或纯监督分类的方法,这类方案更适合从少量标注样本中迁移学习,也便于扩展到其他设备的声学健康监测场景。

来源 Hacker News 时间 2026-07-01 16:57:20 AI 辅助整理
基于可学习三维高斯表示的结构化与非结构化体数据高效压缩

本文提出一种面向结构化与非结构化体数据的压缩方法,核心是用可学习的三维高斯表示来替代传统体素存储。该表示能够以较少参数刻画体数据中的空间分布与局部细节,在保证重建质量的同时显著降低存储开销。相较于直接保存密集体素或依赖固定网格的方案,这种方法对不同形态的数据更具适应性,尤其适合医学影像、科学可视化和三维内容传输等场景。文章重点讨论了表示学习、压缩效率与重建精度之间的权衡。

来源 arXiv 时间 2026-07-01 16:48:46 AI 辅助整理
伊比利亚语言跨语种说话人验证中的说话人与语言效应解耦

本文聚焦跨语种说话人验证中一个常被混淆的问题:模型究竟是在识别说话人身份,还是在利用语言差异做判断。以伊比利亚语言为研究对象,作者分析了说话人特征与语言特征在验证任务中的耦合关系,并尝试将二者影响分离,以更准确评估系统在真实跨语种场景下的泛化能力。研究结果有助于揭示当前语音嵌入与验证模型的偏差来源,为构建对语言变化更稳健、对说话人更敏感的跨语种声纹系统提供方法参考。

来源 arXiv 时间 2026-07-01 16:44:19 AI 辅助整理
面向 AI 安全评测的对抗语用学基准

这篇论文提出一个用于 AI 安全评测的新基准,聚焦于模型在真实对话中容易出错的语用场景:指令冲突、嵌入式命令以及策略边界模糊。作者希望通过“对抗语用学”方法,系统检验模型是否能够识别多层意图、区分主次指令,并在含混上下文中保持安全一致的行为。与传统只看显性违规的测试不同,该基准更强调语境理解、隐含命令解析和策略鲁棒性,可用于衡量大模型在复杂交互中的安全可靠程度。

来源 arXiv 时间 2026-07-01 16:33:14 实体 Semantic Kernel AI 辅助整理
AGC-Bench:面向通用人工创造力的评测基准

AGC-Bench 提出了一套用于衡量“人工通用创造力”(Artificial General Creativity)的评测基准,试图超越传统只看单点任务表现的方式,系统考察模型在新颖性、适应性、跨领域迁移与持续生成能力上的综合创造水平。该工作关注大模型在开放式创作场景中的真实能力差异,强调创造力不仅是产出“像样”的内容,更要能在未知约束下提出独特且有价值的方案。论文通过构建多样化任务与评价维度,为后续研究提供可复用的测试框架,也为理解 AI 创造力的边界与提升路径提供了实验依据。

来源 arXiv 时间 2026-07-01 16:31:11 实体 通义千问 2.5 AI 辅助整理
基于分层JEPA的轻量级自监督多变量时间序列学习框架:ECG应用

本文提出一种面向多变量时间序列的轻量级自监督学习框架,核心方法是分层 JEPA(Joint-Embedding Predictive Architecture)。该框架针对 ECG 心电数据构建多尺度表征,通过在不同时间粒度上预测潜在表示,学习时序结构与跨通道依赖,而无需大量人工标注。与传统对比学习或监督方法相比,该方案更强调表示学习的效率与可迁移性,适合医疗场景中标注稀缺、数据噪声较强的任务。研究表明,分层设计有助于捕捉心电信号的局部波形和全局节律特征,为后续分类、异常检测和下游诊断提供更稳健的特征基础。

来源 arXiv 时间 2026-07-01 16:27:21 实体 Semantic Kernel AI 辅助整理
面向在线反馈搜索的顺序控制交互式多粒子流映射

本文提出一种用于在线反馈驱动搜索的新型多粒子流映射方法,将搜索过程建模为多个粒子在连续空间中的协同演化。方法强调“顺序控制”和“交互式”机制:系统可根据外部反馈逐步调整粒子流向,并通过粒子之间的信息交互提升探索效率与收敛稳定性。相较于传统一次性优化或静态采样策略,该框架更适合需要边搜索、边评估、边修正的场景,如交互式设计、主动学习和人机协同优化。文章核心贡献在于把反馈闭环显式嵌入流式搜索过程,从而在复杂目标空间中实现更灵活的导航与更强的自适应能力。

来源 arXiv 时间 2026-07-01 16:27:17 实体 Semantic Kernel AI 辅助整理
技能并非孤岛:评估智能体技能供应链中的依赖与风险

这篇论文把智能体能力拆解为可组合的“技能”,并进一步把这些技能看作相互依赖的供应链环节,而不是彼此孤立的功能模块。作者关注的核心问题是:当一个 Agent 的关键技能依赖于其他技能、工具或外部模型时,系统会在什么位置形成脆弱点,以及这些依赖如何放大失效、延迟与安全风险。论文提出一套衡量依赖关系与风险暴露的方法,用于识别技能链条中的关键节点、级联故障路径和高风险组合。该研究为构建更可靠、可审计、可治理的多智能体与工具调用系统提供了分析框架。

来源 arXiv 时间 2026-07-01 16:21:49 实体 Lore 决策记忆工具 AI 辅助整理
通过迭代元反思实现自主科学发现

这篇论文探讨了让大模型代理在科学研究中具备“自我校正”能力的方法:系统并非一次性生成答案,而是在每轮实验、推理或假设检验后,利用元反思机制回顾自身表现,识别错误、修正策略并继续迭代。作者关注的是如何把科学发现流程拆解为可循环的代理工作流,使模型能够在信息不足、结论不稳定的场景下逐步逼近更可靠的假设与解释。该方向与AI for Science、自动化研究助手和自主Agent框架密切相关,强调通过反思来提升探索效率、减少幻觉并增强发现过程的可控性。

来源 arXiv 时间 2026-07-01 16:16:07 实体 Lore 决策记忆工具 AI 辅助整理
GAIA:面向正反问题的几何自适应算子学习方法

GAIA提出一种面向偏微分方程等科学计算任务的算子学习框架,重点解决复杂几何条件下前向预测与反问题求解的统一建模。与传统方法往往依赖规则网格或固定域不同,GAIA通过几何自适应机制显式融入边界形状、空间分布与观测条件,使模型能够在不同几何配置间更稳健地泛化。该方法既可用于从初始/边界条件推断系统响应,也可用于由观测结果反演未知参数或源项,适合流体、材料和多物理场等场景。

来源 arXiv 时间 2026-07-01 16:14:22 实体 Semantic Kernel AI 辅助整理
对数空间量化:在对数域中压缩语言模型

本文提出 Log_bQuant,一种面向语言模型的对数空间量化方法。与传统在原始数值域中进行均匀或非均匀量化不同,该方法先将权重或激活映射到对数域,再进行离散化,从而更贴合神经网络参数跨数量级分布的特点,尤其适合长尾、稀疏和尺度差异显著的张量。论文重点讨论了这种表示方式在压缩率、数值稳定性与推理精度之间的权衡,并分析其在大模型推理场景中的实现可行性。该工作为低比特量化提供了一条不同于常规整数化的思路,也有望降低大语言模型部署时的存储与计算成本。

来源 arXiv 时间 2026-07-01 16:13:03 AI 辅助整理
ZO-Act:基于激活信息的一次性低秩子空间高效零阶微调

这篇论文提出 ZO-Act,一种面向大模型微调的高效零阶优化方法。它通过一次前向扫描收集激活统计信息,自动构建与任务相关的低秩子空间,再在该子空间中进行零阶更新,从而显著降低传统零阶训练的采样开销与计算负担。相比直接在全参数空间做扰动搜索,ZO-Act 更能聚焦于对任务最敏感的参数方向,提升优化稳定性与样本效率。该方法特别适合显存受限、无法使用反向传播或需要快速适配的新任务场景,也为大模型轻量化微调提供了新的实用路径。

来源 arXiv 时间 2026-07-01 16:12:50 AI 辅助整理
Muon 作为残差连接:理解与训练大模型的新视角

这篇工作从优化与网络结构的角度重新审视 Muon,并将其解释为一种“残差连接”式的更新机制。作者试图说明,Muon 并不只是单纯的优化器变体,而是在参数更新路径上引入了类似残差模块的稳定性与信息保留特征,从而改善深层模型训练中的梯度传播与收敛表现。文章围绕这一等价或近似等价视角展开分析,并讨论其对大模型训练、参数高效优化以及训练稳定性的启发。对于关注 LLM 训练方法、优化器设计和架构归纳偏置的读者,这项研究提供了一个把优化算法与网络结构统一理解的切入点。

来源 arXiv 时间 2026-07-01 16:12:24 AI 辅助整理
面向高校利益相关者的多模态聊天助手:基于RAG的方法探索

本文聚焦高校场景中的师生、行政人员与管理者等利益相关者,探讨如何构建一个支持文本与多模态信息交互的聊天助手。作者采用检索增强生成(RAG)框架,将校园相关知识接入大模型,以提升回答的准确性、时效性与可追溯性,并缓解通用模型在校内政策、流程和服务问答中的幻觉问题。文章强调多模态能力在高校应用中的价值,例如结合文档、图片或其他校园资源辅助理解与响应。该研究更偏向系统设计与原型探索,为高校智能问答、事务办理与信息服务平台的落地提供了实现思路。

来源 arXiv 时间 2026-07-01 16:03:03 AI 辅助整理
FAR:面向测试时恢复与持续策略提升的失败感知重试方法

本文提出 FAR(Failure-Aware Retry)框架,用于让智能体在测试阶段具备更强的自我恢复能力,并在持续交互中不断改进策略。不同于只依赖单次执行结果的方法,FAR 会显式识别任务失败信号,判断当前尝试为何失效,并据此触发更有针对性的重试与修正,从而提升复杂任务中的成功率与稳健性。该思路尤其适合具备多步规划、工具调用或环境交互的 Agent 场景,因为这类任务往往会因局部错误而导致整体失败。FAR 的核心价值在于把“失败”转化为可学习的反馈,不仅帮助模型在当次任务中完成恢复,也为后续策略更新提供经验累积,体现出测试时学习与持续优化的结合。

来源 arXiv 时间 2026-07-01 16:01:54 实体 Semantic Kernel AI 辅助整理
SynLaD:基于3D药效团条件的可合成分子潜空间扩散生成

本文提出SynLaD,一种面向药物发现的潜空间扩散生成框架,可在3D药效团轮廓约束下生成具有可合成性的分子。与直接在离散化学空间中采样不同,SynLaD将分子表示映射到潜在空间,再通过条件扩散逐步生成候选结构,从而更好地兼顾化学有效性、结构多样性与合成可行性。研究将三维药效团作为关键先验,用于引导模型生成与目标结合特征更匹配的分子骨架与官能团组合。该方法体现了生成式AI在先导化合物设计中的新趋势:把药效团约束、三维构象信息与可合成性联合建模,以提高命中率并降低后续合成筛选成本。

来源 arXiv 时间 2026-07-01 15:57:19 实体 Semantic Kernel AI 辅助整理
CausalMix:将数据混合作为语言模型训练中的因果推断

这篇论文提出 CausalMix 框架,将语言模型训练中的“数据混合”重新表述为一种因果推断问题。作者认为,不同数据源、质量与分布的组合并非简单叠加,而会通过因果路径影响模型学到的能力、泛化表现与训练稳定性。基于这一视角,CausalMix 试图刻画数据配比、采样策略和训练结果之间的因果关系,从而为数据配方设计提供更可解释的依据。相较于经验式调参,该方法强调识别哪些数据因素真正驱动性能提升,并减少由相关性误判带来的混合偏差。

来源 arXiv 时间 2026-07-01 15:56:11 实体 通义千问 2.5 AI 辅助整理
临床级一致性并不等于临床谨慎:大模型评测器在医疗基准中的局限

这篇 arXiv 论文讨论了在医疗 AI 基准评测中,使用大语言模型(LLM)充当“评委”或“裁判”时可能出现的误判风险。作者指出,LLM 评测器有时能与临床专家给出相近的一致性分数,但这种“看起来像专家”的结果并不意味着它具备同等的临床谨慎性,尤其在涉及诊断不确定性、风险边界和安全保守性时更明显。论文强调,若只依赖自动化评测,可能会高估模型的真实临床价值,掩盖其在高风险医疗场景中的缺陷。因此,研究呼吁在医疗 AI 基准中引入更严格的评测设计,将一致性、稳健性与安全性区分开来,并避免把 LLM 评分简单等同于临床判断。

来源 arXiv 时间 2026-07-01 15:55:31 AI 辅助整理
面向数据高效主动学习的群不变核心集方法

本文研究主动学习中的样本选择效率问题,聚焦于如何在标注预算有限时挑选最具代表性的未标注数据。作者将“群不变性”引入核心集构建:当数据存在旋转、平移、翻转等对称变换时,传统核心集往往忽略这些等价关系,导致冗余采样。该方法在选择少量样本的同时,尽量覆盖不同对称轨道上的信息,从而提升标注效率与模型泛化能力。论文从理论上分析了群不变核心集的性质,并给出可用于主动学习的构造思路,适用于具有明显结构先验的视觉与几何任务。

来源 arXiv 时间 2026-07-01 15:46:16 实体 Semantic Kernel AI 辅助整理
低成本代码,高代价判断:可治理代理式软件工程案例研究

本文以代理式软件工程为案例,讨论“写代码很便宜、做判断却很昂贵”的现实困境。随着大模型能够自动生成、修改和提交代码,软件开发的瓶颈正从编码能力转向需求澄清、风险评估、权限控制与结果验收等治理环节。文章重点关注可治理的 agentic software engineering:如何让自治代理在受控边界内协作,而不是在复杂工程场景中盲目扩张行动范围。该研究对当前 AI 编程代理的能力边界、审计要求与组织采用方式具有现实参考价值。

来源 arXiv 时间 2026-07-01 15:44:15 AI 辅助整理
Meta未能驳回多州指控:Facebook和Instagram成瘾化儿童

路透社报道,美国多州针对Meta的诉讼继续推进。法院拒绝了Meta要求驳回的动议,意味着各州关于Facebook和Instagram通过产品设计、推荐机制和通知策略诱导未成年人沉迷成瘾的指控仍可进入后续程序。原告认为,平台对青少年心理健康、注意力和使用时长的负面影响,已超出普通社交产品的范畴,构成对未成年人的不当吸引与风险放大。Meta则预计会继续主张其产品受言论与平台责任保护,且相关指控缺乏足够法律依据。此案是美国围绕社交媒体、青少年保护与平台责任边界的关键诉讼之一。

来源 Hacker News 时间 2026-07-01 15:40:56 AI 辅助整理
LongVQUBench:评测视觉语言模型的长时视频质量理解能力

LongVQUBench 是一个面向长时视频质量理解的新基准,用于系统评估视觉语言模型在长视频场景下对画质变化、失真类型、时序一致性以及整体观看体验的综合判断能力。与只关注单帧图像质量的传统数据集不同,该基准强调视频在较长时间跨度内可能出现的细微质量波动,更贴近真实应用中的视频审核、内容分析和生成式视频评估需求。论文通过构建具有挑战性的长视频样本与多维标注,考察模型是否能从时序上下文中准确捕捉质量问题,并给出可解释的判断结果。

来源 arXiv 时间 2026-07-01 15:40:42 AI 辅助整理
智能体能否泛化到开放世界?静态训练下工具使用的脆弱性

本文讨论大模型智能体在工具使用任务中是否真的具备“开放世界”泛化能力。作者指出,许多现有方法仍依赖静态训练数据与固定工具环境,一旦工具接口、参数分布或任务组合发生变化,智能体性能就会明显下滑,暴露出对训练分布的强依赖。文章从工具调用、环境变化与任务迁移三个角度分析这种脆弱性,并强调仅靠离线优化难以支撑真实场景中的持续适应。该研究为评估 Agent 的鲁棒性与泛化能力提供了更贴近实际的视角,也提示未来需要结合在线交互、动态更新与更强的任务抽象能力。

来源 arXiv 时间 2026-07-01 15:40:25 AI 辅助整理
异步RLHF中的陈旧度与学习率缩放规律

本文研究异步 RLHF 训练中的“参数陈旧度”问题,即采样数据所用策略与当前更新策略之间的时间差,会如何影响训练稳定性与最终性能。作者系统分析了陈旧度、学习率、更新步幅之间的耦合关系,并提出相应的缩放规律,用于指导异步强化学习在大模型对齐中的超参数设置。研究表明,只要合理控制学习率随陈旧度增长而衰减,异步训练仍可保持接近同步训练的效果,同时显著提升资源利用率与吞吐效率。该工作为分布式 RLHF 训练提供了更可操作的工程准则。

来源 arXiv 时间 2026-07-01 15:40:12 AI 辅助整理
当上下文弥补稀疏事件历史:面向时空点过程预测的 AlphaEarth

这篇论文聚焦时空点过程预测中的一个核心难题:真实场景里事件历史往往稀疏、断裂,单靠历史序列很难做出稳定预测。作者提出 AlphaEarth,用丰富的外部上下文信息来补足稀疏历史带来的信息缺口,从而提升对未来事件发生位置与时间的建模能力。方法强调将地理、环境与时空背景融入点过程建模框架,使模型在数据不完整或事件间隔较长时,仍能保持较强的预测性能。论文的意义在于,它把“上下文优先”的思路引入时空事件预测,为交通、灾害、公共安全等低频事件场景提供了更实用的建模路径。

来源 arXiv 时间 2026-07-01 15:38:39 AI 辅助整理