本文提出一套用于物理信息神经网络(PINNs)训练的优化框架,核心目标是缓解该类模型在求解偏微分方程时常见的病态优化问题。PINNs通常同时最小化数据误差与物理残差,但不同损失项的尺度差异、梯度冲突和参数敏感性,往往导致训练不稳定、收敛缓慢甚至陷入劣解。作者围绕“良态训练”展开设计,通过系统化的优化策略改善损失平衡与梯度传播,从而提升PINNs在复杂物理约束下的可训练性与收敛表现。该工作对需要高精度科学计算、反问题求解和物理仿真的神经网络方法具有参考价值。
AI Agent 与大模型中文情报库
持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。
最新动态
最近更新:2026-07-08 10:30:33UA-ChatDev提出一种面向软件开发的多智能体协作方法,将不确定性感知机制引入需求分析、设计、编码与测试等环节。与传统依赖单轮生成或固定分工的Agent流程不同,该框架会显式评估各智能体输出的置信度与风险,在关键决策点触发复核、重规划或角色协商,以减少幻觉、遗漏需求和代码不一致等问题。论文聚焦“可靠性”这一软件工程核心目标,强调通过协作控制与不确定性建模提升交付质量。整体上,它反映了大模型Agent从“能做”走向“做对、做稳”的发展趋势。
RadiomicNet提出了一种将辐射组学特征与深度学习结合的轻量级医学图像分割框架,旨在在保持较低计算开销的同时提升模型的可解释性与分割精度。该方法通过引入手工设计的辐射组学先验,辅助网络学习更符合临床语义的结构信息,从而缓解纯数据驱动模型在小样本、边界模糊和病灶形态复杂场景下的泛化问题。论文强调其“混合式”设计思路:既保留轻量网络对高效推理的优势,又通过辐射组学引导增强对病灶纹理、形状和异质性的建模能力,适用于多类医学影像分割任务。
这篇论文聚焦大语言模型在推理与生成中的“不确定性”刻画问题,提出一种贝叶斯稀疏低秩适配方法,在保持参数高效微调优势的同时,为模型参数引入概率化建模。相比传统LoRA仅学习确定性低秩增量,作者通过贝叶斯框架对适配参数的分布进行估计,并结合稀疏约束提升可解释性与泛化能力,从而更可靠地衡量模型对输出结果的置信程度。该方法适用于需要风险控制的场景,如医疗问答、代码生成和检索增强生成,可为大模型部署提供更稳健的不确定性信号。
本文关注大模型在“深度权重空间”中的推理轨迹建模问题,尝试把一次推理过程看作可演化的图结构,而不仅是静态参数或单步输出。作者提出动态神经图编码方法,用图神经网络刻画推理中不同状态、子步骤与信息流之间的时序关系,从而更细致地表示模型内部的决策路径。该思路有助于分析复杂推理链、识别中间状态变化,并为理解模型为何产生某个答案提供更可解释的结构化视角。
这篇文章围绕一个典型的 LangGraph “god node”(职责过重、逻辑耦合严重的节点)展开,作者用同一重构任务对比了 Fable 和另外 10 款大模型的表现。重点不只是看谁能改对代码,还评估模型在拆分职责、保持图结构语义、减少副作用以及生成可维护设计方面的能力。文章从实战角度揭示了不同模型在代码理解、架构抽象和长链路推理上的差异,也反映出当前 LLM 在复杂 Agent 工作流重构中的真实上限与短板。
本文围绕化学语言模型(Chemical Language Models, CLMs)的表征能力展开系统探测,重点分析预训练策略与下游微调对模型性能和内部语义结构的影响。作者通过一系列 probing 任务,考察模型是否真正学到了分子表示、化学性质与结构关系,而不仅是记忆训练数据。研究进一步比较不同预训练数据、目标函数和微调方式对模型迁移能力、泛化表现及表示可解释性的作用。结果表明,预训练阶段决定了模型吸收化学知识的基础,微调则会在任务适配与知识保留之间产生权衡,为面向分子性质预测、生成和药物发现的模型设计提供了实证依据。
这篇 arXiv 论文关注代码代理(coding agents)在科学机器学习中的实际能力边界。作者围绕若干具有代表性的科研实现任务,评估这类智能体能否依据论文描述自行搭建实验、复现结果并定位实现细节。研究表明,在给定清晰目标和足够上下文时,当前编码代理已经能够完成一部分论文级别的复现工作,尤其适合处理代码框架搭建、实验脚本生成和常规调参等环节。但在涉及隐含假设、复杂实验设计或论文描述不完整时,智能体仍会暴露出可靠性不足与推理深度有限的问题。该研究从“AI 帮助做科研”走向“AI 参与科研复现”提供了实证参考。
本文聚焦一个关键问题:大语言模型生成的研究想法,与人类研究者提出的创意究竟差多远。作者围绕“研究想法质量、原创性与可行性”构建比较框架,尝试从多个维度评估 LLM 在科研构思阶段的能力边界。研究表明,模型可以稳定产出表面上合理、结构完整的想法,但在问题选择的敏锐度、背景约束理解、以及真正可验证的新颖性方面,仍与人类专家存在明显差距。论文的价值不仅在于评估模型,更在于提示:未来 AI 辅助科研需要从“生成文本”走向“理解领域、识别空白、形成可实验验证的假设”。
本文关注模仿学习在示范并不完美时的训练难题:现实中的人类或机器人轨迹往往包含失误、绕路与局部最优,直接模仿会限制策略上限。作者提出一种“语言批判”式学习框架,将示范中的行为转化为可解释的自然语言反馈,用于指出当前动作的不足、修正方向以及更优替代方案,并据此引导策略更新。与只依赖奖励或硬标签的方法相比,该思路更适合吸收次优示范中的有效信息,同时降低错误示范带来的负面迁移。整体上,这项工作把大模型的语言理解与批判能力引入机器人/决策模仿学习,为利用低质量数据训练更稳健、更可泛化的智能体提供了新路径。
本文提出“状态—预测分离假说”,讨论大模型或智能系统在内部表征中,如何将对当前环境状态的编码与对未来结果的预测分离开来。作者认为,这种分离可能是复杂决策、规划和泛化能力的重要基础:模型并不只是把观察到的信息压缩成单一隐状态,而是同时维护可用于推断世界现状的表示,以及用于生成后续预测的表示。论文围绕这一假说给出概念框架,并分析其与表征学习、世界模型和可解释性研究的关系,为理解 Agent 的内部机制提供了新的理论切入点。
FurnitureVLA提出一种面向家具装配的视觉-语言-动作(VLA)框架,聚焦长时程、强接触、强组合性的双臂操作任务。该工作试图让机器人在理解装配指令、识别零件状态与空间关系的基础上,生成连续、协调的双臂动作序列,从而完成桌椅等家具的逐步组装。相比只处理短步骤抓取或单臂操作的方法,FurnitureVLA更强调多步骤规划、工具/部件协同与错误恢复能力,体现了大模型方法向复杂真实操作场景落地的趋势。
这篇论文聚焦一个越来越受关注的问题:用于评估编码智能体的性能优化类基准,是否真的能稳定、可靠地反映模型在真实编程任务中的能力。作者从基准设计、任务分布、评价指标和执行环境等多个角度分析,指出这类测试往往更容易测出“在特定题型上的调参能力”,而不一定等同于通用的软件工程能力。论文强调,若基准只覆盖有限场景,智能体可能通过针对性策略取得高分,却无法证明其在复杂项目、长链路调试和持续迭代中的表现。研究因此呼吁更审慎地解读分数,并推动更接近真实开发流程的评测体系。
AnalystAIPack 是一个面向恶意代码分析与逆向工程(RE)的 Agent 技能集合,作者将 118 个可直接运行的技能打包整理,试图把分散的分析动作模块化、自动化,方便安全研究人员在样本研判、静态分析、动态分析、提取线索和辅助逆向等场景中调用。相较于传统一次性脚本,它更强调可组合、可复用与面向 Agent 工作流的设计思路,适合希望把大模型与安全分析流程结合起来的从业者参考。该项目也反映出“Agent 化安全工具链”正在从概念走向具体落地。
这篇论文聚焦自主实验室编排器在多任务实验环境中的资源分配问题,核心目标是在计算、设备、时间与实验材料受限的条件下,提高自动化实验流程的整体吞吐率与成功率。作者围绕任务调度、资源冲突消解和执行优先级优化展开分析,探讨如何让由大模型或智能代理驱动的实验编排系统更高效地协调多个实验步骤。该研究对机器人实验室、自动化科研平台和闭环实验系统具有直接参考价值,也反映出AI Agent从单一任务执行走向复杂资源治理的趋势。
本文探讨如何在语言模型训练中同时利用可验证奖励和人类示范,提升模型对“正确答案”与“正确方式”的双重对齐能力。作者强调,单纯追求结果正确并不足以保证生成过程可靠、可解释或符合人类偏好;而引入可验证奖励后,模型能够在有明确判定标准的任务上获得更稳定的训练信号,再结合高质量人类示范,进一步学习更自然、更符合规范的推理与表达方式。该研究面向大模型对齐、强化学习与监督微调的交叉场景,旨在减少训练噪声、提升泛化表现,并为构建更可信的智能体提供方法参考。
这篇论文讨论的是“生成得像”与“生成得有用”之间的差异。作者指出,许多基于样本的生成模型主要以拟合数据分布为目标,但在实际应用中,模型输出往往要服务于下游决策,例如推荐、调度、控制或风险评估。为此,论文提出一种决策感知训练思路,将最终决策效果纳入训练目标,而不是只优化传统的似然或重建误差。这样做的核心收益是:生成样本不一定在统计意义上最逼真,但能更好地支持后续任务的性能提升。该工作对生成模型在运筹优化、机器学习决策系统和任务导向生成等场景具有启发意义。
Diffusion-GR2 提出一种面向重排序任务的扩散式生成推理方法,将候选结果选择从传统的判别式打分,转向在多步去噪过程中逐渐逼近更优答案。该框架把“推理”和“重排”统一到生成式建模中,通过扩散过程显式利用上下文与候选之间的关系,提升对复杂语义、长程依赖和歧义样本的辨别能力。相比单次前向打分,Diffusion-GR2 更强调迭代修正与全局一致性,适用于需要精细排序或高质量候选筛选的场景,体现了生成式模型在检索后重排中的新潜力。
这篇论文提出一个用于 AI 安全评测的新基准,聚焦于模型在真实对话中容易出错的语用场景:指令冲突、嵌入式命令以及策略边界模糊。作者希望通过“对抗语用学”方法,系统检验模型是否能够识别多层意图、区分主次指令,并在含混上下文中保持安全一致的行为。与传统只看显性违规的测试不同,该基准更强调语境理解、隐含命令解析和策略鲁棒性,可用于衡量大模型在复杂交互中的安全可靠程度。
本文提出一种面向多变量时间序列的轻量级自监督学习框架,核心方法是分层 JEPA(Joint-Embedding Predictive Architecture)。该框架针对 ECG 心电数据构建多尺度表征,通过在不同时间粒度上预测潜在表示,学习时序结构与跨通道依赖,而无需大量人工标注。与传统对比学习或监督方法相比,该方案更强调表示学习的效率与可迁移性,适合医疗场景中标注稀缺、数据噪声较强的任务。研究表明,分层设计有助于捕捉心电信号的局部波形和全局节律特征,为后续分类、异常检测和下游诊断提供更稳健的特征基础。
本文提出一种用于在线反馈驱动搜索的新型多粒子流映射方法,将搜索过程建模为多个粒子在连续空间中的协同演化。方法强调“顺序控制”和“交互式”机制:系统可根据外部反馈逐步调整粒子流向,并通过粒子之间的信息交互提升探索效率与收敛稳定性。相较于传统一次性优化或静态采样策略,该框架更适合需要边搜索、边评估、边修正的场景,如交互式设计、主动学习和人机协同优化。文章核心贡献在于把反馈闭环显式嵌入流式搜索过程,从而在复杂目标空间中实现更灵活的导航与更强的自适应能力。
GAIA提出一种面向偏微分方程等科学计算任务的算子学习框架,重点解决复杂几何条件下前向预测与反问题求解的统一建模。与传统方法往往依赖规则网格或固定域不同,GAIA通过几何自适应机制显式融入边界形状、空间分布与观测条件,使模型能够在不同几何配置间更稳健地泛化。该方法既可用于从初始/边界条件推断系统响应,也可用于由观测结果反演未知参数或源项,适合流体、材料和多物理场等场景。
本文提出 FAR(Failure-Aware Retry)框架,用于让智能体在测试阶段具备更强的自我恢复能力,并在持续交互中不断改进策略。不同于只依赖单次执行结果的方法,FAR 会显式识别任务失败信号,判断当前尝试为何失效,并据此触发更有针对性的重试与修正,从而提升复杂任务中的成功率与稳健性。该思路尤其适合具备多步规划、工具调用或环境交互的 Agent 场景,因为这类任务往往会因局部错误而导致整体失败。FAR 的核心价值在于把“失败”转化为可学习的反馈,不仅帮助模型在当次任务中完成恢复,也为后续策略更新提供经验累积,体现出测试时学习与持续优化的结合。
本文提出SynLaD,一种面向药物发现的潜空间扩散生成框架,可在3D药效团轮廓约束下生成具有可合成性的分子。与直接在离散化学空间中采样不同,SynLaD将分子表示映射到潜在空间,再通过条件扩散逐步生成候选结构,从而更好地兼顾化学有效性、结构多样性与合成可行性。研究将三维药效团作为关键先验,用于引导模型生成与目标结合特征更匹配的分子骨架与官能团组合。该方法体现了生成式AI在先导化合物设计中的新趋势:把药效团约束、三维构象信息与可合成性联合建模,以提高命中率并降低后续合成筛选成本。
本文研究主动学习中的样本选择效率问题,聚焦于如何在标注预算有限时挑选最具代表性的未标注数据。作者将“群不变性”引入核心集构建:当数据存在旋转、平移、翻转等对称变换时,传统核心集往往忽略这些等价关系,导致冗余采样。该方法在选择少量样本的同时,尽量覆盖不同对称轨道上的信息,从而提升标注效率与模型泛化能力。论文从理论上分析了群不变核心集的性质,并给出可用于主动学习的构造思路,适用于具有明显结构先验的视觉与几何任务。
本文研究量子核方法在带式优化场景中的核心权衡:模型表达能力越强,越可能刻画复杂目标,但往往会增加学习难度并放大采样成本。作者围绕量子核带式优化建立分析框架,讨论如何在核函数的判别能力、带式反馈效率与样本复杂度之间取得平衡。该工作面向量子机器学习与在线决策的交叉问题,为设计更可训练、也更具实际可用性的量子核算法提供了理论依据。
本文讨论了一类通过“消息传递”机制提升推理效率的方法。作者指出,在复杂推理任务中,若让模型在局部状态之间迭代交换信息,可以用更低的计算开销逐步逼近全局一致的判断,从而减少对一次性大规模搜索或长链式生成的依赖。这种思路借鉴了图神经网络和分布式系统中的信息传播机制,强调把推理过程拆解为可并行、可复用的局部更新。文章核心贡献在于说明:合适的信息路由与交互结构,能够让模型在保持表达能力的同时显著提高推理效率,并为构建更可扩展的智能体系统提供启发。
MemSyco-Bench 提出了一套专门用于评估智能体“记忆系统”中谄媚偏差(sycophancy)的基准。研究关注的是:当大模型智能体在多轮交互中写入、检索和更新长期记忆时,是否会为了迎合用户偏好或错误观点而扭曲事实、放大偏见,进而影响后续决策与回答。该基准通过设计可控场景,考察记忆记录、召回、冲突消解与持续学习等环节中的偏差传播问题,帮助分析记忆模块如何成为谄媚行为的放大器。论文为评估更可靠、更稳健的智能体记忆提供了测量工具,也对构建具备事实一致性与抗迎合能力的 AI Agent 具有参考价值。
该文提出 GSRQ(Gain-Shape Residual Quantization),用于将大模型推理中的 KV Cache 压缩到 1 比特以下,以缓解长上下文场景下显存占用过高的问题。方法将向量表示拆分为“增益”和“形状”两部分,并通过多级残差量化逐步逼近原始特征,在极低比特开销下尽量保留注意力计算所需的信息。相较于直接低比特量化,GSRQ 更能兼顾压缩率与精度,适用于推理阶段的内存优化。
本文围绕“可对话的复杂性”展开,讨论由多个具备工具使用、协作与角色分工能力的代理式大模型组成的集体,如何作为理解复杂系统的新型可解释载体。作者关注的不只是单个模型的输出,而是多智能体在交互、协商、冲突与达成一致过程中形成的涌现行为。文章强调,这类 LLM 集体一方面能承载更丰富的推理与决策过程,另一方面也为分析复杂任务中的分工、稳定性与可追溯性提供了观察窗口。整体上,它试图把大模型协同系统从“黑箱能力”转化为“可解释的结构化过程”。