AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
AutoTrainess:让语言模型自主教会语言模型变强

AutoTrainess 提出一种“自我训练导师”框架:不再依赖人工持续标注,而是让一个语言模型在任务分解、答案评估与反馈生成中扮演教练角色,持续指导另一模型改进表现。该方法强调自动化的训练闭环,结合自生成数据、错误诊断和迭代优化,使模型能够在较少人工介入下提升推理、表达与任务完成能力。论文关注如何让模型从“会回答”进一步走向“会教、会改、会迭代”,为构建可扩展的自治式模型优化流程提供了思路,也反映出大模型训练正从静态数据驱动转向动态协同进化。

来源 arXiv 时间 2026-06-30 12:09:51 实体 深度求索 AI 辅助整理
面向 ARC-AGI-2 的模态驱动搜索与全局轨迹判别

本文聚焦 ARC-AGI-2 这类强调通用推理与组合泛化能力的基准,提出一种“模态驱动搜索”框架,并结合“全局轨迹判别”机制来提升解题表现。其核心思路是:不再仅依赖单步启发式决策,而是围绕不同模态信息对候选解题路径进行搜索、生成与筛选,再从整体执行轨迹层面评估方案是否自洽、稳健且真正符合任务意图。该方法试图缓解传统大模型在抽象规则发现、长链推理和错误累积上的不足,为 ARC 类任务提供更具结构性的搜索范式,也体现了“生成—验证—重排”结合的 Agent 化解题方向。

来源 arXiv 时间 2026-06-30 11:55:33 实体 Cohere AI 辅助整理
超越表达性与可训练性悖论:从动力学李代数看量子机器学习中的平坦高原

本文从动力学李代数(dynamical Lie algebra)的角度重新审视量子机器学习中的“表达性—可训练性悖论”。作者指出,量子线路越具表达能力,越容易在参数优化时陷入梯度消失的“平坦高原”,但这一关系并非绝对。文章通过分析可达态空间、对称性约束与生成元结构,说明动力学李代数不仅决定线路能够探索的量子态范围,也会显著影响损失景观的几何形态与优化难度。该视角为设计兼具表达性与可训练性的量子模型提供了理论依据,并为缓解平坦高原提出了结构化电路设计与对称性控制思路。

来源 arXiv 时间 2026-06-30 11:50:52 实体 Semantic Kernel AI 辅助整理
面向严重类别失衡的个体缺勤时间序列分类预测框架

本文提出一种面向个体层面缺勤预测的时间序列分类框架,重点解决真实场景中“缺勤”样本极少、类别极度失衡带来的建模困难。作者将员工相关历史行为与时序信息转化为可学习的预测任务,并围绕不平衡数据下的特征表示、模型训练与评估策略进行设计,以提升对少数类缺勤事件的识别能力。该研究对人力资源管理、排班优化和早期风险预警具有直接应用价值,也为在高噪声、低召回容忍度场景中进行个体级时序预测提供了方法参考。

来源 arXiv 时间 2026-06-30 11:44:52 AI 辅助整理
自我改进式在线大模型对齐的收敛性研究

本文研究一种自我改进的在线大模型对齐框架:模型在持续接收人类反馈或偏好信号的同时,利用自身生成的候选策略进行迭代优化。作者重点分析了这类闭环训练在什么条件下能够稳定收敛,以及收敛后是否会朝向更优的对齐状态。文章从理论角度刻画了更新规则、反馈噪声与策略改进之间的关系,并讨论了在线学习过程中可能出现的偏移、震荡与局部最优问题。该工作为理解“模型自己训练自己”能否可靠提升对齐能力提供了数学基础,也对未来构建持续学习型对齐系统具有参考价值。

来源 arXiv 时间 2026-06-30 11:36:41 实体 Semantic Kernel AI 辅助整理
FinPersona-Bench:自主金融智能体纵向心理特质稳定性基准

这篇论文提出 FinPersona-Bench,一个面向自主金融智能体的评测基准,重点考察模型在长周期交互中的“人格/心理测量特征”是否稳定。与只看单轮任务成绩不同,该基准关注金融场景中智能体在持续决策、信息更新和压力情境下,回答风格、风险偏好、情绪倾向与行为一致性是否发生漂移。论文旨在弥补现有金融 Agent 评测对长期一致性与可控性的缺口,为后续构建更可靠、可审计的金融智能体提供标准化测试框架。

来源 arXiv 时间 2026-06-30 11:33:29 AI 辅助整理
RaBitQCache:面向长上下文推理的 KVCache 旋转二值量化

这篇论文聚焦长上下文大模型推理中的 KVCache 显存瓶颈,提出 RaBitQCache,一种将旋转变换与二值量化结合的缓存压缩方法。其核心思路是在尽量保留注意力所需信息的前提下,把高维 key/value 表示映射到更适合二值化的空间,再以极低比特成本存储,从而显著降低长序列推理时的内存占用与带宽压力。相比传统 KVCache 压缩方案,该方法试图在压缩率、精度损失和推理效率之间取得更好的平衡,适用于长上下文问答、代码生成和文档分析等场景。

来源 arXiv 时间 2026-06-30 11:32:14 实体 Semantic Kernel AI 辅助整理
Agentic Orchestration 与智能体编排系统的设计实现

本文围绕“Agentic Orchestration”与“Orchestration of Agents”两类概念展开,重点讨论在多智能体系统中,如何把大模型驱动的任务拆解、状态管理、工具调用、路由决策与执行反馈组织成可落地的编排框架。文章强调,真正可用的智能体系统不只是单个 Agent 的能力增强,更在于通过显式工作流、控制策略与协同机制,实现多个智能体在复杂任务中的分工、协作与容错。内容对编排层的职责边界、运行时调度、上下文传递以及可观测性等关键问题进行了系统化梳理,为构建可扩展、可维护的 Agent 体系提供设计参考。

来源 arXiv 时间 2026-06-30 11:31:49 实体 Semantic Kernel AI 辅助整理
非暴露而是证伪:冻结小型代码模型自修复反馈的安慰剂对照分解研究

本文围绕“自修复反馈”在冻结的小型代码模型中的真实作用展开实验,采用内部预注册的安慰剂对照设计,将模型在代码修复任务中的改进进一步拆解,以区分真正由反馈带来的能力提升与实验流程、提示偏置或结果解读造成的假象。作者强调研究目标并非单纯展示模型“能修好多少”,而是通过可证伪的设计检验反馈机制是否被高估。该工作对代码模型评测、提示工程归因以及实验可重复性具有参考价值,也为理解小模型在缺少参数更新时的学习边界提供了更严谨的证据。

来源 arXiv 时间 2026-06-30 11:26:14 实体 Semantic Kernel AI 辅助整理
面向儿童朗读训练与评测的自动语音识别系统构建

本文围绕儿童朗读训练与评估场景,探讨如何构建一套适用于儿童语音的自动语音识别(ASR)解决方案。与成人语音相比,儿童发音更不稳定、语速和音高变化更大,且常伴随读错、漏读与停顿,这使通用 ASR 系统难以直接满足教学与测评需求。文章重点关注系统在识别准确率、错读检测、阅读流畅度评估以及反馈可用性方面的设计思路,并结合教育应用场景讨论模型、数据与评测流程的适配问题。该工作可为儿童阅读辅助工具、课堂训练平台和语言学习产品提供技术参考。

来源 arXiv 时间 2026-06-30 11:24:17 实体 Continue AI 辅助整理
将“惊讶”作为可塑性与元认知的信号

这篇论文讨论一个常被忽视却极具信息量的内部信号——“惊讶”(surprise)。作者认为,当模型或智能体遇到与既有预测明显不一致的输入时,这种惊讶不仅意味着预测误差,还可以作为是否需要更新知识结构、调整学习速率与重估自身判断的触发器。文章进一步把惊讶与可塑性联系起来:越是意外的经验,越可能推动表征重组与策略修正;同时,它也可作为元认知线索,帮助系统判断自己“知道多少”“该不该相信当前答案”。这一视角对大模型、自适应智能体和持续学习系统尤其重要。

来源 arXiv 时间 2026-06-30 11:14:04 实体 Semantic Kernel AI 辅助整理
机器人操作鲁棒性:理论基础与前沿进展

本文系统梳理机器人操作任务中的鲁棒性问题,聚焦在抓取、搬运、装配与接触丰富操作中,机器人如何在感知噪声、模型误差、动态环境变化以及物体与环境不确定性下保持稳定表现。文章从理论基础出发,总结鲁棒控制、规划、学习与安全约束等方法如何共同提升操作可靠性,并进一步讨论大模型与数据驱动策略在复杂操作中的新机会与局限。作为综述性工作,它还展望了面向开放世界、长时序任务和人机协作场景的关键挑战。

来源 arXiv 时间 2026-06-30 11:13:03 AI 辅助整理
用置信度驱动的分叉思考:让模型在多路径推理中自我校准

本文围绕大模型在复杂推理中“先分叉、再筛选”的思路展开,重点讨论如何借助置信度信号改进多路径思考(fork-think)机制。与一次性生成答案不同,这类方法会让模型并行探索多个候选推理分支,再依据内部评分、置信估计或一致性指标选择更可靠的路径,从而提升最终回答的稳健性。文章的核心价值在于把“会想”进一步推进到“会判断自己想得是否可靠”,有助于缓解幻觉、提升复杂问题上的正确率,并为 Agent 的规划、反思与自我纠错提供参考。

来源 arXiv 时间 2026-06-30 10:59:20 实体 Lore 决策记忆工具 AI 辅助整理
无 Slater 条件下的约束在线凸优化研究

本文研究约束在线凸优化问题在缺乏 Slater 条件时的可行学习与遗憾分析。Slater 条件通常用于保证强对偶性和稳定的约束控制,但在许多现实场景中并不成立。作者围绕这一更一般也更困难的设定,构建了适用于在线决策的优化框架,分析如何在每轮仅获得局部反馈的情况下,同时兼顾目标最优化与约束满足。论文重点讨论了约束累积、动态调整与算法收敛之间的关系,并给出相应的理论保证,为资源受限、风险敏感和安全约束场景下的在线学习提供了更稳健的基础。

来源 arXiv 时间 2026-06-30 10:54:41 AI 辅助整理
一次反思还不够:通过多假设失败归因实现自我纠错的自主研究

本文讨论一种面向自主科研代理的自我纠错框架,核心观点是:研究任务失败后,仅靠单次反思往往不足以找到真正原因。作者提出“多假设失败归因”机制,让代理在复盘实验、检索、推理或代码执行失败时,同时生成并比较多个可能的失败成因,再据此调整后续探索方向。相比传统只做一次总结式反思的方法,这种做法更强调把失败拆解为可验证的假设,并通过迭代验证逐步缩小错误来源,从而提升研究代理在复杂开放任务中的稳健性、可恢复性与最终产出质量。

来源 arXiv 时间 2026-06-30 10:54:16 AI 辅助整理
TabPATE:无需公共数据的差分隐私表格上下文学习方法

TabPATE提出一种面向表格数据的上下文学习新范式,核心目标是在不依赖公共数据的前提下,实现差分隐私保护下的高效建模。与传统依赖外部预训练语料或公开表格的方案不同,该方法直接利用受保护的私有表格数据,在保证隐私预算约束的同时完成上下文推理与预测。论文重点讨论了如何在表格场景中构造可用的上下文表示、平衡隐私噪声与任务性能,并证明其在多种表格任务上具有竞争力。该工作对金融、医疗等敏感结构化数据场景尤其具有现实意义。

来源 arXiv 时间 2026-06-30 10:50:04 AI 辅助整理
基于冯·米塞斯分布的汽车雷达近距离目标不确定性量化

本文研究车载毫米波雷达在近距离、多目标紧密排列场景下的测量不确定性问题。传统基于高斯假设的方法往往难以准确刻画角度类观测的周期性与多峰特征,尤其是在目标方位接近、回波相互干扰时,容易低估真实误差。作者引入冯·米塞斯分布对雷达角度不确定性进行建模,并据此构建更适合紧密目标场景的置信度评估框架。该方法有助于更可靠地描述雷达检测结果的可信程度,为后续目标分离、跟踪融合与自动驾驶感知决策提供更稳健的不确定性基础。

来源 arXiv 时间 2026-06-30 10:49:45 实体 Semantic Kernel AI 辅助整理
面向漂移环境的决策对齐实例选型:基于零样本基础模型的CLOUDADV

CLOUDADV 研究云资源管理中的实例规格选择问题,核心目标不是单纯预测性能指标,而是让选型结果与真实业务决策目标保持一致。论文针对数据分布漂移、工作负载变化以及历史样本稀缺等常见难题,提出利用零样本基础模型进行决策对齐的实例 sizing 方法,在无需针对特定场景大量训练的情况下,仍能生成稳健的资源配置建议。该方法强调在动态云环境中结合模型泛化能力与决策约束,减少过度配置与性能不足带来的成本和风险,为自动化云资源调优提供了更具可迁移性的思路。

来源 arXiv 时间 2026-06-30 10:49:04 AI 辅助整理
Team MKC 在 CLPsych 2026:通过社交媒体时间线动态捕捉并刻画心理健康变化

这篇论文面向 CLPsych 2026 任务,研究如何从社交媒体用户的时间线中识别并描述心理健康状态的变化。作者关注的不只是单条帖子中的情绪或风险信号,而是利用跨时间的发帖序列、表达方式与内容主题的演化,来捕捉心理健康可能出现的转折点与持续性波动。工作重点在于构建能够刻画“变化过程”的建模思路,为临床心理语言处理中的纵向分析提供方法参考,也有助于理解社交媒体行为与心理状态之间的动态关联。

来源 arXiv 时间 2026-06-30 10:43:22 实体 Semantic Kernel AI 辅助整理
CSTrader:面向语言驱动交易的社区虚拟资产市场测试平台

本文提出 CSTrader,一个用于语言驱动交易研究的测试平台,聚焦社区驱动的虚拟资产市场场景。与传统只依赖价格序列的交易任务不同,CSTrader 将新闻、讨论、社群信号等自然语言信息纳入决策过程,使智能体不仅要预测价格,还要理解市场叙事、情绪与参与者互动。该平台旨在评估大模型或语言智能体在真实感更强的交易环境中的推理、信息整合与策略生成能力,并为语言基础上的金融决策、Agent 交易系统与多智能体市场研究提供统一基准。

来源 arXiv 时间 2026-06-30 10:40:40 实体 Semantic Kernel AI 辅助整理
利用现成生成模型实现目标检测器零样本量化

这篇论文研究如何在几乎不依赖原始训练数据的情况下,对目标检测器进行后训练量化。作者提出一种零样本量化框架,借助现成的生成模型合成具有代表性的输入样本,并用这些样本校准检测器的激活与权重分布,从而降低量化带来的精度损失。与依赖真实数据集的传统方法相比,该方法更适合数据受限、隐私敏感或部署前难以获取训练集的场景。论文重点关注检测任务中特有的多分支结构与定位、分类并行误差,展示了生成式数据在量化感知中的有效性。

来源 arXiv 时间 2026-06-30 10:29:15 实体 Semantic Kernel AI 辅助整理
UniTac:面向跨传感器触觉理解与生成的统一多模态模型

UniTac提出一种统一的多模态框架,面向不同触觉传感器之间的跨域理解与生成任务。论文关注触觉数据在硬件形态、信号分布和采样方式上的显著差异,导致模型往往难以在不同传感器间直接迁移。为此,作者构建单一模型同时处理触觉表征学习、跨传感器对齐以及触觉内容生成,在统一架构下兼顾“看懂触觉”和“生成触觉”。该方法有助于提升机器人在真实环境中的材料识别、接触状态判断与触觉仿真能力,为多传感器触觉基础模型提供了新的实现路径。

来源 arXiv 时间 2026-06-30 10:25:46 实体 Semantic Kernel AI 辅助整理
有限自适应下的上下文Slate GLM多臂老虎机

本文研究上下文 Slate 多臂老虎机问题:系统每轮需从多个候选中选择一个有序组合,并在仅部分可观察的反馈下学习最优策略。作者将奖励建模为广义线性模型(GLM),重点考虑现实中常见的“有限自适应”设置,即决策过程不能频繁依赖完整反馈,只能在少量阶段更新策略。论文围绕探索与利用的权衡,设计了适用于 Slate 结构的在线学习算法,并分析其在参数估计误差、后悔值和样本效率方面的理论保证。该工作对推荐排序、广告展示和搜索重排等需要分层决策的场景具有参考价值。

来源 arXiv 时间 2026-06-30 10:24:37 实体 智谱AI AI 辅助整理
重审 RVL-CDIP:错误量化与训练测试重叠分析

本文重新审视文档图像分类基准 RVL-CDIP,重点评估其标注错误与训练集、测试集之间的重叠问题。作者通过系统抽样与人工核查,量化了数据集中的噪声标注比例,并分析重复或近重复样本对模型评测的影响。结果显示,RVL-CDIP 可能存在显著的数据污染与标签偏差,导致部分模型成绩被高估,基准的区分能力也受到削弱。论文进一步讨论了清洗数据、重构划分与更严格评测协议的重要性,为文档理解任务的可靠评估提供了实证依据。

来源 arXiv 时间 2026-06-30 10:22:50 AI 辅助整理
谁决定情绪的意义?测量边界下的情感主权问题

这篇论文讨论一个看似技术、实则哲学的问题:当我们试图用生理信号、行为数据或机器学习模型去“测量”情绪时,究竟是谁在定义情绪的含义。作者提出“情感主权”这一概念,指出情绪并不只是可被外部指标完整捕捉的客观状态;由于测量方法本身存在边界,情绪的解释权、分类权与命名权会在主体、研究者和系统之间发生张力。论文因此把测量局限提升为认识论问题,反思 AI 情绪识别、心理评估与人机交互中常见的“把指标当真相”的倾向。

来源 arXiv 时间 2026-06-30 10:19:02 实体 Lore 决策记忆工具 AI 辅助整理
CDR-Bench:评估组合式、顺序敏感数据精炼流程的忠实执行

CDR-Bench 是一个用于检验大模型是否能“按步骤准确做事”的评测基准,聚焦数据精炼(data refinement)这类组合式、且对执行顺序高度敏感的任务流程。与只看最终答案的传统基准不同,它更强调模型是否严格遵循给定 recipes 中的每一步操作、条件判断和顺序约束,从而反映其在复杂工作流中的忠实执行能力。该基准可用于分析模型在多步骤指令理解、流程控制与细粒度任务执行上的薄弱环节,也为构建更可靠的 AI Agent 和自动化数据处理系统提供了参考。

来源 arXiv 时间 2026-06-30 10:08:45 实体 Semantic Kernel AI 辅助整理
面向跨基准医疗问答的临床结构化秩门控LoRA方法

本文提出一种面向医疗问答的参数高效微调方法,结合临床结构化表示与秩门控LoRA机制,提升大模型在不同医学基准上的泛化能力。方法核心是在低秩适配过程中引入可学习的门控策略,根据输入问题的临床语义与任务难度动态调整有效秩,从而更好地平衡表达能力与计算开销。作者将该方法用于跨基准医疗问答评测,强调模型不仅要在单一数据集上表现良好,还需在不同题型、知识分布和推理要求下保持稳定性能。整体来看,该工作面向医疗场景中知识密集、专业术语多、标注成本高等现实约束,为大模型的高效适配提供了更具临床可解释性的思路。

来源 arXiv 时间 2026-06-30 09:59:05 实体 通义千问 2.5 AI 辅助整理
DA-Studio:面向端到端数据分析的智能体系统

DA-Studio提出了一套面向端到端数据分析的智能体式工作流,目标是把从数据理解、清洗、探索、建模到结果解释的多个环节串联起来,减少人工在工具切换与流程编排上的负担。相比传统单点式数据分析工具,该系统更强调由智能体根据任务目标主动拆解问题、调用外部工具并迭代修正分析路径,从而提升复杂分析任务的自动化程度与可复用性。论文聚焦于如何让大模型更像数据分析助手而非单次问答接口,并讨论了在真实分析场景中对稳定性、可控性和结果质量的权衡。

来源 arXiv 时间 2026-06-30 09:45:49 实体 Semantic Kernel AI 辅助整理
行动前先问世界:预算约束下的环境探测与世界模型校准

这篇论文关注智能体在执行动作前如何用有限交互“探测环境”,以提升世界模型的可靠性。作者提出预算约束下的环境 probing 思路:在允许的询问次数、试探成本或交互开销内,智能体优先选择最有信息量的探测动作,借此修正对环境状态、转移规律和不确定性的误判。相较于直接依赖已有世界模型做决策,这种方法强调先校准、再行动,适用于开放式任务、动态环境以及模型容易失真的场景。论文的核心价值在于把探索、验证与控制统一到同一框架中,为更稳健的 Agent 决策提供了实用路径。

来源 arXiv 时间 2026-06-30 09:45:49 实体 Semantic Kernel AI 辅助整理
优先保留时序信息而非过度处理:单阶段视频检测器的时空诊断与设计

本文聚焦单阶段视频检测器在时空建模中的核心矛盾:很多方法不断增加时序处理模块,却未必真正提升对视频中动作、目标和上下文变化的理解。作者从“时序保真”与“特征加工”之间的关系入手,对现有时空检测器进行系统诊断,分析其在信息保留、时序对齐和多帧融合中的瓶颈,并据此提出更合理的设计原则:优先保持原始时序线索,再在必要处进行轻量且有针对性的处理。文章不仅给出诊断框架,也为构建更高效、更稳健的单阶段视频检测器提供了设计思路,对视频理解、时序检测与多模态感知研究具有参考价值。

来源 arXiv 时间 2026-06-30 09:44:21 AI 辅助整理