AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
一种可自进化的智能体系统:自动生成与执行生物实验流程

本文提出一种自进化的智能体系统,用于自动生成并执行生物学实验流程,目标是把自然语言研究意图转化为可操作、可迭代优化的实验协议。系统通过多智能体协作,将任务规划、步骤生成、工具调用、执行反馈与结果修正整合到统一闭环中,从而提升生物协议自动化的可行性与鲁棒性。与传统静态工作流不同,该框架强调根据执行过程中的反馈持续调整策略,减少人工干预,并增强对复杂实验场景的适应能力。该研究体现了AI Agent在生命科学实验自动化、科研流程编排与实验室智能化方面的应用潜力。

来源 arXiv 时间 2026-06-30 14:51:13 实体 Semantic Kernel AI 辅助整理
公共行政中 AI 系统的技术类型学框架

本文围绕公共行政场景中的人工智能系统,提出一套更细致的技术类型学,用于区分不同 AI 应用在能力、功能与治理风险上的差异。文章关注的不只是“是否使用 AI”,而是系统如何工作、适合承担哪些行政任务,以及在决策支持、流程自动化、信息检索和公民互动等环节中可能带来的影响。该框架有助于公共部门更准确地识别系统边界、配置监管要求、评估透明度与问责机制,并为采购、部署和审计提供共同语言。对于研究者与政策制定者而言,这类分类方法可提升对政府 AI 采用路径的理解,也为后续制度设计奠定基础。

来源 arXiv 时间 2026-06-30 14:44:56 AI 辅助整理
用竞争奖励机制缓解大语言模型过度拒答问题

大语言模型在安全对齐后,常会把本可正常回答的问题也一并拒绝,出现“过度拒答”现象,影响实用性与用户体验。本文围绕这一问题提出一种竞争奖励框架:一方面鼓励模型在安全前提下尽量给出有帮助的回答,另一方面对真正需要拒绝的请求保持稳健防护,通过两类奖励的平衡来减少误拒。作者讨论了该方法在提升回答覆盖率、保留安全边界和改善对齐效果方面的作用,并为后续构建更精细的安全-有用性折中机制提供思路。

来源 arXiv 时间 2026-06-30 14:38:49 实体 Lore 决策记忆工具 AI 辅助整理
JL1-CC&QA:在JL1-CD基准上扩展变化描述与问答任务

本文提出 JL1-CC&QA,旨在扩展现有 JL1-CD 变化检测基准,使其不仅关注“是否变化”,还进一步评估模型对变化内容的语言理解与表达能力。作者在原有双时相图像变化检测基础上,引入 Change Captioning(变化描述)与 Question Answering(问答)两类任务,用于衡量模型对场景变化的细粒度感知、语义归纳和跨模态推理能力。该基准更贴近实际应用中“发现变化—解释变化—回答相关问题”的完整流程,可为遥感解译、城市监测与多模态视觉理解研究提供统一评测平台。

来源 arXiv 时间 2026-06-30 14:37:25 实体 Semantic Kernel AI 辅助整理
FedXDS:借助模型归因缓解联邦学习中的数据异质性

FedXDS 提出一种面向联邦学习数据异质性的训练策略,核心思路是引入模型归因方法来识别不同客户端数据对全局模型决策的实际影响,并据此动态调节聚合与学习过程。与直接依赖梯度或样本量分配的传统做法相比,该方法更关注“哪些数据在推动模型学习”,从而在非IID场景下提升训练稳定性与跨客户端泛化能力。研究表明,基于归因信号的调节机制可在一定程度上缓解客户端偏置、减少负迁移,并改善整体收敛表现。

来源 arXiv 时间 2026-06-30 14:35:45 实体 Lore 决策记忆工具 AI 辅助整理
STEB:文本风格嵌入能力评测基准

STEB 是一个面向“文本风格嵌入”的评测基准,用于衡量模型是否能把写作风格而非语义内容有效编码到向量空间中。与传统文本表示不同,风格嵌入更关注语气、句式、文体、作者特征和表达习惯等隐性属性,适用于风格检索、作者归因、文本改写与可控生成等任务。该基准通过系统化任务设计与统一指标,帮助研究者比较不同嵌入模型在风格保持、区分度与泛化能力上的表现,并为后续构建更稳健的风格控制与文本分析系统提供参考。

来源 arXiv 时间 2026-06-30 14:35:02 实体 Semantic Kernel AI 辅助整理
自然度一定更合适吗?跨领域TTS评测中的自然性与适切性研究

这篇论文聚焦语音合成(TTS)评测中两个常被混用、但实际并不等价的维度:自然性(naturalness)与适切性(appropriateness)。作者指出,在新闻播报、客服、虚拟助手、教育等不同应用场景中,评测目标并不只是“像真人”,更要看语音是否符合任务语境、角色设定和交互目的。论文围绕不同领域展开对比分析,讨论自然度评分是否足以代表用户体验,以及在何种情况下“更自然”的声音反而可能不够合适。研究旨在为TTS系统设计和基准评测提供更具场景意识的参考,推动从单一音质导向转向面向应用效果的综合评价。

来源 arXiv 时间 2026-06-30 14:28:41 AI 辅助整理
将基础 ASR 模型适配到构音障碍语音的案例研究

本文以构音障碍语音识别为场景,探讨如何将通用基础自动语音识别(ASR)模型迁移到说话障碍人群上。由于构音障碍语音常伴随发音不清、节奏异常和个体差异大,通用模型在此类任务上往往明显退化。论文通过案例研究方式分析不同适配策略的效果,包括少量目标数据微调、参数高效适配以及对基础模型表示能力的利用,评估其在低资源条件下的可行性与局限。研究强调:提升无障碍语音技术不仅依赖模型规模,更需要面向特殊人群的数据、训练策略与评测设置协同优化。

来源 arXiv 时间 2026-06-30 14:23:49 实体 通义千问 2.5 AI 辅助整理
看见不等于共享:部分视觉语言模型在不对称对话中过度估计共同知识

这篇论文研究视觉语言模型在“非对称对话”中的推理偏差:当一方能看到图像、另一方不能时,模型往往会把“自己看见的内容”误当成双方都共享的背景信息,从而高估共同知识。作者通过一系列对话任务发现,部分 VLM 在需要判断对方是否知道某个视觉信息时表现不稳,容易做出过度自信的回应。论文指出,这种偏差会影响模型在协作、问答和多轮交互中的可靠性,也说明当前模型对“共享认知”与“个体可见信息”的区分仍然不足。

来源 arXiv 时间 2026-06-30 14:22:48 实体 通义千问 2.5 AI 辅助整理
基于大语言模型的跨语言关系抽取:罗马尼亚语零样本、少样本与微调评测

本文聚焦跨语言关系抽取任务,系统评估大语言模型在罗马尼亚语场景下的表现,比较零样本、少样本提示与微调三种设置。研究关注模型能否借助高资源语言知识迁移到低资源语言,并分析不同范式在抽取实体关系、泛化能力与稳定性上的差异。该工作为理解大模型在多语种信息抽取中的适用边界提供了实证依据,也为低资源语言的关系抽取系统设计与提示策略优化提供参考。

来源 arXiv 时间 2026-06-30 14:22:46 实体 Semantic Kernel AI 辅助整理
面向非线性的 LoRA:低秩约束下的结构化门控适配

这篇论文聚焦于大模型参数高效微调中的一个关键问题:传统 LoRA 虽然能以低成本适配模型,但在面对非线性强、门控结构复杂的网络层时,表达能力往往受限。作者提出 Nonlinearity-Aware LoRA(NALoRA),将“门控适配”纳入低秩更新框架,在保持参数与计算开销较低的前提下,更有针对性地调整模型中的非线性行为。其核心思路是把结构化门控与低秩分解结合起来,使适配器不仅能修正线性权重,还能更细粒度地影响激活与信息流。实验结果表明,该方法在多种下游任务上相比标准 LoRA 更具效果与稳定性,尤其适合需要精细控制非线性响应的场景。

来源 arXiv 时间 2026-06-30 14:21:51 实体 Semantic Kernel AI 辅助整理
Cursor 推出移动端应用,支持随时随地引导编码代理

Cursor 发布了移动端应用,让开发者可以在外出时继续查看、指挥和调整自己的编码代理,而不必一直守在电脑前。文章指出,这一能力延续了 Cursor 作为 AI 编程工具的定位:把大模型驱动的代码生成、修改与任务执行,变成可在手机上接力管理的工作流。对于经常需要异步处理代码审查、修复 bug、推进小型开发任务的团队来说,移动端入口意味着更高的响应速度和更连续的开发体验,也反映出 AI 编程助手正从“桌面工具”走向“随身代理”。

来源 Hacker News 时间 2026-06-30 14:18:25 实体 Cursor AI 辅助整理
Arena-T2I Hard:依赖感知清单驱动的文生图忠实度基准与改进

这篇工作聚焦文生图模型的“忠实度”问题,提出 Arena-T2I Hard 作为更具挑战性的评测基准,用来检验模型是否真正按文本要求生成图像,而不只是产出视觉上讨喜的结果。论文核心方法是引入“依赖感知清单”(dependency-aware checklist),将复杂提示词拆解为相互依赖的约束项,既能更细致地评估模型在对象、属性、关系和组合指令上的执行情况,也能据此改进生成过程。作者进一步研究如何利用该清单提升模型对文本细节的遵循能力,为文生图系统的可靠性评测和对齐优化提供了新的思路。

来源 arXiv 时间 2026-06-30 14:17:05 AI 辅助整理
语言不是意识的产物?这篇文章讨论 LLM 与人类认知的倒置关系

文章围绕一个颇具争议的命题展开:在人类这里,语言更像是意识活动的外在结果;而在大语言模型中,情况恰好相反——模型先通过统计预测生成“词语”,再让这些输出看起来像是思考的痕迹。作者借此强调,人类的认知、经验与意图并不依赖逐字成句的过程,语言只是意识的表达接口;但 LLM 的“智能”却建立在语言符号本身之上,缺少真实感知、动机和主观体验。文章由此引出对 AI 生成文本本质的反思:我们看到的并不是被翻译出来的思想,而是语言系统内部的概率组织。

来源 Hacker News 时间 2026-06-30 14:16:57 AI 辅助整理
WIDER-FAIR:面向公平性评估的WIDER-FACE标注增强数据集

本文提出 WIDER-FAIR,这是对经典人脸检测数据集 WIDER-FACE 的人工标注增强版本,目标是为算法公平性评估提供更可靠的基准。原始 WIDER-FACE 主要用于检测任务,而 WIDER-FAIR 进一步补充与整理了与人群属性相关的标注,使研究者能够分析不同子群体上的性能差异,识别模型在性别、肤色、年龄等维度可能存在的偏差。该数据集可用于人脸检测、鲁棒性分析以及公平性诊断,为构建更负责任的视觉模型提供数据基础。

来源 arXiv 时间 2026-06-30 14:10:42 实体 Cohere AI 辅助整理
扩散式归责:双流网络中的任务依赖型信用分配

这篇论文讨论生物学上更可实现的双流神经网络中,如何为不同任务分配“功劳”或“责任”。传统深度学习依赖反向传播进行信用分配,但与真实大脑机制差异较大。作者提出一种“扩散式归责”框架,使网络在视觉等任务中能够依据任务目标,动态决定来自不同通路与模块的更新比例,从而在保持生物可解释性的同时提升学习效率。该工作关注多流结构中的任务依赖性,强调同一输入在不同目标下可能需要不同的归因策略,为构建更接近神经机制、又能支持多任务学习的人工智能系统提供了新思路。

来源 arXiv 时间 2026-06-30 14:09:40 实体 Semantic Kernel AI 辅助整理
用稀疏自编码器实现扩散模型遗忘:只看不碰

这篇论文研究如何在扩散模型中实现“遗忘”特定概念或数据,而尽量不破坏模型其他能力。作者引入稀疏自编码器(Sparse Autoencoders, SAE)来定位并分离与目标内容相关的内部表征,再据此对模型进行定向编辑,使其对被遗忘对象“看得见但生成不出来”。这种方法强调可解释性与可控性,力图比直接微调或粗暴屏蔽更稳健地降低副作用。论文聚焦于扩散模型的安全治理、版权与敏感内容移除等场景,展示了稀疏表征在模型遗忘任务中的应用潜力。

来源 arXiv 时间 2026-06-30 14:09:28 AI 辅助整理
RCT:面向触觉泛化的机器人采集触觉-视觉-语言数据集

本文提出 RCT(Robot-Collected Touch-Vision-Language Dataset),一个由机器人自动采集的触觉-视觉-语言多模态数据集,目标是提升模型对触觉感知任务的泛化能力。与仅依赖视觉或少量人工标注的触觉数据不同,RCT 将触觉信号与图像及语言描述对齐,覆盖更丰富的物体材质、表面状态和接触情境,为学习“摸到什么、看起来怎样、如何用语言描述”之间的关联提供了统一基座。作者围绕数据采集流程、标注组织方式和基准任务展开设计,并展示该数据集在触觉理解、跨模态对齐以及迁移到新物体/新场景时的潜力,可为具身智能、机器人操作和多模态表征学习提供新的资源。

来源 arXiv 时间 2026-06-30 14:05:33 AI 辅助整理
ShopX:面向智能购物中意图到商品履约的基础模型

ShopX 是一项面向 Agentic Shopping 的基础模型研究,聚焦“意图到商品履约”这一关键任务:当用户用自然语言提出模糊或多约束的购买意图时,系统不仅要理解需求,还要在商品海量候选中完成匹配、筛选与推荐。该工作强调把购物流程从传统检索式推荐,推进到更具代理能力的多步决策与执行框架,服务于未来可自主协作的购物智能体。论文的核心价值在于将商品选择、约束满足与任务完成统一建模,为电商场景中的大模型落地提供了新的基础能力方向。

来源 arXiv 时间 2026-06-30 14:05:28 实体 Semantic Kernel AI 辅助整理
TalentCLEF 2026概览:技能与职位标题智能用于人力资本管理

本文概述TalentCLEF 2026任务与评测设置,聚焦“技能—职位标题”智能在招聘匹配、岗位画像、人才检索与人力资本管理中的应用。文章介绍该基准如何围绕职位名称标准化、技能抽取与映射、语义检索和分类识别等核心能力构建数据与任务,并讨论面向真实HR场景的挑战,如职位命名不一致、技能表述稀疏、跨行业术语差异及长尾岗位问题。该工作旨在为大模型和信息抽取系统提供统一评测框架,推动更准确的人才理解与岗位匹配技术发展。

来源 arXiv 时间 2026-06-30 14:04:59 实体 Semantic Kernel AI 辅助整理
北美燕麦供应链是如何建立又走向失落的?

这篇文章以作者父亲参与北美燕麦产业建设的经历为切口,回顾燕麦从种植、收购、加工到分销的完整供应链如何在数十年间形成,又为何逐渐被压缩、外移甚至被忽视。文章指出,农业结构变化、加工能力集中、消费习惯转向以及政策与市场激励错位,共同削弱了本地燕麦体系的韧性。作者进一步追问:在健康食品需求回升、供应链安全重新被重视的今天,北美能否重建更具区域性和可持续性的燕麦产业。

来源 Hacker News 时间 2026-06-30 14:00:51 AI 辅助整理
何时截断特征排序:基于残差重叠的子集选择停止规则

本文研究特征排序在子集选择中的“何时停止”问题。传统做法往往先对特征按重要性排序,再逐步加入特征,但排名越靠后,新增特征带来的增益通常迅速下降,甚至引入冗余与噪声。作者提出一种基于“残差重叠”的停止准则:当当前已选子集所解释的残差信息与候选特征的新增信息高度重叠时,就应截断排序、停止继续添加。该方法旨在比固定阈值或交叉验证式的盲目遍历更稳健、更轻量,适用于高维数据、稀疏建模和解释性特征筛选场景。

来源 arXiv 时间 2026-06-30 14:00:29 实体 Semantic Kernel AI 辅助整理
直方图约束下的图像生成方法

该文研究如何在图像生成过程中显式控制像素或特征分布,使生成结果满足预设的直方图约束。与常规扩散模型或GAN只追求整体逼真度不同,这类方法更强调输出在亮度、颜色或纹理统计上的可控性,适用于医学影像、遥感和工业质检等对分布一致性要求较高的场景。论文围绕约束注入、生成优化与分布匹配展开,探讨在不明显损伤视觉质量的前提下提升生成结果的统计可解释性与可控性。

来源 arXiv 时间 2026-06-30 13:58:56 实体 Cohere AI 辅助整理
Claude Code 会删除30天以上转写记录,Anthropic 暂不修复

这条 Hacker News 讨论的是 Anthropic 的 Claude Code 出现了一个让用户措手不及的行为:工具会自动删除超过 30 天的对话转写记录,而且官方表示暂时不会修复。对依赖 Claude Code 进行持续开发、排查问题或保留审计痕迹的用户来说,这意味着历史上下文、调试线索和工作记录可能在不知情的情况下消失。该问题也引发了关于 AI 编程助手数据保留策略、可追溯性与用户数据控制权的争议。

来源 Hacker News 时间 2026-06-30 13:58:21 实体 Anthropic AI 辅助整理
WorldRoamBench:面向交互式世界模型长程稳定性的开放世界基准

WorldRoamBench 提出一个面向开放世界场景的评测基准,用来检验交互式世界模型在长时间、多步交互中的稳定性与一致性。不同于只关注短时预测误差的传统测试,它更强调模型在连续行动、环境反馈和状态演化下,能否保持物理规律、语义连贯与任务可执行性。该基准旨在暴露世界模型在长期滚动推理中常见的漂移、崩坏与误差累积问题,并为比较不同架构、训练策略和记忆机制提供统一平台。

来源 arXiv 时间 2026-06-30 13:51:44 实体 Lore 决策记忆工具 AI 辅助整理
用 J 语言建模新冠疫情暴发:2020 年的一个案例

这篇文章回顾了作者如何使用 J 语言对新冠疫情早期暴发进行建模,重点展示了用函数式、数组化思维快速表达疫情传播、增长曲线和参数拟合的过程。文章不只是介绍代码实现,也强调了在突发公共卫生事件中,借助简洁的计算工具把数据转化为可分析模型的价值。虽然模型本身并不追求复杂精细,但它很好地说明了:当时序数据不断变化时,快速迭代、可视化趋势和理解假设条件,比追求完美模型更重要。

来源 Hacker News 时间 2026-06-30 13:47:17 AI 辅助整理
面向生物特征验证的稀疏诱导散度损失方法

本文研究生物特征验证中的损失函数设计,聚焦如何通过引入“稀疏诱导”机制提升判别能力与泛化表现。作者从散度度量出发,构建适用于验证任务的优化目标,使模型在学习身份相似性时更倾向于形成更清晰的特征分离与更稀疏的响应分布。相比传统的分类或对比学习损失,这类散度损失能够更直接地约束正负样本之间的距离结构,从而改善阈值判定下的鲁棒性。该工作对指纹、人脸、虹膜等生物识别场景具有参考价值,也为度量学习中的损失函数改进提供了新的思路。

来源 arXiv 时间 2026-06-30 13:42:41 AI 辅助整理
通过对抗蒸馏提升可认证鲁棒性

本文围绕深度学习模型的可认证鲁棒性展开,提出利用对抗蒸馏来进一步提升模型在面对扰动时的稳定性与可验证安全性。与传统仅依赖标准训练或单纯对抗训练的方法不同,该工作将“教师—学生”蒸馏机制与对抗样本生成结合,在保留模型精度的同时,强化学生模型对输入扰动的抵抗能力。论文重点讨论了如何将教师模型的知识传递到更易认证的学生模型,并在认证半径、鲁棒精度等指标上取得更优表现。这类方法对高安全需求场景具有实际意义,如自动驾驶、金融风控与安全关键系统。

来源 arXiv 时间 2026-06-30 13:31:35 AI 辅助整理
FARS:面向大规模部署的全自动化研究系统

FARS 是一套面向科研任务的全自动化研究系统,强调从问题定义、信息检索、证据整合到结果产出都尽量由智能体闭环完成,并已在真实场景中实现规模化部署。论文关注的核心不只是“能否做研究”,而是如何让系统在长链路任务中保持稳定、可扩展与可复用,减少人工介入成本。相较于传统单轮问答式工具,FARS 更像一个可持续运行的研究流水线,适用于快速生成资料综述、辅助探索新方向以及支持大规模知识工作。

来源 arXiv 时间 2026-06-30 13:30:24 实体 Semantic Kernel AI 辅助整理
ECHO:通过选择性回合记忆实现剪枝行动与轨迹学习的智能体强化学习

这篇论文提出 ECHO,一种面向智能体强化学习的记忆与训练框架,核心思想是“先剪枝再行动,沿轨迹学习”。在复杂多轮交互中,智能体不必保留全部历史,而是通过选择性回合记忆筛选出对当前决策最有价值的信息,降低上下文冗余与推理成本。与此同时,模型在训练阶段会沿着行为轨迹追踪关键决策信号,从而更有效地学习长期依赖、任务进展和失败原因。相较于传统依赖完整历史或固定窗口的做法,ECHO更强调动态记忆管理与可解释的轨迹建模,适合工具使用、任务规划和长程交互等 agentic RL 场景。

来源 arXiv 时间 2026-06-30 13:29:58 AI 辅助整理