AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
Agentic AI 旅行者指南:理解智能体系统的关键框架

这篇论文围绕“Agentic AI(智能体式 AI)”展开,试图为快速升温的智能体生态提供一份系统化指南。文章重点讨论智能体与普通对话模型的区别:前者不仅能生成文本,还能分解任务、调用工具、执行多步规划并在环境中持续行动。作者进一步梳理了智能体系统的核心构件,包括记忆、规划、工具使用、反思与自我修正,以及多智能体协作等机制,并分析这些能力在实际落地时面临的可靠性、评估、安全与成本问题。整体来看,这是一篇面向研究者和工程实践者的综述型工作,帮助读者建立对智能体架构、能力边界与部署风险的统一认知。

来源 Hacker News 时间 2026-07-06 08:40:29 AI 辅助整理
利用 Apple Find My 网络绕过隔离环境外传数据

该项目展示了一种针对“物理隔离”或 air-gapped 系统的隐蔽数据外传思路:借助 Apple Find My 网络中设备被动上传位置信息与周边信号的机制,把待传输数据编码后塞进可被附近 Apple 设备接收并转发的广播中,从而在没有传统网络连接的情况下完成信息外泄。它并不依赖高带宽,而是利用苹果庞大的终端网络作为“中继”。这一方案再次说明,真正的隔离环境不仅要断开互联网,还要严格管控无线电、蓝牙和周边硬件链路。

来源 Hacker News 时间 2026-07-06 07:31:47 AI 辅助整理
当 AI 成本高于工程师:企业采用的临界点正在逼近

这篇文章讨论了一个正在被低估的问题:随着大模型调用、推理算力和集成成本持续上升,企业在“用 AI 替代人工”时,可能先遇到经济账算不过来的临界点。作者估算,到 2029 年,部分 AI 应用的总成本甚至会高于保留一名工程师,尤其是在高频调用、低容错和需要持续人类监督的场景中。文章的核心观点不是否定 AI,而是提醒管理者:AI 更适合提升人效、重构流程,而非简单替代岗位。真正的竞争优势,来自对模型使用方式、任务拆分与成本结构的精细设计。

来源 Hacker News 时间 2026-07-06 07:05:25 AI 辅助整理
几秒生成可参数化、可制造的 3D 模型

Kyrall 提供一种面向工程与制造场景的 3D 模型生成方式,主打“参数化”与“可制造”两大特性:用户无需从零手工建模,只需输入需求,就能在几秒内得到可编辑、可落地生产的三维方案。相比偏概念展示的生成式 3D 工具,这类产品更强调几何约束、尺寸可调、制造工艺兼容等实用能力,适合快速做零部件原型、结构件设计或方案迭代。它反映了 AI 正从“生成好看模型”走向“生成能生产的模型”,也意味着大模型与 CAD/CAE 工作流的结合正在加速。

来源 Hacker News 时间 2026-07-06 07:04:33 AI 辅助整理
字节阿里将停用类人AI自定义代理,迎接监管新规

据报道,字节跳动与阿里巴巴正陆续关闭或限制部分“类人化”AI自定义代理功能,以配合即将出台的监管要求。这类代理原本允许用户为大模型设定角色、语气和行为边界,打造更像真人的交互体验。随着中国对生成式AI的治理持续收紧,平台需要更严格地控制内容、安全与身份冒充风险。此举反映出大模型产品正在从“追求拟人化体验”转向“强调合规可控”,也意味着AI Agent 生态将进入更审慎的发展阶段。

来源 Hacker News 时间 2026-07-06 06:02:38 AI 辅助整理
PAST-TIDE:面向立场识别的原型锚定陈述调优与话题不变归一化

这篇工作聚焦立场识别中的“话题偏置”问题:模型往往会把观点内容与特定主题强绑定,导致跨话题泛化能力不足。作者提出 PAST-TIDE 框架,通过“原型锚定”的陈述调优机制,让模型围绕代表性立场原型学习更稳定的表达,同时引入话题不变归一化,削弱主题词汇对表示空间的干扰,促使模型更多关注真正的立场信号。整体思路是把样本的立场判断从具体话题中解耦出来,从而提升在不同议题上的鲁棒性与迁移表现。该方法对社交媒体舆情分析、公共议题监测等场景具有参考价值。

来源 arXiv 时间 2026-07-06 05:33:27 实体 Semantic Kernel AI 辅助整理
URSA:面向实用逆合成评估的化学感知基准

URSA 是一个面向逆合成任务的新基准,重点不只看“能否合成”,更强调路线是否具有实用价值。与传统仅评估结构匹配或单步命中率的方法不同,URSA 引入化学感知视角,对候选逆合成方案在可行性、反应合理性与整体合成效用等方面进行更细粒度的衡量。该基准旨在帮助研究者更真实地比较不同模型在真实药物与精细化学合成场景中的表现,也为训练更符合化学规律的大模型和智能体提供标准化测试环境。

来源 arXiv 时间 2026-07-06 05:32:09 实体 Semantic Kernel AI 辅助整理
ToolFailBench:大模型智能体工具调用失效诊断基准

随着大模型智能体广泛依赖外部工具执行复杂任务,工具调用失效已成为制约其可靠性的核心瓶颈。现有评测多聚焦整体成功率,缺乏对失败根因的细粒度归因。本文提出ToolFailBench,首个专注智能体工具调用失效的诊断基准。该框架系统划分了意图偏差、参数构造错误、执行流断裂与异常恢复缺失等故障类别,并配套自动化诊断流水线与多维评估指标。研究者可借此精准定位工具链薄弱环节,针对性优化规划逻辑与容错机制,为打造高鲁棒性Agent生态提供标准化基础设施。

来源 arXiv 时间 2026-07-06 05:25:21 实体 通义千问 2.5 AI 辅助整理
看不见还是不知道:视觉语言模型错误归因研究

这篇论文聚焦视觉语言模型(VLM)在回答错误时,究竟是“看不见”输入中的关键信息,还是“看见了却没理解/没掌握”。作者提出一种错误归因视角,把模型失误拆分为感知、知识与推理等不同环节,进而分析各类错误在真实任务中的来源与表现。研究有助于区分模型的视觉识别能力不足、语言先验偏置,还是知识调用与组合推理失败,并为后续改进模型评测、训练数据设计和可解释性分析提供依据。

来源 arXiv 时间 2026-07-06 05:11:45 AI 辅助整理
视觉-语言-动作模型真的“言行一致”吗:具身推理中的忠实性问题

本文聚焦视觉-语言-动作(VLA)模型在具身推理中的“忠实性”问题,即模型给出的语言解释、推理链与实际动作决策是否真正一致。作者围绕“模型说了什么”与“模型到底依据什么做决定”之间的偏差展开分析,指出在机器人与具身智能任务中,光有看似合理的解释并不足以证明模型理解了环境或任务。研究强调,应将忠实性作为评估VLA系统的重要维度,避免把事后生成的说明误当作真实推理过程。该工作为构建更可解释、可验证、可部署的具身智能系统提供了方法论提醒。

来源 arXiv 时间 2026-07-06 05:10:27 实体 Cohere AI 辅助整理
物理约束神经框架:学习三维晶粒生长动力学

本文提出一种受物理规律约束的神经网络框架,用于学习三维晶粒生长的动态演化过程。晶粒生长是材料微观组织演化中的关键现象,直接影响金属和陶瓷等材料的强度、韧性与稳定性。该方法将传统数据驱动模型与晶界迁移、曲率驱动演化等物理先验结合,旨在提升对复杂三维结构变化的刻画能力,并减少纯黑箱模型在外推和可解释性方面的不足。研究重点在于构建能够同时保持物理一致性与学习效率的预测模型,为材料组织模拟、性能优化和工艺设计提供新的计算工具。

来源 arXiv 时间 2026-07-06 05:08:57 AI 辅助整理
面向可解释青光眼诊断的生物标志物中心眼底知识图谱

该研究提出 GlaKG,一个以生物标志物为核心的眼底知识图谱,用于支持青光眼的可解释诊断与风险评估。作者将眼底影像中的关键结构特征、临床指标及其关系进行系统化建模,把原本分散在图像与病历中的信息转化为可推理的知识网络,从而提升模型输出的透明度与临床可用性。与单纯依赖黑箱分类器的方法相比,GlaKG 强调“为什么判定为高风险”的证据链,能够帮助医生理解青光眼相关风险因素之间的关联,并为后续个体化随访与干预提供支持。

来源 arXiv 时间 2026-07-06 04:56:39 实体 Semantic Kernel AI 辅助整理
Elastic Gang:硬屏障 LLM 推理组的逐 Token 弹性成员变更

本文提出 Elastic Gang,一种面向大模型推理的协同调度机制,旨在与操作系统进程并行共调度时,降低 GPU 资源碎片与等待开销。与传统固定成员的“gang scheduling”不同,它支持按 token 粒度动态调整组内成员,在严格硬屏障同步约束下实现推理任务的弹性加入与退出。该方法特别适合多模型、多请求并发场景,可在维持推理正确性与同步一致性的同时,提升设备利用率和系统吞吐,并缓解长尾请求对整体时延的拖累。

来源 arXiv 时间 2026-07-06 04:50:32 AI 辅助整理
面向自动驾驶稀疏视角三维重建的目标结构补全方法

这项工作聚焦自动驾驶场景中的稀疏视角三维重建问题。由于车载传感器观测角度有限、遮挡频繁,常规重建方法容易在车辆、行人和路侧设施等目标上出现结构缺失与几何断裂。作者提出一种“目标结构补全”思路,针对关键对象进行有针对性的形状修复与结构推断,以提升稀疏观测条件下的三维场景完整性与可用性。该方法有助于增强对局部细节、物体轮廓和空间关系的恢复能力,从而为自动驾驶中的环境感知、规划决策和仿真建图提供更可靠的三维基础。

来源 arXiv 时间 2026-07-06 04:31:45 AI 辅助整理
FormalRx:自动形式化中的语义失效校正与检验

论文提出 FormalRx,用于系统性发现并修正自动形式化(autoformalization)中的语义失效。自动形式化旨在把自然语言数学陈述转换为形式证明语言,但模型常会在定义、量词范围、条件约束和隐含前提上偏离原意,导致“形式上可编译、语义上不等价”的问题。FormalRx 通过“校正—检验”两阶段流程:先定位潜在语义偏差,再生成更符合原命题的候选形式化,并用检查机制验证其一致性。作者围绕这一任务构建了评测与分析框架,系统揭示当前大模型在数学理解、细粒度逻辑对齐与长程依赖处理上的薄弱环节。研究为提升 AI 辅助定理证明与数学知识工程的可靠性提供了方法基础。

来源 arXiv 时间 2026-07-06 04:20:06 AI 辅助整理
贝叶斯网络的分解:局部与并行推理方法

本文讨论如何利用“分解”思想提升贝叶斯网络中的推理效率。传统精确推理在复杂网络上往往面临状态空间爆炸,难以直接计算后验分布;该文聚焦于把一个大规模贝叶斯网络拆解为若干局部子结构,使推理可以在更小的范围内完成,并进一步支持并行计算。这样的思路不仅有助于降低计算负担,也更适合分布式系统与多核环境。文章核心关注局部推理与并行推理之间的关系,强调通过结构化分解来复用局部结果、减少全局耦合,从而提升可扩展性。整体来看,这是面向概率图模型高效计算的一种结构化方法。

来源 arXiv 时间 2026-07-06 04:08:15 AI 辅助整理
基于昼夜节律评分的抑郁筛查与干预机器学习方法

本文围绕抑郁症的早筛与干预展开,提出一种基于昼夜节律评分(circadian rhythm score)的原创方法,将个体的睡眠、活动与日常行为节律特征转化为可量化指标,并结合机器学习模型识别抑郁风险。该思路旨在补足传统量表在连续监测、客观性与个体差异刻画上的不足,为抑郁症的早期预警和个性化干预提供技术路径。研究强调将生理节律信号纳入精神健康评估框架,体现了可穿戴数据与AI辅助心理健康管理的交叉趋势。

来源 arXiv 时间 2026-07-06 04:04:32 实体 Semantic Kernel AI 辅助整理
面向多模态数据的贝叶斯广义线性混合模型融合神经编码器

本文提出一种将神经编码器嵌入贝叶斯广义线性混合模型的建模框架,用于处理多模态数据中的复杂非线性关系与分层结构。方法先由神经网络从图像、文本或其他高维输入中提取潜在表示,再与贝叶斯混合效应模型结合,以显式刻画个体差异、组间变异及不确定性。相比单纯深度学习,该框架兼顾了特征学习能力与统计可解释性;相比传统混合模型,又能更好地利用非结构化数据。该工作对医疗、多源感知和社会科学等场景具有应用潜力。

来源 arXiv 时间 2026-07-06 04:01:22 实体 智谱AI AI 辅助整理
RetroCoT:用事后推理重建提示诊断模型安全差异

本文提出 Retroactive Chain-of-Thought(RetroCoT),一种“事后回溯式”推理提示框架:先要求模型依据给定线索重建事件、意图与决策链,再借此观察其是否会在不完整、含诱导性的取证语境中暴露安全边界与推理漏洞。作者将这类 forensic reconstruction prompts 作为跨代模型的安全诊断工具,用于比较不同世代模型在一致性、稳健性、拒答策略与幻觉倾向上的差异。研究强调,模型越强,不一定越安全;它们可能更善于补全叙事、也更容易在“像真的”重建中被诱导出不可靠结论。

来源 arXiv 时间 2026-07-06 03:59:06 实体 Continue AI 辅助整理
错在先对在后:对齐大模型的延迟救援与接口失效

本文揭示了对齐大语言模型在自回归生成中的时序性缺陷:模型常在初期产生错误或违规内容,而安全对齐机制往往在序列中后期才触发“延迟救援”,导致底层生成逻辑与外部安全接口发生断裂。研究指出,现有对齐范式缺乏细粒度时序控制,易引发Agent行为失控。该发现为重构实时拦截架构、提升人机交互鲁棒性提供了关键理论支撑。

来源 arXiv 时间 2026-07-06 03:51:24 实体 通义千问 2.5 AI 辅助整理
Formal Disco:可扩展的开放式形式化验证程序生成

该论文提出 Formal Disco,一种面向形式化验证程序的开放式生成框架,目标是在保持正确性的前提下,持续扩展可生成程序的规模与多样性。与传统依赖人工设计模板或有限搜索空间的方法不同,Formal Disco 结合自动化约束、程序合成与验证反馈,支持在更广阔的空间中探索可证明正确的程序候选。作者强调其“开放式”特性:系统不仅能生成单个已知任务的解,还能随着任务复杂度提升不断扩展生成能力,为自动程序合成、可信软件构建以及大模型辅助代码生成提供了新的技术路径。

来源 arXiv 时间 2026-07-06 03:31:14 AI 辅助整理
人格训练蒙特卡洛的可靠性与可识别性研究

本文围绕“persona-trained Monte Carlo”方法在异质新闻反应建模中的可靠性与可识别性展开分析。作者从方差分解入手,讨论模型输出中的不确定性来源,并给出稳定性边界,用以衡量不同人格设定下结果的一致程度。同时,论文进一步考察异质新闻反应参数是否能够被有效识别,分析在不同样本与设定下模型对真实反应差异的辨别能力。研究为基于人格提示的蒙特卡洛推断提供了理论支撑,也为评估大模型在经济金融类文本反应任务中的稳健性与解释性提供了方法参考。

来源 arXiv 时间 2026-07-06 03:22:05 AI 辅助整理
面向长文档理解的分层证据驱动推理方法

长文档理解的难点不在于“读到”,而在于从海量文本中逐步筛出关键证据,并将其组织成可追溯的推理链。该研究围绕这一问题提出分层证据驱动推理框架:先在粗粒度层面定位与问题相关的段落或片段,再在细粒度层面抽取支撑结论的具体证据,最后结合层级信息完成答案生成或判断。相比一次性全局建模,这种方法更强调检索、归纳与推理的递进协同,能够降低长上下文带来的噪声干扰,并提升复杂文档场景下的可解释性与稳定性。

来源 arXiv 时间 2026-07-06 03:08:28 AI 辅助整理
CARD:跨组件音频表征蒸馏用于无编码器音频描述生成

本文提出 CARD(Cross-component Audio Representation Distillation)框架,面向无编码器音频描述生成任务,核心思路是不再依赖传统音频编码器,而是通过跨组件表征蒸馏,把音频中的时序、频谱与语义线索压缩到更适合生成模型利用的表示中。该方法旨在缓解音频到文本映射中的信息损失与训练不稳定问题,并提升模型对复杂声场、事件重叠和细粒度声学变化的描述能力。相较于依赖重型预训练编码器的方案,CARD 更强调端到端生成与表征对齐的协同优化,为高效音频理解与开放域音频描述提供了新路径。

来源 arXiv 时间 2026-07-06 02:58:47 AI 辅助整理
MRMS:面向长寿命 AI Agent 的多分辨率记忆底座

这篇论文提出 MRMS(Multi-Resolution Memory Substrate),目标是解决长生命周期 AI Agent 在持续交互中“记不住、记不准、记不快”的核心瓶颈。作者将记忆按不同时间尺度与抽象层级组织,使 Agent 能同时保留细粒度事件、阶段性经验与高层语义知识,并在检索时按任务需求动态调用。相比单一向量库或简单摘要式记忆,MRMS 更强调可压缩、可更新和可追溯,适合长期陪伴、复杂工作流与多轮协作场景。该工作体现了大模型 Agent 从“短上下文对话”走向“持续存在系统”的重要一步。

来源 arXiv 时间 2026-07-06 02:54:37 AI 辅助整理
SILO:面向多阶段线缆布线的仿真闭环 Sim-to-Real 迁移方法

本文提出 SILO(Simulation-in-the-Loop),用于解决多阶段线缆布线任务中的仿真到真实世界迁移问题。线缆布线兼具长时序、多接触、强几何约束等特点,传统单次仿真训练往往难以适应真实环境中的偏差。SILO 的核心思路是在训练过程中持续引入真实执行反馈,让仿真策略在循环中修正轨迹与动作分布,从而缩小 sim-to-real gap。该方法面向多阶段操作流程,将复杂布线拆解为若干可控阶段,并通过仿真闭环提升策略鲁棒性与泛化能力。研究显示,这种“边仿真、边校正”的训练范式能更稳定地迁移到真实机器人系统,适用于柔性物体操控与工业装配场景。

来源 arXiv 时间 2026-07-06 02:48:10 实体 Semantic Kernel AI 辅助整理
受治理的个体化:用密码学将智能体学习与权限解耦

本文围绕“受治理的个体化”展开,讨论如何通过密码学机制,将智能体在运行中获得的学习能力与其可执行权限相互分离。作者关注的是:智能体即便持续从环境和交互中积累经验,也不应自动扩大其对外部系统的控制范围。通过这种解耦设计,系统可在保留适应性与持续学习能力的同时,降低越权操作、能力漂移和权限滥用的风险。该思路对需要长期在线学习、但又必须满足审计、合规与最小权限原则的AI Agent架构具有现实意义。

来源 arXiv 时间 2026-07-06 02:42:06 实体 Continue AI 辅助整理
白宫介入世界杯红牌争议,试图推翻判罚

据华尔街日报报道,美国白宫曾介入一场世界杯相关的红牌争议,试图推动国际足联撤销对球员的处罚。事件围绕一张关键红牌展开,背后牵涉到美国队在赛事中的竞争利益、赛事裁判权威,以及政治力量对体育判罚的边界。报道显示,这类操作并非单纯的赛场申诉,而是由政府层面通过外交和舆论渠道施压,希望改变比赛结果带来的连锁影响。此事也再次引发外界对国际体育治理独立性、公平竞争原则以及主办国与国际组织关系的讨论。

来源 Hacker News 时间 2026-07-06 02:41:08 AI 辅助整理
G2VD:通过反事实干预与因果解耦实现可泛化AI生成视频检测

本文聚焦AI生成视频检测在跨模型、跨数据分布场景下泛化不足的问题,提出G2VD框架。方法核心是将视频中的伪造线索与内容语义、运动模式等因素做因果解耦,并通过反事实干预显式削弱与生成器特定风格相关的偏置特征,从而迫使模型学习更稳定的判别依据。相较依赖表面纹理或局部伪影的传统检测器,G2VD更强调可迁移的因果特征表示,提升对未知生成模型和后续编辑手段的鲁棒性。该工作为深度伪造视频检测提供了一种更具泛化能力的因果学习思路。

来源 arXiv 时间 2026-07-06 02:25:18 实体 Semantic Kernel AI 辅助整理
视觉 token 并非同等重要:面向图文检索的目标证据保留式 token 合并

本文关注视觉语言检索中的一个核心效率问题:视觉编码器产生的大量 token 并非都同等重要,若直接压缩,容易丢失与检索相关的对象证据。作者提出一种“目标证据保留式”token 合并方法,在降低视觉 token 数量、减少计算开销的同时,尽量保留图像中对文本匹配最关键的物体线索。该方法面向图文检索场景设计,强调在压缩过程中维持对象级语义信息,从而兼顾效率与检索精度。整体思路适合大模型视觉端加速,也为视觉 token 选择与信息保真提供了新的视角。

来源 arXiv 时间 2026-07-06 02:19:11 AI 辅助整理