本文围绕自由观看场景下的注视数据分析,提出并评估一致性聚类方法,用以从个体差异明显的眼动轨迹中提炼稳定的群体结构。作者从“人如何与信息交互”的角度出发,结合多参与者自由浏览时的注视模式,识别出具有共同特征的视觉关注簇,并进一步分析这些簇与任务、内容布局及信息显著性的关系。研究表明,一致性聚类能够比传统方法更稳健地揭示人类视觉注意的共享规律,为理解阅读、浏览与界面设计中的信息引导机制提供了新证据,也为眼动数据建模和人机交互优化提供了可迁移的方法基础。
AI Agent 与大模型中文情报库
持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。
最新动态
最近更新:2026-07-08 10:30:33本文提出 T3R,一种面向图神经网络的测试时自适应方法,目标是在不重新训练模型的情况下,提升模型在分布漂移场景下的泛化能力。与常见只在浅层参数或少量步数上做微调的方法不同,T3R 强调更“深层”的测试时适应,并引入梯度旋转机制,缓解适应过程中梯度方向不稳定、更新冲突和过拟合测试样本的问题。该方法适用于图数据中常见的结构变化、特征偏移和跨域迁移场景,旨在让已训练好的 GNN 在推理阶段更稳健地自我调整。
AlgoSkill 提出一种面向算法设计的新训练范式:将“规划、分解、比较、验证、修正”等类人技能显式组织成可调度的流程,让模型不只是在生成答案,而是在逐步形成可复用的算法设计策略。该工作关注大模型在组合推理与算法构造中的局限,尝试通过技能编排提升其对复杂问题的建模、搜索与反思能力。其核心思路是把算法设计视为技能协同而非单次推断,从而增强模型在新任务上的泛化、稳定性与可解释性,适合用于代码生成、竞赛题求解和自动化推理系统。
该工作聚焦循环式 Transformer 在测试时长上下文外推中的不稳定问题:模型在迭代推理中往往会出现发散、振荡或性能退化。作者提出一种可学习的随机停止机制,让模型在每次循环后根据当前状态自适应决定是否继续迭代,从而避免固定步数带来的过度计算或不足计算。该方法本质上把“何时停止”纳入训练目标,使模型在保持推理灵活性的同时提升外推稳定性与鲁棒性。实验表明,这种停止策略可显著改善循环推理在更长序列和更难分布外场景下的表现。
本文聚焦机器人与智能体在新环境中的探索效率和在线迁移能力。作者提出以行为基础模型为核心,将大规模离线行为数据中学到的先验用于在线决策,使智能体在未知任务中更快找到有效策略,并在任务、场景或动力学发生变化时持续自适应。相比传统依赖纯试错的探索方法,该思路强调利用通用行为表征提升样本效率与鲁棒性,为具身智能、机器人操作和持续学习提供了更可扩展的基础框架。
该论文提出一种将一阶时序逻辑与张量网络结合的表示与推理框架,目标是在统一的数学形式下刻画对象、关系及其随时间变化的约束。与传统符号逻辑方法相比,这类张量化建模更适合处理连续参数、并行计算和可微优化,也为将逻辑规则嵌入神经系统提供了接口。论文关注如何把时序算子、量词与张量结构对应起来,从而支持对动态知识、事件演化和时间依赖关系的表达与推断。该方向可为神经符号推理、知识图谱时序建模以及可解释 AI 提供新的理论基础。
本文提出 NeuReasoner,用理论视角系统刻画“何时、何种条件下”大模型更容易被诱发出推理能力,并进一步映射这种能力的边界。作者关注的不是单纯提升答案正确率,而是识别提示、任务结构与模型内部表征之间的关系,从而解释推理行为为何在不同场景下呈现明显差异。该工作为理解大模型推理的可触发性、稳定性与失效模式提供了理论化框架,也为设计更可靠的推理提示、评测协议和 Agent 任务拆解策略提供参考。
RiverONE 提出一种面向知识密集型场景的视觉语言模型生成框架,核心思路是借助“模拟量子机器”来组织和驱动模型能力的形成。与传统依赖静态训练数据和单一监督信号的方法不同,该工作强调将知识获取、表示与推理过程纳入统一生成机制,以提升模型在复杂语义理解、跨模态对齐和知识调用方面的表现。论文关注的问题不仅是让 VLM“看懂图像、读懂文本”,更是让模型具备更强的结构化知识整合能力,适用于需要外部知识参与的问答、分析与推断任务。整体上,这是一项偏方法论探索的研究,试图为下一代知识增强型多模态模型提供新的构建范式。
这篇论文聚焦端侧记忆智能体的能力提升,提出 DuoMem 框架,通过“双空间蒸馏”将云端大模型的知识与记忆能力迁移到可本地部署的轻量模型中。其核心思路是在表示空间与行为空间同时对齐,让学生模型不仅学会记住关键信息,还能在多轮交互中更稳定地检索、更新并利用长期记忆。作者强调,端侧场景往往受限于算力、隐私和时延,因此需要兼顾效率与效果的记忆机制。实验表明,DuoMem 能显著增强设备端智能体在持续对话、个性化记忆与任务跟踪等场景中的表现。
本文提出并评估了 SWE-Together,一个面向代码智能体的交互式评测框架,重点考察模型在真实用户参与的会话中如何理解需求、持续澄清问题并逐步完成修复任务。与一次性提交式基准不同,该工作更关注编码智能体在多轮沟通中的协作能力、上下文保持、错误恢复与任务推进效率。研究通过构建接近真实软件工程场景的交互流程,分析不同智能体在需求模糊、约束变化和用户反馈存在歧义时的表现差异,为衡量“会聊天、会协作、会落地”的编程助手提供了更贴近实际的软件工程评测视角。
SpreadsheetBench 2 面向真实商业场景下的电子表格任务,评估大模型智能体能否完成从理解需求、处理数据到生成结果的端到端工作流。相比只考查单步操作的传统基准,它更强调多步骤推理、表格函数运用、跨表引用、格式与结果一致性,以及在复杂业务约束下的自动化执行能力。该基准有助于衡量智能体在 Excel/Sheets 这类高频办公工具中的实用性,也为“AI 助理直接接管表格工作”提供更贴近真实工作的测试环境。
本文聚焦分布外检测(OOD)在深度模型中的高效实现问题,提出利用决策边界附近“局部平坦性”的新思路来识别异常样本。与依赖额外生成模型或昂贵集成方法的方案不同,该方法从模型在输入邻域内的输出稳定性出发,刻画样本是否处于训练分布支持区域内:若轻微扰动下预测保持平滑一致,往往更可能属于已知分布;反之则可能为分布外数据。该框架旨在在不显著增加推理成本的前提下提升OOD检测效果,适用于部署场景下的实时监控与可靠性增强。
英国《每日电讯报》报道称,多国央行人士警告,当前由生成式AI和算力投资推动的科技热潮,正在把资金、估值与预期推向危险区间。一旦企业盈利兑现不及预期,或市场重新评估AI应用落地速度,相关股票、债券和私募资产可能同步回调,进而放大金融系统压力。报道将这一风险与2000年互联网泡沫类比,指出“卖铲子”的芯片、云计算和数据中心供应链也已被过度定价。
Wayfinder Router 是一个开源轻量级路由中间件,专为多LLM环境设计,支持基于规则(如模型能力、上下文长度、响应延迟)或策略(如成本、隐私合规性)对用户请求进行确定性分发——即相同输入始终路由至同一后端模型。它不依赖外部服务,可嵌入现有API网关或Agent框架,兼容OpenAI、Ollama等主流接口,并内置负载均衡与故障转移机制。项目采用Rust编写,强调低延迟与高可靠性,适用于需兼顾数据主权(本地部署模型)与算力弹性(云端托管模型)的混合推理场景,如企业知识助手或边缘AI应用。
loopy 是一个面向 AI Agent 的实用型循环工作流库,同时也提供可安装的 skill,用来帮助用户发现、改造并设计可重复执行的 agent 工作流。它强调“循环”这一核心模式:把规划、执行、检查、修正等步骤组织成稳定的迭代流程,适合构建更可靠的自动化代理。对于想把大模型从一次性问答推进到持续执行任务的团队来说,loopy 提供了可落地的范式,既能直接复用现成流程,也便于基于具体场景快速调整。项目以 JavaScript 生态为基础,适合与现有开发工具和 agent 框架结合。
据《每日邮报》报道,一架小型民用飞机于今日上午意外撞击北京中信大厦(中国尊),该建筑高528米,为北京目前最高摩天楼。事故未造成明火或结构坍塌,但导致部分楼层玻璃幕墙碎裂、内部烟雾弥漫,大厦启动应急疏散程序,数千名办公人员被有序撤离。北京市应急管理局与民航华北地区管理局已联合成立调查组,初步排除恐怖袭击可能,疑似因恶劣天气与导航设备异常导致飞行偏离航线。目前无人员死亡报告,但有十余人受轻伤送医。事件引发公众对超高层建筑低空飞行安全防护及城市空中交通管理机制的广泛讨论,业内专家指出,现行《通用航空飞行管制条例》对城市核心区禁飞区动态监控仍存盲区。
DexCompose提出一种面向多任务操作的灵巧手策略复用框架,核心目标是在仅使用单只机械手的情况下,让已学会的技能更高效地迁移到新任务上。相比为每个任务单独训练策略,该方法强调将动作能力拆解并组合,通过复用已有的 dexterous policy 来覆盖更广的操作场景,从而降低训练成本与数据需求。文章聚焦灵巧操作中常见的“任务相似但目标不同”问题,尝试在保持控制精细度的同时提升泛化能力。该研究与机器人学习、技能组合和多任务操作密切相关,对减少大规模机器人采集与训练开销具有现实意义。
本文讨论零和博弈中“纳什均衡并不唯一”这一常被忽视的问题:当可行均衡构成一个多面体时,不同求解器、不同数值设置乃至不同优化路径,可能会稳定地选出不同的均衡点。作者系统分析了这种“求解器依赖的均衡选择”现象,强调传统上把均衡视为唯一输出的做法,会掩盖算法对结果的隐性偏置。论文进一步从几何与优化角度解释了零和纳什多面体上的选择机制,并讨论其对博弈求解、策略评估以及基于均衡的学习系统的影响。
本文提出一种面向掩码扩散模型的测试时扩展方法 VGB,目标是在不重新训练模型的前提下,更高效地提升生成样本对外部奖励或约束的满足程度,并支持更灵活的样本编辑。该方法围绕“在推理阶段分配额外计算”这一思路,通过更有针对性的搜索与修正策略,在保持生成质量的同时增强可控性与任务适配能力。与传统依赖大规模重采样或复杂后处理的做法相比,VGB 更强调计算效率和可扩展性,适合需要按奖励反馈动态优化输出的场景。整体上,这项工作为扩散模型的测试时对齐与可控生成提供了新的工程化路径。
本文提出“民主式ICAI”框架,尝试将人类偏好直接转化为可用于引导AI行为的原则。作者认为,与其依赖少数专家预先定义规则,不如让不同参与者围绕偏好展开结构化辩论,再从争议中提炼更具共识性的 steering principles。该方法关注的是如何在交互式对齐(ICAI)中,把分散、冲突甚至隐性的价值判断,逐步整理成可操作的治理依据。论文强调辩论不仅是生成结论的机制,也是一种发现分歧、校准权重、暴露偏差的过程,对大模型对齐、偏好建模与AI治理都有启发意义。
该研究面向核物理中的全局核质量预测问题,尝试将第一性原理计算所蕴含的对称性约束与神经网络建模相结合。作者提出可解释神经网络框架,把物理先验嵌入模型结构或特征表示中,在保持对核质量系统性规律敏感性的同时,提升对未知核区的泛化能力。与传统黑箱机器学习相比,该方法更强调可追溯性,便于分析哪些物理量、对称性或核结构因素主导了预测结果。研究结果表明,借助这些物理约束,模型能够更稳健地重建已知核质量并外推到远离稳定线的核素,为核质量表、核结构研究以及天体核合成中的输入数据构建提供了新的数据驱动工具。
本文讨论 AI 原生软件开发中的风险评估应从“单个 Agent 是否安全”转向“代码仓库与生态系统是否可控”。作者指出,随着大模型 Agent 具备读写仓库、提交补丁、触发自动化流程等能力,风险往往通过依赖关系、权限边界和协作流程在仓库层面放大,而非只体现在某次模型输出上。论文提出面向生态层级的风险度量框架,用于衡量仓库结构、工具链集成、访问权限与自动化程度共同带来的攻击面与失控概率,为 AI 参与软件工程的治理、审计和部署策略提供依据。
COCOLogic-V2 聚焦于自动识别文本或推理结果中的逻辑不一致问题,核心改进在于构造“真正困难”的负样本,以显著提升模型对细微矛盾、表面合理但实则错误推理的辨别能力。相比常规负样本,这类样本更接近真实应用中的模糊边界与混淆场景,因此更能检验和强化模型的逻辑判别能力。该工作延续并扩展了 COCOLogic 系列思路,强调高质量对照数据在逻辑一致性检测、推理鲁棒性评估与模型训练中的关键作用,可用于推动大模型在复杂推理任务上的可靠性提升。
本文围绕斯里兰卡汇款体系展开数据驱动分析,旨在为政策制定、金融服务优化与侨汇管理提供可操作的决策支持。研究重点不只是统计汇款规模和流向,而是进一步识别影响汇款行为的关键因素、资金进入国内后的分布特征,以及其对家庭消费、外汇稳定和宏观经济的潜在影响。文章通过整合多源数据与分析方法,构建面向治理与金融服务场景的“汇款蓝图”,强调以数据智能提升透明度、效率与韧性。对于关注发展经济、金融科技与公共政策的读者,这是一篇具有现实应用导向的工作。
这篇论文提出 LLawCo,用于从交互数据中学习“协作法则”,以刻画具身多智能体在真实环境中的协同行为。与只关注单个智能体策略不同,该方法强调从群体互动里归纳可迁移的合作规律,从而更准确地建模多智能体在任务执行、空间协调与目标分配中的动态关系。作者希望借此提升对复杂具身场景中群体行为的解释能力与预测能力,也为后续多机器人协作、仿真训练和人机协同提供基础。该工作处于多智能体学习与具身智能交叉方向,关注的是如何从经验中抽象出可复用的“合作规则”。
该文提出CPAgents,一种面向心脏疾病关联研究的智能体式复合表型生成框架。论文聚焦电子病历中表型定义分散、组合复杂、人工构建成本高的问题,利用大模型驱动的多智能体协作,自动生成、组合并校验与心脏疾病相关的复合表型,从而提升疾病关联分析的效率与覆盖面。作者强调,该方法不仅能减少对专家手工规则的依赖,还可更灵活地适配不同临床场景中的表型描述与研究需求。整体上,这项工作将Agentic工作流引入医学表型工程,为临床数据挖掘、疾病分层和生物医学关联发现提供了新的自动化路径。
这项研究提出 EchoSonar-R,一种面向超声心动图的多视图推理模型,旨在同时完成疾病分类与检查报告生成。与仅依赖单帧或单视角信息的传统方法不同,该模型利用心脏超声中的多视图成像特征,结合推理机制整合不同视角下的结构与功能线索,从而提升对复杂病变的识别能力。研究重点关注临床场景中“看图诊断”和“自动生成报告”两类关键任务,希望为超声检查的智能辅助解读提供统一框架,也为多模态医学视觉-语言建模在心血管影像中的应用提供参考。
本文提出一种正则化奖惩强化学习框架,将传统奖励最大化与惩罚约束纳入同一优化视角,用以缓解强化学习中策略更新不稳定、信用分配困难以及约束违背等问题。作者通过引入正则项控制策略偏移,并在奖惩信号之间建立更清晰的权衡机制,使算法在保持探索能力的同时提升训练鲁棒性与收敛稳定性。该方法适用于需要兼顾性能与安全/成本约束的场景,例如机器人控制、推荐系统和大模型对齐训练。
本文聚焦于上下文分割中的鲁棒性问题,即模型在仅依赖少量示例或提示进行分割时,容易受目标外观变化、背景干扰和类间相似性的影响。作者提出“概念引导”思路,将抽象语义概念引入分割推理过程,以增强模型对目标本质特征的捕捉能力,而不只依赖表层视觉匹配。该方法旨在提升 in-context segmentation 在跨场景、跨类别和复杂背景下的稳定性与泛化能力。相比传统依赖像素或局部特征对齐的方案,这一方向更强调语义层面的约束与引导,为大模型驱动的视觉分割提供了更具可迁移性的设计范式。
本文聚焦图欺诈检测中的少样本难题:真实业务里可标注欺诈样本极少,而欺诈关系又高度依赖图结构,导致传统监督学习容易失效。作者提出一种扩散引导的学习框架,将扩散模型的生成与去噪能力用于补足稀疏标签场景下的训练信号,并结合图表示学习提升对可疑节点与边关系的辨识能力。方法核心是利用扩散过程缓解样本不足带来的偏置,让模型在少量标注下仍能学习更稳健的欺诈模式。实验表明,该方法在少样本图欺诈检测任务中较现有基线更具鲁棒性与泛化能力。