Cohere

company
AI 辅助整理 · 事实字段按公开来源校验

加拿大 AI 公司,专注企业级 LLM 与检索,主打 Command 系列与嵌入/重排模型。

内容完整度: 4/5 · 待补:related_entities

事实字段

类型
企业 LLM
代表产品
Command
国家/地区
加拿大
来源追溯: 事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。

整理说明

本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 Cohere 在 AI Agent 与大模型生态中的位置。

事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。

版本演进

2026-07-08
update
本文提出嵌套情景状态拓扑(NEST),尝试用图论框架刻画认知状态的组织方式与动态演化。作者将认知过程表示为由多个情景状态构成的嵌套结构,并通过节点、边及层级关系描述状态之间的关联、切换与复用机制。相比传统把思维视为线性序列的模型,NEST更强调状态的层次性、上下文依赖性以及跨场景的结构共享。该架构可为记忆建模、任务规划和代理式推理提供统一表示,也有助于分析大模型在复杂任务中的内部状态流转。 原文
2026-07-08
update
本文提出一种面向可维护性的混合生成式音乐系统设计思路,将规则约束、搜索策略与生成模型结合,用于自动生成旋律和声。作者借鉴量子启发式的表示与优化思想,把和声选择视为多状态协同搜索问题,以提升生成结果的连贯性、可控性与风格一致性。相较于单纯依赖大模型的端到端方案,该方法更强调模块化架构、可解释规则和工程可维护性,便于后续迭代、调参与扩展。文章聚焦自动作曲中的和声生成任务,为AI音乐系统在创意能力与系统稳定性之间取得平衡提供了新的设计路径。 原文
2026-07-08
update
UI2App 提出一个面向可执行网页应用生成的新基准,重点考察模型能否从界面视觉信息中推断用户交互逻辑,而不只是复刻静态页面外观。作者围绕“视觉交互推断”这一任务,构建评测流程来检验模型对按钮、输入框、状态变化与页面跳转等行为关系的理解能力,并将其置于真实可运行的 Web 应用生成场景中。该工作有助于区分“能画页面”与“能做应用”的能力差异,也为评估多模态大模型、Agent 与前端自动化生成系统提供了更贴近实际的软件工程基准。 原文
2026-07-08
update
本文聚焦长视频外推中的计算与参数效率问题,提出一种结合 Prompt-Adapter 与上下文路由的轻量化框架,用于在少量示例条件下生成更长时间跨度的视频内容。方法核心是在不同上下文与任务模式之间进行自适应路由,将提示信息与适配器模块有机结合,从而减少对大规模微调参数的依赖,同时提升长时序一致性与画面延续性。该思路适合处理长视频预测、延展与补全等任务,尤其面向资源受限场景下的多样本推断。 原文
2026-07-08
update
该论文聚焦全双工语音语言模型(SLM)在“边听边说”场景中的建模难题,提出一种层次化声学-语义框架,以缓解语音信号中的声学细节与高层语义目标相互干扰的问题。作者通过模态分离,将底层声学表征与上层语义表征解耦,再结合语义连贯性约束,提升连续对话中的上下文一致性与响应稳定性。该方法旨在让模型更好地同时处理输入语音、生成自然回复,并保持实时交互中的理解与表达协同,为全双工语音助手、实时陪伴式对话系统和低延迟多轮交互提供新的结构设计思路。 原文
2026-07-07
update
本文聚焦视觉-语言-动作(VLA)模型在具身推理中的“忠实性”问题,即模型给出的语言解释、推理链与实际动作决策是否真正一致。作者围绕“模型说了什么”与“模型到底依据什么做决定”之间的偏差展开分析,指出在机器人与具身智能任务中,光有看似合理的解释并不足以证明模型理解了环境或任务。研究强调,应将忠实性作为评估VLA系统的重要维度,避免把事后生成的说明误当作真实推理过程。该工作为构建更可解释、可验证、可部署的具身智能系统提供了方法论提醒。 原文
2026-07-03
update
这篇论文提出了一个面向档案胶片修复的新基准 AbsoluteDegradation,核心贡献是构建了一套受真实物理过程启发的合成胶片退化流水线,用于更逼真地模拟老胶片在长期保存与放映过程中出现的褪色、划痕、污渍、颗粒噪声、化学劣化等问题。与仅靠简单噪声或单一退化模型不同,该方法强调退化机制的可控组合,从而为训练和评估胶片修复模型提供更接近真实场景的数据支撑。论文同时将该流程包装成档案胶片修复基准,旨在统一比较不同恢复算法在复杂退化条件下的表现,并推动面向文化遗产数字化的视觉修复研究。 原文
2026-07-03
update
该研究聚焦检索增强推理中的一个关键问题:模型在利用外部知识作答时,推理过程是否真正与检索到的证据一致。作者提出 CheckRLM,用于有效检查“知识—思维”一致性,帮助识别大模型在引用信息、链式推理与最终结论之间出现的偏差、幻觉或逻辑断裂。与只看答案正确与否不同,该方法更强调推理可追溯性和证据对齐,适用于需要高可靠性的问答、检索增强生成与复杂推理场景。 原文
2026-07-03
update
本文研究在量子存储受限的条件下,如何最有效地测试与学习稳定子态(stabilizer states)这一量子信息中的重要类别。作者关注的问题不仅是“能否识别”某个量子态是否属于稳定子集合,还包括在只允许有限量子内存、甚至需要分批接收量子样本时,怎样设计最优算法以尽量减少样本消耗和存储开销。该工作从理论上刻画了测试与学习任务的复杂度边界,并给出在受限内存模型下的最优或近最优方案。这类结果对量子纠错、量子态表征、以及资源受限的量子实验和量子机器学习都有直接意义。 原文
2026-07-02
update
本文聚焦长篇叙事生成中的核心难题:如何让角色行为、人物关系与情节发展保持一致且具备长期连贯性。作者提出一种角色锚定的多智能体故事生成框架,将不同角色拆分为多个协同智能体,使其基于各自的人物画像、动机与记忆共同推进故事,而不是仅由单一模型一次性生成全文。该方法旨在提升人物一致性、剧情可控性和长文本中的前后呼应能力,并为自动生成小说、剧本和互动叙事提供更稳健的技术路径。 原文
2026-07-02
update
该研究提出一种图原生强化学习框架,用于从现有知识中进行“概念重组”,自动生成可追溯的科学假设。方法将科学知识表示为图结构,并在图上直接进行策略学习与搜索,从而把文献、概念和关系纳入统一推理空间。与传统黑箱式生成不同,该框架强调每一步推导路径都可回溯,可帮助研究者理解某个假设是如何由多个已知概念组合而来。作者希望借此提升假设生成的系统性、可解释性与可验证性,为 AI 辅助科研提供一种更透明的路径。 原文
2026-07-02
update
这项研究提出 SenseWalk,用大语言模型驱动智能体在分区环境中生成语义轨迹,用于模拟人或实体在空间中的移动、停留与路径选择。与传统只关注坐标序列的轨迹生成不同,SenseWalk 更强调“行为—语义—环境”之间的对应关系,将环境划分为具有不同功能或语义属性的区域,并让智能体依据上下文做出更符合真实场景的决策。该方法可用于城市空间分析、位置感知建模、数字孪生与仿真训练等任务,尤其适合需要理解“为什么会走这条路线”的场景。论文体现了大模型在空间行为建模中的新用法,即从语言知识中提炼人类式决策逻辑,提升轨迹仿真的可解释性与场景适配能力。 原文
2026-07-02
update
Theoria 研究的是:在大模型进行多步推理时,如何判断一段“非形式化”的中间推理状态,能否被安全地重写而不破坏最终结论。作者将推理过程视为可编辑的状态序列,并提出“重写可接受性”验证框架,用于衡量对中间步骤做局部修改后,结果是否仍与原推理目标一致。该思路可用于提升长链推理的可控性、纠错能力与可解释性,也为自动化审计、推理压缩和代理式工作流中的状态修复提供基础。 原文
2026-07-01
update
该文研究如何在图像生成过程中显式控制像素或特征分布,使生成结果满足预设的直方图约束。与常规扩散模型或GAN只追求整体逼真度不同,这类方法更强调输出在亮度、颜色或纹理统计上的可控性,适用于医学影像、遥感和工业质检等对分布一致性要求较高的场景。论文围绕约束注入、生成优化与分布匹配展开,探讨在不明显损伤视觉质量的前提下提升生成结果的统计可解释性与可控性。 原文
2026-07-01
update
本文提出 WIDER-FAIR,这是对经典人脸检测数据集 WIDER-FACE 的人工标注增强版本,目标是为算法公平性评估提供更可靠的基准。原始 WIDER-FACE 主要用于检测任务,而 WIDER-FAIR 进一步补充与整理了与人群属性相关的标注,使研究者能够分析不同子群体上的性能差异,识别模型在性别、肤色、年龄等维度可能存在的偏差。该数据集可用于人脸检测、鲁棒性分析以及公平性诊断,为构建更负责任的视觉模型提供数据基础。 原文
2026-07-01
update
本文聚焦闭环交通建模中的一个核心难题:现实中可获得的往往只是车辆传感器、路侧设备等有限局部观测,而交通流仿真又需要刻画全局路网状态及其动态耦合。作者尝试在局部数据与全局模拟之间建立桥梁,使模型既能利用真实观测进行校准与反馈,又能在未观测区域保持合理的系统级一致性。该方向对交通预测、信号控制、自动驾驶仿真和数字孪生城市具有重要意义,也反映出大模型时代中“感知—推理—仿真”一体化建模的趋势。 原文
2026-07-01
update
LUNA提出一种面向通用三维人体动画的新方法,试图突破传统基于骨骼蒙皮的表达限制。该类方法在处理复杂衣物、非刚性形变、拓扑变化或大幅度动作时,往往容易出现失真、穿模和细节丢失。LUNA通过学习更通用的人体动画表示,将人体运动、外观与几何变化进行更灵活的建模,从而支持更自然、更高保真的三维人物动画生成。该研究对数字人、虚拟现实、游戏制作与影视特效等场景具有较强应用价值,也反映出当前三维人体建模正从“骨骼驱动”向“数据驱动的通用动态表示”演进。 原文
2026-07-01
update
本文讨论一种通过“链式再生”(chained regeneration)来放大成员信号的技术路径,核心关注点是如何让模型在多轮生成与重构过程中,逐步增强某类样本是否出现在训练集中的可辨识特征。此类方法与成员推断、隐私评估和数据泄露风险分析密切相关,也可用于检验大模型对训练数据的记忆程度。文章从生成链条中信号累积的角度切入,说明再生成过程并不只是内容重写,还可能放大原本微弱的统计痕迹,从而提升成员身份判别能力。该研究对理解模型记忆、训练数据暴露与隐私防护具有参考价值。 原文
2026-07-01
update
本文聚焦 ARC-AGI-2 这类强调通用推理与组合泛化能力的基准,提出一种“模态驱动搜索”框架,并结合“全局轨迹判别”机制来提升解题表现。其核心思路是:不再仅依赖单步启发式决策,而是围绕不同模态信息对候选解题路径进行搜索、生成与筛选,再从整体执行轨迹层面评估方案是否自洽、稳健且真正符合任务意图。该方法试图缓解传统大模型在抽象规则发现、长链推理和错误累积上的不足,为 ARC 类任务提供更具结构性的搜索范式,也体现了“生成—验证—重排”结合的 Agent 化解题方向。 原文
2026-07-01
update
本文研究多语言工具使用智能体如何在保持推理与调用工具能力的同时,高效适配到目标语言。作者提出一种“英语思考、韩语作答”的训练与推理范式:让模型内部推理与工具交互优先使用高资源语言英语,而最终面向用户的自然语言输出切换为韩语。该方法利用英语在工具调用、规划和推理上的稳定性,减少直接在低资源语言中端到端对齐的成本,并显著提升多语言场景下的可迁移性与效率。实验表明,这种分离式适配策略能在较少额外训练开销下,兼顾回答质量、工具使用正确率与语言自然度,为多语言 Agent 的低成本落地提供了可行路径。 原文
2026-06-30
update
MaDI-Bench 是一个面向端到端数据集成场景的新型基准,旨在系统评估模型或智能体在真实数据整合流程中的综合能力,而不仅仅是局部子任务表现。与只关注实体匹配、模式对齐或数据清洗的传统数据集不同,该基准更强调从输入数据、关系发现到集成结果生成的完整链路,能够更贴近企业数据治理、知识库构建与多源异构数据融合等实际需求。它为研究者提供了统一的评测框架,有助于比较不同方法在复杂集成任务中的鲁棒性、准确性与端到端完成度。 原文
2026-06-30
update
本文聚焦稀疏自编码器在表征学习中的两个常见问题:特征分裂与特征吸收。前者指同一语义特征被拆散到多个神经元中,后者则表现为部分特征过度占用表示容量,压制其他特征的学习。作者提出跨样本一致性正则化方法 C²R,通过约束不同样本在特征激活上的一致性,鼓励模型形成更稳定、可解释且更少冗余的稀疏表示。实验表明,该方法能有效缓解上述问题,并提升特征可分性与重构质量,为稀疏自编码器在可解释 AI 和机制可视化中的应用提供了新思路。 原文
2026-06-30
update
LeVo 2 面向歌声生成中的稳定性与音乐性难题,提出一种结合层级表征建模和渐进式后训练的生成框架。该方法通过在不同时间尺度上分解并学习音乐与人声信息,强化旋律、节奏与演唱细节的一致性,从而缓解传统生成模型常见的音准漂移、连贯性不足和音色生硬等问题。论文进一步引入分阶段后训练策略,逐步提升模型对真实演唱分布的拟合能力,使生成结果在稳定性、可唱性和听感自然度上更均衡。整体上,LeVo 2 展示了大模型化歌声生成在结构建模与训练策略上的新进展。 原文
2026-06-30
update
本文讨论一种用于产品演示的多智能体协同方案:先通过“排练”机制让多个智能体分工演练讲解、问答与流程衔接,再在正式直播中结合实时语音问答能力,持续回应观众提问。该方法的重点不只是生成演示内容,而是让演示过程具备更强的互动性、稳定性与可控性,降低现场讲解中断、回答不一致或信息遗漏的风险。此类系统对 AI 直播、售前演示、远程销售和客服导览等场景具有参考价值,也体现了大模型应用从单轮对话向协作式、实时化人机交互的演进。 原文
2026-06-29
update
这篇论文提出一种面向语音认知障碍检测的多阶段可解释框架,目标是在提升分类性能的同时,让模型输出更贴近临床可理解的证据。作者围绕语音中的韵律、流利度、发音和语言组织等线索进行分层建模,并通过阶段化分析将“识别结果”进一步转化为“可解释特征”。该方法强调从黑箱判别走向临床洞察,既可用于辅助早筛,也有助于医生理解模型为何给出高风险判断,从而提升系统的可信度与可用性。 原文
2026-06-29
update
该研究聚焦异常分割中的一个关键难点:模型不仅要识别像素级异常,还要尽量保持目标区域的拓扑结构与边界连贯性。论文提出一种面向测试时自适应的方法,在推理阶段利用未标注测试数据持续调整特征表示,使模型逐步学习更具拓扑感知能力的表征。与传统仅依赖静态训练权重的方法相比,这种策略更适合面对分布偏移、复杂背景和形态多样的异常目标。作者强调,方法核心并非单纯提高局部分类精度,而是通过自适应机制增强对结构一致性和空间连通性的建模,从而提升异常区域分割质量与鲁棒性。 原文
2026-06-26
update
该论文提出Look-Before-Move(观而后行)框架,旨在解决AI Agent在动态3D故事世界中执行任务时的视觉注意力分配问题。不同于传统端到端策略,该方法将叙事文本作为语义锚点,通过跨模态对齐实现‘叙事-场景’联合 grounding,引导Agent在动作执行前主动聚焦于与当前情节逻辑相关的关键物体与空间区域。作者构建了Narrative3D基准——首个融合多角色、时间演进与因果逻辑的3D叙事环境,并在其中验证了模型在任务成功率、注意力合理性及跨场景泛化性上的显著提升。研究为具身智能体理解复杂叙事驱动行为提供了新范式,也揭示了语言引导视觉注意对认知建模的重要价值。 原文
2026-06-26
update
该论文系统梳理了具身智能体(Embodied Agents)在多模态感知与物理交互能力上的关键进展,指出当前研究仍受限于任务隔离、仿真-现实鸿沟及长程规划薄弱等瓶颈。作者提出‘日常物理自主’(Everyday Physical Autonomy)新范式,强调在开放家庭环境中持续理解、推理并执行复杂物理任务的能力,并构建了涵盖视觉-语言-动作-触觉的全模态(Omnimodal)统一架构。文中还介绍了首个面向真实家居场景的细粒度评估基准EPA-Bench,验证了模型在物体操作、工具使用与跨任务泛化上的显著提升。研究为具身AI从实验室走向真实世界提供了可扩展的方法论框架。 原文
2026-06-25
update
该论文从模型论与集合论交叉视角出发,严格证明了“可测多数”(measurable majorities)这一在社会选择、投票理论及高阶逻辑中具有基础意义的结构类,不具有有限公理化能力——即不存在有限条一阶句子能精确刻画其所有模型。作者通过构造一类渐进式反例模型序列,并结合超积方法与可测基数的内模型性质,否定了此前关于该类可能具备有限公理化的猜想。结果对逻辑学中公理化可行性边界的研究构成重要推进,也对AI中基于逻辑的群体决策建模(如多智能体共识协议的形式验证)提出了根本性限制:当涉及大规模异构主体的偏好聚合时,无法依赖简洁有限的逻辑规则集保证行为一致性。 原文
2026-06-24
update
该论文提出一种名为Streaming Consistency Distillation(SCD)的新型蒸馏框架,无需任何训练数据即可将大型离线音乐生成模型(如MusicLM)压缩为轻量级流式模型,支持毫秒级延迟的实时交互生成。其核心创新在于利用教师模型自身在时间维度上的自洽性构建伪监督信号,在音频token流式生成过程中动态约束学生模型输出的一致性与连贯性。实验表明,SCD在仅用1/10参数量的情况下,生成质量接近原模型,且首次在端侧设备(如MacBook M1)上实现稳定低延迟(<80ms)的键盘触发式即兴伴奏。该方法突破了传统知识蒸馏对标注数据或教师-学生架构强耦合的依赖,为边缘AI音乐创作开辟新路径。 原文
2026-06-24
update
本文正式发布布拉格依存树库(Prague Dependency Treebank, PDT)的 Consolidated 2.0 版本,这是捷克语大规模句法资源的重要升级。相较于早期版本,2.0 版在理论一致性、标注粒度和跨层对齐方面实现系统性优化:统一了依存结构、短语结构与形态特征三层标注框架;修复历史遗留的层级错位与语义不一致问题;新增细粒度功能标签(如话题化、焦点标记)及跨从句依存关系支持。作者团队还构建了自动化校验流水线与人工复审机制,显著提升标注可靠性。该资源已开放下载,广泛服务于依存解析、多层句法建模及低资源语言树库建设研究,是欧洲语言学驱动型NLP资源的典范实践。 原文
2026-06-24
update
该论文提出「Age of LLM」——首个面向军事决策复杂场景(即‘战争迷雾’)的大语言模型战略能力评测框架。通过构建高保真1v1实时对抗环境,模拟资源约束、信息不完全、意图不可观测等真实冲突要素,系统评估LLM在多步逻辑推理、动态联盟谈判、承诺可信度维持及长期策略一致性等方面的表现。研究发现,当前主流闭源与开源模型在隐性欺骗识别、跨回合信誉建模等关键能力上存在显著短板,且模型规模与战略稳健性并非单调正相关。作者开源了可配置的仿真引擎与标准化评测协议,为AI安全、自主代理治理及人机协同决策提供新基准。 原文
2026-06-23
update
该论文提出将相对论重离子对撞中极小横动量的超外围碰撞(UPC)重构为一种新型核结构探测工具——‘核结构干涉仪’。作者构建了一个物理引导的多任务深度学习框架,同步回归电荷分布半径、表面厚度及中子皮厚度等关键核参数,并通过注意力机制与梯度加权类激活映射(Grad-CAM)实现模型决策过程的可解释性。研究在金-金和铅-铅碰撞模拟数据上验证了亚飞米级核形变分辨能力,显著优于传统唯象拟合方法。该工作 bridging nuclear physics and AI interpretability,为高能核物理实验提供了一种数据驱动、可溯源的结构反演新范式。 原文
2026-06-23
update
TailorMind 是一种新型多模态生成框架,旨在将用户隐式偏好(如风格倾向、语义重点、交互习惯)精准嵌入生成过程。不同于传统端到端微调或提示工程,该方法引入可学习的‘偏好解耦模块’,在视觉-语言联合表征空间中分离内容主干与偏好信号,并通过轻量级适配器实现跨任务偏好迁移。作者在图文生成、个性化视频摘要和跨模态检索等任务上验证其有效性,在保持生成质量的同时显著提升用户满意度(+23.7% Likert评分)。论文还构建了首个含细粒度偏好标注的多模态偏好数据集PreferenceBench,为后续研究提供基准支撑。 原文
2026-06-23
update
该论文提出Flow Annealing(流式退火)框架,一种面向函数空间贝叶斯推断的新型后验采样技术,专为回归与反问题设计。区别于传统参数空间采样,该方法直接在函数空间建模先验与似然,结合可逆流模型与温度退火机制,在保持高维函数表示能力的同时提升采样效率与收敛稳定性。作者在非线性反演、稀疏观测回归等任务上验证了其优于标准MCMC和变分推断的表现,并提供了理论分析证明其渐近一致性。该工作填补了深度生成模型与贝叶斯函数推断交叉领域的关键方法空白,为科学计算与物理信息学习提供了新范式。 原文
2026-06-23
update
ORBIT 是一种创新的大语言模型行为调控框架,无需微调或强化学习即可实现对多个语义属性(如礼貌性、简洁度、专业性等)的协同控制。其核心思想是将模型内部表征空间分解为正交子空间,每个子空间对应一个可解释的行为属性;通过旋转这些子空间而非修改权重,动态调整输出风格。该方法在 LLaMA-3 和 Qwen 等主流模型上验证有效,显著优于 Prompt Engineering 和 P-tuning 等基线,在保持生成质量的同时实现细粒度、解耦式的行为干预,为可控生成提供了轻量、可解释的新范式。 原文
2026-06-23
update
该论文指出,当前主流解码策略(如top-k、temperature缩放)过度依赖token似然分数,易陷入“似然陷阱”——即高概率但语义贫乏或重复的文本生成。作者提出VCM(Variance-Calibrated Modulation),一种无需额外训练、可即插即用的解码层调控机制:通过动态估计logits分布的局部方差,对高置信低多样性区域实施自适应抑制,同时保留低方差下的确定性输出。在多个开放域生成任务(如WikiBio、XSum)上,VCM显著提升事实一致性与多样性指标(如BERTScore↑3.2%,Self-BLEU↓18.7%),且不增加推理延迟。该工作为解码器层面的可控生成提供了新范式,呼应了近期从“概率驱动”向“不确定性感知”范式的演进趋势。 原文
2026-06-23
update
该研究揭示大型语言模型(LLM)在看似连贯的文本中产生的“连贯性幻觉”——即模型输出虽语法正确、语境贴合,却实际违背事实或逻辑。作者提出三个互补的诊断性度量: surprisal(意外度)反映局部预测不确定性;energy(能量值)源自隐状态势能建模,捕捉全局语义张力;attention entropy(注意力熵)衡量注意力分布的离散程度,指示信息整合质量。实验表明,三者联合可有效识别模型在长程推理、反事实提示或知识冲突场景下的隐性失效,显著优于传统困惑度(perplexity)。这项工作为可信AI评估提供了可解释、无需标注的内在评估范式,对模型调试与安全对齐具有实践价值。 原文
2026-06-23
update
该论文提出一种在量子纯态流形(即复射影空间CP^{d−1})上定义的内禀流匹配(Intrinsic Flow Matching)新框架,突破传统欧氏空间假设,直接在黎曼几何结构上建模概率分布演化。核心创新在于引入‘相位对齐传输’机制——通过规范不变的平行移动约束,消除全局相位自由度干扰,确保薛定谔演化与概率流严格一致。作者推导了对应Fokker–Planck方程的几何形式,并在多量子比特态生成任务中验证其优于标准扩散模型:不仅采样保真度更高,且天然满足幺正性与迹守恒等量子物理约束。本工作为量子机器学习中的生成建模提供了首个严格内蕴、物理可解释的流匹配范式。 原文
2026-06-23
update
本文提出一种面向AI智能体(Agentic AI)工作流的设计时验证新范式,核心是将复杂任务分解为可形式化验证的‘概念构件’(Conceptual Building Blocks),如规划器、执行器、反思模块等,并通过组合语义与契约式接口确保端到端行为可验证。作者构建了轻量级DSL与验证框架,支持在部署前对工作流的完整性、一致性与安全性进行静态分析与定理证明,显著区别于传统依赖运行时日志或测试的验证方式。该方法已在多个典型多步推理任务中验证其有效性,为高可靠性智能体系统提供了可工程化的验证基础设施。 原文
2026-06-23
update
该论文提出「信念代价几何」(Cost Geometry of Belief)理论框架,系统刻画智能体在计算资源受限且观测存在噪声条件下进行贝叶斯推理的内在权衡。作者将信念状态建模为概率单纯形上的点,将推理过程抽象为受资源约束的流形上路径优化问题,并引入「推理代价张量」量化不同方向上的信息获取与计算消耗。通过将采样成本、内存占用与观测信噪比统一嵌入几何结构,该工作为AI Agent的实时决策、边缘设备上的轻量级推理以及鲁棒感知-行动闭环设计提供了新的理论基础,弥补了传统信息论与计算复杂性理论在动态不确定性建模中的关键缺口。 原文
2026-06-20
update
该研究提出一种多源数据协同建模框架,将地面实测的国家森林清查(NFI)数据、高精度机载激光雷达(LiDAR)点云及多时相Sentinel-2卫星影像,通过计算机视觉驱动的深度学习模型(如U-Net变体与多尺度特征融合模块)进行联合校准与空间外推。方法在瑞典全境实现30米分辨率的森林高度、冠层密度与生物量等结构参数的无缝制图,显著优于单一遥感反演方案;其创新在于构建了NFI站点到LiDAR航带再到卫星像元的三级尺度传递机制,并引入不确定性量化模块以支持林业碳汇监测与可持续经营决策。 原文
2026-06-20
update
DataMagic 是一种新型AI驱动的数据分析框架,专为非技术用户设计,能将CSV或数据库中的表格数据自动解析、推理并生成带语音解说、动态图表与关键洞见标注的短视频。其核心包含三层架构:语义理解层(基于微调的多模态大模型识别字段语义与业务上下文)、洞察生成层(结合统计检验、异常检测与因果启发式挖掘可操作结论),以及视频合成层(采用时间感知布局引擎协调可视化节奏与叙事逻辑)。论文在金融、零售和医疗三类真实数据集上验证了其生成视频对决策者理解效率的提升达47%(p<0.01),显著优于传统BI仪表盘与静态报告。该工作填补了「数据→洞察→传播」链路中自动化叙事表达的关键空白。 原文

关联动态

层次化声学-语义建模:面向全双工 SLM 的模态分离与语义连贯性

该论文聚焦全双工语音语言模型(SLM)在“边听边说”场景中的建模难题,提出一种层次化声学-语义框架,以缓解语音信号中的声学细节与高层语义目标相互干扰的问题。作者通过模态分离,将底层声学表征与上层语义表征解耦,再结合语义连贯性约束,提升连续对话中的上下文一致性与响应稳定性。该方法旨在让模型更好地同时处理输入语音、生成自然回复,并保持实时交互中的理解与表达协同,为全双工语音助手、实时陪伴式对话系统和低延迟多轮交互提供新的结构设计思路。

来源 arXiv 时间 2026-07-07 17:43:36
基于提示适配器上下文路由的参数高效多样本长视频外推方法

本文聚焦长视频外推中的计算与参数效率问题,提出一种结合 Prompt-Adapter 与上下文路由的轻量化框架,用于在少量示例条件下生成更长时间跨度的视频内容。方法核心是在不同上下文与任务模式之间进行自适应路由,将提示信息与适配器模块有机结合,从而减少对大规模微调参数的依赖,同时提升长时序一致性与画面延续性。该思路适合处理长视频预测、延展与补全等任务,尤其面向资源受限场景下的多样本推断。

来源 arXiv 时间 2026-07-07 16:41:25
UI2App:可执行网页应用生成中的视觉交互推断基准

UI2App 提出一个面向可执行网页应用生成的新基准,重点考察模型能否从界面视觉信息中推断用户交互逻辑,而不只是复刻静态页面外观。作者围绕“视觉交互推断”这一任务,构建评测流程来检验模型对按钮、输入框、状态变化与页面跳转等行为关系的理解能力,并将其置于真实可运行的 Web 应用生成场景中。该工作有助于区分“能画页面”与“能做应用”的能力差异,也为评估多模态大模型、Agent 与前端自动化生成系统提供了更贴近实际的软件工程基准。

来源 arXiv 时间 2026-07-07 14:08:55
面向可维护混合生成系统的量子启发式自动和声生成方法

本文提出一种面向可维护性的混合生成式音乐系统设计思路,将规则约束、搜索策略与生成模型结合,用于自动生成旋律和声。作者借鉴量子启发式的表示与优化思想,把和声选择视为多状态协同搜索问题,以提升生成结果的连贯性、可控性与风格一致性。相较于单纯依赖大模型的端到端方案,该方法更强调模块化架构、可解释规则和工程可维护性,便于后续迭代、调参与扩展。文章聚焦自动作曲中的和声生成任务,为AI音乐系统在创意能力与系统稳定性之间取得平衡提供了新的设计路径。

来源 arXiv 时间 2026-07-07 14:03:10
嵌套情景状态拓扑(NEST):认知状态的图论架构

本文提出嵌套情景状态拓扑(NEST),尝试用图论框架刻画认知状态的组织方式与动态演化。作者将认知过程表示为由多个情景状态构成的嵌套结构,并通过节点、边及层级关系描述状态之间的关联、切换与复用机制。相比传统把思维视为线性序列的模型,NEST更强调状态的层次性、上下文依赖性以及跨场景的结构共享。该架构可为记忆建模、任务规划和代理式推理提供统一表示,也有助于分析大模型在复杂任务中的内部状态流转。

来源 arXiv 时间 2026-07-07 09:31:55
视觉-语言-动作模型真的“言行一致”吗:具身推理中的忠实性问题

本文聚焦视觉-语言-动作(VLA)模型在具身推理中的“忠实性”问题,即模型给出的语言解释、推理链与实际动作决策是否真正一致。作者围绕“模型说了什么”与“模型到底依据什么做决定”之间的偏差展开分析,指出在机器人与具身智能任务中,光有看似合理的解释并不足以证明模型理解了环境或任务。研究强调,应将忠实性作为评估VLA系统的重要维度,避免把事后生成的说明误当作真实推理过程。该工作为构建更可解释、可验证、可部署的具身智能系统提供了方法论提醒。

来源 arXiv 时间 2026-07-06 05:10:27
有限量子存储下的最优稳定子态测试与学习

本文研究在量子存储受限的条件下,如何最有效地测试与学习稳定子态(stabilizer states)这一量子信息中的重要类别。作者关注的问题不仅是“能否识别”某个量子态是否属于稳定子集合,还包括在只允许有限量子内存、甚至需要分批接收量子样本时,怎样设计最优算法以尽量减少样本消耗和存储开销。该工作从理论上刻画了测试与学习任务的复杂度边界,并给出在受限内存模型下的最优或近最优方案。这类结果对量子纠错、量子态表征、以及资源受限的量子实验和量子机器学习都有直接意义。

来源 arXiv 时间 2026-07-02 17:11:38
CheckRLM:检验检索增强推理中的知识与思维一致性

该研究聚焦检索增强推理中的一个关键问题:模型在利用外部知识作答时,推理过程是否真正与检索到的证据一致。作者提出 CheckRLM,用于有效检查“知识—思维”一致性,帮助识别大模型在引用信息、链式推理与最终结论之间出现的偏差、幻觉或逻辑断裂。与只看答案正确与否不同,该方法更强调推理可追溯性和证据对齐,适用于需要高可靠性的问答、检索增强生成与复杂推理场景。

来源 arXiv 时间 2026-07-02 14:50:25
AbsoluteDegradation:面向档案胶片修复的物理启发式合成退化流程与基准

这篇论文提出了一个面向档案胶片修复的新基准 AbsoluteDegradation,核心贡献是构建了一套受真实物理过程启发的合成胶片退化流水线,用于更逼真地模拟老胶片在长期保存与放映过程中出现的褪色、划痕、污渍、颗粒噪声、化学劣化等问题。与仅靠简单噪声或单一退化模型不同,该方法强调退化机制的可控组合,从而为训练和评估胶片修复模型提供更接近真实场景的数据支撑。论文同时将该流程包装成档案胶片修复基准,旨在统一比较不同恢复算法在复杂退化条件下的表现,并推动面向文化遗产数字化的视觉修复研究。

来源 arXiv 时间 2026-07-02 13:08:26
Theoria:面向非形式推理状态的重写可接受性验证

Theoria 研究的是:在大模型进行多步推理时,如何判断一段“非形式化”的中间推理状态,能否被安全地重写而不破坏最终结论。作者将推理过程视为可编辑的状态序列,并提出“重写可接受性”验证框架,用于衡量对中间步骤做局部修改后,结果是否仍与原推理目标一致。该思路可用于提升长链推理的可控性、纠错能力与可解释性,也为自动化审计、推理压缩和代理式工作流中的状态修复提供基础。

来源 arXiv 时间 2026-07-01 17:56:42