该论文聚焦全双工语音语言模型(SLM)在“边听边说”场景中的建模难题,提出一种层次化声学-语义框架,以缓解语音信号中的声学细节与高层语义目标相互干扰的问题。作者通过模态分离,将底层声学表征与上层语义表征解耦,再结合语义连贯性约束,提升连续对话中的上下文一致性与响应稳定性。该方法旨在让模型更好地同时处理输入语音、生成自然回复,并保持实时交互中的理解与表达协同,为全双工语音助手、实时陪伴式对话系统和低延迟多轮交互提供新的结构设计思路。
Cohere
company加拿大 AI 公司,专注企业级 LLM 与检索,主打 Command 系列与嵌入/重排模型。
事实字段
整理说明
本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 Cohere 在 AI Agent 与大模型生态中的位置。
事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。
版本演进
关联动态
本文聚焦长视频外推中的计算与参数效率问题,提出一种结合 Prompt-Adapter 与上下文路由的轻量化框架,用于在少量示例条件下生成更长时间跨度的视频内容。方法核心是在不同上下文与任务模式之间进行自适应路由,将提示信息与适配器模块有机结合,从而减少对大规模微调参数的依赖,同时提升长时序一致性与画面延续性。该思路适合处理长视频预测、延展与补全等任务,尤其面向资源受限场景下的多样本推断。
UI2App 提出一个面向可执行网页应用生成的新基准,重点考察模型能否从界面视觉信息中推断用户交互逻辑,而不只是复刻静态页面外观。作者围绕“视觉交互推断”这一任务,构建评测流程来检验模型对按钮、输入框、状态变化与页面跳转等行为关系的理解能力,并将其置于真实可运行的 Web 应用生成场景中。该工作有助于区分“能画页面”与“能做应用”的能力差异,也为评估多模态大模型、Agent 与前端自动化生成系统提供了更贴近实际的软件工程基准。
本文提出一种面向可维护性的混合生成式音乐系统设计思路,将规则约束、搜索策略与生成模型结合,用于自动生成旋律和声。作者借鉴量子启发式的表示与优化思想,把和声选择视为多状态协同搜索问题,以提升生成结果的连贯性、可控性与风格一致性。相较于单纯依赖大模型的端到端方案,该方法更强调模块化架构、可解释规则和工程可维护性,便于后续迭代、调参与扩展。文章聚焦自动作曲中的和声生成任务,为AI音乐系统在创意能力与系统稳定性之间取得平衡提供了新的设计路径。
本文提出嵌套情景状态拓扑(NEST),尝试用图论框架刻画认知状态的组织方式与动态演化。作者将认知过程表示为由多个情景状态构成的嵌套结构,并通过节点、边及层级关系描述状态之间的关联、切换与复用机制。相比传统把思维视为线性序列的模型,NEST更强调状态的层次性、上下文依赖性以及跨场景的结构共享。该架构可为记忆建模、任务规划和代理式推理提供统一表示,也有助于分析大模型在复杂任务中的内部状态流转。
本文聚焦视觉-语言-动作(VLA)模型在具身推理中的“忠实性”问题,即模型给出的语言解释、推理链与实际动作决策是否真正一致。作者围绕“模型说了什么”与“模型到底依据什么做决定”之间的偏差展开分析,指出在机器人与具身智能任务中,光有看似合理的解释并不足以证明模型理解了环境或任务。研究强调,应将忠实性作为评估VLA系统的重要维度,避免把事后生成的说明误当作真实推理过程。该工作为构建更可解释、可验证、可部署的具身智能系统提供了方法论提醒。
本文研究在量子存储受限的条件下,如何最有效地测试与学习稳定子态(stabilizer states)这一量子信息中的重要类别。作者关注的问题不仅是“能否识别”某个量子态是否属于稳定子集合,还包括在只允许有限量子内存、甚至需要分批接收量子样本时,怎样设计最优算法以尽量减少样本消耗和存储开销。该工作从理论上刻画了测试与学习任务的复杂度边界,并给出在受限内存模型下的最优或近最优方案。这类结果对量子纠错、量子态表征、以及资源受限的量子实验和量子机器学习都有直接意义。
该研究聚焦检索增强推理中的一个关键问题:模型在利用外部知识作答时,推理过程是否真正与检索到的证据一致。作者提出 CheckRLM,用于有效检查“知识—思维”一致性,帮助识别大模型在引用信息、链式推理与最终结论之间出现的偏差、幻觉或逻辑断裂。与只看答案正确与否不同,该方法更强调推理可追溯性和证据对齐,适用于需要高可靠性的问答、检索增强生成与复杂推理场景。
这篇论文提出了一个面向档案胶片修复的新基准 AbsoluteDegradation,核心贡献是构建了一套受真实物理过程启发的合成胶片退化流水线,用于更逼真地模拟老胶片在长期保存与放映过程中出现的褪色、划痕、污渍、颗粒噪声、化学劣化等问题。与仅靠简单噪声或单一退化模型不同,该方法强调退化机制的可控组合,从而为训练和评估胶片修复模型提供更接近真实场景的数据支撑。论文同时将该流程包装成档案胶片修复基准,旨在统一比较不同恢复算法在复杂退化条件下的表现,并推动面向文化遗产数字化的视觉修复研究。
Theoria 研究的是:在大模型进行多步推理时,如何判断一段“非形式化”的中间推理状态,能否被安全地重写而不破坏最终结论。作者将推理过程视为可编辑的状态序列,并提出“重写可接受性”验证框架,用于衡量对中间步骤做局部修改后,结果是否仍与原推理目标一致。该思路可用于提升长链推理的可控性、纠错能力与可解释性,也为自动化审计、推理压缩和代理式工作流中的状态修复提供基础。