Lore 决策记忆工具

tool Lore
AI 辅助整理 · 事实字段按公开来源校验

Lore 是一个为 coding agent 提供团队决策上下文的工具候选,适合跟踪项目记忆与 AI 编码协作方向。

内容完整度: 4/5 · 待补:related_entities

事实字段

category
tool
confidence
medium
reviewed_by
codex-current-session
source_candidate_name
Lore – give your coding agent the decisions your team made
来源追溯: 事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。

整理说明

本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 Lore 决策记忆工具 在 AI Agent 与大模型生态中的位置。

事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。

版本演进

2026-07-08
update
本文提出一种面向化学交换饱和转移(CEST)成像的自监督隐式重建方法。该方法将 CEST 信号的物理先验融入网络设计,通过物理约束的洛伦兹编码对谱形进行参数化表达,再利用隐式表示学习从稀疏或欠采样观测中恢复完整 CEST 图像与频谱信息。与依赖大量标注数据的监督式方案不同,该方法无需高质量真值即可训练,能更好适应实际扫描中噪声较大、采样受限的场景。实验结果表明,该框架在重建精度、谱一致性与鲁棒性方面均具有优势,有望提升 CEST 在临床磁共振中的可用性。 原文
2026-07-08
update
这篇论文提出并演示了 TOFFEE,一种用于大规模合成数据智能体轨迹的学习型系统。随着数据智能体在检索、清洗、转换与分析等任务中的应用增多,高质量交互轨迹正成为训练和评测的重要资源,但人工采集成本高、覆盖面有限。TOFFEE 的核心目标是自动生成更丰富、更可控的智能体行为序列,以支持数据智能体的训练与系统研究。论文围绕轨迹合成的规模化、真实性与多样性展开,展示了该系统如何在复杂任务场景中生成可用的代理行为数据,并为后续构建数据智能体基座模型提供支持。这项工作体现了“用模型生成训练模型所需轨迹”的趋势,具有较强的工程与研究双重意义。 原文
2026-07-08
update
这篇论文研究机器人如何在存在多个障碍物的环境中,学习把物体投掷到目标位置,同时避免碰撞与失控。作者关注的是“投掷”这一高动态操作:它比传统抓取、放置更依赖对轨迹、速度和环境几何的精准预测,也更容易在复杂场景中产生安全风险。论文通过学习方法让系统在规划投掷动作时综合考虑障碍分布、物体运动学以及落点约束,从而提升成功率与安全性。该工作对仓储分拣、灵巧操作和受限空间中的机器人搬运具有现实意义。 原文
2026-07-08
update
本文聚焦联网与自动驾驶车辆所依赖的增强型三维点云公共数据集,系统评估数据投毒攻击对下游运行效果的实际影响。作者从数据层面引入恶意污染,并观察其对点云感知、目标识别与场景理解等任务的连锁破坏。研究重点不只在于模型精度下降,还考察攻击在公开数据与现实部署之间可能造成的安全与运营风险,说明即便少量异常样本也可能显著削弱系统鲁棒性。该工作有助于理解车载感知数据集的安全边界,并为后续的数据治理、训练防护与可信评测提供参考。 原文
2026-07-08
update
据《华尔街日报》报道,摩根大通、美国银行等大型银行正在探讨收购一家卡网络机构,以重塑支付行业格局,并推动借记卡相关收费上调。当前美国借记卡支付高度依赖少数卡组织和清算网络,银行希望通过掌握基础设施增强议价能力、增加手续费收入,同时对抗现有支付体系中长期存在的费率压缩问题。若交易推进,可能影响零售商、发卡行与消费者之间的费用分配,并引发监管机构对市场竞争与垄断风险的关注。 原文
2026-07-07
update
时序图神经网络(Temporal GNN)训练常同时受制于内存 I/O、计算开销和邻居采样效率,三者彼此耦合,单点优化往往难以显著提速。FAST 提出一个整体化优化框架,将数据访问、计算执行与采样流程协同设计,以缓解训练中的瓶颈失衡问题。该方法面向大规模时序图场景,强调通过统一调度减少无效搬运与重复计算,从而提升端到端训练吞吐并降低资源浪费。论文聚焦于 Temporal GNN 训练系统层优化,对需要处理动态交互图、事件序列与时间依赖关系的任务具有参考价值。 原文
2026-07-07
update
本文聚焦反洗钱(AML)算法中的公平性评估问题,提出利用反事实方法识别模型是否对特定群体产生系统性偏差。与传统只看预测结果的统计检验不同,反事实分析会在保持其他条件不变的情况下,考察敏感属性变化后模型输出是否显著改变,从而更直接地揭示潜在歧视来源。研究面向金融风控场景,强调在高误报成本与合规要求并存的环境下,如何在保证检测能力的同时降低对受影响客户群体的不公平影响。该工作为银行与监管机构提供了一种更细粒度、可解释的算法审计思路。 原文
2026-07-07
update
TacReasoner提出一种融合触觉与语言的动态推理框架,面向机器人在真实环境中的交互式决策任务。与仅依赖视觉或静态多模态输入的方法不同,该框架强调在操作过程中持续获取触觉反馈,并将其与语言指令、上下文状态联合建模,从而支持对物体材质、接触状态、受力变化及操作结果的实时推断。该工作旨在提升机器人在遮挡、低光、视觉不完整等场景下的理解与推理能力,为精细操作、材料识别和人机交互提供更鲁棒的感知基础。 原文
2026-07-07
update
AgentGym2 是一个面向大语言模型智能体的新型评测基准,重点不再局限于理想化、规则清晰的实验环境,而是把智能体放进更接近真实世界的“去理想化”场景中检验其能力。论文关注模型在复杂约束、噪声干扰、信息不完整和环境动态变化下的任务执行表现,旨在弥补现有基准对现实复杂性的覆盖不足。通过更贴近实际应用的任务设计,AgentGym2 可用于分析智能体的规划、适应、稳健性与错误恢复能力,为后续构建更可靠的通用 AI Agent 提供评测依据与研究方向。 原文
2026-07-07
update
这项工作围绕“大模型能否全流程采用 4bit 浮点训练”展开,提出 Full-Stack FP4 预训练方案,将量化不仅用于权重或激活,还进一步覆盖投影层、优化器状态与注意力计算等关键环节。作者重点解决低精度训练中常见的不稳定、收敛变差和数值误差累积问题,并给出一套可用于预训练阶段的稳定实现路径。结果表明,在保持训练稳定性的同时,FP4 方案有望显著降低显存占用与计算开销,为更低成本训练更大规模语言模型提供了可行方向。 原文
2026-07-07
update
这篇工作围绕视觉-语言-动作(VLA)学习中的示范数据设计展开,提出一种“由简单到复杂”的结构化示范策略。论文关注机器人或具身智能模型在学习多步任务时,如何通过更有组织的示例序列提升泛化与动作执行稳定性。相较于直接堆叠大量杂乱演示,该方法强调按任务难度、动作组合关系与语义结构组织示范,使模型先掌握基础子技能,再逐步迁移到更复杂的交互与长程规划场景。此思路有助于缓解训练数据效率低、任务迁移弱和复杂指令执行不稳等问题,对构建更可靠的通用机器人策略具有参考价值。 原文
2026-07-03
update
本文研究分布式编码计算中的两个核心诉求:一是如何在多节点协同计算时保护输入数据与中间结果的隐私,二是如何验证返回结果是否真实可靠。针对精确计算在通信和容错上的开销较高这一现实问题,作者进一步引入近似计算框架,在允许可控误差的前提下提升效率与可扩展性。论文围绕编码设计、隐私泄露控制、结果可验证机制以及近似误差分析展开,旨在为大规模分布式机器学习、科学计算与边缘协同场景提供一种兼顾效率、安全性与可信性的计算范式。 原文
2026-07-03
update
该论文提出 CoFL-S,一种面向局部导航的空间可查询“扇区流场”表示,用语言指令直接约束机器人在局部环境中的运动决策。与传统依赖离散路径点或全局规划的方法不同,CoFL-S 将可通行方向与空间位置进行连续关联,使模型能够在不同区域快速查询应朝向何处移动,并据此生成更细粒度的行动建议。作者强调这种表示对开放场景中的语言条件导航更灵活,也更适合处理局部可见、动态变化或信息不完整的环境。 原文
2026-07-03
update
本文聚焦“LLM-as-a-Judge”在多语言评测中的适用性,尤其是低资源语言场景下的可靠性问题。作者指出,当前以大模型充当评审的做法在英文环境中已较常见,但一旦扩展到不同语言、不同书写系统和文化语境,便会面临评分偏置、语言理解不一致、翻译引入噪声以及跨语言公平性不足等挑战。文章进一步梳理了构建多语言裁判体系时的关键注意事项,并提出改进建议,包括更严格的提示设计、语言覆盖更均衡的评测集、人工校准与抽检机制,以及面向低资源语言的专门评测流程,以提升结果的可信度与可比性。 原文
2026-07-03
update
本文从强化学习(RL)角度重新审视神经量子态(Neural Quantum States, NQS)这一量子多体问题中的关键表示方法。作者将波函数采样、能量最小化与策略优化联系起来,说明传统 NQS 训练过程可被理解为在高维态空间中的序列决策与奖励搜索。相比仅从生成建模或变分优化解释,RL 视角有助于统一理解探索、信用分配和训练稳定性等问题,并为设计更高效的采样与优化算法提供思路。该工作面向量子计算、量子化学与机器学习交叉领域,强调方法论上的重构与关联,而非仅是技巧性改进。 原文
2026-07-03
update
本文提出 Transformer Geometry Observatory(TGO-II),聚焦于大模型内部表征的相似性分析与可视化。作者将不同层、不同头以及不同输入条件下的隐藏状态嵌入到统一的几何框架中,借助相似度度量与观测指标,刻画模型在推理、记忆与泛化过程中的表示演化。相比只看输出结果的方法,TGO-II 更强调从内部结构理解 Transformer 的行为,可用于诊断表征塌缩、层间冗余及注意力模式变化,并为模型可解释性、调试与架构比较提供工具支持。 原文
2026-07-03
update
本文提出 LIME(Learning Intent-aware Camera Motion),旨在从第一视角视频中学习与“拍摄意图”一致的相机运动模式,而不仅仅是模仿表层的镜头轨迹。与传统基于规则或纯轨迹拟合的方法不同,LIME尝试从人类在日常活动中的头部/相机运动中提炼出可泛化的运动先验,使模型能够理解“为什么要这样移动镜头”。这类研究对可穿戴摄像、机器人视角控制、自动剪辑和沉浸式内容生成都有潜在价值。该工作聚焦第一视角视频这一更贴近真实人类行为的数据来源,为后续生成更自然、更符合任务目标的相机控制提供了基础。 原文
2026-07-03
update
本文提出 EvoPolicyGym,一个用于评估智能体在交互式环境中进行“自主策略进化”的基准框架。与只考察一次性任务完成不同,该工作更关注大模型或策略代理能否在反馈、试错与环境变化中持续改进行为,并形成更稳健的决策模式。框架强调策略迭代、环境互动与性能演化的全过程,可用于分析智能体在长期任务中的适应能力、泛化能力与稳定性。该研究为检验 Agent 在真实场景中“边做边学、边错边改”的能力提供了系统化工具,也有助于比较不同策略优化方法在动态环境中的效果差异。 原文
2026-07-03
update
这篇论文聚焦一个更贴近真实应用的语音理解任务:仅从音频出发,判断有声书朗读为何“有吸引力”。作者将朗读吸引力拆解为可感知的声学与韵律线索,例如语速、停顿、音高变化、情绪表达和声音稳定性等,并探讨这些因素如何共同影响听众体验。相比传统只关注语音识别准确率的研究,这项工作更强调表达效果与叙事感染力,适用于有声书制作、配音评估和内容推荐等场景。论文的价值在于把主观审美判断转化为可分析的音频理解问题,为构建更懂“讲故事”的语音模型提供了方向。 原文
2026-07-03
update
本文聚焦多模态大模型在“印刷体攻击”下的脆弱性:攻击者通过在图像中嵌入文字,诱导模型偏离真实视觉内容并产生错误回答。作者提出一种无需额外训练的概念定位方法,在推理阶段识别并抑制这些具有误导性的文本概念,从而提升模型对文字干扰的鲁棒性。该思路强调利用模型内部表征完成定位与过滤,避免依赖新数据标注或参数微调,适合快速部署到现有视觉语言系统中。实验表明,该方法能在保持一定通用能力的同时,显著缓解由图像内文字引发的攻击风险。 原文
2026-07-03
update
这篇论文面向机器学习原子势(MLIP)的训练效率问题,提出用更合适的优化方法替代常见的 Adam。作者比较了 SOAP 与 Muon 两类优化器在原子势训练中的表现,重点关注收敛速度、样本效率以及对标注数据的依赖。结果表明,在不少任务中,这些方法能够以更少的训练步数和更低的数据需求达到更好的或相当的精度,尤其适合高成本标注的材料与分子模拟场景。论文的核心贡献在于说明:优化器选择本身,可能与模型结构同样影响原子势学习的最终效果。 原文
2026-07-02
update
毫米波通信依赖窄波束实现高增益传输,但波束对准过程开销大、对环境变化敏感。本文围绕毫米波波束对准问题,引入元迁移学习思路:先利用跨场景知识学习一个可快速适应的新任务初始化,再结合少量目标环境数据完成快速校准。该方法旨在缓解训练样本稀缺、场景分布变化和在线重对准成本高等难题,提升波束选择的准确性与适应速度。对于未来的6G毫米波/太赫兹接入、移动终端和动态遮挡场景,这类方法具有较强的工程价值。 原文
2026-07-02
update
本文研究在存在约束条件、且可从多个信息源获取不同成本与精度观测时,如何高效进行贝叶斯优化。与传统只依赖单一高保真评估的做法相比,多信息源场景更符合工程设计、实验筛选和仿真优化中的实际需求。作者围绕“在满足约束的前提下最小化目标函数”的问题,构建了兼顾信息价值与采样成本的决策框架,利用不确定性建模来判断应从哪一类信息源、以何种顺序进行查询,从而提升找到可行最优解的效率。该工作对自动化实验、黑盒优化与多保真决策具有直接参考价值。 原文
2026-07-02
update
本文从几何结构出发,研究文本转语音(TTS)模型中的情感操控如何实现“可组合”控制,即不同情感方向能否像向量一样叠加、插值并保持可预测效果。作者将情感属性视为潜在表示空间中的方向或子空间,分析其线性可分性、独立性与交互关系,并据此解释为何某些情感组合能自然叠加,而另一些会相互干扰。该工作不仅为情感控制提供了更可解释的理论框架,也有助于设计更稳定、更细粒度的语音生成与风格编辑方法,对多情绪播报、拟人化语音和可控语音助手具有参考价值。 原文
2026-07-02
update
本文聚焦心脏影像中的动态建模问题,研究如何从数据中学习稳定且可泛化的心脏运动先验,并将其注入隐式神经表示框架。作者认为,单纯依赖逐帧拟合容易受到噪声、缺失观测和个体差异影响,因此需要显式建模心脏运动的结构化规律。该方法通过学习心脏形变与时序变化的先验分布,帮助隐式表示更准确地重建连续的心脏运动场,并提升对未见样本和稀疏采样场景的鲁棒性。整体思路对心脏MRI、超声等医学动态重建与分析任务具有应用价值。 原文
2026-07-02
update
本文研究在同一数据集中同时预测连续、二分类等混合类型结局时的建模问题。作者提出一种深度多任务学习框架,通过共享稀疏性机制在多个任务间复用有用特征,并抑制无关变量的干扰,从而兼顾预测性能与模型可解释性。与传统单任务或仅依赖参数共享的方法相比,该方法更适合现实中的多结局场景,例如医疗、金融和社会科学中的联合风险建模。论文重点讨论了如何在异质输出分布下统一训练目标,并通过实验验证所提方法在多任务相关性强、特征维度高的条件下具有更稳定的泛化能力。 原文
2026-07-02
update
KnowledgeDebugger 是一款面向 Transformer 的知识定位与知识编辑探索工具,帮助研究者在模型内部追踪特定事实或概念主要分布于哪些层、哪些模块以及哪些参数位置,并进一步评估不同编辑策略对模型行为的影响。该工具强调“可解释定位—可控修改—效果验证”的闭环流程,适用于研究知识记忆、事实纠错与模型可塑性。它把原本分散在分析、干预和评测中的工作整合到统一界面中,降低了大模型知识编辑实验的门槛,也便于比较不同编辑方法在准确性、稳定性和副作用上的差异。 原文
2026-07-02
update
这篇论文探讨了让大模型代理在科学研究中具备“自我校正”能力的方法:系统并非一次性生成答案,而是在每轮实验、推理或假设检验后,利用元反思机制回顾自身表现,识别错误、修正策略并继续迭代。作者关注的是如何把科学发现流程拆解为可循环的代理工作流,使模型能够在信息不足、结论不稳定的场景下逐步逼近更可靠的假设与解释。该方向与AI for Science、自动化研究助手和自主Agent框架密切相关,强调通过反思来提升探索效率、减少幻觉并增强发现过程的可控性。 原文
2026-07-02
update
这篇论文把智能体能力拆解为可组合的“技能”,并进一步把这些技能看作相互依赖的供应链环节,而不是彼此孤立的功能模块。作者关注的核心问题是:当一个 Agent 的关键技能依赖于其他技能、工具或外部模型时,系统会在什么位置形成脆弱点,以及这些依赖如何放大失效、延迟与安全风险。论文提出一套衡量依赖关系与风险暴露的方法,用于识别技能链条中的关键节点、级联故障路径和高风险组合。该研究为构建更可靠、可审计、可治理的多智能体与工具调用系统提供了分析框架。 原文
2026-07-02
update
QuasiMoTTo提出一种面向大模型推理阶段的测试时扩展思路,将准蒙特卡洛采样引入生成与搜索过程,以更低方差、更均匀的采样覆盖提升答案质量。相较于依赖随机多次采样的传统做法,该方法强调在固定计算预算下提高推理效率与结果稳定性,适用于需要多步思考、候选重排和答案聚合的任务。论文关注测试时扩展这一近年受到重视的方向,即通过增加推理阶段计算而非重新训练模型,进一步挖掘模型能力。 原文
2026-07-01
update
WorldRoamBench 提出一个面向开放世界场景的评测基准,用来检验交互式世界模型在长时间、多步交互中的稳定性与一致性。不同于只关注短时预测误差的传统测试,它更强调模型在连续行动、环境反馈和状态演化下,能否保持物理规律、语义连贯与任务可执行性。该基准旨在暴露世界模型在长期滚动推理中常见的漂移、崩坏与误差累积问题,并为比较不同架构、训练策略和记忆机制提供统一平台。 原文
2026-07-01
update
FedXDS 提出一种面向联邦学习数据异质性的训练策略,核心思路是引入模型归因方法来识别不同客户端数据对全局模型决策的实际影响,并据此动态调节聚合与学习过程。与直接依赖梯度或样本量分配的传统做法相比,该方法更关注“哪些数据在推动模型学习”,从而在非IID场景下提升训练稳定性与跨客户端泛化能力。研究表明,基于归因信号的调节机制可在一定程度上缓解客户端偏置、减少负迁移,并改善整体收敛表现。 原文
2026-07-01
update
大语言模型在安全对齐后,常会把本可正常回答的问题也一并拒绝,出现“过度拒答”现象,影响实用性与用户体验。本文围绕这一问题提出一种竞争奖励框架:一方面鼓励模型在安全前提下尽量给出有帮助的回答,另一方面对真正需要拒绝的请求保持稳健防护,通过两类奖励的平衡来减少误拒。作者讨论了该方法在提升回答覆盖率、保留安全边界和改善对齐效果方面的作用,并为后续构建更精细的安全-有用性折中机制提供思路。 原文
2026-07-01
update
本文探讨如何将大语言模型中已知的“文本拒答方向”迁移到多模态场景,用于提升图文模型在面对有害请求时的安全性。作者关注的是:模型在纯文本中学到的拒绝、回避与安全响应模式,能否作为一种可解释的内部方向,被用于抑制多模态输入中的风险输出。研究核心在于把文本安全机制与视觉-语言对齐过程结合,分析其在越狱提示、隐晦诱导和跨模态攻击中的效果。该思路为多模态安全提供了一条轻量、可迁移的防护路径,也说明安全对齐未必只能依赖端到端再训练。 原文
2026-07-01
update
MECoBench 提出一个面向具身环境中多模态智能体协作的系统化基准与研究框架,重点考察多个智能体如何在视觉、语言与行动信号共同作用下进行分工、沟通、协调与任务执行。论文围绕真实感较强的交互场景,分析协作过程中常见的瓶颈,如信息不对称、目标对齐困难、通信冗余以及行动规划不稳定等,并据此设计评测任务与指标,用于衡量协作效率、鲁棒性和任务完成质量。该工作不仅为理解多模态 Agent 在具身场景中的协同机制提供了实验平台,也为后续构建更可靠的多智能体系统与通用智能体基础设施提供了参考。 原文
2026-07-01
update
本文发布 GR2 的技术报告,重点介绍其作为面向机器人任务的通用模型框架,如何结合多模态感知、语言理解与动作生成来提升机器人在开放环境中的泛化能力。报告围绕模型架构、训练数据与训练策略展开,强调通过大规模跨任务数据学习统一的表征与控制能力,使机器人能够更自然地理解指令、感知场景并执行连续动作。该工作延续了具身智能与机器人基础模型的发展方向,适合作为研究通用机器人代理与多任务控制的参考。 原文
2026-07-01
update
本文聚焦航天器在再入大气层阶段的姿态控制问题。该阶段气动环境剧烈变化、非线性强且不确定因素多,传统控制方法往往依赖精确模型和预设工况,鲁棒性与适应性受限。作者引入深度强化学习,将姿态控制建模为序贯决策任务,使智能体在仿真环境中通过试错学习控制策略,以在高动态扰动下维持姿态稳定并提升再入过程的可控性。此类方法的价值在于能够弱化对精确动力学建模的依赖,并为复杂航天任务中的自主控制提供新思路。 原文
2026-07-01
update
这篇论文讨论一个看似技术、实则哲学的问题:当我们试图用生理信号、行为数据或机器学习模型去“测量”情绪时,究竟是谁在定义情绪的含义。作者提出“情感主权”这一概念,指出情绪并不只是可被外部指标完整捕捉的客观状态;由于测量方法本身存在边界,情绪的解释权、分类权与命名权会在主体、研究者和系统之间发生张力。论文因此把测量局限提升为认识论问题,反思 AI 情绪识别、心理评估与人机交互中常见的“把指标当真相”的倾向。 原文
2026-07-01
update
本文围绕大模型在复杂推理中“先分叉、再筛选”的思路展开,重点讨论如何借助置信度信号改进多路径思考(fork-think)机制。与一次性生成答案不同,这类方法会让模型并行探索多个候选推理分支,再依据内部评分、置信估计或一致性指标选择更可靠的路径,从而提升最终回答的稳健性。文章的核心价值在于把“会想”进一步推进到“会判断自己想得是否可靠”,有助于缓解幻觉、提升复杂问题上的正确率,并为 Agent 的规划、反思与自我纠错提供参考。 原文
2026-07-01
update
本文提出一种面向图像分类的局部化保形预测方法,结合视觉语言模型的表征能力,在保证预测集合覆盖率的同时提升结果的针对性与可解释性。相较于传统保形预测依赖全局统一阈值、难以适应样本难度差异的问题,该方法根据图像语义与分布特征进行局部校准,使不同区域样本获得更贴合的不确定性估计。实验表明,这种做法能够在维持统计有效性的前提下,显著优化预测集合大小与分类效率,尤其适合开放世界或长尾类别场景。 原文
2026-07-01
update
本文讨论健康科学中的科学解释应如何满足“解释得通”与“解释有用”两类要求。作者围绕因果性展开,指出健康领域中的解释不能只停留在相关性描述,而应尽可能说明机制、干预路径及其边界条件。同时,文章把“信任”纳入解释评价框架,强调临床决策、公共卫生传播与患者沟通都依赖解释是否足够透明、可检验且与证据一致。最后,作者以“认识充分性”为标准,讨论科学解释在不确定性、复杂系统和多层级证据下应达到何种深度,避免过度简化或空洞抽象。整体上,文章为健康科学中的解释标准提供了规范性分析。 原文
2026-06-30
update
本文提出 DRIFT,一种面向难例路由的自蒸馏训练框架,用于缓解大模型在训练过程中“简单样本学得快、难样本学不动”的问题。方法结合节律门控探索与成功缓冲区训练:前者按训练节奏动态控制探索强度,避免过早收敛到次优策略;后者优先积累并复用经过验证的高质量成功样本,提升对困难样本的学习效率。作者将“难度路由”引入自蒸馏流程,使模型能够更有针对性地分配学习资源,在保持稳定性的同时增强泛化与鲁棒性。该思路适用于复杂推理、长尾任务和稀疏反馈场景。 原文
2026-06-30
update
本文聚焦表格机器学习中一个常被忽视的问题:企业真实业务数据与公开基准数据之间存在显著差异。作者从数据分布、缺失模式、类别编码、噪声结构、时间漂移和目标定义等维度,分析了公开基准往往过于“干净”、规模有限且与实际场景脱节的现象。文章强调,许多在标准 benchmark 上表现优异的方法,在企业数据上未必同样稳健,原因在于真实业务更具异构性、稀疏性与动态变化。该研究旨在帮助研究者重新审视评测范式,并为更贴近产业需求的表格模型设计与实验基准提供参考。 原文
2026-06-30
update
COHORT提出一种面向网络防御加固的协同编排方法,将攻击侧行为在仿真拓扑中进行回放,用于系统性暴露薄弱环节并验证防护措施。该工作强调在受控环境里复现真实攻击链,再结合多组件协同调度,对检测、隔离、修复与策略调整进行联动评估,从而提升复杂基础设施的整体抗攻击能力。相较于单点加固,COHORT更关注跨节点、跨策略的联合防御效果,适合用于红队演练、攻防验证与安全基线强化。 原文

关联动态

摩根大通、银行巨头拟收购卡组织,借机提高借记卡费率

据《华尔街日报》报道,摩根大通、美国银行等大型银行正在探讨收购一家卡网络机构,以重塑支付行业格局,并推动借记卡相关收费上调。当前美国借记卡支付高度依赖少数卡组织和清算网络,银行希望通过掌握基础设施增强议价能力、增加手续费收入,同时对抗现有支付体系中长期存在的费率压缩问题。若交易推进,可能影响零售商、发卡行与消费者之间的费用分配,并引发监管机构对市场竞争与垄断风险的关注。

来源 Hacker News 时间 2026-07-07 22:04:18
面向车联网与自动驾驶的3D点云投毒攻击运营影响评估

本文聚焦联网与自动驾驶车辆所依赖的增强型三维点云公共数据集,系统评估数据投毒攻击对下游运行效果的实际影响。作者从数据层面引入恶意污染,并观察其对点云感知、目标识别与场景理解等任务的连锁破坏。研究重点不只在于模型精度下降,还考察攻击在公开数据与现实部署之间可能造成的安全与运营风险,说明即便少量异常样本也可能显著削弱系统鲁棒性。该工作有助于理解车载感知数据集的安全边界,并为后续的数据治理、训练防护与可信评测提供参考。

来源 arXiv 时间 2026-07-07 16:46:16
在多障碍环境中学习安全投掷物体

这篇论文研究机器人如何在存在多个障碍物的环境中,学习把物体投掷到目标位置,同时避免碰撞与失控。作者关注的是“投掷”这一高动态操作:它比传统抓取、放置更依赖对轨迹、速度和环境几何的精准预测,也更容易在复杂场景中产生安全风险。论文通过学习方法让系统在规划投掷动作时综合考虑障碍分布、物体运动学以及落点约束,从而提升成功率与安全性。该工作对仓储分拣、灵巧操作和受限空间中的机器人搬运具有现实意义。

来源 arXiv 时间 2026-07-07 15:24:12
TOFFEE:一种可大规模合成数据智能体轨迹的学习系统

这篇论文提出并演示了 TOFFEE,一种用于大规模合成数据智能体轨迹的学习型系统。随着数据智能体在检索、清洗、转换与分析等任务中的应用增多,高质量交互轨迹正成为训练和评测的重要资源,但人工采集成本高、覆盖面有限。TOFFEE 的核心目标是自动生成更丰富、更可控的智能体行为序列,以支持数据智能体的训练与系统研究。论文围绕轨迹合成的规模化、真实性与多样性展开,展示了该系统如何在复杂任务场景中生成可用的代理行为数据,并为后续构建数据智能体基座模型提供支持。这项工作体现了“用模型生成训练模型所需轨迹”的趋势,具有较强的工程与研究双重意义。

来源 arXiv 时间 2026-07-07 13:02:08
基于物理约束洛伦兹编码的自监督隐式 CEST 重建

本文提出一种面向化学交换饱和转移(CEST)成像的自监督隐式重建方法。该方法将 CEST 信号的物理先验融入网络设计,通过物理约束的洛伦兹编码对谱形进行参数化表达,再利用隐式表示学习从稀疏或欠采样观测中恢复完整 CEST 图像与频谱信息。与依赖大量标注数据的监督式方案不同,该方法无需高质量真值即可训练,能更好适应实际扫描中噪声较大、采样受限的场景。实验结果表明,该框架在重建精度、谱一致性与鲁棒性方面均具有优势,有望提升 CEST 在临床磁共振中的可用性。

来源 arXiv 时间 2026-07-07 10:49:07
AgentGym2:在去理想化真实环境中评测大语言模型智能体

AgentGym2 是一个面向大语言模型智能体的新型评测基准,重点不再局限于理想化、规则清晰的实验环境,而是把智能体放进更接近真实世界的“去理想化”场景中检验其能力。论文关注模型在复杂约束、噪声干扰、信息不完整和环境动态变化下的任务执行表现,旨在弥补现有基准对现实复杂性的覆盖不足。通过更贴近实际应用的任务设计,AgentGym2 可用于分析智能体的规划、适应、稳健性与错误恢复能力,为后续构建更可靠的通用 AI Agent 提供评测依据与研究方向。

来源 arXiv 时间 2026-07-06 14:56:51
TacReasoner:面向真实场景交互推理的动态触觉语言框架

TacReasoner提出一种融合触觉与语言的动态推理框架,面向机器人在真实环境中的交互式决策任务。与仅依赖视觉或静态多模态输入的方法不同,该框架强调在操作过程中持续获取触觉反馈,并将其与语言指令、上下文状态联合建模,从而支持对物体材质、接触状态、受力变化及操作结果的实时推断。该工作旨在提升机器人在遮挡、低光、视觉不完整等场景下的理解与推理能力,为精细操作、材料识别和人机交互提供更鲁棒的感知基础。

来源 arXiv 时间 2026-07-06 14:17:44
基于反事实方法检测反洗钱算法中的不公平性

本文聚焦反洗钱(AML)算法中的公平性评估问题,提出利用反事实方法识别模型是否对特定群体产生系统性偏差。与传统只看预测结果的统计检验不同,反事实分析会在保持其他条件不变的情况下,考察敏感属性变化后模型输出是否显著改变,从而更直接地揭示潜在歧视来源。研究面向金融风控场景,强调在高误报成本与合规要求并存的环境下,如何在保证检测能力的同时降低对受影响客户群体的不公平影响。该工作为银行与监管机构提供了一种更细粒度、可解释的算法审计思路。

来源 arXiv 时间 2026-07-06 13:57:21
FAST:面向时序图神经网络训练的内存 I/O、计算与采样联合优化框架

时序图神经网络(Temporal GNN)训练常同时受制于内存 I/O、计算开销和邻居采样效率,三者彼此耦合,单点优化往往难以显著提速。FAST 提出一个整体化优化框架,将数据访问、计算执行与采样流程协同设计,以缓解训练中的瓶颈失衡问题。该方法面向大规模时序图场景,强调通过统一调度减少无效搬运与重复计算,从而提升端到端训练吞吐并降低资源浪费。论文聚焦于 Temporal GNN 训练系统层优化,对需要处理动态交互图、事件序列与时间依赖关系的任务具有参考价值。

来源 arXiv 时间 2026-07-06 13:54:01
从简单到复杂的结构化示范驱动视觉-语言-动作学习

这篇工作围绕视觉-语言-动作(VLA)学习中的示范数据设计展开,提出一种“由简单到复杂”的结构化示范策略。论文关注机器人或具身智能模型在学习多步任务时,如何通过更有组织的示例序列提升泛化与动作执行稳定性。相较于直接堆叠大量杂乱演示,该方法强调按任务难度、动作组合关系与语义结构组织示范,使模型先掌握基础子技能,再逐步迁移到更复杂的交互与长程规划场景。此思路有助于缓解训练数据效率低、任务迁移弱和复杂指令执行不稳等问题,对构建更可靠的通用机器人策略具有参考价值。

来源 arXiv 时间 2026-07-06 01:38:43