AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
面向患者的对比学习:保持心率变异性表征的个体结构一致性

该研究针对心电RR间期序列建模中忽略患者个体差异的问题,提出一种患者感知的对比学习框架(PACLR)。传统自监督方法易将不同患者相似心跳模式错误拉近,导致表征混淆;PACLR通过引入患者级正样本对与跨患者负样本隔离机制,在特征空间中显式保留每位患者的生理结构特异性。在MIT-BIH、PTB-Diagnostic等多中心数据集上验证表明,该方法显著提升下游任务(如房颤检测、心力衰竭分级)的泛化性与鲁棒性,尤其在小样本患者场景下AUC提升达4.2%。研究为可解释、个体化的心律分析提供了新范式。

来源 arXiv 时间 2026-06-22 16:35:18 AI 辅助整理
SVD-Surgeon:面向大语言模型压缩的最优奇异值外科手术法

该论文提出SVD-Surgeon,一种基于奇异值分解(SVD)的精细化模型压缩框架,突破传统截断SVD的粗粒度限制。作者将权重矩阵的奇异值调整建模为带约束的优化问题,引入可学习的缩放掩码与梯度重参数化机制,在保留关键语义通道的同时精准衰减冗余频谱分量。在LLaMA-2、Phi-3等主流模型上实验证明,相较标准剪枝或量化方法,SVD-Surgeon在同等压缩率下平均提升2.3%的零样本任务准确率,并显著缓解层间误差累积问题。研究还揭示了不同层对奇异值扰动的敏感性差异,为结构化压缩提供了理论依据与实用工具链。

来源 arXiv 时间 2026-06-22 16:33:16 实体 Perplexity AI 辅助整理
调度思维序列:扩散语言模型中的推理步骤学习

该论文提出「思维调度」(Scheduling Thoughts)框架,首次系统性地建模并学习扩散语言模型(DLM)中隐式生成的思维步骤顺序。不同于传统自回归模型显式输出思维链(CoT),扩散模型以迭代去噪方式生成文本,其内部中间隐状态天然蕴含多步推理轨迹。作者设计可微分的时序对齐损失与排序感知采样策略,使模型能自主发现最优思维展开顺序,并在数学推理、符号操作等任务上显著提升最终答案准确率。实验表明,该方法在不增加参数量的前提下,使MiniCPM-Diffusion在GSM8K上准确率提升7.2%,揭示了扩散架构在结构化推理建模上的独特潜力。

来源 arXiv 时间 2026-06-22 16:32:25 实体 Semantic Kernel AI 辅助整理
LangMAP:面向多语言适配的动态分词新范式

LangMAP提出一种语言自适应的分词框架,突破传统静态词汇表限制,通过轻量级语言感知模块实时调整子词切分策略,在低资源语言上显著提升分词一致性与下游任务性能。该方法无需重训整个模型,仅需微调分词器参数即可适配新语言,已在12种语系、47种语言上验证其泛化能力,并在机器翻译、跨语言NER等任务中平均提升2.3个BLEU/0.9 F1分数。研究揭示了分词粒度与语言形态学特征(如黏着性、屈折复杂度)间的强相关性,为大模型全球化部署提供了可扩展的分词基础设施方案。

来源 arXiv 时间 2026-06-22 16:32:00 实体 Semantic Kernel AI 辅助整理
基于神经微分方程的带植入吸引子速度场建模用于分类

该论文提出一种新颖的神经微分方程(Neural-ODE)框架,通过在动力学系统中显式植入可学习的吸引子(attractors),对隐式表征空间中的速度场进行结构化建模。与传统Neural-ODE仅依赖黑箱向量场不同,该方法将分类任务先验编码为多个局部稳定吸引点,使轨迹演化具备明确语义导向——样本流形被引导至对应类别的吸引子附近,从而提升决策边界鲁棒性与可解释性。作者在图像与时间序列分类基准上验证了其有效性,并分析了吸引子位置、稳定性参数与泛化性能间的耦合关系,为将动力系统先验融入深度生成式建模提供了新思路。

来源 arXiv 时间 2026-06-22 16:25:07 实体 Semantic Kernel AI 辅助整理
SuperCond-GNN:面向超导电路仿真的可扩展图神经网络代理模型

超导量子电路的电磁仿真(如Ansys HFSS或CST)计算开销极高,严重制约设计迭代效率。本文提出SuperCond-GNN——一种专为超导电路建模定制的图神经网络代理模型,将电路拓扑编码为异构图(含电容、电感、约瑟夫森结等元件节点及连接边),结合物理启发的特征工程与分层消息传递机制,在保持亚MHz级频率响应精度的同时,将仿真耗时从小时级压缩至毫秒级。作者在包含跨阻放大器、谐振腔与多量子比特耦合结构的12类真实电路基准上验证了其泛化能力,并开源了数据集与训练框架。该工作 bridging the gap between quantum hardware design and ML-driven surrogate modeling,为超导量子芯片的快速参数扫描与自动化布局优化提供了新范式。

来源 arXiv 时间 2026-06-22 16:22:01 AI 辅助整理
Transformer微调能耗建模:基于Roofline理论的可扩展分析框架

该研究提出首个面向Transformer微调阶段的细粒度能耗预测模型,受Roofline模型启发,将计算强度、内存带宽与硬件能效边界耦合,系统量化了参数规模、batch size、序列长度及精度(FP16/INT8)对GPU端能耗的影响。作者在Llama、BERT等主流架构上验证模型误差低于12%,并揭示微调中“显存带宽瓶颈”常比算力瓶颈更早制约能效提升——这一发现挑战了业界普遍依赖FLOPs估算能耗的简化范式。研究还开源了配套工具EcoTune,支持开发者在训练前预估碳足迹,为绿色AI实践提供可落地的技术路径。

来源 arXiv 时间 2026-06-22 16:18:06 AI 辅助整理
VeriEvol:基于可验证演进指令的多模态数学推理扩展框架

VeriEvol 提出一种新型数据合成范式,通过引入形式化验证反馈闭环(如 Lean 或 Isabelle 证明检查器)驱动的演进式指令生成,显著提升大模型在多模态数学任务(含公式、图表与自然语言混合输入)中的推理鲁棒性与泛化能力。该方法不仅规避了传统合成数据中常见的逻辑谬误与幻觉问题,还支持跨领域迁移(如从初等代数到形式化证明),在 MATH、AMC2024 和新构建的 MultiMathBench 基准上均超越 GPT-4o、Claude-3.5 等强基线。论文开源了 VeriEvol 数据集与轻量级验证适配器,为构建可信AI数学助手提供可复现的技术路径。

来源 arXiv 时间 2026-06-22 16:17:30 AI 辅助整理
SQLConductor:面向分步式文本到SQL生成的搜索驱动策略学习框架

SQLConductor提出一种新型“搜索到策略”(Search-to-Policy)学习范式,将文本到SQL任务解耦为可解释的多步编排过程:先通过语义搜索定位相关数据库模式片段,再基于强化学习动态生成SQL子句。该方法摒弃端到端黑箱建模,引入可追溯的中间状态监督与渐进式错误修正机制,在Spider、BIRD等主流基准上显著提升泛化性与复杂查询准确率,尤其在跨域schema理解和长依赖推理场景中表现突出。其设计兼顾模型可控性与部署实用性,为构建可调试、可审计的SQL生成Agent提供了新路径。

来源 arXiv 时间 2026-06-22 16:13:39 实体 Semantic Kernel AI 辅助整理
基于稀疏计数数据的无仿真交通流估计方法

该论文提出一种无需交通仿真模型即可从稀疏、不完整传感器计数数据中高精度重建全路网交通流的新框架。作者构建了融合图神经网络与物理约束(如流量守恒、路段通行能力边界)的可微分联合优化模型,将传统依赖宏观仿真或强假设的插值方法,转变为端到端的数据驱动反演问题。在多个真实城市路网(含北京、洛杉矶公开数据集)上的实验表明,其在仅部署5%–10%传感器覆盖率下,平均流量估计误差低于12.3%,显著优于经典EM算法与GNN基线。研究为低成本智能交通感知系统提供了理论支撑与落地路径。

来源 arXiv 时间 2026-06-22 16:13:17 AI 辅助整理
POTracker:面向电力 outage 报告标准化生成的大模型优化方法

POTracker 是一种专为电力系统设计的轻量级AI代理框架,旨在提升大语言模型(LLM)在生成符合IEEE 1366及IEC 61970等国际标准的停电报告时的准确性与合规性。该方法通过结构化提示工程、领域知识注入和多阶段校验机制,在不微调模型权重的前提下,显著降低事实性错误率(较基线模型下降62%),并确保时间戳、设备编码、影响范围等关键字段严格遵循行业规范。作者在北美三家配电网运营商的真实工单数据集上完成验证,平均F1值达0.91,同时支持与SCADA和GIS系统的API级对接,具备实际部署潜力。

来源 arXiv 时间 2026-06-22 16:12:50 实体 通义千问 2.5 AI 辅助整理
自压缩语言模型智能体:面向高效部署的轻量化Agent架构

该论文提出“自压缩语言模型智能体”(Self-Compacting LMA),一种在运行时动态精简自身推理路径与参数表示的新型Agent范式。不同于传统模型压缩依赖离线剪枝或量化,该方法通过可学习的紧凑化控制器,在任务执行过程中实时识别冗余模块(如低贡献的工具调用链、重复记忆片段或过载的思维链节点),并触发结构化裁剪与知识蒸馏,实现推理延迟降低37%、内存占用减少52%,同时保持98.6%的原始任务准确率。作者在ToolQA、HotpotQA和AgentBench等多基准测试中验证其泛化性,并开源了CompactAgent框架。这项工作为边缘端AI Agent的可持续部署提供了新思路,呼应了当前大模型落地中对能效比与自治性的双重诉求。

来源 arXiv 时间 2026-06-22 16:08:34 实体 Semantic Kernel AI 辅助整理
Concordia:面向大语言模型容错推理的即时编译持久化内核检查点机制

Concordia 提出一种新型容错推理框架,专为长时序、高吞吐LLM服务设计。其核心创新在于将检查点(checkpointing)从传统内存快照升级为‘持久化内核’——通过JIT编译技术,在GPU上动态生成并固化关键计算状态(如KV缓存、解码器中间激活),使故障恢复无需重新加载模型权重或重放完整前序token。相比PyTorch内置检查点或CPU侧序列重放方案,Concordia在NVIDIA A100上实现平均2.3倍恢复加速与17%端到端延迟降低,且兼容Hugging Face生态与vLLM调度器。该工作填补了LLM在线服务中‘细粒度、低开销、硬件协同’容错机制的技术空白。

来源 arXiv 时间 2026-06-22 16:06:11 实体 Semantic Kernel AI 辅助整理
高阶结构下的坍缩有效算符理论框架

本文提出一种新型坍缩有效算符(Collapsed Effective Operators, CEO)方法,用于处理复杂系统中涌现的高阶结构(如超图、单纯复形及高阶网络)。不同于传统微扰展开或平均场近似,该框架通过代数收缩与范畴论引导的投影机制,在保持关键拓扑与动力学特征的前提下,系统性降低模型维度。作者证明CEO在保持高阶关联不变量(如Hodge拉普拉斯谱、高阶同步临界点)方面具有严格保真性,并在神经元集群建模与多智能体协同任务中验证其泛化能力。该工作为AI Agent群体建模、大模型内部结构可解释性分析及复杂系统降维提供了新的数学工具。

来源 arXiv 时间 2026-06-22 16:04:42 AI 辅助整理
FairBED:基于贝叶斯实验设计的公平数据采集框架

该论文提出FairBED——一种面向数据采集阶段的贝叶斯实验设计方法,旨在从源头缓解机器学习中的群体不公平问题。不同于传统事后公平性修正策略,FairBED将公平性约束(如人口均等、机会均等)嵌入主动采样过程,通过贝叶斯优化动态选择最具信息量且能平衡各子群体代表性的样本。作者在多个真实数据集(如UCI Adult、COMPAS)上验证其有效性,结果显示:在同等标注预算下,FairBED训练出的分类器在准确率不降的前提下,显著提升公平性指标(如平等机会差异降低达42%)。该工作为‘公平性内生于数据生成过程’这一新兴范式提供了可扩展、理论可证的实现路径。

来源 arXiv 时间 2026-06-22 16:02:08 实体 Dify AI 辅助整理
DVL-DeepONet:面向水下鲁棒导航的物理引导型算子学习框架

该论文提出DVL-DeepONet,一种融合多普勒测速仪(DVL)物理模型与DeepONet架构的新型算子学习方法,专为解决水下无人系统在通信受限、传感器噪声大及流场扰动强等挑战下的导航退化问题。通过将DVL观测方程嵌入神经算子的损失函数与网络结构设计中,模型在保持端到端可微性的同时,显著提升对未知洋流、声速剖面变化及DVL失锁场景的泛化能力。实验表明,其在真实AUV数据集上的位姿估计误差较纯数据驱动基线降低42%,且推理延迟满足实时导航需求(<50ms)。该工作标志着物理信息深度学习从状态估计向动态系统算子建模的重要拓展。

来源 arXiv 时间 2026-06-22 15:48:58 AI 辅助整理
FLKit:面向医疗与生命科学的联邦学习结构化入门工具包

本文介绍了FLKit——一个专为医疗与生命科学领域设计的联邦学习(Federated Learning, FL)结构化入门工具包。针对该领域数据敏感、跨机构协作壁垒高、技术门槛突出等现实挑战,FLKit 提供模块化组件,涵盖数据合规封装、隐私保护配置(如差分隐私与安全聚合)、异构设备适配、符合HIPAA/GDPR的审计日志,以及面向生物医学数据的预训练模型接口。作者通过在真实临床影像与基因组数据集上的多中心验证,证明其可将新团队的FL系统部署周期从数周缩短至2–3天,并显著降低通信开销与调试错误率。该工具包开源且兼容PySyft与FedML生态,旨在弥合AI研究者与临床实践者之间的工程鸿沟。

来源 arXiv 时间 2026-06-22 15:46:09 AI 辅助整理
TROPT:面向离散文本优化的开源统一框架

TROPT 是一个专为离散文本优化任务设计的开源框架,旨在统一分散的优化范式(如梯度近似、强化学习、基于提示的搜索等),并提供模块化、可扩展的接口支持。该框架抽象出文本空间中的离散操作原语(如 token 替换、插入、删除),内置多种优化器(包括基于 LLM 的策略优化器与确定性局部搜索器),并支持与主流大模型无缝集成。作者在 prompt 优化、对抗样本生成、可控文本编辑等典型任务上验证了其有效性,在多个基准上超越现有方法。论文强调可复现性与工程友好性,配套完整代码、文档及预置 pipeline,填补了当前 AI Agent 中离散文本决策缺乏标准化优化基础设施的空白。

来源 arXiv 时间 2026-06-22 15:44:27 AI 辅助整理
Oak:面向AI代理优化的新型版本控制系统

Oak 是一个专为 AI Agent 协作场景重新设计的分布式版本控制系统,旨在替代 Git。它将代码变更、执行日志、推理链(reasoning traces)、工具调用记录等多模态操作统一建模为可追溯、可验证的「智能提交」(smart commits),支持语义化差异比对、基于意图的分支合并与自动冲突消解。项目已开源,提供 CLI 工具链及 VS Code 插件,并内置对 LLM 调用上下文的原生追踪能力——这使其区别于传统 VCS,更接近「AI 工作流的不可篡改账本」。目前处于早期开发阶段,但已引发 AI 工程化社区对「Agent-native infrastructure」基础设施范式的讨论。

来源 Hacker News 时间 2026-06-22 15:37:48 AI 辅助整理
CADRE:面向医学视觉语言模型的稳定高效适配方法

CADRE是一种新型参数高效微调框架,专为医学多模态大模型设计。它通过引入有界遗忘约束(bounded forgetting)与先验漂移抑制机制,在有限标注数据下实现稳定适配,显著缓解灾难性遗忘与预训练知识退化问题。该方法在多个医学影像-报告对齐任务(如放射学报告生成、病变定位与诊断推理)上超越LoRA、Adapter等主流PEFT方案,同时保持推理延迟几乎不变。研究还提出可微分先验正则项,显式约束微调过程对原始语言-视觉联合分布的扰动幅度,为临床可信AI部署提供了理论保障与工程实践范式。

来源 arXiv 时间 2026-06-22 15:34:32 AI 辅助整理
亚线性结构深度神经网络实现组合函数的特征学习一致性

该论文提出一类具有亚线性参数增长结构的深度神经网络(如宽度逐层递减或稀疏连接),理论证明其在学习具有层次化组合结构的函数(如f(x)=g₃(g₂(g₁(x₁),g₁(x₂))))时,能实现特征表示的跨样本一致性——即不同输入经网络提取的中间表征在语义上对齐且可复用。作者通过构造性分析与泛化误差界推导,指出传统全连接网络的冗余参数并非必要,而亚线性结构在保持表达能力的同时显著降低过拟合风险,并在图像分割与符号推理任务中验证了其相较ResNet和Transformer的特征解耦优势。该工作为轻量化模型的可解释性设计提供了新范式。

来源 arXiv 时间 2026-06-22 15:24:53 实体 Semantic Kernel AI 辅助整理
基于微分同胚时间规整的时序分类方法

该论文提出DiffTW(Diffeomorphic Time Warping),一种新型可微时间规整框架,通过引入微分同胚约束确保时间轴变换严格单调、光滑且可逆,克服了传统DTW及其可微变体(如Soft-DTW)在梯度传播中易出现病态形变或非单射映射的问题。作者将DiffTW嵌入端到端神经网络,在UCR时序分类基准上显著提升准确率,尤其在长度不一、存在局部形变的生理信号与传感器数据上表现稳健。方法支持反向传播,可联合优化特征提取与对齐过程,并开源了PyTorch实现。研究为时序建模提供了兼具几何严谨性与工程实用性的对齐新范式。

来源 arXiv 时间 2026-06-22 15:18:24 实体 Semantic Kernel AI 辅助整理
贝恩咨询用“氛围编码”AI复刻评估软件公司收购标的

贝恩咨询正尝试一种新型尽职调查方法:为潜在收购的软件公司构建高度拟真的AI数字分身,即所谓“vibecoding”(氛围编码)——通过深度学习其公开代码库、开发者博客、GitHub提交记录、技术文档及社区互动,生成能模拟其工程文化、技术债倾向与架构演进逻辑的AI代理。该AI并非功能替代品,而是用于压力测试:例如在虚拟并购场景中观察其应对架构重构或客户迁移时的响应模式。此举折射出顶级咨询机构正将大模型从辅助工具升级为战略推演引擎,也引发关于AI复刻是否模糊了知识产权边界、以及“文化可计算性”是否过度简化复杂组织行为的业内争议。目前该方法尚处试点阶段,尚未用于最终决策。

来源 Hacker News 时间 2026-06-22 15:16:45 AI 辅助整理
抽象战场:科学交流中军事化语言的兴起与影响

该论文系统考察了“攻克难题”“击败基线”“部署模型”等军事隐喻在AI与计算机科学论文中的高频使用现象。作者基于百万级arXiv论文语料库,结合语义分析与引文网络追踪,发现军事化语言自2015年起显著增长,尤其在机器学习领域;此类修辞虽增强表达张力,却可能扭曲科研价值观——弱化协作精神、加剧零和竞争叙事,并隐性排斥非英语母语研究者。研究呼吁建立更具包容性与建设性的学术话语规范,强调科学本质是探索而非征服。

来源 arXiv 时间 2026-06-22 15:10:32 AI 辅助整理
TriggerBench:面向大语言模型的前瞻性记忆评测基准

该论文提出TriggerBench——首个专为评估大语言模型(LLM)前瞻性记忆能力设计的标准化评测基准。前瞻性记忆指个体在将来特定时间或情境下执行预定意图的能力,是人类高级认知的关键维度,但长期被LLM研究忽视。TriggerBench构建了涵盖时间触发、事件触发与复合触发三类场景的12项任务,覆盖多轮对话、长程依赖与上下文干扰等真实挑战,并在主流闭源与开源模型(如GPT-4、Claude、Llama系列)上开展系统性评测。实验揭示当前LLM在延迟响应与条件激活方面存在显著瓶颈,尤其在跨会话记忆保持和隐式触发识别上表现脆弱,为后续Agent架构与记忆增强机制提供了可量化的改进标尺。

来源 arXiv 时间 2026-06-22 15:07:36 AI 辅助整理
位置编码器能否捕捉空间效应?跨尺度GeoShapley基准评测

该研究首次系统评估地理机器学习中常用位置编码器(如经纬度嵌入、RBF、Geohash等)对空间效应的建模能力。作者提出GeoShapley——一种基于Shapley值的空间可解释性框架,通过量化不同空间尺度(从街区到城市群)下位置特征的边际贡献,揭示编码器在距离衰减、空间异质性与尺度敏感性等方面的隐式建模偏差。实验覆盖全球12个城市的POI预测与房价回归任务,发现多数编码器在中尺度(1–10km)存在显著性能塌缩,且对空间交互的捕获高度依赖下游任务结构。研究为地理AI模型的可解释性验证与编码器选型提供了新范式。

来源 arXiv 时间 2026-06-22 15:05:03 AI 辅助整理
AOHP:面向个性化、高效与安全交互的开源操作系统级智能体运行框架

AOHP(Agent Operating Harness Platform)是一个开源的OS级智能体运行框架,旨在将大模型驱动的AI Agent深度集成至操作系统内核与系统服务层。它通过轻量级沙箱隔离、细粒度权限控制与上下文感知的资源调度机制,在保障安全性的同时支持用户行为建模与个性化任务编排。区别于传统应用层Agent架构,AOHP直接对接系统调用接口,实现跨应用的无缝协同与低延迟响应,适用于隐私敏感场景下的本地化智能助手、自动化运维及可信数字代理等方向。项目已开源,配套提供基准测试套件与可扩展插件生态。

来源 arXiv 时间 2026-06-22 15:02:42 实体 Semantic Kernel AI 辅助整理
基于元学习的时序预测选择机制研究

该论文提出一种面向异构时间序列任务的元学习框架,旨在解决传统统一模型在多源、多尺度、非平稳时序数据上泛化能力弱的问题。作者设计了可学习的‘任务选择器’模块,通过少量历史序列片段快速识别任务特性(如周期性、趋势性、噪声水平),并动态调度适配的子模型或超参数配置;在电力负荷、交通流量、金融价格等12个真实数据集上验证表明,其相较Autoformer、Informer等SOTA方法平均提升MAE 12.7%,且推理延迟降低38%。研究进一步揭示了元知识在时序建模中的迁移边界,为轻量化、自适应的工业级时序AI系统提供了新范式。

来源 arXiv 时间 2026-06-22 15:02:10 实体 Semantic Kernel AI 辅助整理
SkyJEPA:面向四旋翼零样本仿真到现实迁移的长时程世界模型

SkyJEPA 提出一种基于联合嵌入预测架构(JEPA)的新型世界模型框架,专为四旋翼无人机长时程(>10秒)自主控制设计。该方法摒弃传统像素级重建或显式物理建模,转而学习高维潜空间中状态演化的一致性表征,在仿真环境中仅需无监督预训练即可获得强泛化能力。关键创新在于引入分层时空抽象与动作感知对比约束,使模型在未见过的真实场景中实现零样本sim-to-real迁移——无需真实数据微调,即在复杂风扰、传感器噪声及动态障碍下完成精准轨迹跟踪与避障。实验表明其在真实DJI M300平台上的控制性能超越现有端到端与模型预测控制(MPC)基线。

来源 arXiv 时间 2026-06-22 15:00:59 实体 Semantic Kernel AI 辅助整理
化学语言模型对分子结构与性质的认知边界研究

该论文系统评估了当前主流化学语言模型(如ChemBERTa、MolFormer等)在分子表征任务中的知识覆盖度与推理能力。作者构建了涵盖分子图性质、反应活性、药代动力学参数及合成可行性等六大维度的基准测试集,发现模型虽在SMILES语法建模和简单理化性质预测上表现良好,但在跨模态推理(如从结构预测生物靶点)和长程电子效应建模上存在显著局限。研究进一步揭示,预训练语料偏差(如PubChem中过度集中于类药分子)导致模型对稀有官能团和无机配合物的理解严重不足。成果为化学AI的可解释性提升与领域适应性优化提供了实证基础。

来源 arXiv 时间 2026-06-22 14:59:57 AI 辅助整理