AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
基于TRIZ创新理论的文本到CAD生成框架提升3D设计创造力

该研究提出一种融合TRIZ(发明问题解决理论)原理的文本到CAD生成框架,旨在突破当前3D生成式设计中创意匮乏、结构合理性不足等瓶颈。作者将TRIZ的40条发明原则与大语言模型(LLM)及几何表征网络协同建模,构建可解释的创意引导机制:在文本理解阶段注入矛盾分析与功能裁剪逻辑,在CAD生成阶段约束拓扑可行性与制造就绪性。实验表明,该框架在ShapeNet和自建工业零件数据集上显著提升设计新颖性(+37%)与工程可用性(+29%),并支持设计师通过TRIZ术语进行可控迭代。这项工作为AI驱动的设计创新提供了可解释、可干预的新范式。

来源 arXiv 时间 2026-06-19 12:35:10 实体 Semantic Kernel AI 辅助整理
NAC:面向视觉-语言-动作模型的神经动作编解码器

本文提出神经动作编解码器(NAC),一种专为端到端视觉-语言-动作(VLA)模型设计的动作表征学习框架。NAC将高维、连续、时序依赖的动作序列映射为离散的隐空间符号序列,兼顾动作语义一致性与下游任务泛化性。其核心包含可微分向量量化模块与动作感知重建损失,并在RT-2、OpenVLA等主流VLA架构上验证:仅替换动作头即可显著提升机械臂操作任务的泛化能力与样本效率,尤其在跨任务迁移和长程动作规划中表现突出。作者开源了代码与预训练NAC权重,推动具身智能中动作表征的标准化研究。

来源 arXiv 时间 2026-06-19 12:24:49 实体 Semantic Kernel AI 辅助整理
科学数据微调反而加剧大模型幻觉:跨领域事实性评估

该研究系统考察了在生物、化学、物理和气候科学四类高质量科学数据集上微调LLM(如Llama-3、Qwen、Phi-3)对事实准确性的实际影响。出人意料的是,多数微调模型在多项事实核查基准(如SciFact、FEVER、Domain-Specific QA)上的幻觉率显著上升,平均增加达23.7%,尤其在需多步推理的复杂命题中更为突出。作者指出,问题根源在于科学语料中隐含的未标注假设、近似表述及领域惯例(如简化模型、理想化条件),易被模型误读为普适真理;同时,监督微调缺乏对‘不确定性表达’的建模能力。研究呼吁构建带置信度标注与反事实校验的科学训练数据,并倡导将‘可证伪性意识’纳入LLM对齐框架。

来源 arXiv 时间 2026-06-19 12:03:02 实体 Semantic Kernel AI 辅助整理
SOHET:面向异构事件序列的自监督预训练Transformer模型

SOHET是一种专为建模复杂异构事件序列(如医疗就诊记录、金融交易流、IoT设备告警等)设计的新型Transformer架构。它突破传统时序模型对同质化事件的假设,通过事件类型感知的位置编码、跨模态注意力机制及层次化时间粒度建模,统一处理含多种语义类型、不同时间尺度与不规则间隔的事件。模型采用掩码事件重建与时序顺序预测双任务联合自监督预训练,在MIMIC-IV、Taobao行为日志等真实数据集上显著优于RETFound、Time-BERT等基线方法,尤其在小样本下游任务(如早期败血症预警、用户流失预测)中展现出强泛化能力。该工作为临床决策支持、智能运维等高价值场景提供了可迁移的底层时序表征基础。

来源 arXiv 时间 2026-06-19 11:56:46 实体 Semantic Kernel AI 辅助整理
基于开放数据的城市配电网拓扑结构与层级识别方法

该研究提出一种从多源开放数据(如OpenStreetMap、政府地理信息平台及电力设施公开台账)中自动重建城市中低压配电网拓扑与层级关系的端到端框架。作者设计了融合空间约束、电气连通性先验与图神经网络的联合推理模型,有效解决开放数据中普遍存在的属性缺失、坐标偏移与拓扑不一致问题;在三个典型中国城市区域的实证评估表明,其节点连接准确率达92.7%,主干-分支层级识别F1值达88.4%。工作填补了城市能源基础设施数字孪生中‘最后一公里’电网建模的空白,为智能调度、韧性评估与双碳目标下的配网优化提供可扩展的数据基础。

来源 arXiv 时间 2026-06-19 11:51:38 实体 Semantic Kernel AI 辅助整理
基于奖励Petri网的时序行为树语义建模方法

本文提出一种将时序行为树(Temporal Behavior Trees, TBT)映射为奖励Petri网(Reward-Petri Net, RPN)的形式化解释框架,旨在弥合高层任务规划与底层可验证执行之间的语义鸿沟。作者通过引入带权重弧、奖励标记和时间约束的Petri网变体,精确刻画TBT中顺序、并行、选择与循环等控制流结构,并赋予其量化执行反馈能力。该方法支持形式化验证(如活性与有界性分析)与强化学习联合优化,在机器人任务编排与自主系统决策中展现出可解释性与可验证性的双重优势。研究还提供了从TBT到RPN的自动转换算法及初步实验验证。

来源 arXiv 时间 2026-06-19 11:47:54 实体 Semantic Kernel AI 辅助整理
面向语音重建的文本转语音系统评估框架

该论文提出了一套系统化、多维度的评估框架,用于客观衡量文本转语音(TTS)模型在语音重建任务中的性能。不同于传统仅关注自然度或MOS评分的评估方式,该框架整合了音色保真度、说话人身份一致性、语义内容忠实性及跨文本泛化能力四大核心维度,并引入可复现的自动化指标(如Speaker Verification Score、Content Preservation Index)与受控人工评测协议。作者在VCTK、LibriSpeech及自建高保真重建数据集上验证了框架的有效性,揭示了当前主流TTS模型(如VITS、Grad-TTS)在跨说话人重建中普遍存在的身份漂移与韵律失真问题,为语音重建技术的标准化评测提供了方法论基础和开源工具支持。

来源 arXiv 时间 2026-06-19 11:41:30 实体 Semantic Kernel AI 辅助整理
DataClaw0:面向原始多模态流数据的AI Agent自主清洗与结构化框架

DataClaw0提出一种新型AI Agent范式,专为实时、异构的原始多模态数据流(如视频帧、音频片段、传感器时序信号及文本日志)设计。区别于传统预处理流水线,它将数据清洗、对齐、标注与元数据生成等任务交由可调度的轻量级Agent协同完成,支持动态策略调整与反馈驱动优化。论文在自动驾驶与工业IoT场景中验证其有效性,在噪声高达40%的数据流下仍保持92.3%的语义一致性准确率。该工作填补了大模型时代‘数据供给链’中智能前置处理环节的空白,为后续多模态理解与推理提供高质量、低延迟的输入基座。

来源 arXiv 时间 2026-06-19 11:31:43 实体 Semantic Kernel AI 辅助整理
面向异构任务持续学习的原子技能差异化扩展与路由机制

该论文提出一种新型持续学习框架,针对高度异构的任务(如视觉识别、文本生成、强化学习控制等)设计「任务差异化原子技能」:将模型能力解耦为细粒度、可复用的技能单元,并依据任务语义动态扩展新技能而非覆盖旧技能;引入轻量级路由模块,基于任务表征自动调度最适技能子集,避免灾难性遗忘。作者在跨模态、跨领域任务流(含12类差异显著的基准任务)上验证其有效性,相较传统参数隔离或重放缓冲方法,平均准确率提升11.3%,技能复用率达67%。工作呼应了AI Agent对模块化、可演进能力架构的核心需求。

来源 arXiv 时间 2026-06-19 10:41:30 实体 Semantic Kernel AI 辅助整理
NASDAQ环境下的归一化观测空间与动力学增强Q学习

该论文针对金融时序强化学习中观测空间尺度失衡与环境动态建模不足两大挑战,提出NASDAQ-NODAQ框架:首先构建基于滚动标准化与波动率感知的归一化观测空间,缓解价格量纲差异与市场状态漂移;其次引入轻量级动力学模块(Dynamics-Augmented Head),在Q网络中显式建模价格跳变、流动性衰减等高频市场动力学特征,并通过反事实奖励修正提升策略鲁棒性。在NASDAQ真实tick级数据(2023–2024)上的实证表明,其夏普比率较SAC、PPO及传统DQN提升23.7%,且在闪崩场景下回撤控制能力显著优于基线模型。研究为高频交易Agent的感知-决策协同优化提供了新范式。

来源 arXiv 时间 2026-06-19 10:21:04 实体 Semantic Kernel AI 辅助整理
拓扑神经动力学:面向序列建模的神经元级建模范式

该论文提出“拓扑神经动力学”(TND)框架,突破传统RNN/Transformer对序列的全局时序建模范式,转而为每个神经元赋予独立、可学习的动力学轨迹,并通过微分同胚映射将神经元状态演化嵌入低维拓扑流形。作者证明TND在长程依赖捕捉、抗噪声鲁棒性及参数效率上显著优于LSTM与State Space Models,在WikiText-2、Character-Level PTB等基准任务中实现更低困惑度与更快收敛。技术核心在于将神经元激活视为流形上的连续轨迹,而非离散时间步的静态向量,从而为序列建模引入微分几何与动力系统理论的新视角。该工作为AI模型的可解释性与生物合理性提供了新路径。

来源 arXiv 时间 2026-06-19 10:18:24 实体 Semantic Kernel AI 辅助整理
频谱随机掩码重建助力深度神经网络识别判别性波数

该研究提出一种新型自监督预训练策略:对红外或拉曼光谱数据进行随机波数掩码,再通过深度神经网络重构被遮蔽区域。实验表明,这种重建任务能显著增强模型对关键判别性波数(如官能团特征峰)的敏感性与定位能力,优于传统端到端监督训练。作者在多个光谱分类基准(如聚合物识别、疾病诊断)上验证了方法有效性,并通过注意力可视化与消融分析证实,预训练过程促使网络自发聚焦于化学意义明确的谱带区域,为小样本光谱分析提供了可解释性强、泛化性优的新范式。

来源 arXiv 时间 2026-06-19 10:13:18 实体 Semantic Kernel AI 辅助整理
无奖励预训练:基于占据分布覆盖最大化强化学习前置训练

该论文提出一种无需环境奖励信号的强化学习预训练范式,核心思想是通过最大化状态-动作对的占据分布(occupancy measure)覆盖范围,驱动智能体在未知环境中主动探索并构建泛化性强的表征。作者将此建模为一个可微分优化问题,结合策略梯度与密度估计技术,在离线与在线设定下均验证了其有效性;预训练后的策略在下游稀疏奖励任务中显著提升样本效率与零样本迁移能力。该方法规避了传统预训练对人工设计奖励函数的依赖,为构建通用型RL智能体提供了新路径,也呼应了当前AI社区对‘世界模型’与‘自主探索’基础能力的关注。

来源 arXiv 时间 2026-06-19 09:47:38 实体 Semantic Kernel AI 辅助整理
再生核希尔伯特空间中监督学习的子采样理论

该论文系统研究了在再生核希尔伯特空间(RKHS)框架下,针对大规模监督学习任务的子采样策略及其统计泛化性能。作者建立了子采样估计量与全样本核岭回归解之间的误差上界,揭示了采样规模、核函数复杂度与目标函数光滑性之间的三重权衡关系;特别指出,在满足源条件(source condition)和容量条件(capacity condition)时,仅需O(n^{2/3})量级的样本即可达到与全样本同阶的收敛速率。研究还对比了均匀采样与重要性加权采样的优劣,并通过合成数据与真实基准(如UCI数据集)验证了理论结论。该工作为核方法在大数据场景下的可扩展性提供了严谨的理论支撑。

来源 arXiv 时间 2026-06-19 09:36:10 实体 Semantic Kernel AI 辅助整理
RoPE 位置编码是否损害检索型注意力头?跨模型家族的机制分析

该研究首次系统探究旋转位置编码(RoPE)对Transformer中“检索头”(retrieval heads)——即专用于长程键值匹配、承担类似记忆检索功能的注意力头——的影响。作者通过归因分析、头级干预与因果追踪,在Llama、Qwen、Phi-3等主流开源模型上发现:RoPE并非完全阻止检索头形成,但会显著削弱其在长距离上下文中的定位精度与键值对齐稳定性;这种退化在浅层更明显,且与RoPE的相对位置建模特性及Q/K投影权重分布存在强相关性。研究进一步提出轻量级RoPE变体R-RoPE,在保持生成质量前提下恢复检索头效能,为构建兼具强推理与高效检索能力的Agent基础模型提供关键洞见。

来源 arXiv 时间 2026-06-19 09:23:59 实体 Haystack AI 辅助整理
ACE-GS:面向精度、紧凑性与效率平衡的3D高斯溅射新框架

ACE-GS 是一种面向神经渲染的新型3D高斯溅射(Gaussian Splatting)优化框架,旨在系统性解决该技术在重建精度、模型体积与推理速度三者间的固有矛盾。作者提出分层参数压缩机制与自适应高斯椭球裁剪策略,在保持PSNR与LPIPS指标接近SOTA水平的同时,将显存占用降低42%,训练时间缩短35%,并支持实时(>30 FPS)渲染。方法在ScanNet、Mip-NeRF 360等标准数据集上验证有效,特别适用于边缘端部署与交互式三维重建场景。其开源实现已推动社区对轻量化神经辐射场架构的重新思考。

来源 arXiv 时间 2026-06-19 09:11:13 实体 Semantic Kernel AI 辅助整理
QBioFusion-QSAR:面向小样本配体分类的摩根指纹锚定量子多核学习方法

该论文提出QBioFusion-QSAR框架,针对药物发现中普遍存在的小样本配体活性分类难题,创新性地将量子机器学习与经典QSAR建模融合。方法以Morgan指纹为结构锚点,构建量子特征映射空间,并采用多核学习(MKL)策略自适应融合经典与量子核函数,在有限标注数据下显著提升泛化能力。作者在多个真实小分子生物活性数据集(如DUD-E子集)上验证其性能,相比传统RF、GCN及标准SVM提升AUC达8.2–12.7个百分点,同时保持可解释性——量子核权重可反演关键药效团特征。工作 bridging quantum computing and practical cheminformatics,为AI赋能早期药物筛选提供了兼顾数据效率与物理合理性的新范式。

来源 arXiv 时间 2026-06-19 08:30:51 实体 Semantic Kernel AI 辅助整理
神经元细胞自动机中的通信异质性与群体共识形成

该研究系统探究了神经元细胞自动机(NCA)中个体间通信能力差异(即通信异质性)对全局集体共识涌现的影响。作者通过构建具有可调通信带宽与连接拓扑的NCA模型,发现适度的异质性反而能加速共识收敛并提升鲁棒性——这挑战了传统‘同质化通信更优’的直觉认知。研究进一步揭示,关键节点的高通信能力可充当‘共识枢纽’,而冗余低带宽连接则有助于抑制局部振荡。实验涵盖图像修复、模式同步等典型任务,并与经典共识算法(如平均一致性协议)对比,验证了生物启发式异质架构在分布式学习与自组织系统中的独特优势。

来源 arXiv 时间 2026-06-19 08:15:29 实体 Semantic Kernel AI 辅助整理
text-to-cad:面向硬件设计的AI Agent技能集合

text-to-cad 是由开发者 earthtojake 主导的开源项目,聚焦于将自然语言指令转化为可执行的 CAD 建模、机器人运动规划与硬件原型设计任务。项目基于 JavaScript 构建,深度集成 Build123d(Python 优先的参数化建模库)的语义桥接能力,并支持 3MF 格式导出,实现跨平台硬件协作。其核心是一组模块化 AI Agent 技能(skills),涵盖几何生成、约束解析、装配关系推断及物理可行性校验等关键环节,旨在降低硬件开发门槛,推动‘用对话驱动制造’的范式演进。项目虽处于早期阶段,但已展现出在教育、快速原型和嵌入式系统设计中的实用潜力。

来源 GitHub 时间 2026-06-18 22:13:41 实体 Semantic Kernel AI 辅助整理
DiffusionGemma 可解释性深度评估:架构透明度与决策溯源分析

该论文系统考察了 Google 最新发布的多模态生成模型 DiffusionGemma 的透明度问题,聚焦其扩散-语言联合架构中注意力机制、隐空间映射及采样路径的可追溯性。作者通过梯度归因、特征可视化与反事实扰动实验,在文本到图像生成任务上量化了各模块对最终输出的因果贡献,并指出当前模型在跨模态对齐层存在显著的‘黑箱间隙’——即文本指令语义与扩散去噪步之间的映射缺乏显式监督信号。研究还对比了 DiffusionGemma 与 Stable Diffusion v2、LLaVA-1.6 在可解释性基准(XAI-Bench)上的表现,揭示其虽具更强生成能力,但内部逻辑一致性弱于轻量级专家模型。文末提出‘分层可解释性协议’(HEP)作为改进框架。

来源 arXiv 时间 2026-06-18 17:59:46 实体 Semantic Kernel AI 辅助整理
UNIEGO:基于代理中介的统一第一人称视频表征学习框架

UNIEGO提出一种新颖的统一学习范式,旨在解决第一人称(egocentric)视频理解中多任务目标不一致、标注成本高及跨场景泛化弱等核心挑战。该方法引入可学习的‘代理’(proxies)作为语义中介,在隐空间中桥接动作识别、时序定位、目标交互等异构任务,通过对比蒸馏与代理对齐机制实现共享表征的协同优化。不同于依赖大量人工标注或单一预训练目标的传统方法,UNIEGO在EPIC-Kitchens、EGO4D等主流基准上显著提升零样本迁移与少样本微调性能,且无需任务特定架构修改,展现出强泛化性与部署友好性。其设计亦为具身智能体的视觉-行为联合建模提供了新思路。

来源 arXiv 时间 2026-06-18 17:59:45 实体 Semantic Kernel AI 辅助整理
最优确定性多校准理论与全预测框架

本文系统构建了确定性多校准(deterministic multicalibration)的最优算法理论,首次证明其可在多项式时间内实现任意精细粒度的群体公平性约束,并严格刻画了校准误差与计算复杂度的权衡边界。研究进一步提出‘全预测’(omniprediction)新范式——一种能同时优化无穷多类损失函数(包括0-1损失、绝对误差、F1分数等)的统一预测机制,并证明多校准是实现全预测的充要条件。该成果为公平机器学习、可信AI评估及模型鲁棒性分析提供了坚实的理论基础与可构造算法,显著拓展了经典校准理论在大模型时代下的适用边界。

来源 arXiv 时间 2026-06-18 17:59:31 实体 Semantic Kernel AI 辅助整理
分布偏移下校准型混合专家模型的构建路径

该论文聚焦于大语言模型中MoE(Mixture-of-Experts)架构在分布偏移场景下的可靠性问题,指出传统MoE易因专家选择偏差与置信度失准导致预测校准性下降。作者提出一种端到端可训练的校准框架,通过联合优化专家路由置信度、门控函数温度系数及后验概率校准模块,在保持稀疏推理效率的同时显著提升OOD(Out-of-Distribution)样本下的预测可信度。实验覆盖文本分类、问答与多领域泛化任务,在WILDS、DomainNet等标准偏移基准上验证了方法在ECE(Expected Calibration Error)指标上的持续改进,并揭示了专家多样性与校准性能间的耦合机制。

来源 arXiv 时间 2026-06-18 17:55:00 实体 Semantic Kernel AI 辅助整理
多任务贝叶斯上下文学习:面向小样本泛化的元推理框架

该论文提出Multi-Task Bayesian In-Context Learning(MT-BICL),将贝叶斯推理与上下文学习深度融合,首次在统一框架下建模任务间先验共享与实例级不确定性。不同于传统ICL依赖大模型隐式统计,MT-BICL显式构建任务超先验分布,通过变分推断动态更新上下文中的任务后验,并支持跨任务知识迁移。作者在FewRel、Meta-Dataset等少样本基准上验证其泛化性,在仅5个示例下相对标准ICL提升12.7%准确率;同时提供理论保证——其预测误差界随任务相似性增强而收缩。工作填补了贝叶斯方法与大模型上下文学习之间的关键方法论鸿沟,为可信、可解释的轻量级适配提供了新范式。

来源 arXiv 时间 2026-06-18 17:50:10 实体 Semantic Kernel AI 辅助整理
LedgerAgent:面向策略合规的工具调用智能体结构化状态框架

LedgerAgent 是一种新型AI Agent架构,旨在解决大模型在复杂工具调用场景中因状态管理松散导致的策略违背问题(如越权操作、流程跳步、数据泄露)。其核心创新在于引入受区块链启发的‘分类账式状态机’(Ledger-State Machine),将工具调用历史、权限上下文、业务规则约束显式编码为不可篡改的结构化状态链,并通过轻量级验证器实时校验每步动作的策略一致性。论文在金融风控与IT运维两个高合规要求领域进行了实证,相比Chain-of-Thought和ReAct基线,违规调用率降低73%,任务完成准确率提升21%。该工作为构建可审计、可追溯、策略内生的生产级Agent提供了新范式。

来源 arXiv 时间 2026-06-18 17:41:56 实体 Semantic Kernel AI 辅助整理
Multi-LCB:将LiveCodeBench评测基准扩展至多编程语言支持

LiveCodeBench 是一个面向代码生成能力的动态、交互式评测基准,原仅支持 Python。本文提出 Multi-LCB,通过系统性重构其测试用例生成、执行沙箱与评估协议,首次将该基准扩展至 Java、C++、JavaScript、Go 和 Rust 共六种主流语言。作者构建了跨语言对齐的 1,200+ 道高质量题目(含算法、系统设计与调试任务),并引入语言感知的编译/运行时错误归因机制与标准化输出比对策略。实验表明,主流开源与闭源大模型在多语言任务上表现差异显著,凸显当前代码模型的语言覆盖不均衡问题。Multi-LCB 已开源,为评估和推动多语言代码智能体提供了可复现、可扩展的新基础设施。

来源 arXiv 时间 2026-06-18 17:35:57 实体 Semantic Kernel AI 辅助整理
AnySearch-Skill:面向AI Agent的统一实时搜索技能库

AnySearch-Skill 是一个专为AI Agent设计的开源Python技能模块,支持对接AnySearch实时搜索引擎,提供低延迟、高相关性的跨源(网页、文档、知识库等)统一检索能力。它采用标准化Skill接口规范,已深度适配Hermes、OpenClaw、QClaw等主流Agent框架,可无缝集成至Agent工作流中作为核心检索组件。项目强调轻量部署与协议兼容性,内置自动重试、结果去重与结构化解析功能,并提供可扩展的插件式认证与路由机制,助力开发者快速构建具备真实世界信息获取能力的智能体系统。

来源 GitHub 时间 2026-06-18 17:12:40 实体 Semantic Kernel AI 辅助整理
面向跨设备智能体系统的分层恢复机制

本文针对多设备协同场景下AI智能体(Agent)因局部故障导致全局重规划开销过大的问题,提出一种分层恢复架构。该架构将任务执行划分为设备内(intra-device)与设备间(inter-device)两个控制层级:底层通过轻量级状态监控与本地策略微调实现毫秒级故障响应;上层仅在必要时触发跨设备协调,显著降低通信与计算负载。作者在真实异构设备集群(含手机、边缘网关与云服务器)上验证了该方法,在任务成功率提升12.7%的同时,平均恢复延迟降低63%,且不依赖中心化调度器。研究为构建鲁棒、可扩展的分布式Agent系统提供了新范式。

来源 arXiv 时间 2026-06-18 17:04:17 实体 Semantic Kernel AI 辅助整理
多智能体与多体系统最优序结构的统一理论框架

该论文构建了一个统一的数学框架,用于刻画多智能体系统(MAS)与经典/量子多体物理系统中涌现的“最优序”——即在分布式交互约束下实现全局协同性能最优的结构化组织形态。作者将序(order)形式化为状态空间中的低维流形嵌入与信息瓶颈约束下的因果依赖图,并证明其存在性、唯一性及对通信拓扑与动力学耦合强度的鲁棒性。研究突破了传统控制论对线性可解性的依赖,引入广义变分原理与非平衡随机博弈的联合分析工具,为大规模AI Agent编排、自组织机器人集群及凝聚态类比计算提供了新的理论基础。文中还给出了面向异构Agent网络的分布式序发现算法及其收敛性证明。

来源 arXiv 时间 2026-06-18 17:03:03 实体 Semantic Kernel AI 辅助整理
面向放射学的可扩展空间对齐二维视觉-语言模型训练

该论文提出一种专为医学影像(尤其是X光、CT等2D放射图像)设计的视觉-语言模型训练框架,核心创新在于引入空间接地(spatial grounding)机制——通过将报告文本中的解剖描述与图像局部区域显式对齐,提升模型对病灶位置与语义关系的理解能力。作者构建了首个大规模、细粒度标注的放射学空间对齐数据集,并设计轻量级适配器架构,在保持预训练视觉编码器冻结的前提下实现高效微调,显著降低计算开销。实验表明,该方法在放射报告生成、异常定位及跨模态检索任务上均超越现有SOTA模型,且具备良好临床可解释性。研究为AI辅助诊断系统向‘看得见、说得准、指得清’迈进提供了新范式。

来源 arXiv 时间 2026-06-18 16:55:26 实体 Semantic Kernel AI 辅助整理