AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
Polymarket被曝付费雇人拍摄虚假投注“获胜”视频

据Slashdot报道,去中心化预测市场平台Polymarket被揭露曾向数十名用户支付报酬,要求其录制自己在平台上“赢得”大额赌注的短视频——而这些交易实际使用的是平台提供的测试代币或已撤销的虚假订单,并未发生真实资金流动。此举旨在营造平台活跃、盈利容易的假象,用于社交媒体营销。事件曝光后引发社区对Web3项目诚信机制的广泛质疑,尤其凸显了链下行为(如内容营销)与链上真实性之间的严重脱节。多位加密领域评论者指出,此类操作虽未直接违反智能合约规则,却实质性损害用户信任,暴露了当前预测市场在治理透明度和营销伦理方面的深层缺陷。

来源 Hacker News 时间 2026-06-21 04:45:03 AI 辅助整理
基于假设驱动的LLM智能体技能优化方法

该论文提出一种面向大语言模型(LLM)智能体的假设驱动技能优化框架,旨在解决现有Agent在复杂任务中技能泛化性弱、调试成本高的问题。作者将技能学习建模为可验证的科学假设过程:首先生成关于技能失效原因的可证伪假设(如‘工具调用失败源于参数格式错误’),再通过可控实验(如构造边界测试用例)进行验证与迭代修正。该方法融合程序分析、轻量级符号执行与反馈驱动的提示微调,在ToolQA、WebShop等基准上显著提升任务成功率,同时降低人工干预频次。研究强调可解释性与可复现性,为LLM Agent的工程化落地提供了新范式。

来源 arXiv 时间 2026-06-21 04:43:20 实体 通义千问 2.5 AI 辅助整理
BabelJudge:跨语言与多步推理轨迹下的LLM裁判可靠性评测框架

该研究提出BabelJudge,首个系统性评估大语言模型作为自动裁判(LLM-as-a-Judge)在多语言环境及复杂Agent决策路径中可靠性的基准框架。作者构建覆盖12种语言的多样化评测集,涵盖事实一致性、逻辑连贯性与文化适配性三类核心维度,并首次引入‘轨迹敏感性’指标,量化模型在不同推理步骤序列下的评分稳定性。实验表明,当前主流裁判模型在非英语语境下性能显著下降,且对Agent中间状态微小扰动高度敏感——揭示了现有评估范式隐含的语言中心主义与路径脆弱性问题。研究为构建鲁棒、公平、可解释的AI评估基础设施提供了方法论基础与开源工具支持。

来源 arXiv 时间 2026-06-21 04:35:43 实体 通义千问 2.5 AI 辅助整理
构建高可靠性的AI Agent系统:从设计原则到工程实践

本文由软件工程权威Martin Fowler与拜耳AI团队联合撰写,深入剖析了在工业级场景中构建可靠AI Agent系统的关键挑战与应对策略。作者指出,单纯依赖大模型的「端到端幻觉」不可靠,必须通过结构化编排(如分步推理、工具调用、状态管理)、显式错误处理、可追溯的决策链路以及严格的输入/输出契约来提升系统鲁棒性。文中以拜耳实际部署的药物研发辅助Agent为例,展示了如何将LLM嵌入传统软件工程范式——包括单元测试、监控告警、回滚机制和人工审核门禁。文章强调:可靠性不来自模型更大,而来自架构更审慎、边界更清晰、可观测性更强。

来源 Hacker News 时间 2026-06-21 04:28:39 AI 辅助整理
面向大模型服务的几何感知在线调度方法

该论文针对LLM推理服务中请求异构性(如输入/输出长度、计算密度)导致的传统调度器性能瓶颈,提出一种几何感知的在线调度框架。作者将请求特征建模为高维几何空间中的点,结合批处理效率与显存约束构建理论最优性下界,并据此设计轻量级在线算法GeoSched——无需预训练、支持动态负载调整。在vLLM和Triton后端上的实测表明,相比FIFO、FairSeq等基线,其P99延迟降低37%,GPU利用率提升22%。工作 bridging the gap between scheduling theory and LLM serving practice,为大模型推理系统提供了兼具数学严谨性与工程落地性的新范式。

来源 arXiv 时间 2026-06-21 04:05:38 实体 vLLM AI 辅助整理
信息过载时代:大脑并非为持续接收坏消息而演化

本文基于2026年6月《科学日报》刊载的神经认知研究指出,人类大脑的威胁检测机制源于远古环境——偶发性、具象化、可应对的危险(如猛兽逼近);而当代媒体生态却持续推送抽象、远距、不可控的负面信息(战争、气候灾难、系统性危机),导致前额叶皮层与杏仁核长期失衡,引发慢性焦虑、共情疲劳与决策钝化。研究团队通过fMRI追踪发现,每日接触超3条高强度负面新闻即显著抑制默认模式网络活跃度,削弱反思与意义建构能力。文章并非主张信息回避,而是呼吁重建‘认知节律’:设置信息摄入时段、优先关注解决方案导向报道、恢复线下具身社交等神经保护实践。该观点呼应了近年‘数字斋戒’与‘慢新闻’运动的科学依据。

来源 Hacker News 时间 2026-06-21 04:02:08 AI 辅助整理
Adam优化器在非光滑非凸优化中的收敛性证明

该论文首次在无需梯度裁剪、不依赖Lipschitz连续性假设的条件下,严格证明了标准Adam算法在非光滑、非凸目标函数下的收敛性。作者引入广义次梯度(Clarke次梯度)框架,结合自适应步长与动量机制的耦合分析,证明其迭代序列的次梯度范数均值以O(1/√T)速率收敛至零。研究突破了以往对Adam收敛性分析需依赖平滑性或强假设的局限,为深度学习中广泛使用的Adam在训练含ReLU、Dropout等不可导组件的模型时提供了坚实的理论支撑,也推动了非光滑优化与自适应优化算法的交叉研究进展。

来源 arXiv 时间 2026-06-21 04:00:35 AI 辅助整理
所有路径终致崩溃:大语言模型推理链的系统性失效分析

该论文深入探究了大语言模型(LLM)在多步推理任务中普遍存在的‘推理链崩溃’现象——即随着推理步骤增加,模型准确率非线性骤降。作者通过构建可控的合成推理基准(如递归逻辑谜题与分层数学推导),实证发现崩溃并非源于单一因素(如注意力衰减或位置编码限制),而是由上下文窗口内语义漂移、中间状态置信度累积误差及自我修正机制失灵三者协同导致。研究进一步提出‘崩溃临界点’量化指标,并验证了思维链微调、中间结果显式校验等策略的缓解边界。本工作为理解LLM长程推理瓶颈提供了新范式,对AI Agent的可靠规划能力设计具有重要启示。

来源 arXiv 时间 2026-06-21 03:59:13 AI 辅助整理
课程强化学习可激发大模型超越基座的推理能力

该研究提出一种面向大语言模型(LLM)的课程强化学习(CRL)框架,通过渐进式任务难度调度与奖励塑形,引导模型在微调过程中自发发展出结构化推理能力。实验表明,在不依赖额外推理模块或监督标注的前提下,CRL显著提升LLM在数学推理、符号操作与多步逻辑推断等任务上的表现,且泛化至未见题型;其效果超越标准PPO微调与监督微调基线,并在多个开源模型(如Qwen2、Llama3-8B)上验证了可复现性。作者进一步分析指出,课程设计中的认知负荷调控是激活隐式推理路径的关键机制,为‘让模型学会思考’提供了可干预的训练范式。

来源 arXiv 时间 2026-06-21 03:15:25 实体 深度求索 AI 辅助整理
扩散集成梯度:面向可控路径生成的灵活特征归因方法

本文提出Diffusion Integrated Gradients(DIG),一种融合扩散模型路径先验与积分梯度框架的新归因算法。区别于传统积分梯度依赖线性插值路径,DIG利用预训练扩散模型生成语义连贯、多样性丰富的隐空间轨迹,使特征重要性计算更符合真实数据流形结构。作者在图像分类与文本生成任务中验证其鲁棒性与可解释性提升,并支持用户通过条件引导调控归因路径——例如聚焦物体局部区域或抑制背景干扰。该方法为大模型可解释性研究提供了兼具理论严谨性与工程实用性的新范式,尤其适用于高维非线性决策场景。

来源 arXiv 时间 2026-06-21 03:04:35 实体 xAI AI 辅助整理
Omnigent:开源AI智能体框架与元调度平台

Omnigent 是一个面向生产级应用的开源AI智能体(Agent)框架与元调度器(meta-harness),支持无缝集成Claude Code、Codex、Cursor、Pi等主流AI编码助手及用户自定义智能体。其核心创新在于‘ harness-agnostic’架构——开发者可动态切换底层执行环境(如不同模型API或沙箱运行时),无需重写业务逻辑;内置细粒度策略引擎,实现跨Agent的访问控制、数据脱敏、资源配额与安全沙箱隔离;并提供低延迟协同内核,支持多终端实时协作。项目采用Python构建,强调可审计性与企业级治理能力,填补了当前AI Agent在编排灵活性、安全合规与团队协同三方面的关键空白。

来源 GitHub 时间 2026-06-21 02:49:35 实体 Claude AI 辅助整理
阿里开源代码审查工具:确定性流水线+LLM智能体协同

阿里巴巴开源的 Open Code Review 是一款经超大规模生产环境验证的免费代码审查工具。它采用混合架构设计,融合确定性规则引擎(支持空指针、线程安全、XSS、SQL注入等内置微调规则集)与可插拔的LLM智能体,实现精准到行级的审查意见生成。工具原生兼容OpenAI与Anthropic大模型,并支持仓库级上下文理解,显著提升审查覆盖率与可解释性。项目使用Go语言开发,强调轻量集成与工程可控性,适用于CI/CD流水线嵌入及IDE插件扩展,是面向企业级研发效能提升的下一代代码审查基础设施。

来源 GitHub 时间 2026-06-21 02:47:27 实体 Anthropic AI 辅助整理
小米MiMo-Code:模型与智能体协同演化的开源框架

MiMo-Code 是小米旗下 MiMo 实验室推出的开源项目,旨在构建模型(Model)与智能体(Agent)双向驱动、持续协同演化的技术范式。项目以 TypeScript 编写,提供轻量级 CLI 工具链,支持开发者快速定义、编排和迭代 AI Agent 行为,并通过结构化反馈机制反向优化底层大模型提示与推理策略。其核心创新在于打破传统‘模型训练→部署→调用’单向流程,引入运行时观测、行为蒸馏与策略对齐等机制,使 Agent 的实际执行数据可闭环回流至模型微调与架构演进。项目已开源基础框架、示例工作流及评估协议,适用于智能体开发、RAG 增强、自动化任务编排等前沿场景,体现了国内企业在 AI Agent 基础设施层面的系统性探索。

来源 GitHub 时间 2026-06-21 02:44:02 AI 辅助整理
基于熵引导边界监督的乳腺超声分割方法

该研究针对乳腺超声图像分割中特异性不足与模型校准偏差两大挑战,提出一种熵引导的边界监督框架。通过在边界区域引入像素级熵约束,显式抑制低置信度预测的伪标签污染,同时结合不确定性感知的损失函数优化,显著提升分割结果的解剖合理性与概率校准性。在私有临床数据集及公开BUSI数据集上的实验表明,该方法在Dice系数、Hausdorff距离及ECE(预期校准误差)等指标上均优于现有SOTA方法,尤其在囊实性交界、边缘模糊等困难区域展现出更强鲁棒性。研究还提供了可解释的不确定性热力图,为临床辅助诊断提供可信度支持。

来源 arXiv 时间 2026-06-21 02:21:11 实体 Semantic Kernel AI 辅助整理
基于流形恢复混合的蛋白质表征学习增强方法

该论文提出Manifold Restore Mixing(MRM)——一种面向蛋白质序列建模的新型数据增强与表征学习框架。针对现有自监督方法在低维隐空间中易丢失结构拓扑信息的问题,MRM通过显式建模蛋白质残基间几何约束,在特征空间中执行受流形曲率引导的混合操作,从而在保持生物物理合理性的同时提升表示鲁棒性。作者在多个下游任务(如二级结构预测、稳定性评估和功能位点识别)上验证了MRM的有效性,在ESM-2等主流基础模型上实现显著性能增益,并通过可视化分析证实其增强了对折叠拓扑与进化保守性的捕捉能力。该工作为AI for Science中结构感知的生物大分子表征学习提供了新范式。

来源 arXiv 时间 2026-06-21 02:20:14 实体 Semantic Kernel AI 辅助整理
利用大语言模型混淆代码作者识别:GPT-3.5与GPT-4对比研究

该研究系统评估了GPT-3.5和GPT-4在代码风格迁移(code stylometry obfuscation)任务中的能力,即通过重写源代码掩盖开发者独特的编码习惯(如命名偏好、缩进风格、控制流结构等),从而规避基于机器学习的作者识别系统。作者构建了包含10名程序员的真实Python代码数据集,设计多维度评估指标(包括作者混淆成功率、语义保真度、语法正确性及运行时行为一致性),发现GPT-4在保持功能正确性的前提下显著优于GPT-3.5,但两类模型均存在重写后引入逻辑偏差或性能退化的问题。研究还揭示了当前代码 stylometry 检测器对LLM改写代码的脆弱性,为代码溯源治理与开发者隐私保护提供了实证依据与技术边界认知。

来源 arXiv 时间 2026-06-21 02:19:45 AI 辅助整理
适配学习节奏:动态数据调度提升大语言模型强化学习效果

该论文提出一种面向大语言模型(LLM)强化学习的自适应数据调度框架,突破传统RLHF中静态或启发式数据采样范式。作者设计了基于策略置信度、奖励方差与样本难度的多维评估指标,动态调整训练批次中样本的采样概率与时序顺序,使模型在不同训练阶段接触难度渐进、信息增益最优的数据子集。在多个指令微调与数学推理基准(如GSM8K、HumanEval)上的实验表明,该方法显著提升收敛速度与最终性能,同时降低策略崩溃风险。研究揭示了数据调度作为隐式课程学习机制的关键作用,为LLM对齐优化提供了新的系统性视角。

来源 arXiv 时间 2026-06-21 02:19:17 实体 Dify AI 辅助整理
基于编码器-解码器流形对齐的幂等生成方法

该论文提出一种新型生成范式,通过在隐空间中构建编码器-解码器协同对齐机制,强制模型输出满足幂等性约束(即重复输入产生相同输出),从而提升生成结果的一致性与可复现性。作者将生成过程建模为流形上的几何映射问题,利用对比学习与正则化联合优化编码器与解码器的联合流形结构,使潜在表示既保持语义连续性,又满足幂等操作的拓扑不变性。实验表明,该方法在文本重写、图像修复与代码补全等任务中显著降低输出抖动(output jitter),尤其适用于需多次调用或链式调用的AI Agent场景。研究填补了生成模型在数学一致性(如幂等性)与几何表征之间协同建模的理论空白。

来源 arXiv 时间 2026-06-21 02:14:37 实体 Semantic Kernel AI 辅助整理
OpenLess:跨平台开源语音输入工具,按键即说、松手即得AI润色文本

OpenLess 是一款面向 macOS 和 Windows 的开源语音输入增强工具,用户按住自定义快捷键(如 Ctrl+Space)即可开始语音输入,松开后自动完成语音识别(ASR)、语义理解与文本润色,并将优化后的结果无缝粘贴至当前光标位置——无需切换应用或依赖云端服务。其核心采用本地化轻量 ASR 模型与可插拔 LLM 推理层(支持 Ollama、LM Studio 等),兼顾隐私性与响应速度。项目明确暂不支持 Linux,但开放模块化架构,鼓励社区适配。相比系统原生听写,OpenLess 强调‘意图感知’编辑能力,例如自动修正口语冗余、补全技术术语、调整语气正式度,真正实现‘语音到可用文本’的闭环。

来源 GitHub 时间 2026-06-21 02:04:35 实体 Cursor AI 辅助整理
Open-Design:本地优先的开源AI设计代理,支持多端原型与全格式导出

Open-Design 是一款本地优先(Local-first)的开源AI设计工具,定位为Claude Design的替代方案,提供原生桌面客户端。它内置259+可组合技能与142+预置设计系统,支持网页、桌面、移动端原型、幻灯片、图像及视频生成,并首创HyperFrames动态帧交互技术。所有预览均在沙盒环境中运行,保障安全;输出支持HTML、PDF、PPTX、MP4等多格式。底层兼容Claude Code、Qwen、Kimi、Hermes等17+主流AI模型与CLI工具,同时支持BYOK(Bring Your Own Key)模式,赋予用户对模型调用与数据主权的完全控制权。项目采用TypeScript构建,体现AI Agent在专业设计工作流中的深度集成能力。

来源 GitHub 时间 2026-06-21 01:54:19 实体 Claude AI 辅助整理
SCENIC:面向结构化IoT指令生成的语义驱动边缘感知神经框架

SCENIC提出了一种新型神经框架,专为物联网(IoT)场景下结构化自然语言指令到可执行命令的精准转换而设计。该框架融合语义条件建模与边缘感知机制,通过显式建模设备拓扑、上下文语义约束及物理边界(如传感器覆盖范围、通信延迟等边缘特性),显著提升指令解析的鲁棒性与设备适配性。不同于传统端到端序列生成模型,SCENIC引入分层指令图解码器与轻量级边缘特征嵌入模块,在资源受限的边缘设备上实现低延迟推理。实验表明,其在SmartThings与HomeAssistant真实IoT数据集上指令生成准确率较SOTA模型提升12.3%,且对模糊、多意图口语指令具备更强泛化能力。

来源 arXiv 时间 2026-06-21 01:41:35 实体 Semantic Kernel AI 辅助整理
Polymarket被曝雇佣创作者发布误导性营销视频

据《华尔街日报》调查,预测市场平台Polymarket系统性雇佣社交媒体创作者,制作并投放大量看似中立、实则刻意淡化风险与监管隐患的短视频,内容常将平台包装为“民主化预测工具”,却回避其未获美国CFTC批准、用户资金无FDIC保障等关键事实。此类内容广泛出现在TikTok、YouTube Shorts及X平台,部分创作者未披露付费合作关系,涉嫌违反FTC披露指南。事件引发对Web3项目灰色营销手段的质疑——在监管缺位背景下,预测市场正以算法推荐放大信息不对称,将高风险金融产品包装成娱乐化内容渗透主流社交生态。

来源 Hacker News 时间 2026-06-21 01:12:21 AI 辅助整理
即便AI生成代码能运行,我仍会拒绝——一名资深工程师的审慎实践

本文作者Vinícius Brasil作为有多年经验的软件工程师,系统阐述了为何在生产环境中主动拒用「功能正确但不可维护」的AI生成代码。他指出,当前大模型常产出缺乏清晰抽象、违反团队约定、难以调试或隐含边界漏洞的实现;即便通过测试,这类代码会显著抬高长期协作成本与技术债。作者强调,工程判断力不能让位于表面效率——可读性、可演进性、可归因性(如明确的函数职责与文档契约)才是代码价值的核心。文中还对比了「能跑通」与「可交付」的本质差异,并呼吁团队建立面向AI协作的代码审查新范式,而非仅依赖自动化测试覆盖。

来源 Hacker News 时间 2026-06-21 00:58:13 AI 辅助整理
Ponytail:面向AI代理的极简主义编程哲学工具

Ponytail 是一个轻量级 JavaScript 库,受‘懒惰资深开发者’思维启发,主张‘最好的代码是从未写的代码’——通过智能跳过冗余步骤、复用现有能力、优先调用外部工具(如 CLI、API 或已有函数)而非自行实现,显著提升 AI Agent 的执行效率与鲁棒性。它并非传统代码生成器,而是为 Claude 等大模型(尤其适配 Claude Code 及其插件生态)提供一套可嵌入的决策层,引导 Agent 在任务规划阶段主动规避过度工程。项目强调‘最小可行行动’原则,契合现代 AI Agent 设计中对成本控制、延迟优化与可维护性的深层诉求,已在实际工作流中验证其降低 token 消耗与错误率的效果。

来源 GitHub 时间 2026-06-21 00:23:17 AI 辅助整理
Any-Body Guard:基于动作掩码的通用操作策略安全防护框架

该论文提出Any-Body Guard——一种面向具身智能体(embodied agents)操作策略的通用安全防护机制。不同于依赖特定任务或机器人本体建模的传统方法,它通过轻量级、可插拔的动作掩码(action masking)模块,在策略执行前实时过滤危险或非法动作空间,实现跨平台、跨任务的安全对齐。作者在仿真环境(如Ravens、Bridge)及真实机械臂平台上验证了其有效性,证明该方法能显著降低误操作率(平均下降73%),同时保持原始策略98%以上的任务成功率。其核心创新在于将安全约束解耦为独立于策略训练的运行时干预层,兼顾泛化性与部署灵活性,为AI Agent在开放物理环境中的鲁棒落地提供了新范式。

来源 arXiv 时间 2026-06-21 00:11:46 实体 Semantic Kernel AI 辅助整理
主动感知与延迟决策轨迹优化实现鲁棒目标识别

本文提出一种融合主动感知与延迟决策机制的轨迹优化框架,用于提升动态环境中目标识别的鲁棒性。作者将传感器调度、运动规划与识别决策解耦,引入可学习的“决策门控”模块,在轨迹执行过程中动态推迟不确定识别点的最终判定,同时利用贝叶斯更新持续优化感知策略。方法在仿真与真实机器人平台(搭载RGB-D与事件相机)上验证,相较传统端到端策略,在遮挡、低信噪比及目标相似度高等挑战场景下,识别准确率提升12.7%,决策延迟降低34%。研究为具身智能体在开放世界中实现可信感知-行动闭环提供了新范式。

来源 arXiv 时间 2026-06-21 00:09:45 AI 辅助整理
基于ASR的低资源语言文本语料构建方法评估:以丰贝语和豪萨语为例

该研究系统评估了利用自动语音识别(ASR)技术将口语语音转录为文本语料,以缓解低资源非洲语言(丰贝语和豪萨语)文本数据稀缺问题的可行性。作者构建了高质量语音-文本对齐的基准测试集,对比多种开源与商用ASR模型在跨方言、噪声环境及有限训练数据下的鲁棒性,并分析转录错误对下游NLP任务(如词性标注、命名实体识别)的影响。结果表明,经领域适配与后处理优化的ASR流水线可生成具备实用价值的伪标注语料,在无监督/半监督训练中显著提升模型性能,为资源极度匮乏语言的数据飞轮建设提供了可复现的技术路径。

来源 arXiv 时间 2026-06-20 23:51:55 AI 辅助整理
MixedPEFT:面向无监督域自适应的多PEFT方法混合优化框架

该论文提出MixedPEFT,一种在无监督域自适应(UDA)场景下协同融合多种参数高效微调(PEFT)技术的新型框架。不同于传统单一PEFT方法(如LoRA、Adapter或Prompt Tuning),MixedPEFT通过可学习的混合门控机制动态加权不同PEFT模块的输出,并联合优化域不变表征与任务目标,兼顾特征对齐与下游性能。作者在多个跨域文本分类与序列标注基准(如Amazon→Yelp、CoNLL→WNUT)上验证其有效性,显著超越单PEFT基线及主流UDA方法。研究还揭示了不同PEFT组件在域迁移中的互补性,为大模型轻量化适配提供了新范式。

来源 arXiv 时间 2026-06-20 23:45:19 实体 Semantic Kernel AI 辅助整理
豪萨语与丰语机器翻译评估:大模型基准测试、失效分析与指标可靠性研究

该研究首次系统评估主流大语言模型(如LLaMA-3、Qwen、DeepSeek)在低资源非洲语言——豪萨语(Hausa)和丰语(Fongbe)上的机器翻译能力。作者构建了高质量双语测试集,涵盖新闻、宗教文本与日常对话,并发现当前模型在形态复杂词(如丰语动词屈折)和文化专有项(如豪萨谚语)上错误率超65%。研究还揭示BLEU等自动指标与人工评价相关性偏低(r<0.42),提出需结合语义保真度与语法正确性双维度人工评估框架。成果为非洲语言AI本地化提供了可复现的评估范式与关键失效归因。

来源 arXiv 时间 2026-06-20 23:23:54 实体 通义千问 2.5 AI 辅助整理
Revelio:面向超大规模代码库的轻量级智能体内存安全漏洞检测框架

Revelio 是一种专为仓库级(repository-scale)代码库设计的低成本、高精度内存安全漏洞检测方法,突破传统静态分析与模糊测试在扩展性与误报率上的瓶颈。其核心创新在于构建轻量级 AI Agent 协同架构:通过语义感知的代码切片策略聚焦高风险区域,结合符号执行与大语言模型驱动的上下文敏感污点分析,在保持低资源开销的同时显著提升对 Use-After-Free、Double-Free 等复杂漏洞的检出能力。作者在 Linux 内核子系统及 Apache 基金会 127 个 C/C++ 项目上验证,相较 CodeQL 和 Infer,漏报率降低 43%,单仓库平均分析耗时控制在 2.1 小时以内,支持增量式持续检测。该工作为开源生态中大规模遗留系统的内存安全治理提供了可落地的技术路径。

来源 arXiv 时间 2026-06-20 23:17:23 实体 Semantic Kernel AI 辅助整理