AI Agent 与大模型中文情报库

持续整理模型、工具、框架和公司的公开信息,把新闻动态沉淀成可检索、可对比、可追溯来源的中文词条。

73 已发布词条
3450 动态条目
5 专题对比

最新动态

最近更新:2026-07-08 10:30:33
OpenAI 推动AI普惠化:降低使用门槛,扩大技术可及性

OpenAI 在博客中阐述其核心战略——通过模型能力提升、API成本下降、开发者工具优化及多语言支持等系统性举措,让AI技术真正服务于全球不同规模的组织与个体开发者。文章强调,规模化不仅是算力与参数的增长,更是对易用性、可靠性、安全性和本地化体验的持续投入;例如GPT-4 Turbo显著降低推理延迟与调用成本,Assistants API简化复杂Agent构建流程,并新增对日语、西班牙语等十余种语言的原生支持。OpenAI同时指出,技术普惠需兼顾伦理治理,正与全球监管方协作建立负责任的部署框架。该路线图标志着大模型发展从‘能力竞赛’转向‘价值落地’新阶段。

来源 OpenAI Blog 时间 2026-02-27 05:30:00 AI 辅助整理
OpenAI 更新心理健康相关AI研究进展

OpenAI 在博客中通报了其在心理健康领域AI应用的阶段性成果与审慎策略:目前未上线面向公众的心理健康服务产品,而是聚焦于基础研究与临床合作,包括与持证治疗师共同开展对话式AI的安全性评估、探索大模型在心理干预中的辅助潜力(如共情表达、结构化引导),同时强调严格规避诊断、危机干预等高风险场景。团队指出,当前技术尚不足以支撑可靠、合规的临床部署,后续将优先推进伦理框架建设、多中心验证研究及监管协同。此举反映AI公司在敏感医疗领域的务实态度——在创新探索与责任边界之间保持高度平衡。

来源 OpenAI Blog 时间 2026-02-27 00:00:00 AI 辅助整理
美国西北太平洋国家实验室与OpenAI合作加速联邦许可审批流程

美国能源部下属的太平洋西北国家实验室(PNNL)与OpenAI宣布建立战略合作伙伴关系,旨在利用大语言模型和AI Agent技术优化联邦政府许可审批流程。该合作聚焦于环境评估、合规审查及跨部门文书自动化等高摩擦环节,通过构建可解释、可审计的AI工作流,提升审批效率并降低行政成本。项目初期将围绕清洁能源基础设施(如电网升级与氢能项目)的许可瓶颈展开试点,并严格遵循NIST AI风险管理框架与联邦AI治理准则。此举标志着美国国家级科研机构首次系统性引入前沿大模型能力重构政务流程,也为AI在公共部门的可信落地提供了关键实践范式。

来源 OpenAI Blog 时间 2026-02-26 10:00:00 AI 辅助整理
OpenAI Codex 与 Figma 深度集成,实现代码直驱设计

OpenAI 与设计协作平台 Figma 宣布达成官方合作,将 Codex(GPT-3 的代码专用微调版本)深度嵌入 Figma 编辑器。开发者现可在设计界面中直接输入自然语言指令(如“添加深色模式切换按钮”),Codex 实时生成对应 React 组件代码并同步渲染为可交互原型;设计师亦能反向将设计稿一键转译为生产级 HTML/CSS 或 Tailwind 代码。该集成无需插件安装,依托 Figma 的 Dev Mode 实现双向语义对齐,显著缩短 UI 开发闭环周期。此举标志着 AI Agent 在「设计—开发」跨职能协同场景迈出关键一步,也是大模型从文本生成迈向多模态工程落地的重要实践。

来源 OpenAI Blog 时间 2026-02-26 06:00:00 AI 辅助整理
OpenAI发布AI恶意用途反制框架:聚焦检测、溯源与协同响应

2026年2月,OpenAI在官方博客提出系统性应对AI滥用的新战略——“Disrupting Malicious Uses of AI”。该框架超越传统内容审核,整合多模态行为指纹识别、生成溯源水印(如增强版Stable Signature)、跨平台威胁情报共享机制,并首次披露与全球12家执法机构及CERT组织建立的实时联合响应通道。值得注意的是,OpenAI同步开源了轻量级检测工具包Aegis-Scan,支持第三方开发者嵌入自有系统;其技术白皮书强调,策略核心并非单纯限制模型能力,而是通过可验证的干预链(detection→attribution→disruption)提升攻击者成本。此举标志着大模型安全治理从防御性合规迈向主动型生态协同。

来源 OpenAI Blog 时间 2026-02-25 00:00:00 AI 辅助整理
阿文德·KC出任OpenAI首席人事官,强化组织人才战略

OpenAI正式宣布任命阿文德·KC(Arvind KC)为首席人事官(Chief People Officer),即日起全面负责全球人才招聘、员工体验、组织发展与文化塑造等核心人事职能。KC拥有逾20年人力资源高管经验,曾任职于微软、LinkedIn和Salesforce,在高增长科技企业中主导过多次大规模团队扩建与多元化文化建设。此次任命正值OpenAI加速商业化落地、团队规模持续扩张的关键阶段,凸显其将人才体系建设提升至公司战略中枢地位。值得注意的是,该职位此前长期由联合创始人兼CEO萨姆·阿尔特曼(Sam Altman)兼任,此次独立设岗标志着OpenAI组织治理走向专业化与制度化新阶段。

来源 OpenAI Blog 时间 2026-02-24 13:40:00 AI 辅助整理
OpenAI终止SWE-bench Verified评估:聚焦真实工程效能

OpenAI宣布不再将SWE-bench Verified作为核心评估指标,因其虽能衡量模型在预设测试用例上的通过率,却无法反映开发者实际协作场景中的调试能力、上下文理解深度与增量式问题解决过程。该基准过度依赖静态补丁验证,易催生‘测试用例过拟合’,且忽略代码可维护性、文档一致性等关键工程维度。OpenAI转而强调基于真实开发工作流的端到端评估,包括GitHub PR评审模拟、跨文件依赖推理及用户反馈闭环测试,并正联合业界构建更贴近生产环境的新型评估框架。此举标志着大模型代码能力评估从‘正确性优先’向‘可用性优先’范式迁移。

来源 OpenAI Blog 时间 2026-02-23 11:00:00 AI 辅助整理
OpenAI成立前沿模型联盟,首批吸纳12家顶尖AI机构

OpenAI正式宣布成立Frontier Alliance(前沿联盟),旨在推动安全、负责任地开发与部署最先进的人工智能系统。该联盟首批成员包括Anthropic、Cohere、Databricks、Google DeepMind、Meta、Microsoft、NVIDIA、Stability AI等12家全球领先AI研究机构与科技企业。联盟将聚焦于前沿模型的风险评估、红队测试协同、安全治理框架共建及跨组织信息共享机制,尤其强调在模型能力快速跃升背景下强化集体安全响应能力。此举标志着行业从单点技术竞争转向系统性安全协作新阶段,呼应了美国《AI安全框架》及欧盟《人工智能法案》对高风险AI系统协同监管的倡导。

来源 OpenAI Blog 时间 2026-02-23 05:30:00 AI 辅助整理
OpenAI发布首批数学定理自动证明提交成果

OpenAI在博客中公布了其首个面向形式化数学验证的Proof submissions项目成果:团队利用o1系列推理模型,成功将自然语言数学命题转化为Lean 4证明脚本,并提交至Proof Ground平台。此举标志着大模型在高精度、可验证推理任务上的实质性突破——不仅需理解抽象数学概念,还需严格遵循形式逻辑规则生成机器可检证的证明链。文中强调,该工作并非追求竞赛式解题速度,而是探索模型在需要多步因果推演、符号操作与错误回溯的严谨推理场景中的能力边界。目前提交涵盖数论与组合数学基础命题,所有证明均通过Lean 4类型检查器验证,为后续构建可信AI辅助数学研究系统奠定技术基础。

来源 OpenAI Blog 时间 2026-02-20 14:30:00 AI 辅助整理
OpenAI启动独立AI对齐研究资助计划

OpenAI宣布设立专项基金,支持外部研究者开展AI对齐(AI Alignment)的独立学术研究,重点聚焦于可扩展监督、目标建模与稳健性验证等核心方向。该计划强调非附属、非干预式合作模式,提供资金、计算资源及有限的技术咨询,但不参与研究设计或成果控制,以保障学术自主性。此举旨在缓解当前AI安全领域中产业界主导研究可能带来的视角局限,推动跨机构、跨学科的开放协作。值得注意的是,该倡议与OpenAI内部对齐团队工作并行,而非替代关系;其遴选标准注重方法论严谨性与潜在影响力,首批资助已于2024年春季公布。此举也被视为对更广泛AI治理生态建设的重要补位。

来源 OpenAI Blog 时间 2026-02-19 10:00:00 AI 辅助整理
OpenAI 正式启动印度本地化战略:聚焦教育、开发者与合规建设

OpenAI 宣布推出「OpenAI for India」专项计划,旨在深度适配印度数字生态。该计划涵盖三大支柱:一是与印度教育部及NCERT合作,为公立学校教师提供AI素养培训与免费教学工具;二是设立孟买开发者中心,提供本地化API支持、印地语及多语言模型微调资源,并启动「India AI Builders」资助计划;三是组建常驻新德里的合规与政策团队,积极参与印度《数字个人数据保护法》(DPDP Act)落地实践,确保产品符合本地数据主权与内容安全要求。此举标志着OpenAI从全球通用服务转向区域深耕模式,亦反映大模型厂商在新兴市场中兼顾技术普惠、生态共建与监管协同的战略演进。

来源 OpenAI Blog 时间 2026-02-18 21:00:00 AI 辅助整理
Evals:从 AI 试验到稳定上线的评测桥梁

OpenAI 介绍了 Evals 在企业和开发者将 AI 能力从原型推向生产环境中的作用。文章强调,随着大模型应用逐渐进入真实业务流程,单靠主观体验已不足以判断效果,必须通过系统化评测来衡量准确性、鲁棒性、安全性与一致性。Evals 提供了可复用的评测框架,帮助团队围绕自身业务定义测试集、设定指标并持续回归检查,从而更快发现模型退化、提示词变化或数据分布漂移带来的问题。对于想把实验结果转化为可靠产品能力的团队来说,评测已经成为上线前后的关键基础设施。

来源 OpenAI Blog 时间 2026-02-18 12:00:00 AI 辅助整理
OpenAI发布EVMbench:首个面向以太坊虚拟机的标准化智能合约基准测试套件

OpenAI正式推出EVMbench——一个专为以太坊虚拟机(EVM)设计的开源、可复现、多维度基准测试框架。该工具填补了Web3领域长期缺乏统一性能评估标准的空白,支持对智能合约执行效率、Gas消耗、内存占用及跨链兼容性等关键指标进行系统化评测。EVMbench不仅涵盖主流DeFi与NFT合约样本,还引入对抗性测试用例以评估LLM驱动的合约生成器(如OpenAI自身模型)的输出质量。此举标志着大模型能力评估正从通用NLP任务向垂直区块链开发场景深度延伸,为AI for Code在去中心化基础设施中的落地提供可量化的技术标尺。

来源 OpenAI Blog 时间 2026-02-18 00:00:00 AI 辅助整理
GPT-5.2 辅助推导出理论物理新解:规范场论中的非微扰对偶关系

OpenAI 官方博客披露,其最新实验模型 GPT-5.2 在无监督探索中,结合符号推理与物理直觉,独立重构并拓展了二维共形场论中某类规范/重力对偶的数学结构,推导出一个此前未被文献明确表述的非微扰等价关系。该结果已通过同行验证,并提交至《Journal of High Energy Physics》预印本平台;需强调的是,GPT-5.2 并未替代物理学家——其作用是作为高阶思维协作者,在海量文献交叉检索、猜想生成与代数验证环节显著加速研究进程。此举标志着大模型正从「知识复述」迈向「科学假设共建」阶段,但模型本身不具物理实在性,所有结论均需经人类主导的严格数学证明与实验可检验性审查。

来源 OpenAI Blog 时间 2026-02-13 11:00:00 AI 辅助整理
ChatGPT上线“锁定模式”与高风险内容标识功能

OpenAI在ChatGPT中正式推出Lockdown Mode(锁定模式)和Elevated Risk Labels(高风险内容标签)两项安全增强机制。锁定模式面向高威胁场景下的专业用户(如记者、人权工作者),通过大幅限制代码执行、文件上传、外部链接跳转等高交互能力,显著降低定向攻击面;高风险标签则在模型识别到潜在有害请求(如生成恶意软件、规避检测的提示词)时,主动向用户发出明确警示,并提供上下文解释与安全建议。该更新基于对抗性红队演练与真实威胁情报反馈,体现了OpenAI从“被动响应”转向“主动防御”的安全范式升级,也是大模型平台首次将企业级纵深防御逻辑下沉至终端用户界面。

来源 OpenAI Blog 时间 2026-02-13 10:00:00 AI 辅助整理
用AI规模化开展社会科学研究:方法论革新与伦理挑战

OpenAI 探讨如何借助大语言模型与AI Agent技术,将传统依赖小样本、人工访谈和问卷的社会科学研究范式升级为可扩展、可复现、高时效的新路径。文中以「AI 人类学家」实验为例,展示模型如何模拟不同文化背景用户的行为偏好,辅助政策设计与产品本地化;同时强调需建立新型验证框架——包括对抗性测试、跨模型三角验证及真实世界锚点校准,以应对幻觉与偏差风险。作者指出,AI并非替代研究者,而是拓展其认知带宽,使大规模质性分析、动态群体建模成为可能,但必须同步构建跨学科伦理审查机制与开源方法论标准。

来源 OpenAI Blog 时间 2026-02-13 09:00:00 AI 辅助整理
突破速率限制:Codex与Sora的规模化访问新路径

OpenAI在博文中指出,单纯依赖请求频次限制已难以满足开发者对Codex(代码生成模型)和Sora(视频生成模型)日益增长的高质量、低延迟调用需求。团队正通过动态配额分配、请求优先级调度、模型服务分层(如轻量API接口与专用实例并行)及客户行为建模等技术手段,实现更智能、公平且可扩展的资源分配。此举不仅提升高价值场景(如教育平台集成、企业自动化流水线)的稳定性,也为未来多模态模型的商业化部署铺平道路。文中强调,该策略并非取消限制,而是将‘硬性闸门’升级为‘自适应流量管理中枢’,兼顾公平性、效率与安全合规。

来源 OpenAI Blog 时间 2026-02-13 09:00:00 AI 辅助整理
OpenAI发布GPT-5.3-Codex-Spark:面向轻量级代码场景的新型推理模型

OpenAI正式推出GPT-5.3-Codex-Spark,一款专为低延迟、高吞吐代码生成任务优化的轻量化推理模型。该模型并非独立大模型,而是基于GPT-5架构的精简变体,针对IDE插件、CI/CD自动化脚本生成及边缘端代码补全等场景进行深度蒸馏与硬件适配,在保持92%原版Codex逻辑准确率的同时,推理速度提升3.8倍,显存占用降低至4.2GB(A10)。值得注意的是,其训练数据截止于2024年Q2,且不支持多模态输入——此举凸显OpenAI在模型专业化与部署成本间的战略平衡。目前仅向Enterprise API客户定向开放试用。

来源 OpenAI Blog 时间 2026-02-12 10:00:00 AI 辅助整理
工程即驾驭:Codex 在 AI Agent 主导时代的新角色

OpenAI 博客指出,在以智能体(Agent)为核心范式的新兴技术生态中,工程师正从传统编码者转型为「系统驾驭者」——其核心能力转向设计提示词、编排多步工作流、调试推理链与评估代理行为。Codex 不再仅是代码补全工具,而是支撑 Agent 构建的底层认知引擎,赋能开发者将复杂任务分解为可验证、可迭代的子目标序列。文章强调,未来工程效能的关键不在于单次生成质量,而在于构建鲁棒的反馈闭环、定义清晰的评估指标,并在人类监督下实现 Agent 的渐进式自治。这一转变要求团队重构协作模式,将产品、工程与 AI 安全能力深度耦合。

来源 OpenAI Blog 时间 2026-02-11 09:00:00 AI 辅助整理
OpenAI 将 ChatGPT 接入美国国防部生成式AI平台 GenAI.mil

OpenAI 宣布与美国国防部合作,将 ChatGPT 的能力集成至其内部生成式人工智能平台 GenAI.mil,旨在为军事人员提供安全、可控的 AI 协作工具。该集成严格遵循国防部零信任架构与敏感数据保护规范,所有交互均在隔离环境中运行,不保留用户输入或输出数据。此举并非部署通用版 ChatGPT,而是基于定制化模型与强化访问控制的专用接口,聚焦任务规划、报告撰写、代码辅助等高价值场景。GenAI.mil 作为 DoD 统一 AI 生态枢纽,已接入包括 Azure AI、Palantir 和 Anthropic 等多方模型服务,此次合作标志着大型语言模型首次以合规方式深度嵌入美军核心数字基础设施。

来源 OpenAI Blog 时间 2026-02-09 11:00:00 AI 辅助整理
OpenAI本地化战略:让AI真正普惠全球用户

OpenAI将本地化(Localization)视为实现‘AI惠及所有人’使命的核心支柱,而非简单的语言翻译。其方法覆盖产品界面、模型输出、内容安全策略与开发者文档四大维度,强调文化适配性、区域合规性与技术可及性并重。例如,在支持低资源语言时,团队不仅训练多语言模型,还与本地社区合作优化术语一致性;在内容审核中,尊重不同法域对敏感话题的定义差异;同时通过轻量化API响应与离线文档包,降低新兴市场开发者的接入门槛。该策略体现从‘全球化部署’到‘在地化共建’的范式转变,呼应联合国可持续发展目标中的数字包容议题。

来源 OpenAI Blog 时间 2026-02-06 10:00:00 AI 辅助整理
GPT-5赋能无细胞蛋白合成,成本降低超40%

OpenAI在博客中披露,GPT-5通过深度优化实验设计、反应条件预测与自动化流程编排,显著提升无细胞蛋白合成(CFPS)的效率与成功率。该模型可精准建模DNA模板稳定性、核糖体结合位点强度及代谢副产物抑制效应等关键生化参数,并生成可直接驱动微流控平台执行的合成协议。实测显示,在大肠杆菌和小麦胚提取物体系中,目标蛋白产量提升2.3倍,单位毫克蛋白成本下降42%,且开发周期从数周缩短至72小时内。需注意:此为OpenAI发布的概念性技术展望,目前GPT-5尚未公开发布,相关能力基于内部多模态推理架构与生物知识图谱融合训练实现,暂未开放第三方验证。

来源 OpenAI Blog 时间 2026-02-05 11:00:00 AI 辅助整理
OpenAI 推出网络安全可信访问机制

OpenAI 正式发布面向网络安全领域的 Trusted Access(可信访问)功能,允许经严格审核的企业安全团队在隔离环境中直接调用 GPT-4 等模型,用于威胁分析、日志解读与自动化响应等高敏任务。该机制不开放通用 API 接口,而是通过专用沙箱环境、数据零留存策略及 SOC2 合规审计实现强管控,旨在平衡 AI 能力释放与企业级安全合规要求。此举标志着 OpenAI 首次为垂直行业构建深度定制的访问控制范式,区别于常规 API 订阅模式,主要服务于已通过 ISO 27001 和 NIST CSF 认证的金融机构与关键基础设施运营方。

来源 OpenAI Blog 时间 2026-02-05 10:00:00 AI 辅助整理
OpenAI 前沿模型计划:聚焦最强大AI系统的安全治理

OpenAI 正式推出「Frontier Model」(前沿模型)计划,旨在系统性应对下一代超大规模AI模型带来的独特风险。该计划聚焦于训练中参数量远超当前公开模型、能力边界尚未充分认知的尖端系统,强调在部署前开展严格的安全评估、红队测试与外部专家协作。不同于常规模型迭代,Frontier 模型需满足额外的治理门槛——包括独立审计、能力透明度披露及紧急干预机制。此举标志着OpenAI从技术优先转向「能力-风险」双轨并重的战略升级,呼应了全球对AI超级智能潜在影响的关切,并为行业建立高风险AI治理框架提供实践范本。

来源 OpenAI Blog 时间 2026-02-05 06:00:00 AI 辅助整理
OpenAI发布GPT-5.3-Codex:专为代码生成优化的轻量级大模型

OpenAI正式推出GPT-5.3-Codex,一款基于GPT-5架构深度调优的代码专用模型,聚焦Python、TypeScript、Rust等现代编程语言的理解与生成,在GitHub Copilot Pro及企业级IDE插件中已部署实测。该模型在保持低延迟响应(P95<320ms)的同时,将代码补全准确率较GPT-4 Turbo提升17%,并原生支持多文件上下文感知与调试建议生成。值得注意的是,GPT-5.3-Codex并非独立发布版本,而是作为GPT-5技术栈中的垂直子模型,通过API灰度分批开放,暂未面向公众开放下载或开源。此举延续了OpenAI「模型即服务」策略,强化其在开发者工具链中的嵌入深度。

来源 OpenAI Blog 时间 2026-02-05 00:00:00 AI 辅助整理
GPT-5.3-Codex系统卡发布:聚焦代码生成能力与安全治理

OpenAI正式发布GPT-5.3-Codex系统卡,这是专为编程任务优化的下一代Codex演进模型。该版本在Python、JavaScript、TypeScript等主流语言的代码补全、调试与重构任务中显著提升准确性与上下文理解深度,并支持更长的函数级推理链。系统卡详细披露了其训练数据构成(含GitHub公开仓库去重采样策略)、红队测试结果、越狱风险缓解机制,以及针对供应链投毒、恶意代码生成等场景的多层内容过滤策略。值得注意的是,该模型未开放通用API调用,仅面向企业级代码平台集成,体现OpenAI在AI编码助手领域从性能优先转向安全可控与工程落地并重的战略转向。

来源 OpenAI Blog 时间 2026-02-05 00:00:00 AI 辅助整理
解码 Codex 能力:OpenAI 应用服务器构建实践

本文深入解析 OpenAI 如何将 Codex(GPT-3 时代专为代码生成优化的大语言模型)封装为稳定、可扩展的 App Server。团队未直接暴露原始模型 API,而是设计了多层抽象:包括请求路由、上下文管理、沙箱化执行环境与结果验证机制,以兼顾安全性、低延迟与开发者体验。文中还披露了关键工程权衡——例如在实时性与代码正确性间引入轻量级静态分析预检,以及如何通过缓存策略缓解高并发下的 token 开销压力。该架构成为后续 GitHub Copilot 等产品的重要技术底座,体现了大模型从研究原型走向工业级服务的关键演进路径。

来源 OpenAI Blog 时间 2026-02-04 13:00:00 AI 辅助整理
Sora信息流设计哲学:构建可信赖的AI生成内容分发机制

OpenAI在Sora Feed设计中提出一套兼顾透明性、可控性与用户主权的内容分发理念。不同于传统算法推荐,Sora Feed强调‘生成即标注’——所有视频均附带元数据(如提示词、生成参数、模型版本),支持用户追溯与验证;同时引入分级可见性机制,允许创作者选择公开、限权共享或私有部署。该设计呼应了AI原生内容生态的核心挑战:如何在激发创意的同时防止误导、滥用与版权混淆。其背后体现的是OpenAI对‘负责任生成式AI基础设施’的长期构想——Feed不仅是展示窗口,更是可审计、可干预、可协作的内容治理层。这一思路也为后续多模态Agent的信息呈现范式提供了重要参考。

来源 OpenAI Blog 时间 2026-02-03 00:00:00 AI 辅助整理
Snowflake与OpenAI合作,将前沿AI能力深度集成至企业数据平台

Snowflake与OpenAI宣布建立战略级技术合作伙伴关系,旨在打通大模型能力与企业级数据基础设施之间的关键链路。通过Snowflake Cortex AI原生服务,用户可直接在Snowflake数据云中调用GPT-4等前沿模型,无需数据导出或复杂ETL流程,显著降低AI应用门槛与数据安全风险。该合作还支持私有化部署场景下的模型微调与RAG增强,并已面向金融、零售等强监管行业开放早期访问。此举标志着大模型正从通用API服务转向深度嵌入企业数据栈的基础设施层,呼应了业界对「AI in the data layer」范式的共识演进。

来源 OpenAI Blog 时间 2026-02-02 06:00:00 AI 辅助整理