Perplexity

tool
AI 辅助整理 · 事实字段按公开来源校验

以「带引用的回答」为核心的 AI 搜索产品,把检索与 LLM 总结结合,强调可溯源。

内容完整度: 4/5 · 待补:related_entities

事实字段

定位
AI 搜索引擎
开发方
Perplexity AI
许可证
商用闭源
来源追溯: 事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。

整理说明

本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 Perplexity 在 AI Agent 与大模型生态中的位置。

事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。

版本演进

2026-07-03
update
A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
2026-07-02
update
Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization
2026-07-01
update
Explicit Fuzzy Logic in the Feed-Forward Layer: Self-Forgetting Quantifiers Discover Legible Grammatical-Licensing Detectors
2026-06-26
update
CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention
2026-06-25
update
OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning
2026-06-24
update
Decentralised AI Training and Inference with BlockTrain
2026-06-23
update
SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression
2026-06-23
update
Tapered Language Models
2026-06-23
update
An Empirical Study of OpenPangu Quantization on Ascend NPUs

关联动态

为线性注意力配备海马体:补全循环状态遗忘的精确记忆

这篇论文提出一种面向线性注意力模型的外部记忆机制,借鉴海马体在生物记忆中的作用,用来精确保存循环状态容易丢失的信息。作者关注的是:线性注意力虽然计算高效、适合长序列,但其递推式状态更新往往会发生信息压缩与遗忘,导致部分关键细节无法被长期保留。为此,论文设计了一个“海马体”式记忆模块,在不破坏高效递推的前提下,对被状态遗忘的内容进行补偿与检索,从而提升长程依赖建模能力与记忆完整性。

来源 arXiv 时间 2026-07-02 15:19:49
超越激活对齐:任务感知大模型量化中的对齐与多样性权衡

本文聚焦任务感知的大模型量化问题,指出传统方法往往强调激活对齐,即尽量让量化后模型的中间表示贴近原模型,但这种做法可能牺牲表示多样性,进而限制模型在不同任务上的泛化与鲁棒性。作者从“对齐—多样性”权衡出发,分析为何单纯追求激活一致并不足以获得最优量化效果,并探讨在压缩模型、保持任务性能与适配多任务需求之间更均衡的设计思路。该工作为LLM量化提供了新的评价视角,也为后续在任务敏感场景下改进量化算法提供了理论依据与实践启发。

来源 arXiv 时间 2026-07-01 13:12:21
前馈层中的显式模糊逻辑:可读语法许可检测器的自遗忘量词

本文研究如何在神经网络前馈层中显式引入模糊逻辑机制,并提出“自遗忘量词”框架,用于从数据中自动发现可解释的语法许可检测器。作者关注模型在处理语言结构约束时,如何将原本隐式、分散的判别信号转化为更接近逻辑规则的表征,从而提升可读性与可分析性。实验表明,这类量化式模糊单元能够学习到与语法许可相关的模式,并以较强的可解释方式对应人类可理解的语法现象。该工作为将符号逻辑、模糊推理与深度学习结合提供了新的实现路径,也为构建更透明的语言模型组件提供了思路。

来源 arXiv 时间 2026-06-30 15:46:27
CARVE:面向分块并行线性注意力的内容感知循环架构

CARVE 是一种新型线性注意力机制,专为长序列建模设计,通过引入内容感知的循环状态更新与价值效率优化,在保持O(n)时间复杂度的同时显著提升建模精度。其核心创新在于将输入内容动态编码进循环隐藏态,并在分块并行计算中复用中间值,减少冗余计算;实验表明,该方法在语言建模、长文档理解等任务上优于FlashAttention-2与Linformer,在GPU显存占用降低23%的前提下仍维持98.7%的原始模型性能。论文还开源了适配Hugging Face生态的PyTorch实现,支持无缝集成至现有Transformer流水线。

来源 arXiv 时间 2026-06-25 16:16:51
OPERA:基于目标困惑度的强化学习对齐开放推理

该论文提出OPERA框架,旨在解决大语言模型在开放域推理任务中目标漂移与策略不可控的问题。不同于依赖人工反馈或监督微调的传统方法,OPERA创新性地将推理过程建模为序列决策问题,并以‘目标困惑度’(Objective Perplexity)作为可微分、可优化的内在奖励信号——该指标量化模型在达成用户指定目标(如证明定理、生成合规代码)时每步输出与理想路径的语义偏离程度。通过PPO算法进行端到端强化学习,OPERA在数学推理、多跳问答和安全敏感推理等任务上显著提升目标一致性与逻辑鲁棒性,且无需额外标注数据或外部评判器。实验表明,其在GSM8K和ProofWriter基准上超越基线模型12.3%准确率,同时降低幻觉率37%。

来源 arXiv 时间 2026-06-24 12:31:14
BlockTrain:基于区块链的去中心化AI训练与推理框架

BlockTrain 是一种新型开源架构,旨在解决大模型时代下AI算力资源垄断与数据隐私困境。该框架将分布式训练和推理任务解耦为可验证的链上智能合约与链下可信执行环境(TEE)协同范式,支持异构设备(如消费级GPU、边缘终端)安全接入,并通过零知识证明保障梯度更新的完整性。论文在真实联邦学习场景中验证了其相较传统FedAvg提升23%通信效率,且在恶意节点占比达30%时仍保持92%模型准确率。作者强调其非替代现有分布式训练框架,而是提供可插拔的信任增强层,兼容PyTorch生态与主流共识机制(如PoS+轻量BFT)。

来源 arXiv 时间 2026-06-23 15:47:33
渐缩式语言模型:面向推理效率与精度的分层架构设计

该论文提出‘渐缩式语言模型’(Tapered Language Models),一种新型分层推理架构:在前向传播中动态缩减隐藏层维度,形成从宽输入到窄输出的锥形结构,显著降低计算开销而不牺牲关键层表达能力。作者通过理论分析证明其在注意力头稀疏性与FFN通道压缩间的最优权衡,并在多个基准(如MMLU、GSM8K、HumanEval)上验证其相较同等参数量标准Transformer提升17–23%推理吞吐量,同时保持98.4%以上原始性能。该设计兼容现有训练流程,支持即插即用式部署,为边缘端与高并发场景下的大模型轻量化提供了新范式。

来源 arXiv 时间 2026-06-22 17:56:25
SVD-Surgeon:面向大语言模型压缩的最优奇异值外科手术法

该论文提出SVD-Surgeon,一种基于奇异值分解(SVD)的精细化模型压缩框架,突破传统截断SVD的粗粒度限制。作者将权重矩阵的奇异值调整建模为带约束的优化问题,引入可学习的缩放掩码与梯度重参数化机制,在保留关键语义通道的同时精准衰减冗余频谱分量。在LLaMA-2、Phi-3等主流模型上实验证明,相较标准剪枝或量化方法,SVD-Surgeon在同等压缩率下平均提升2.3%的零样本任务准确率,并显著缓解层间误差累积问题。研究还揭示了不同层对奇异值扰动的敏感性差异,为结构化压缩提供了理论依据与实用工具链。

来源 arXiv 时间 2026-06-22 16:33:16
昇腾NPU上盘古大模型量化效果实证研究

本研究系统评估了华为开源大模型OpenPangu在昇腾(Ascend)NPU硬件平台上的量化性能,对比FP16、INT8及混合精度量化策略在推理延迟、内存占用与精度损失三方面的表现。实验覆盖多个模型规模(10B至130B参数)及典型NLP任务(如文本生成与问答),发现INT8量化在多数场景下可实现2.3倍加速与58%显存压缩,同时保持<1.2%的BLEU/ROUGE指标下降;作者还揭示了昇腾芯片特有的权重分组校准机制对量化鲁棒性的关键影响,并开源了适配CANN 7.0+的量化工具链。该工作为国产AI芯片与大模型协同优化提供了可复现的工程范式。

来源 arXiv 时间 2026-06-19 09:33:11