Haystack

framework
AI 辅助整理 · 事实字段按公开来源校验

deepset 开源的可组合 RAG 与搜索框架,以 Pipeline 串联检索、生成与评估组件。

内容完整度: 4/5 · 待补:related_entities

事实字段

定位
RAG 与搜索框架
主语言
Python
开发方
deepset
许可证
Apache-2.0
来源追溯: 事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。

整理说明

本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 Haystack 在 AI Agent 与大模型生态中的位置。

事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。

版本演进

2026-07-08
update
DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression
2026-06-24
update
Haystack: Open-Source AI Framework for Production Ready Agents, RAG
2026-06-24
update
AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression
2026-06-24
update
CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference
2026-06-23
update
Does RoPE Prevent or Degrade Retrieval Heads? A Mechanistic Analysis Across Model Families

关联动态

DepthWeave-KV:面向长上下文的跨层残差分解 KV 缓存压缩

这项工作聚焦大模型长上下文推理中的核心瓶颈——KV Cache 过大导致显存与吞吐受限。作者提出 DepthWeave-KV,一种 token 自适应的跨层残差分解方法,通过在不同层之间重构并压缩键值缓存,尽量保留对注意力计算最关键的信息,同时显著降低缓存开销。相比单纯按层裁剪或量化,这种方法更强调跨层信息复用与残差信号建模,适合长文本问答、代码补全和多轮对话等场景。整体思路兼顾压缩率与推理质量,为长上下文高效部署提供了新的工程路径。

来源 arXiv 时间 2026-07-07 17:29:01
Haystack:面向生产环境的开源AI智能体与RAG框架

Haystack 是由德国 deepset 公司主导开发的开源AI框架,专为构建可部署、可扩展的生产级AI智能体(Agent)和检索增强生成(RAG)系统而设计。它提供模块化架构,支持灵活编排LLM、文档检索器、重排序器、提示工程及评估工具,并原生兼容主流模型(如Llama 3、GPT、Claude)与向量数据库(Chroma、Qdrant、Elasticsearch)。2024年发布的 Haystack 2.x 版本全面转向异步、轻量API优先设计,显著提升吞吐与可观测性;其配套工具如 haystack-ui 和 evals 模块,进一步降低企业级RAG落地门槛。目前已被SAP、宝马、德意志银行等机构用于知识问答、客服自动化与合规文档分析场景。

来源 Hacker News 时间 2026-06-24 11:21:32
CompressKV:基于语义检索的KV缓存压缩方法

该论文提出CompressKV,一种面向长上下文大语言模型推理的高效KV缓存压缩框架。不同于传统按距离或重要性阈值裁剪的启发式方法,CompressKV引入轻量级语义检索模块,在推理时动态识别并保留与当前查询最相关的键值对,剔除语义冗余项。其核心创新在于将检索精度与缓存压缩率解耦——通过离线构建分层语义索引、在线执行近似最近邻查询,实现毫秒级响应开销。在Llama-3-8B等模型上实验表明,CompressKV在保持<0.5%困惑度损失前提下,将128K上下文的KV内存占用降低62%,端到端延迟下降37%,显著优于FlashAttention-2与StreamingLLM等基线方法。

来源 arXiv 时间 2026-06-23 11:59:46
AVOC:面向小时级音视频理解的检索式令牌压缩方法

该论文提出AVOC(Audio-Video Omni-Compression)框架,专为解决现有多模态大语言模型(Omni-Modal LLMs)在处理长时序音视频(如数小时会议录像、课程录像)时面临的计算开销大、上下文窗口受限及关键信息稀释等瓶颈。AVOC受信息检索中查询-文档匹配机制启发,设计分层令牌压缩策略:先通过语义相似性筛选高价值帧/音频片段,再以可学习的软掩码对冗余token进行动态压缩,保留跨模态时序结构与事件逻辑链。在Hourly-VideoBench等长视频理解基准上,AVOC将推理速度提升3.2倍,同时使问答准确率相对基线提升11.7%,且无需额外微调下游任务头。该工作为构建真正实用的长时音视频原生AI Agent提供了新范式。

来源 arXiv 时间 2026-06-23 08:06:58
RoPE 位置编码是否损害检索型注意力头?跨模型家族的机制分析

该研究首次系统探究旋转位置编码(RoPE)对Transformer中“检索头”(retrieval heads)——即专用于长程键值匹配、承担类似记忆检索功能的注意力头——的影响。作者通过归因分析、头级干预与因果追踪,在Llama、Qwen、Phi-3等主流开源模型上发现:RoPE并非完全阻止检索头形成,但会显著削弱其在长距离上下文中的定位精度与键值对齐稳定性;这种退化在浅层更明显,且与RoPE的相对位置建模特性及Q/K投影权重分布存在强相关性。研究进一步提出轻量级RoPE变体R-RoPE,在保持生成质量前提下恢复检索头效能,为构建兼具强推理与高效检索能力的Agent基础模型提供关键洞见。

来源 arXiv 时间 2026-06-19 09:23:59