KV-psi 是一个开源工具,利用 Linux 内核的 Pressure Stall Information(PSI)机制实时监测系统资源压力(如 CPU、内存、IO 等),并据此智能收缩大语言模型推理过程中的 Key-Value 缓存(KV cache)。相比传统固定长度或启发式缓存策略,它能在内存紧张时主动释放非关键缓存块,降低 OOM 风险,同时尽量减少推理延迟波动。项目采用 Rust 编写,支持与主流推理框架(如 llama.cpp、vLLM)集成,无需修改模型逻辑,仅通过环境变量或 API 注入即可启用。其设计体现了「系统感知型 AI」新范式——将底层 OS 信号直接反馈至模型执行层,是边缘部署与多租户场景下资源协同优化的重要实践。
KV-psi KV 缓存管理工具
tool KV-psiAI 辅助整理 · 事实字段按公开来源校验
KV-psi 是一个利用 Linux PSI 信号修剪 LLM KV cache 的工具候选,适合跟踪推理性能与内存管理方向。
事实字段
category
tool
confidence
medium
reviewed_by
codex-current-session
source_candidate_name
Show HN: KV-psi, using Linux PSI to to trim an LLM KV cache
来源追溯:
事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。
整理说明
本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 KV-psi KV 缓存管理工具 在 AI Agent 与大模型生态中的位置。
事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。