NexusKV
通用大语言模型状态智能与分布式内存基础设施层
💡 什么是 NexusKV?
NexusKV 是专为大语言模型推理平台设计的下一代通用模型状态智能与分布式内存基础设施层。
面向 DeepSeek-V4(CSA / HCA 混合 Attention)、NVIDIA Vera Rubin (Rubin CPX / HBM4) 以及 UALink 2.0 / CXL 3.1 时代,基于统一状态契约与多语言协同架构设计:
- 分布式控制面 (Go):基于 Raft 协议提供分布式租约管理、自愈哈希环与多租户硬隔离配额(Quota)。
- 高性能匹配与存储引擎 (Rust):nxradixtree-core 提供高并发前缀树匹配,nexus-store 提供锁页内存与 CXL/POSIX SHM 零拷贝管理。
- 通用挂载与决策框架 (Python / C-FFI / C++):基于端到端有效收益评估方程($G = T_{compute} - T_{cache} > 0$)决策传输路径,支持 NVFP4 量化 Scale 对齐并提供 <1ms Fail-Open 降级保障。
⚡ 架构特性对比
| 维度 | 本地引擎缓存 | 进程外缓存 Sidecar | NexusKV |
|---|---|---|---|
| 系统架构 | 嵌入在推理 Worker 进程 | Python 进程外侧车 | Go 控制面 + Rust 数据引擎 + C++/Python SDK |
| 复用决策 | 本地盲目命中 | 盲目块拉取 | 基于有效收益方程 ($G = T_{compute} - T_{cache} > 0$) 智能路由 |
| Attention 支持 | 密集型 MHA / Paged KV | 裸 Tensor Blobs | 原生支持 DeepSeek-V4 (CSA/HCA)、MLA (512维 Latent Vector) 与 NVFP4 Scale |
| 物理传输 | 引擎内部 IPC | 进程间通信 | CUDA IPC P2P 零拷贝、POSIX SHM、CXL 3.1、NVLink 6 与 UALink 2.0 |
| 多租户与过载 | 无隔离 / 被动驱逐 | 阻塞队列 | TenantQuotaManager 主动反压与硬隔离 |
| 系统降级保障 | 阻塞挂起 | 传输挂起 | <1ms 极速 Fail-Open 平滑退回 GPU 重算 |
🚀 核心架构与模块导航
- 📖 快速开始与部署指南:单节点部署、vLLM/SGLang 适配器与集成说明。
- 🏛 架构全景指南:分布式 Radix 前缀树、租约协议与数据面说明。
- 📚 Beyond KV-Cache 学术白皮书:系统设计、数学证明与基准测试数据。
- 🗺 2026 季度演进路线图:NexusKV 季度敏捷路线图。