跳转至

NexusKV

通用大语言模型状态智能与分布式内存基础设施层

NexusKV Unified CI License: Apache 2.0 Go Version Rust Workspace Python Suite


💡 什么是 NexusKV?

NexusKV 是专为大语言模型推理平台设计的下一代通用模型状态智能与分布式内存基础设施层

面向 DeepSeek-V4(CSA / HCA 混合 Attention)、NVIDIA Vera Rubin (Rubin CPX / HBM4) 以及 UALink 2.0 / CXL 3.1 时代,基于统一状态契约与多语言协同架构设计: - 分布式控制面 (Go):基于 Raft 协议提供分布式租约管理、自愈哈希环与多租户硬隔离配额(Quota)。 - 高性能匹配与存储引擎 (Rust)nxradixtree-core 提供高并发前缀树匹配,nexus-store 提供锁页内存与 CXL/POSIX SHM 零拷贝管理。 - 通用挂载与决策框架 (Python / C-FFI / C++):基于端到端有效收益评估方程($G = T_{compute} - T_{cache} > 0$)决策传输路径,支持 NVFP4 量化 Scale 对齐并提供 <1ms Fail-Open 降级保障。


⚡ 架构特性对比

维度 本地引擎缓存 进程外缓存 Sidecar NexusKV
系统架构 嵌入在推理 Worker 进程 Python 进程外侧车 Go 控制面 + Rust 数据引擎 + C++/Python SDK
复用决策 本地盲目命中 盲目块拉取 基于有效收益方程 ($G = T_{compute} - T_{cache} > 0$) 智能路由
Attention 支持 密集型 MHA / Paged KV 裸 Tensor Blobs 原生支持 DeepSeek-V4 (CSA/HCA)、MLA (512维 Latent Vector) 与 NVFP4 Scale
物理传输 引擎内部 IPC 进程间通信 CUDA IPC P2P 零拷贝、POSIX SHM、CXL 3.1、NVLink 6 与 UALink 2.0
多租户与过载 无隔离 / 被动驱逐 阻塞队列 TenantQuotaManager 主动反压与硬隔离
系统降级保障 阻塞挂起 传输挂起 <1ms 极速 Fail-Open 平滑退回 GPU 重算

🚀 核心架构与模块导航