返回项目

2026 - Now / Deployment & Optimization

Kimi K3 Inference Stack

将 Kimi K3 部署到 NVIDIA B300,围绕推理效率持续测量与优化,并通过 Token 中转服务提供稳定的外部调用入口。

用于大模型部署和性能分析的工程工作区
Status
Ongoing
Period
2026 - Now
Role
Deployment & Optimization
Stack
B300 / SGLang

这个项目的目标不是完成一次性的部署演示,而是把算力环境、推理引擎、性能测量、优化实验和外部访问入口连接成一套可以持续迭代的系统。

NVIDIA B300 → SGLang → 数据采集与分析 → 推理优化 → Token 中转服务

目前,Kimi K3 已经通过 SGLang 部署到 NVIDIA B300 平台,基础请求链路可以工作;首轮运行与请求数据正在持续收集和分析;面向外部调用的 Token 中转站也已经搭建完成。

系统链路

层级当前实现关注点
ComputeNVIDIA B300显存占用、计算利用率与多请求并发
RuntimeSGLang模型加载、调度策略与推理稳定性
MeasurementData & Analysis不同负载、并发和上下文下的实际表现
AccessToken Relay统一入口、鉴权、限流与可观测性

已完成

正在推进

用数据决定优化方向

我不会只使用一个“每秒 Token 数”概括系统表现。当前测量主要围绕四组指标展开:

指标含义用途
TTFT首 Token 时延判断排队、预填充与调度开销
TPOT单 Token 生成时延拆解持续解码阶段的生成效率
TPS吞吐与并发寻找吞吐和单请求体验之间的平衡点
GPU显存与稳定性跟踪利用率、失败请求和长时间运行状态

项目仍在进行中。具体性能数字会在测试条件、样本规模和对照方案稳定后再公开,避免把偶然结果当作优化结论。

下一阶段

下一步先形成一份可复现的基线报告,固定模型版本、引擎版本、请求分布、并发配置和统计口径,再进入有针对性的参数优化与压力测试。每次优化都需要保留对照组,并能解释它改善的是哪一个阶段、付出了什么代价。