VLLM · TELEMETRY推理监控中心
实时更新

REAL-TIME OVERVIEW / 实时总览

推理服务总览

从吞吐、并发到缓存与延迟,持续观察模型运行状态

数据状态 · 每 5 秒刷新连接中…

THROUGHPUT / TOKEN 吞吐

实时吞吐趋势

-Generation · tokens/s
蓝线:生成吞吐灰线:输入吞吐
并发 / 排队请求
-
Running / Waiting
Prompt 吞吐
-
tokens/s
KV Cache 使用
-
%
Prefix Cache 命中
-
%
首 Token 延迟
-
TTFT · ms
投机解码接受率
-
%

运行概览

当前节点 · 指标实时更新

性能趋势

时间窗口可在页面顶部切换

缓存效率

KV Cache 使用率 / Prefix Cache 命中率 · %

请求并发

Running / Waiting · 请求数

请求延迟

TTFT / E2E / Queue · s,ITL · ms

延迟分位数

TTFT P50 / P95 · s,ITL P50 / P95 · ms

阶段耗时

Prefill / Decode · P50 与 P95

请求完成情况

按结束原因累计完成数 / QPS

投机解码

接受速率、质量与逐位表现

接受与草拟吞吐

Accepted / Drafted · tokens/s

解码质量

平均接受长度 / 接受率

逐位接受率

Draft 位置对应的接受率 · %

节点环境

GPU 与请求来源

GPU 利用率 / 温度

当前客户端 IP · vLLM :?

待采集…

最近请求来源

-

原始日志尾部

费用测算

按累计 token 与配置单价估算

单价 / 百万 tokens:

待采集…