AI Infra 工程师 · 专注大模型推理引擎与推理服务评测
- 🏙️ 北京,AI Infra 工程师,方向为大模型推理引擎与推理服务评测
- � 自研轻量 vLLM 风格推理引擎,研究 GPU 在线调度(Prefill/Decode 策略、Paged KV Cache、FlashAttention、SSE 流式)
- 📊 自研推理服务评测平台,测量 TTFT / TPOT / 吞吐 / Goodput,产出可复核的实验数据
- 🧩 喜欢把复杂的推理问题拆成可复现、可度量的工程实验
轻量 vLLM 风格推理引擎,二次开发在线请求调度:Prefill First / Decode First / Bounded Decode First 三策略、逐 Token SSE 流式、请求取消与背压;在 RTX 4060 / Qwen3-0.6B 上实测调度策略对 TTFT / TPOT 的影响。
面向 OpenAI 兼容推理服务的评测平台:流式压测、实验有效性校验(SLO / Goodput / GPU 隔离),采集 vLLM 与 NVML 遥测,产出可复核的原始数据、报告与图表。