20000元以上
* 职位描述:
职位描述:
1. 参与自研推理集群的建设,针对推理负载特征(Prefill/Decode阶段差异、请求长度不KV Cache动态占用)设计显存/带宽感知调度策略,消除GPU资源碎片;
2. 优化Kubernetes/Volcano调度框架,支持GPU拓扑(NVLink域、PCIe带宽)感知的推理Pod放置,降低跨卡通信对推理尾延迟(P99)的影响;
3. 设计推理任务的弹性排队与优先级抢占机制,保障高优业务在资源争抢下的服务质量。
4. 探索GPU显存与算力的动态切分技术(MIG/时间分片),将单卡按需分配给多个轻量推理负载,提升卡级利用率。
5. 构建推理集群的过载保护与全局流控体系,规避突发流量下的集群雪崩(如排队超时、OOM);
职位要求:
1.硕士以上学历优先,计算机、电子信息等相关专业。
2.深入理解进程调度、内存管理、I/O模型与网络协议栈,熟练使用perf/eBPF等工具进行系统级性能分析;
3.了解大语言模型推理的基本流程(Prefill + Decode),清楚KV Cache对显存占用的影响,理解批处理(Continuous Batching)对吞吐和延迟的权衡关系;熟悉至少一种推理框架(vLLM、TGI、TensorRT-LLM、SGLang)的基本架构。
加分项
1.有Kubernetes Scheduler Framework扩展或Volcano/Kueue等批量调度系统开发经验;
2.熟悉eBPF编程,有基于Cilium或自定义探针对网络/内核延迟的监控实践;
3.了解vLLM/TensorRT-LLM的源码或有过二次开发经验;
4.熟悉PD(Prefill-Decode)分离部署架构或KV Cache分布式缓存等前沿推理集群方案;
5.有大规模在线推理服务(日均百万级请求)的压测与调优经验;
6.在ACM/ICPC等编程竞赛获奖,或有系统顶会(OSDI/SOSP/ATC)论文发表。







清昴智能科技(北京)有限公司
招聘信息

津公网安备12010402000967号