20000元以上
* 职位描述:
岗位职责
1.测试策略与方案设计
-负责大模型推理集群的全链路质量保障,制定功能、性能、稳定性、安全等维度的测试策略与计划。
-深入理解推理引擎(如vLLM、TensorRT- LLM、TGI等)、调度系统与GPU集群架构,设计高覆盖、可复用的测试方案。
2.功能与精度验证
-验证模型推理结果的正确性与数值精度(如与训练框架对齐、不同量化精度对比),确保多模型、多版本、多硬件环境下的输出一致性。
-构造覆盖正常、边界、异常、对抗性的测试用例,评估提示词鲁棒性、多轮对话记忆、长上下文等特性。
3.性能与压力测试
-设计并执行延迟、吞吐、首token时间、并发用户数等关键指标的压测方案,建立性能基线。
-分析GPU利用率、显存占用、网络带宽、调度延迟等瓶颈,配合研发团队进行性能调优与回归验证。
4.稳定性与混沌工程
-开展长时间稳定性测试,验证内存泄漏、显存碎片、资源回收、故障自愈等能力。
-引入故障注入(节点宕机、网络分区、GPU错误、Etcd异常等),检验集群高可用与容错机制。
5.自动化测试与工具链建设
-搭建持续集成/持续测试流水线,开发自动化测试框架与工具沉淀测试数据集(模型集对话集、压力脚本)。
-实现指标监控、日志采集、异常检测的自动化链路,推动测试左移与质量门禁建设。
6.缺陷管理与质量分析
-全流程跟踪缺陷,准确定位至组件层(推理引擎、调度器、网关、模型服务、节点环境),推动高效闭环。
-定期输出质量报告,量化风险,提出改进建议,参与发布评审与上线决策。
任职要求必备条件
学历与经验:本科及以上学历,计算机科学、软件工程等相关专业;有质量保障或系统测试经验优先,有从事大型分布式系统或AI基础设施测试经验优先。
编程能力:熟练掌握Python/Shell,具备良好的编码习惯,能够开发复杂测试工具与脚本。
大模型推理知识:理解Transformer架构及推理流程(Prefill/Decode、KV Cache、
Continuous Batching、PagedAttention等),熟悉至少一种主流推理框架(vLLM、TensorRT-LLM、SGLang、TGI、Triton Inference Server) .
性能工程:有丰富的性能测试经验,熟练使用 Locust、JMeter、wrk或自研压测平台;能独立分析 GPU Profile(Nsight Systems/ncu)、 Trace数据并定位瓶颈。
集群与云原生:熟悉Kubernetes、Docker,掌握GPU Operator、Volcano/Koordinator等调度器原理,理解InfiniBand/RoCE网络、并行文件系统等基础。
思维与沟通:具备优秀的逻辑分析、问题拆解能力,强质量风险意识,良好的团队协作与推动能力。
加分项
-有大模型训练/微调经验,了解Megatron, DeepSpeed PEFT技术。
-熟悉MLPerf、LLMPerf或内部基准测试体系,有服务器性能调优经验。
-掌握Go/Rust/C++中的一种,能阅读推理框架源码并编写扩展。
-有构建模型评测平台、自动化模型质量监控体系的经验。
-熟悉安全测试,对模型提示注入、隐私泄露等风险有验证经验。
我们能提供
-参与构建千卡至万卡级推理集群,直面超大并发场景的挑战。
-紧跟前沿的推理加速技术(Speculative
Decoding、FP8量化、MoE并行等),与资深工程及算法团队紧密协作







清昴智能科技(北京)有限公司
招聘信息

津公网安备12010402000967号