VNG Career Site Header

Chia sẻ việc làm

  • Logo Footer
  • Logo Footer

Công việc liên quan

Tìm công việc

Senior Software Engineer (AI Inference), GreenNode

OfficialTechSoftware26-ENG-4041
locationThành phố Hồ Chí Min...
Xem mô tả bằng
Tiếng Anh

Mô tả công việc

Mô tả công việc
  • Chúng tôi đang tìm kiếm Senior Inference Engineer có nền tảng vững về software engineering, distributed systems và performance optimization để xây dựng và tối ưu inference engine cho các hệ thống LLM serving quy mô lớn.
  • Bạn sẽ làm việc ở cả research và production, đảm bảo các hệ thống LLM serving của chúng tôi nhanh, có khả năng mở rộng và hiệu quả. Công việc trải rộng xuyên suốt inference stack — từ kernel và runtime đến scheduling, memory management và distributed execution.

Trách nhiệm chính
  • Profile, benchmark và phân tích bottleneck cho các workload LLM inference xuyên các tầng: kernel, memory, networking, scheduler
  • Tối ưu các inference engine (vLLM, SGLang, TensorRT-LLM) về throughput, latency, memory efficiency, GPU utilization và chi phí
  • Triển khai và tinh chỉnh các kỹ thuật tối ưu inference: batching, KV-cache management, quantization, speculative decoding, parallelism strategies, disaggregated serving
  • Xây dựng instrumentation và profiling tooling để phát hiện bottleneck
  • Đảm bảo độ tin cậy cho inference pipeline: A/B launches, rollback, model versioning, fault tolerance
  • Phối hợp với đội Platform Engineering để cải thiện serving architecture dựa trên các phát hiện về hiệu năng
  • Ghi chép và chia sẻ kinh nghiệm, đóng góp vào best practices nội bộ và các dự án AI open-source khi có thể 

Yêu cầu

Yêu cầu

Bắt buộc:

  • Tối thiểu 5 năm kinh nghiệm ở vị trí Software Engineer, Performance Engineer hoặc tương đương.
  • Nền tảng vững về Software Engineering, Software Architecture và Distributed Systems.
  • Thành thạo ít nhất một trong các ngôn ngữ Python, Go hoặc C++.
  • Có kinh nghiệm phát triển hoặc tối ưu các hệ thống distributed, high-throughput backend hoặc large-scale serving systems.
  • Có kinh nghiệm benchmark, profiling và performance tuning trên môi trường production
  • Có khả năng phân tích bottleneck về CPU, Memory, Network hoặc Storage
  • .Có tư duy hệ thống tốt, khả năng phân tích Root Cause Analysis và giải quyết các bài toán hiệu năng phức tạp.
  • Có tinh thần ownership và khả năng làm việc độc lập.
Điểm cộng
  • Có kinh nghiệm với Linux internals, kernel tuning hoặc custom Linux kernel.
  • Có hiểu biết về GPU Architecture hoặc CUDA Programming
  • Có kinh nghiệm với AI/ML Serving Systems hoặc LLM Inference.- Đã làm việc với một trong các inference engine như vLLM, SGLang, TensorRT-LLM hoặc Triton Inference Server
  • Có hiểu biết về batching, KV Cache, quantization, speculative decoding, tensor/pipeline parallelism hoặc disaggregated serving.
  • Có kinh nghiệm với NVIDIA inference stack (TensorRT, Triton, CUTLASS, NCCL, cuBLAS, cuDNN)
  • Có kinh nghiệm với observability stack như Prometheus, Grafana hoặc OpenTelemetry
  • Có đóng góp open-source hoặc công trình nghiên cứu liên quan đến AI Infrastructure, ML Systems hoặc Performance Optimization