【關於這個角色】 Raccoon AI 打造生成式 AI 客服 SaaS 平台,服務橫跨電商、旅遊、金融科技等產業的企業客戶,系統由多個微服務組成(AI 推論後端、檢索服務、工具服務,以及多租戶管理平台),全部運行於 AWS。目前的部署與基礎設施由工程團隊自行維護,已能運作但仍以腳本與手動設定為主。 我們正在尋找一位能接手並系統化整個雲端平台的資深 Platform Engineer:把基礎設施 IaC 化、強化可靠性與可觀測性、收斂多環境複雜度,並打造讓工程師能安全、快速、自助出版本的平台。這是一個高自主、橫跨整個 stack、擁有完整技術決策權的關鍵角色。 【工作內容】 CI/CD 擁有權:維護並強化 GitHub Actions(多環境分支部署、tag 控管的 production、canary、Docker Buildx 快取)。 基礎設施 IaC 化:把手動/腳本建立的 AWS 資源(ECS、task definition、IAM、網路)收斂為版本控管、可重現、可審核的 Terraform。 容器與部署:管理 ECS Fargate(ARM64/Graviton)、Lambda、以 Kamal 部署的 Rails 服務;落實零停機/藍綠/canary 部署與一鍵回滾。 可觀測性與可靠性:整合 log/metrics/tracing/告警,建立 SLO,改善事故應變與 on-call 流程。 資料層維運:PostgreSQL(含 PGVector)維運、備份、連線池調校與 migration 支援。 安全與密鑰管理:IAM 最小權限、SSM/Secrets Manager、供應鏈與映像安全。 成本最佳化:right-sizing、ARM/Graviton 遷移、Lambda 冷啟動、快取策略,控制雲端與推論成本。 收斂環境複雜度:整頓 staging/beta/production 與多個開發者環境,同時支援 Ruby/Rails 與 Python/FastAPI。 【你需要具備】 5 年以上 DevOps/SRE/Platform Engineering 經驗,且有正式環境 AWS 維運實績。 紮實的 AWS 技能:ECS/Fargate、Lambda、ECR、IAM、VPC、CloudWatch、SSM、S3。 具備 Docker 與容器化部署的 production 經驗。 設計並擁有過 CI/CD 流水線(GitHub Actions 尤佳)。 具備 Terraform(IaC)實作經驗。 具有 Linux + 紮實的 Bash/Python 自動化能力。 零停機部署、監控告警、事故應變/on-call 經驗。 密鑰管理與雲端安全實務經驗。 【你可能還有】 ARM/Graviton 部署與成本最佳化實績。 Kamal 或 Rails 應用部署經驗。 能同時支援 Ruby 與 Python 服務。 PostgreSQL/PGVector 或向量資料庫維運。 LLM/AI 服務基礎設施經驗(推論成本、延遲、Langfuse 類 tracing)。 可觀測性堆疊、Cloudflare、Slack ChatOps。
Full-Stack Engineer - AI Customer Service Platform
Raccoon AI (JTCG)
Senior Software Engineer, Cloud Platform
Nvidia
Senior Platform & System Engineer
Berry AI
Client Full-Stack Engineer — IM Chat Platform, Android Focus
Binance
Senior Software Engineer, Platform Portability
Roku
Entry-Level Engineer, Environment, Taipei 副工程師 (環境部 - 台北)
AECOM