> Markdown version of [/jobs/ext/3038037-ml-engineer-css](https://www.wearedevelopers.com/jobs/ext/3038037-ml-engineer-css). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # ML Engineer (CSS) - **Company:** TOSS, INC. - **Location:** United States (Remote available) - **Contract:** Permanent contract - **Skills:** Java (Programming Language), Application Programming Interfaces (APIs), Artificial Intelligence, Airflow, Amazon Web Services, Amazon S3, Data Analysis, Software Applications, Microsoft Azure, Big Data, Cascading Style Sheets (CSS), Cloud Computing, Databases, Data Cleansing, Data Mining, Elasticsearch, Monitoring of Systems, Python (Programming Language), Machine Learning, MongoDB, MySQL, Routing, Nginx, NumPy, Octopus Deploy, Open Source Technology, Redis, Prometheus, SQL Databases, Network Routers, Load Balancing, Apache Cassandra, Pytorch, Large Language Models, Grafana, Deep Learning, Caching, Fastapi, Kotlin, Pandas, Scikit Learn, Kubernetes, Deployment Automation, Apache Kafka, Machine Learning Operations, Front End Software Development, TensorRT, Api Gateway, Kibana, Terraform, Golang - **Published:** September 23, 2026 - **Apply:** https://arc.dev/remote-jobs/j/redirect/pm2uz33lvu ## About the Role * 전사 LLM API 요청을 처리하는 Gateway 시스템을 FastAPI 기반으로 개발·운영해요. * FastAPI로 구현된 Gateway 애플리케이션에서 인증, 라우팅, 트래픽 제어, 장애 격리(Circuit Breaker, Fallback), 대규모 TPS 처리 및 부하 분산 전략을 애플리케이션,인프라 관점에서 설계·구현해요. ️ ML 서비스 운영과 서빙을 책임져요. * Kubernetes 환경에서 머신러닝 모델 서빙 시스템을 직접 운영해요. * 대규모 트래픽 상황에서도 안정적으로 동작할 수 있도록 LLM 서빙 아키텍처를 설계·개선해요. * 서비스 중인 모델의 latency, 에러율, 리소스 사용량 등을 모니터링하고, 운영 이슈를 직접 분석·해결해요. * 장애 발생 시 근본 원인을 규명하고, 운영 정책이나 아키텍처를 포함한 구조적인 개선까지 수행해요. ️ 전사 공통 ML 플랫폼을 개발하고 운영해요. * Kubeflow 기반으로 사내 ML/LLM 모델의 학습 및 서빙을 효율적으로 운영할 수 있는 공통 플랫폼을 개발·운영해요. * 플랫폼에서 실행되는 워크로드의 성능과 리소스를 지속적으로 모니터링하고 최적화해요. ️ LLM 기반 서비스를 위한 인프라 환경을 구축해요. * vLLM, SGLang, Triton 등 다양한 서빙 프레임워크를 활용해 LLM 서비스를 운영해요. * H100/B300 등 고성능 GPU 클러스터에서 학습·서빙 워크로드가 안정적으로 동작하도록 환경을 관리해요. * 금융 도메인 특화 LLM을 위한 대규모 데이터 학습 환경을 구축·운영해요., * ML 모델 학습과 추론에 사용되는 배치성 Feature Mart를 설계·구축하고, 데이터 품질과 정합성을 관리해요. * 대규모 배치 추론(Batch Inference) 파이프라인을 개발하고, 처리 성능과 비용을 최적화해요. * 배치 스케줄러 기반의 워크플로우를 설계하고, 실패 복구·재처리·모니터링 체계를 만들어 운영 안정성을 높여요. * Data Scientist와 협업하여 모델이 필요로 하는 데이터를 정의하고, 실험부터 프로덕션까지 이어지는 데이터 흐름을 책임져요., * Airflow 등 배치 스케줄러의 동작 원리를 이해하고, 스케줄링·재처리·의존성 관리를 설계할 수 있어야 해요. * ML 모델링의 전체 과정(Feature 생성, 학습, 평가, 추론)을 이해하고, 모델이 요구하는 데이터의 특성을 파악하여 파이프라인에 반영할 수 있어야 해요. * 사용하는 기술의 동작 원리를 바닥까지 이해하고, 선택한 근거를 설명할 수 있어요. * 데이터 처리량·처리 시간·비용의 트레이드오프를 고려해 아키텍처를 설계하고, 각 컴포넌트의 역할을 설명할 수 있어요. * 정해진 정답(Best Practice)을 따르기보다, 문제를 정의하고 왜 그 기술을 선택했는지 스스로 설명할 수 있는 분을 찾아요. ## Description 합류하게 될 팀에 대해 알려드려요 - 토스의 ML Engineer (CSS)는 토스의 Credit Modeling팀에 속해 있고, 다양한 백그라운드를 가지고 있는 ML Engineer들이 한 팀으로 구성되어 있어요. - Credit Modeling팀은 대출, 카드, 계좌 등 여러개의 금융 서비스들이 모여있는 Financial Marketplace 도메인에 소속되어 대출비교플랫폼에 입점한 금융사들을 위한 Risk Index 모형을 개발하고, 도메인내 다양한 금융 서비스들의 비즈니스 문제를 머신러닝을 통해 해결하는 업무를 담당하고 있어요. - 토스 데이터 조직에 대해 더 알아보고 싶다면? [* 토스 Data Division 위키](https://recruit-data-division.oopy.io/) 합류하면 함께 할 업무예요 - 대출 니즈 모형, 카드 발급 예측 모형, 신용평가 모형 등 신용과 대출 도메인 영역에서 유저에게 맞춤형 서비스를 제공하기 위한 다양한 ML 모델을 개발해요. - Data Mining / Machine Learning / Deep Learning 기술들을 활용하여 새로운 가치를 발굴해 비즈니스 고도화에 기여해요. - 신규 서비스 및 사업 영역의 발굴을 위해 다양한 데이터에 대한 분석 및 탐색을 진행해요. - 빠르게 변화하는 비즈니스 성장 전략과 방향성에 맞도록 모델을 고도화하고 최적화를 수행해요. 이런 분과 함께하고 싶어요 - 개인 혹은 개인사업자의 대안/신용평가모델(CSS)을 개발해 내재화하신 경험이 필요해요. - 신용평가모형 개발 환경, 제도, 규제에 대한 이해를 바탕으로 독립적이고 주도적인 모델링 경험이 필요해요. - 복잡한 원천 데이터로부터 데이터 정제 작업을 직접 해보신 경험이 필요해요. - Python, SQL 등의 언어를 능숙하게 다룰 수 있는 분이 필요해요. - Machine Learning / Deep Learning 등 최신 알고리즘을 활용한 실제 비즈니스 문제 해결 경험이 필요해요. - 다양한 최신 기술에 관심이 있고, 새로운 것을 학습하고 성장하기를 원하시는 분이 필요해요. 이력서는 이렇게 작성하시는 걸 추천해요 - 현재 채용 공고와 관련 있었던 업무/프로젝트, 그 결과에 대해 구체적으로 작성해주세요. - 프로젝트에서 어떤 모델을 사용했는지 구체적으로 작성해주세요. - Machine Learning 모형을 직접 개발하고 서비스에 적용해 본 경험이 있다면 구체적으로 작성해주세요. - 기술적으로 외부 공개가 민감한 사항일 경우, 해당 부분은 제외해주세요. 토스로의 합류 여정 - 서류 접수 > 프리 인터뷰 > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우 협의 > 최종 합격 - 프리 인터뷰에서는 지원서 기반의 주요 경험과 직무 적합도를 중심으로 면접이 진행될 예정이에요. - 직무 인터뷰에서는 심층 기술 면접과 ML 모델 설계를 주제로 면접이 진행될 예정이에요. 함께할 동료를 위한 한마디 > "금융 혁신의 주인공은 당신입니다" - Credit Modeling Team은 토스의 금융 도메인에서의 핵심 역할을 수행하고 있어요. - 단순히 주어진 문제를 해결하는 것이 아니라 모델링을 통해 비즈니스의 확장과 고도화에 기여할 수 있어요. - 금융 관련 데이터 뿐만 아니라 비금융(대안정보) 정보도 활용 가능하고 다양 머신러닝 기법들을 활용하여 비즈니스 임팩트를 극대화 할 수 있어요., * 우리는 모델을 만드는 것에서 끝나지 않고, 모델이 학습·검증·배포·서빙·모니터링되는 전 과정을 플랫폼화해요. ML Engineer, ML Modeler, Data Scientist, Data Engineer, Product Team과 함께 토스뱅크의 다양한 금융 서비스에 머신러닝과 LLM을 더 빠르고 안전하게 적용할 수 있도록 돕고 있어요. * MLflow, Airflow, JupyterHub, Kubeflow, Feature Store, Triton Inference Server, vLLM/SGLang/TensorRT-LLM 기반 서빙 환경, LLM Gateway, Vector Database 등 ML/LLM 서비스를 위한 핵심 플랫폼을 다루고 있어요. * 금융 도메인 특성상 안정성, 확장성, 보안, 개인정보 보호, 감사 가능성이 매우 중요해요. 단순히 기술을 도입하는 것을 넘어, 실제 운영 환경에서 신뢰할 수 있는 ML/LLM 플랫폼을 만드는 경험을 할 수 있어요. 합류하면 함께할 업무예요 * ML 챕터 내 공통 기술을 개발하고, 토스뱅크의 ML/LLM 플랫폼을 함께 고도화해요. * MLflow, Airflow, JupyterHub, Kubeflow 등 사내 머신러닝 플랫폼을 구축하고 운영해요. * ScyllaDB 클러스터 기반의 Feature Store를 운영하고, ML 서비스가 안정적으로 데이터를 활용할 수 있는 환경을 만들어요. * Triton Inference Server, vLLM, SGLang 등 다양한 서빙 기술을 활용해 ML/LLM 모델 서빙 환경을 개발하고 최적화해요. * LLM Gateway, Workflow, Vector Database 등 LLMOps 플랫폼을 구축하고 운영해요. * 기존 On-Premise 중심의 머신러닝/LLM 인프라를 AWS, GCP 등 클라우드 환경으로 확장하고 고도화해요. * EKS, GKE 등 Kubernetes 기반 클라우드 환경에서 ML/LLM 워크로드를 안정적으로 운영할 수 있도록 플랫폼을 설계하고 개선해요. * On-Premise와 Cloud가 함께 동작하는 Hybrid ML/LLM 인프라를 설계하고 운영해요. * GPU 기반 학습/서빙 워크로드의 확장성, 가용성, 성능, 비용 효율을 높이기 위해 클러스터 운영, 오토스케일링, 모니터링 체계를 개선해요. * Data Engineer, ML Modeler, Data Scientist, Product Engineer 등 다양한 동료들과 협업하며 ML/LLM 기술이 실제 금융 서비스에 안정적으로 적용될 수 있도록 만들어요. 이런 분과 함께하고 싶어요 * Kubernetes 위에서 서비스를 개발, 배포하고 운영해본 경험이 있으신 분이 필요해요. * AWS, GCP 등 클라우드 환경에서 서비스를 설계, 구축, 운영해본 경험이 있으시면 좋아요. * EKS, GKE 등 Kubernetes 기반 클라우드 환경에서 서비스를 운영하거나 트러블슈팅해본 경험이 있으시면 좋아요. * On-Premise와 Cloud를 함께 사용하는 Hybrid 환경에 대한 이해 또는 경험이 있으시면 좋아요. * MLflow, Airflow, JupyterHub, Kubeflow 등 ML 플랫폼을 구축하거나 운영해본 경험이 있으시면 좋아요. * 대규모 트래픽 또는 ML/LLM 워크로드를 안정적으로 운영하기 위한 확장성, 가용성 설계 경험이 있으시면 좋아요. * GPU 기반 워크로드를 운영하거나 성능/비용 최적화를 해본 경험이 있으시면 좋아요. * vLLM, SGLang, Triton Inference Server, TensorRT-LLM 등 모델 서빙 프레임워크를 활용해본 경험이 있으시면 좋아요. * LLM Gateway, Workflow, Vector Database 등 LLMOps 플랫폼을 구축하고 운영해본 경험이 있으시면 좋아요. * Apache Cassandra, ScyllaDB 등 분산 데이터베이스를 운영한 경험이 있으시면 좋아요. * Terraform, Helm, ArgoCD 등 IaC/배포 자동화 도구를 활용해 인프라 운영을 자동화해본 경험이 있으시면 좋아요. * Prometheus, Grafana, OpenTelemetry 등으로 서비스와 인프라의 상태를 관측하고 개선해본 경험이 있으시면 좋아요. * 최신 ML/LLM 기술에 관심이 많고, 다양한 상황에서 최적의 솔루션을 찾을 수 있는 문제해결능력과 원활한 커뮤니케이션 역량을 갖춘 분을 찾고 있어요., * 토스증권 ML Engineer(LLM)는 AI Tribe에 속해 있어요. 다양한 Silo와 Platform에서 Data/Server/Frontend Engineer, Designer, PO와 협업하며 제품 단위의 문제를 함께 풀어가요. * AI Tribe의 목표는 복잡한 금융·증권 정보를 더 이해하기 쉽게 만들고, 개인에게 필요한 정보만 정확히 전달하는 데이터·ML 기반 서비스를 만드는 거예요. * 이를 위해 NLP/LLM 학습과 운영, AI 기반 서비스 개발, 개인화 추천 등 다양한 ML 기술을 실험하고 실제 제품에 녹이고 있어요., * Python, Go, Java, Kotlin 중 하나 이상의 언어에 능숙하며, 프로덕션 환경의 API 서버를 설계·개발해 본 경험이 필요해요. * API Gateway(Nginx, Kong 등) 또는 LLM Router(LiteLLM, Envoy AI Gateway 등)를 개발하거나 운영하며, 대용량 트래픽 처리 및 장애 대응 경험이 필요해요. * Kafka, Elasticsearch, Kibana 등과 연동해 서빙 로그 및 이벤트 파이프라인을 운영해 본 경험이 필요해요. * Prometheus, Grafana 등을 활용해 모델 서빙 모니터링 지표를 정의하고 대시보드를 구성·운영해 본 경험이 필요해요. * KServe, BentoML, vLLM, SGLang 등을 활용해 ML/LLM 모델 서빙을 운영해 본 경험이 필요해요. * Kubernetes 환경에서 MLOps 컴포넌트(Kubeflow, KServe, Airflow, Argo CD, MLflow 등)를 직접 운영하며 장애를 디버깅하고 해결해 본 경험이 필요해요., * Azure AI Foundry, Azure AI Studio, AWS Bedrock, AWS SageMaker 등 Public Cloud 환경에서 MLOps 또는 LLMOps 컴포넌트를 운영해 본 경험이 있다면 더 좋아요. * vLLM, SGLang 등을 활용해 LLM 서빙 병목을 분석하고 성능을 최적화해 본 경험(또는 관련 오픈소스 기여 경험)이 있다면 더 좋아요. * disaggregated serving, prefix-aware routing, context caching 등 LLM 기반 시스템을 설계하고 최적화해 본 경험이 있다면 더 좋아요. * Kubernetes Operator 또는 Scheduler 등 Kubernetes 확장 컴포넌트를 설계·개발해 본 경험이 있다면 더 좋아요. * 데이터 전처리부터 학습, 배포, 품질 관리, 재학습까지 머신러닝 파이프라인을 실제 서비스 환경에서 운영해 본 경험이 있다면 더 좋아요., * Workflow & Platform: Kubernetes, Kubeflow, Argo CD, Argo Workflows, Airflow * Model Serving & Optimization: vLLM, SGLang, KServe, BentoML * Monitoring & Logging: Prometheus, Grafana, Kafka, Elasticsearch, Kibana * Cloud & Infra: GPU Cluster (A40/A100/H100/H200/B300), Kubernetes 기반 ML 인프라, * Development & ML: Python, PyTorch, pandas, NumPy, scikit-learn, Transformers * API & Serving: FastAPI, KServe, Kubernetes * DB & Messaging & Cache: Elasticsearch, ClickHouse, MySQL, MongoDB, Impala, Milvus**,** S3, Kafka, Redis * Monitoring & Observability: MLflow**,** Prometheus, Grafana ## Related Videos - [Reducing LLM Calls with Vector Search Patterns - Raphael De Lio (Redis)](https://www.wearedevelopers.com/videos/1714-reducing-llm-calls-with-vector-search-patterns-raphael-de-lio-redis) - [Vectorize all the things! Using linear algebra and NumPy to make your Python code lightning fast.](https://www.wearedevelopers.com/videos/562-vectorize-all-the-things-using-linear-algebra-and-numpy-to-make-your-python-code-lightning-fast) - [Post-Quantum Cryptography: Preparing for Q-Day](https://www.wearedevelopers.com/videos/100179-post-quantum-cryptography-preparing-for-q-day) - [DevOps for AI: running LLMs in production with Kubernetes and KubeFlow](https://www.wearedevelopers.com/videos/1222-devops-for-ai-running-llms-in-production-with-kubernetes-and-kubeflow) - [Streaming AI Responses in Real-Time with SSE in Next.js & NestJS](https://www.wearedevelopers.com/videos/1630-streaming-ai-responses-in-real-time-with-sse-in-next-js-nestjs) - [Unveiling the Magic: Scaling Large Language Models to Serve Millions](https://www.wearedevelopers.com/videos/1619-unveiling-the-magic-scaling-large-language-models-to-serve-millions) ## Related Articles - [What Are Large Language Models?](https://www.wearedevelopers.com/magazine/304-what-are-large-language-models) - [MLops – Deploying, Maintaining And Evolving Machine Learning Models in Production](https://www.wearedevelopers.com/magazine/115-mlops-deploying-maintaining-and-evolving-machine-learning-models-in-production) - [MLOps – What’s the deal behind it?](https://www.wearedevelopers.com/magazine/125-mlops-what-s-the-deal-behind-it) - [MLOps And AI Driven Development](https://www.wearedevelopers.com/magazine/82-mlops-and-ai-driven-development) - [Who Owns Your Content in the Age of LLMs?](https://www.wearedevelopers.com/magazine/610-who-owns-your-content-in-the-age-of-llms) - [A 5-Step Open-Source Setup for Agentic Engineering](https://www.wearedevelopers.com/magazine/738-a-5-step-open-source-setup-for-agentic-engineering)