Site Reliability Engineer 계열사 소개 계열사 소개 합류 여정 팀 문화 아티클 자주 묻는 질문 전체 공고 Site Reliability Engineer Site Reliability Engineer 토스플레이스 소속 정규직 초기 멤버 합류하게 될 팀에 대해 알려드려요 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요. SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요. Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요. Observability 환경을 지속적으로 고도화하면서, 토스플레이스의 신뢰성을 어떻게 정의하고 측정할지 기준을 정립해요. 장애를 더 빠르게 발견하고 대응하며, 그 경험을 시스템 개선으로 연결하는 방식도 함께 만들어가요. 토스플레이스의 SRE 역할과 업무 방식을 처음부터 정의하고, 신뢰성 기준과 실행 방법을 조직에 정착시켜 갈 첫 멤버를 기다리고 있어요. 합류하면 함께할 업무예요 토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요. 결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요. Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요. 주요 장애의 대응을 조율하고 Post-mortem을 주도해요. 장애에서 얻은 학습을 코드, 자동화, 아키텍처와 프로세스 개선으로 연결해 반복 장애를 줄여요. 서비스별 Alert와 Runbook의 소유권, 장애 등급, 1차 대응과 Escalation 기준을 정립하고 토스플레이스에 적합한 Incident Management 체계를 발전시켜요. SPOF, 성능 병목, 용량 한계와 잠재적 실패 지점을 찾아 개선해요. 성능 테스트와 용량 계획, 안전하게 통제된 Fault Injection을 통해 장애 전파 경로와 시스템의 복구 방식을 검증해요. 문제의 성격에 따라 제품팀과 함께 제품 코드를 개선하고, 공통 플랫폼에 필요한 기능과 진단, 복구 도구는 직접 개발해요. 반복적인 진단과 복구 작업은 자동화로 줄여 나가요. 이런 분과 함께하고 싶어요 하나 이상의 프로그래밍 언어를 이용해 프로덕션 코드와 운영 도구를 개발하고 개선할 수 있는 분을 찾아요. 운영 중인 서비스의 장애 대응과 원인 분석을 주도하고, 코드, 자동화, 아키텍처 개선을 통해 재발을 방지해 본 분을 찾아요. 특정 기술 계층에 한정되지 않고, 가설과 데이터를 바탕으로 애플리케이션, OS, Network, Infrastructure 등 여러 계층에서 문제의 원인을 추적할 수 있는 분을 찾아요. 분산 시스템의 가용성, 지연시간, 성능과 용량을 나타내는 지표를 정의하고, 이를 바탕으로 신뢰성 문제를 구조적으로 개선해 본 분을 찾아요. AWS 등 Public Cloud 환경에서 Kubernetes 기반의 프로덕션 서비스를 운영하고 트러블슈팅해 본 분을 찾아요. 신뢰성 기준이나 장애 대응 체계를 수립, 개선하고, 여러 제품팀과 우선순위를 조율하며 이를 조직의 업무 방식으로 정착시켜 본 분과 함께하고 싶어요. 이런 분이면 더 좋아요 SLI, SLO 또는 Error Budget을 정의하고 실제 서비스 운영과 의사결정에 활용해 본 경험이 있으면 좋아요. Incident Management, Post-mortem 또는 Reliability Review 체계를 만들거나 개선해 본 경험이 있으면 좋아요. 클라이언트부터 서버와 외부 시스템까지 이어지는 엔드투엔드 흐름에서 장애를 분석하고 해결해 본 경험이 있으면 좋아요. 결제처럼 장애나 데이터 정합성 문제가 고객과 비즈니스에 직접적인 영향을 주는 Mission-Critical 서비스를 운영해 본 경험이 있으면 좋아요. Istio 등 Service Mesh 환경에서 서비스 간 트래픽 흐름과 장애 전파 경로를 분석하고 개선해 본 경험이 있으면 좋아요. Fault Injection 실험이나 장애 복구 훈련을 설계하고, 시스템의 복원력을 검증, 개선해 본 경험이 있으면 좋아요. Java/Kotlin과 Spring Ecosystem을 이용해 제품 또는 플랫폼 코드를 개발해 본 경험이 있으면 좋아요. 이력서는 이렇게 작성하시는 걸 추천해요 장애 대응, 신뢰성, 성능 개선 또는 운영 자동화와 관련된 대표 경험 2~3가지를 중심으로 작성해 주세요. 어떤 사용자 또는 비즈니스 문제가 있었고, 당시 시스템과 조직에 어떤 제약이 있었는지 알려주세요. 원인을 찾기 위해 어떤 가설을 세웠고, 어떤 데이터와 도구를 활용했는지 작성해 주세요. 본인이 직접 판단하고 설계, 구현, 조율한 범위와, 해결 과정에서 고려한 트레이드오프를 구체적으로 알려주세요. 개선 전후의 오류율, 지연시간, 탐지, 복구 시간, 장애 빈도 또는 반복 작업량의 변화를 가능한 범위에서 작성해 주세요. 토스플레이스에서 사용하는 기술 Java, Kotlin, Spring Boot, Spring Cloud, JPA/Hibernate, Gradle MySQL, MongoDB, Elasticsearch, Redis, Kafka AWS, Kubernetes, Istio, Podman, Containerd Git, GoCD, ArgoCD, Vault Prometheus, Thanos, Grafana Chaos Mesh 특정 기술의 사용 경험보다 문제를 정확히 이해하고 적절한 해결 방법을 선택하는 역량을 중요하게 생각해요. 서비스의 신뢰성을 높이는 데 필요한 기술과 도구는 함께 검토해 도입하거나 직접 개발할 수 있어요. 토스플레이스로의 합류 여정 서류전형 > 테크핏 인터뷰(30분) > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우협의 > 최종합격 및 입사 함께할 동료를 위한 한마디 "복잡한 오프라인의 문제를 해결하며, 전체 시스템을 직접 설계하고 주도하는 압도적인 성장을 경험하고 있어요." 오프라인 결제 환경에서는 온라인보다 훨씬 다양한 변수와 예외를 마주하게 돼요. 서버 플랫폼 팀은 이런 환경에서도 서비스가 안정적으로 운영될 수 있도록 공통 모듈과 플랫폼 서비스를 만들고, 장애를 더 빠르게 감지하고 회복할 수 있는 기반을 계속 개선하고 있어요. 합류하시면 특정 서비스 하나가 아니라 전체 시스템을 더 나은 방향으로 설계하고 운영하는 경험을 할 수 있어요. 기술적 오너십을 가지고 깊이 기여하고 싶은 분, 좋은 동료들과 함께 답을 만들어가며 성장하고 싶은 분께 정말 좋은 팀이에요. 지원하기 전체 채용공고 목록으로 돌아가기 토스플레이스 소속 정규직 초기 멤버 합류하게 될 팀에 대해 알려드려요 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요. SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요. Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요. Observability 환경을 지속적으로 고도화하면서, 토스플레이스의 신뢰성을 어떻게 정의하고 측정할지 기준을 정립해요. 장애를 더 빠르게 발견하고 대응하며, 그 경험을 시스템 개선으로 연결하는 방식도 함께 만들어가요. 토스플레이스의 SRE 역할과 업무 방식을 처음부터 정의하고, 신뢰성 기준과 실행 방법을 조직에 정착시켜 갈 첫 멤버를 기다리고 있어요. 합류하면 함께할 업무예요 토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요. 결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요. Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요. 주요 장애의 대응을 조율하고 Post-mortem을 주도해요. 장애에서 얻은 학습을 코드, 자동화, 아키텍처와 프로세스 개선으로 연결해 반복 장애를 줄여요. 서비스별 Alert와 Runbook의 소유권, 장애 등급, 1차 대응과 Escalation 기준을 정립하고 토스플레이스에 적합한 Incident Management 체계를 발전시켜요. SPOF, 성능 병목, 용량 한계와 잠재적 실패 지점을 찾아 개선해요. 성능 테스트와 용량 계획, 안전하게 통제된 Fault Injection을 통해 장애 전파 경로와 시스템의 복구 방식을 검증해요. 문제의 성격에 따라 제품팀과 함께 제품 코드를 개선하고, 공통 플랫폼에 필요한 기능과 진단, 복구 도구는 직접 개발해요. 반복적인 진단과 복구 작업은 자동화로 줄여 나가요. 이런 분과 함께하고 싶어요 하나 이상의 프로그래밍 언어를 이용해 프로덕션 코드와 운영 도구를 개발하고 개선할 수 있는 분을 찾아요. 운영 중인 서비스의 장애 대응과 원인 분석을 주도하고, 코드, 자동화, 아키텍처 개선을 통해 재발을 방지해 본 분을 찾아요. 특정 기술 계층에 한정되지 않고, 가설과 데이터를 바탕으로 애플리케이션, OS, Network, Infrastructure 등 여러 계층에서 문제의 원인을 추적할 수 있는 분을 찾아요. 분산 시스템의 가용성, 지연시간, 성능과 용량을 나타내는 지표를 정의하고, 이를 바탕으로 신뢰성 문제를 구조적으로 개선해 본 분을 찾아요. AWS 등 Public Cloud 환경에서 Kubernetes 기반의 프로덕션 서비스를 운영하고 트러블슈팅해 본 분을 찾아요. 신뢰성 기준이나 장애 대응 체계를 수립, 개선하고, 여러 제품팀과 우선순위를 조율하며 이를 조직의 업무 방식으로 정착시켜 본 분과 함께하고 싶어요. 이런 분이면 더 좋아요 SLI, SLO 또는 Error Budget을 정의하고 실제 서비스 운영과 의사결정에 활용해 본 경험이 있으면 좋아요. Incident Management, Post-mortem 또는 Reliability Review 체계를 만들거나 개선해 본 경험이 있으면 좋아요. 클라이언트부터 서버와 외부 시스템까지 이어지는 엔드투엔드 흐름에서 장애를 분석하고 해결해 본 경험이 있으면 좋아요. 결제처럼 장애나 데이터 정합성 문제가 고객과 비즈니스에 직접적인 영향을 주는 Mission-Critical 서비스를 운영해 본 경험이 있으면 좋아요. Istio 등 Service Mesh 환경에서 서비스 간 트래픽 흐름과 장애 전파 경로를 분석하고 개선해 본 경험이 있으면 좋아요. Fault Injection 실험이나 장애 복구 훈련을 설계하고, 시스템의 복원력을 검증, 개선해 본 경험이 있으면 좋아요. Java/Kotlin과 Spring Ecosystem을 이용해 제품 또는 플랫폼 코드를 개발해 본 경험이 있으면 좋아요. 이력서는 이렇게 작성하시는 걸 추천해요 장애 대응, 신뢰성, 성능 개선 또는 운영 자동화와 관련된 대표 경험 2~3가지를 중심으로 작성해 주세요. 어떤 사용자 또는 비즈니스 문제가 있었고, 당시 시스템과 조직에 어떤 제약이 있었는지 알려주세요. 원인을 찾기 위해 어떤 가설을 세웠고, 어떤 데이터와 도구를 활용했는지 작성해 주세요. 본인이 직접 판단하고 설계, 구현, 조율한 범위와, 해결 과정에서 고려한 트레이드오프를 구체적으로 알려주세요. 개선 전후의 오류율, 지연시간, 탐지, 복구 시간, 장애 빈도 또는 반복 작업량의 변화를 가능한 범위에서 작성해 주세요. 토스플레이스에서 사용하는 기술 Java, Kotlin, Spring Boot, Spring Cloud, JPA/Hibernate, Gradle MySQL, MongoDB, Elasticsearch, Redis, Kafka AWS, Kubernetes, Istio, Podman, Containerd Git, GoCD, ArgoCD, Vault Prometheus, Thanos, Grafana Chaos Mesh 특정 기술의 사용 경험보다 문제를 정확히 이해하고 적절한 해결 방법을 선택하는 역량을 중요하게 생각해요. 서비스의 신뢰성을 높이는 데 필요한 기술과 도구는 함께 검토해 도입하거나 직접 개발할 수 있어요. 토스플레이스로의 합류 여정 서류전형 > 테크핏 인터뷰(30분) > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우협의 > 최종합격 및 입사 함께할 동료를 위한 한마디 "복잡한 오프라인의 문제를 해결하며, 전체 시스템을 직접 설계하고 주도하는 압도적인 성장을 경험하고 있어요." 오프라인 결제 환경에서는 온라인보다 훨씬 다양한 변수와 예외를 마주하게 돼요. 서버 플랫폼 팀은 이런 환경에서도 서비스가 안정적으로 운영될 수 있도록 공통 모듈과 플랫폼 서비스를 만들고, 장애를 더 빠르게 감지하고 회복할 수 있는 기반을 계속 개선하고 있어요. 합류하시면 특정 서비스 하나가 아니라 전체 시스템을 더 나은 방향으로 설계하고 운영하는 경험을 할 수 있어요. 기술적 오너십을 가지고 깊이 기여하고 싶은 분, 좋은 동료들과 함께 답을 만들어가며 성장하고 싶은 분께 정말 좋은 팀이에요. 전체 채용공고 목록으로 돌아가기 지원하기 채용팀에 문의하기
Location
Seoul
Total raised
$1.4B
Last stage
Series G
Investors
Lee Seung-gun
Founder & CEO
No applications, no recruiter spam. Just the intro.
A few questions to make sure this role is the right shape for you. Two minutes.
I write the intro, send it to the founder, and handle the back-and-forth.
If they’re a yes, I book the chat. You show up — that’s the whole job-hunt.