ChatGPT·Claude·Grok 장애 겹쳐…기업 AI 도입의 다음 과제는 ‘업무 연속성’
오픈AI의 ChatGPT와 Codex, 앤스로픽의 Claude, xAI의 Grok이 9월 3일 비슷한 시간대에 서비스 장애를 겪었다. 세 장애의 공통 원인은 확인되지 않았지만, 생성형 AI를 실제 업무에 연결한 기업에는 모델 성능뿐 아니라 서비스 중단 때 업무를 유지할 수 있는 설계가 필요하다는 점을 보여줬다.
오픈AI에 따르면 라우팅 오류로 인해 3일 오전 7시43분부터 일부 이용자가 ChatGPT와 Codex를 사용하지 못했다. 이는 보스턴 등 미 동부시간으로 오전 10시43분이다. 약 34분 뒤인 오전 8시17분 태평양시간, 미 동부시간 오전 11시17분에 완화 조치가 적용됐고 회사는 복구 상태를 모니터링했다. 상태 페이지에서 사건이 최종 종료된 시각은 오후 12시55분 미 동부시간이었다. 따라서 전체 사건 처리 시간과 실제 오류 영향 시간을 같은 의미의 ‘약 2시간 장애’로 보기는 어렵다.
앤스로픽은 미 동부시간 오전 9시26분부터 여러 Claude 모델에서 높아진 오류율을 조사했다. 15분 뒤 원인을 파악했다고 알렸지만, 구체적으로 어떤 문제가 발생했는지는 공개하지 않았다. Claude 웹 서비스와 API, Claude Code, Claude Cowork가 영향을 받았으며, 회사는 정오 무렵 수정 조치를 배포한 뒤 오후 12시16분 영향이 끝났다고 밝혔다.
xAI 상태 페이지에는 Grok 관련 문제가 미 동부시간 오전 9시30분부터 오후 1시5분까지 3시간35분간 이어진 것으로 기록됐다. SpaceX는 별도 공개 설명에서 멤피스 컴퓨팅센터 장애가 Grok 서비스에 영향을 줬다고 밝혔다.
세 서비스의 장애 시간이 겹쳤다는 사실만으로 하나의 클라우드나 네트워크 문제가 모두를 멈췄다고 판단하기는 어렵다. 오픈AI는 라우팅 오류를 설명했고, 앤스로픽은 원인을 파악했다고만 공지했으며, Grok과 관련해서는 멤피스 컴퓨팅센터 장애가 공개됐다. 주요 클라우드·네트워크 사업자가 같은 시간대에 대규모 장애를 공식 보고하지도 않았다. 현재 확인된 정보로는 공통 원인이 있었다고 단정할 근거가 부족하다.
기업 입장에서 더 중요한 부분은 원인이 달라도 사용자가 경험한 결과는 비슷했다는 점이다. 문서 초안이나 아이디어 정리처럼 독립된 작업은 서비스가 복구될 때까지 기다릴 수 있다. 그러나 고객 상담, 소프트웨어 배포, 내부 지식 검색, 임상·보험 문서 처리처럼 AI가 업무 흐름에 직접 들어가면 짧은 중단도 요청 누적과 처리 지연으로 이어질 수 있다.
보스턴권의 의료·바이오, 금융, 교육, 로보틱스 기업에는 이 문제가 특히 민감하다. 이들 산업은 정확성뿐 아니라 개인정보 보호, 접근 권한, 결과 검토와 감사 기록이 중요하다. 주력 AI가 멈췄을 때 다른 모델로 자동 전환하는 ‘멀티모델’ 방식도 선택지가 될 수 있지만, 대체 모델이 동일한 보안·품질 조건을 충족하는지 먼저 확인해야 한다. 여러 모델이 같은 클라우드, 인증 서비스 또는 네트워크에 의존한다면 공급업체 수를 늘리는 것만으로 위험이 충분히 분산되지 않을 수도 있다.
현실적인 점검 대상은 AI가 중단돼도 사람이 처리할 수 있는 최소 절차, 실패한 요청을 안전하게 보관해 재처리하는 기능, 사용량과 오류율을 확인하는 모니터링 체계다. 고객이나 환자에게 영향을 주는 업무라면 자동 생성 결과를 어느 단계에서 사람이 확인할지, 대체 모델 사용 시 민감한 데이터가 어디에 저장되는지도 함께 정할 필요가 있다.
채용시장에서는 모델을 직접 개발하는 직무와 함께 AI 서비스를 안정적으로 운영하는 역할이 주목받을 가능성이 있다. 플랫폼 엔지니어, 사이트 신뢰성 엔지니어(SRE), 클라우드 인프라 담당자뿐 아니라 AI 품질평가, 보안, 감사와 거버넌스 담당자가 해당한다. 이는 AI가 사람의 업무를 대체하는 흐름만이 아니라, AI를 기존 시스템과 연결하고 오류를 관리하며 결과를 검증하는 업무도 함께 늘어날 수 있다는 의미다.
취업 준비생과 이직 지원자는 단순한 프롬프트 작성 경험보다 API 오류 처리, 재시도와 우회 경로 설계, 로그 분석, 권한 관리, 사람의 검토 절차를 프로젝트에서 어떻게 구현했는지 보여주는 편이 실무 역량을 설명하는 데 도움이 된다. 채용 공고에서는 ‘AI platform’, ‘LLMOps’, ‘observability’, ‘model evaluation’, ‘incident response’, ‘governance’ 같은 표현을 살펴볼 만하다.
이번 장애가 OPT나 H-1B 같은 취업비자 제도를 직접 바꾸는 것은 아니다. 다만 스폰서십을 제공하는 기업이 AI 인력을 채용할 때 연구·모델 경험뿐 아니라 기존 제품과 데이터를 연결하고 안정적으로 운영한 경험을 구체적으로 평가할 수 있다. 실제 비자 지원 여부와 고용 조건은 회사와 개인 상황에 따라 달라지므로 별도 확인이 필요하다.
이번 사례는 생성형 AI를 신뢰할 수 없다는 결론보다, 기업이 이를 일반적인 클라우드 시스템과 마찬가지로 장애가 발생할 수 있는 운영 인프라로 다뤄야 한다는 신호에 가깝다. 앞으로는 사업자들이 장애 원인과 외부 의존 관계를 얼마나 구체적으로 공개하는지, 기업 고객이 실제 업무 중단 시간을 측정하고 대체 절차를 정기적으로 검증하는지가 주요 관전 포인트다.