01 / INFERENCE CAPACITY
추론 용량과 서비스 밀도 — 추론 단가는 낮아지고, 운영해야 할 요청은 늘어납니다.
280× · GPT-3.5 수준 시스템의 추론 비용 하락Stanford HAI는 2022년 11월부터 2024년 10월 사이 GPT-3.5 수준 시스템의 백만 토큰당 추론 비용이 20달러에서 0.07달러로 낮아졌다고 집계했습니다. 같은 보고서에서 2024년 조직의 AI 사용 응답은 78%로 나타났습니다.
비용 하락은 GPU 검토를 끝내는 신호가 아니라 동시성, 지연 시간, 자원 공유와 관측 기준을 더 일찍 정해야 한다는 신호입니다.
피크 동시성·지연·GPU 공유 조건을 GPU 서버 용량, 배치·확장 조건과 MLOps 관측 항목으로 정리합니다.
- 피크 동시성과 목표 응답 시간은 무엇인가
- GPU를 어떤 작업과 공유할 것인가
- 비용·지연·품질을 어떤 단위로 관측할 것인가
추론 동시성·지연·GPU 공유 기준 검토GPU COMPUTE 수행 경로02 / PHYSICAL CAPACITY
전력·냉각과 물리 수용 조건 — GPU 클러스터의 첫 제약은 전산실 바깥에서 시작됩니다.
17% · 2025년 전 세계 데이터센터 전력 수요 증가율IEA는 2025년 데이터센터 전력 수요가 17% 증가했으며 AI 중심 데이터센터의 수요는 그보다 더 빠르게 늘었다고 분석했습니다. 전력망 연결과 공급 병목은 GPU 도입 일정과 배치 가능한 밀도를 결정하는 선행 조건입니다.
GPU 수량만 산정해서는 실행 가능한 구성이 되지 않습니다. 전력 인입, 랙 밀도, 냉각 방식, 열 여유와 네트워크 배선을 같은 물리 설계 경계에서 확인해야 합니다.
전력·랙·냉각·배선 조건을 GPU 서버와 네트워크 패브릭 구성의 선행 입력과 검수 항목으로 정리합니다.
- 가용 전력과 랙당 허용 밀도는 얼마인가
- 냉각 방식과 확장 여유는 확인됐는가
- 전력·열·네트워크 장애 경계는 어디인가
GPU 전력·냉각·랙 수용 조건 검토GPU COMPUTE 수행 경로03 / AI DATA PATH
AI 데이터 공급·보존 경로 — GPU 성능은 데이터가 도착할 때 비로소 사용할 수 있습니다.
8개월 · 주요 LLM 학습 데이터셋 규모의 추정 배증 주기Stanford HAI의 2025 AI Index는 주요 LLM 학습 데이터셋 규모가 약 8개월마다 두 배가 되는 흐름을 소개합니다. 데이터의 규모뿐 아니라 접근 패턴과 이동 경로도 컴퓨트 활용률의 조건이 됩니다.
저장 용량과 GPU 노드를 따로 발주하기 전에 수집, 전처리, 공급, 체크포인트, 보존과 복구가 이어지는 경로를 하나의 처리 흐름으로 설계해야 합니다.
수집·전처리·GPU 공급·체크포인트·복구 경로를 스토리지, 네트워크와 GPU 컴퓨팅 사이의 데이터 흐름으로 연결합니다.
- 데이터는 어디에서 생성되고 어느 속도로 증가하는가
- GPU에 공급되는 경로의 병목은 어디인가
- 체크포인트와 복구 데이터는 어디에 보존하는가
AI 스토리지·데이터 공급 경로 검토AI DATA 수행 경로04 / AI NETWORK FABRIC
AI 패브릭과 혼잡 제어 — GPU 클러스터의 통신 경로를 컴퓨트·스토리지·운영망으로 나누어 봅니다.
END-TO-END · NIC·스위치·광·케이블을 잇는 공개 규격 범위Ultra Ethernet Consortium의 현재 공개 규격 v1.0.3은 AI·HPC용 Ethernet 통신 스택을 NIC, 스위치, 광, 케이블과 RDMA·혼잡 제어까지 연결합니다. NVIDIA DGX B200 참조 아키텍처는 특정 제조사 사례로서 컴퓨트, 스토리지, 인밴드와 아웃오브밴드 관리망을 구분합니다.
링크 속도와 포트 수뿐 아니라 통신 패턴, 토폴로지, 수용비, 혼잡 제어, 장애 경계와 관측 항목을 함께 검토해야 합니다.
GPU 서버의 통신 패턴을 네트워크 토폴로지, 스토리지 경로와 운영 관측 기준에 연결해 초기 설계 입력으로 정리합니다.
- 노드 간 통신과 스토리지 트래픽을 어떻게 구분할 것인가
- 토폴로지·수용비·장애 경계 기준은 무엇인가
- 혼잡·손실·꼬리 지연을 어떤 지표로 관측할 것인가
AI 패브릭 설계 입력 검토NETWORK FABRIC 수행 경로05 / GPU OPERATING LAYER
GPU 자원 운영과 배포 — AI 인프라는 구축보다 반복 가능한 운영에서 완성됩니다.
66% · 생성형 AI 호스팅 조직 중 Kubernetes로 추론을 운영하는 비율CNCF의 2026 Annual Cloud Native Survey는 생성형 AI 모델을 호스팅하는 조직의 66%가 일부 또는 전체 추론 워크로드를 Kubernetes로 관리한다고 보고했습니다. 컨테이너 사용자의 82%는 Kubernetes를 프로덕션에서 사용합니다.
GPU 스케줄링, 배포, 구성 변경, 관측과 복구를 공통 운영 레이어에 연결해야 자원 공유와 반복 배포가 실제 운영 체계가 됩니다.
GPU 스케줄링·배포·변경·관측·복구를 MLOps 운영 정책과 GPU 서버 자원 관리 절차로 연결합니다.
- GPU 스케줄링과 할당 정책은 누가 관리하는가
- 모델·구성·데이터 변경을 어떻게 추적하는가
- 관측과 장애 복구의 책임 경계는 어디인가
GPU 스케줄링·배포·관측 운영 검토MLOPS & OPERATIONS 수행 경로06 / AI CONTROL PLANE
모델·데이터 통제 경로 — 거버넌스는 문서가 아니라 운영 경로의 제어면입니다.
4 FUNCTIONS · GOVERN · MAP · MEASURE · MANAGENIST AI RMF는 AI 위험 관리를 Govern, Map, Measure, Manage의 반복 가능한 기능으로 구성합니다. GenAI Profile은 생성형 AI의 고유하거나 확대된 위험을 수명주기 전반에서 다루기 위한 보완 지침을 제공합니다.
모델·데이터 출처, 접근 권한, 평가 결과, 변경 승인과 장애 대응 기록이 배포 파이프라인과 운영 인수 조건에 연결돼야 합니다.
모델·데이터 권한, 변경 승인, 평가 기록과 중단 기준을 MLOps, 네트워크와 AI 스토리지 운영 경로에 연결합니다.
- 모델과 데이터 변경을 누가 승인하는가
- 품질·안전·보안 평가 결과를 어디에 기록하는가
- 위험 수용과 운영 중단 기준은 무엇인가
모델·데이터 권한·변경 통제 기준 검토MLOPS & OPERATIONS 수행 경로07 / AGENTIC RUNTIME
에이전트형 AI 실행 경로 — 에이전트는 한 번의 응답이 아니라 상태와 도구를 가진 실행 흐름입니다.
1 IN 3 · 구조화된 에이전트 벤치마크에서 남는 실패 비율(약)Stanford HAI의 2026 AI Index는 AI 에이전트가 2025년에 질문 응답에서 작업 수행으로 진전했지만, 구조화된 벤치마크에서는 여전히 약 3번 중 1번 실패한다고 정리합니다. NIST의 2026 에이전트 보안 의견 분석은 기존 사이버보안 원칙이 계속 중요하지만 에이전트의 새로운 위협에 맞춘 조정이 필요하다는 공통 의견을 보고했습니다.
여러 단계와 도구 호출을 거치는 요청은 GPU 점유 시간, 상태 저장, 데이터 접근, 외부 통신, 권한과 실행 기록을 함께 설계해야 합니다. 성공 응답뿐 아니라 중단, 재시도와 사람 승인 경로가 운영 기준에 포함돼야 합니다.
실행 상태, 도구·데이터 권한, 외부 통신, 재시도와 사람 승인을 GPU·스토리지·네트워크·MLOps 전체 경계에서 검토합니다.
- 한 요청은 몇 단계로 얼마나 오래 실행되는가
- 도구·데이터 접근과 외부 통신 권한은 어디에서 제어하는가
- 입력·행동·출력·재시도와 사람 승인을 어떻게 추적하는가
에이전트 실행·권한·상태 추적 기준 검토MLOPS & OPERATIONS 수행 경로