AI 인프라는 두 개의 뚜렷한 운영 모델로 나뉘고 있습니다. 하나는 전통적인 데이터 센터입니다. 많은 애플리케이션을 안정적이고, 안전하며, 비용 효율적으로 실행하도록 최적화된 범용 시설입니다. 용량 계획은 CPU 사용률과 물리적 또는 가상 밀도를 중심으로 이루어집니다.
다른 하나는 AI 팩토리입니다. 데이터를 산업 규모의 ‘지능’으로 전환하도록 설계된 AI 네이티브 생산 환경으로, 효과적인 추론을 보장하기 위해 측정 가능한 처리량을 바탕으로 모델을 지속적으로 학습시키고, 미세 조정하며, 서빙합니다. AI 팩토리의 경우, GPU 시간, 토큰 처리량, 모델 반복 속도 및 데이터 파이프라인 효율성이 핵심 요소입니다. AI 팩토리에서 스토리지는 단순히 저장소 역할을 하는 수준을 넘어, AI 생산 라인의 성능을 좌우하는 중요한 단계가 됩니다.
AI 팩토리는 목적에 맞게 설계된 AI 라이프사이클 생산 시스템으로 이해하는 것이 가장 적절합니다. NVIDIA 용어집에서는 이를 AI 수명 주기 전체를 관리하는 특수 컴퓨팅 인프라로 정의합니다1. 여기서 수명 주기는 데이터 수집 및 데이터 준비부터 학습, 미세 조정, 대규모 추론에 이르는 과정을 포괄하며2, ‘제품’은 단위 시간당 토큰이나 추론, 또는 결과물로 흔히 표현되는 처리량을 통해 측정되는 지능입니다.
데이터 센터는 서버, 스토리지 시스템, 네트워킹 장비와 이를 운영하는 데 필요한 전력, 냉각, 물리적 보안과 같은 보조 시스템을 수용하는 범용 시설입니다. IEA는 데이터 센터를 IT 장비 랙과 해당 장비의 기능을 유지하는 데 필요한 지원 인프라를 갖춘 시설로 설명합니다.3
AI 팩토리 또한 데이터 센터에서 볼 수 있는 하드웨어와 보조 시스템을 갖추고 있습니다. 그렇다면, 실제 어떤 차이가 있을까요?
유용한 멘탈 모델: AI 팩토리는 데이터 센터 내부에 위치할 수 있지만, 생산 라인처럼 작동합니다. 컴퓨팅, 네트워크 및 스토리지 전반에서 보다 결정론적인 성능을 요구하는데, 이는 병목 현상이 발생하면 GPU 활용이 저하되고 비용이 상승하기 때문입니다.
AI 팩토리는 다음을 위해 설계된 하드웨어, 소프트웨어 및 운영 프로세스의 통합 스택입니다.
핵심 요소는 AI 팩토리의 산출물이 특정 비즈니스 애플리케이션이 아니라 지속적으로 생성되는 지능이라는 점입니다. 이러한 산출물은 추천, 분류, 요약, 액터 또는 에이전트일 수 있습니다. NVIDIA는 AI 팩토리를 전체 수명 주기를 관리하고 대규모 추론을 확장하는 환경으로 명확히 정의하고 있습니다.1
AI 팩토리는 원시 데이터를 AI 모델, 예측, 의사결정, 생성된 콘텐츠와 같은 학습된 결과물로 변환합니다. 이들은 데이터 파이프라인을 프로덕션 인프라로 취급하며, 학습 및 추론을 통해 결과물을 지속적으로 개선합니다. 데이터가 정제, 스테이징, 변환, 버전 관리 및 검증 과정을 거치므로, 향상되는 데이터 품질을 기반으로 모델 품질이 구축됩니다.
‘모델 프로젝트’ 대신, 이전 작업을 기반으로 각 작업이 구축되는 일련의 작업을 수행하게 됩니다. 에이전트는 이를 반복 가능한 프로세스로 만들 수 있습니다.
수만 달러에 달하는 GPU나 DPU가 유휴 상태라면 비용이 빠르게 증가할 수 있습니다. 핵심 운영 목표는 가속기 ‘버블 타임’, 즉 GPU가 데이터, 동기화 또는 I/O를 기다리는 유휴 시간을 최소화하는 것입니다. NVIDIA의 AI 엔터프라이즈 사이징 가이드는 로컬 NVMe 스토리지가 데이터를 GPU 가까이 유지함으로써 스토리지 병목 현상을 제거하고 학습 및 추론 처리량을 높일 수 있음을 명확히 설명합니다.5
‘GPU가 쉴 틈 없이 돌아갈 만큼 데이터 파이프라인을 빠르게 유지한다’는 하나의 원칙은 AI 팩토리와 일반 데이터 센터 간 스토리지 아키텍처 결정을 크게 좌우하는 요인입니다.6 NVMe 스토리지는 이제 과거의 데이터 센터 구축에서처럼 나중에 고려할 부차적인 요소가 아니라, AI 팩토리 인프라 및 컴퓨팅 전략의 필수적인 부분이 되었습니다. 더 자세한 내용은 ‘NVIDIA GTC ’26에서 명확하게 알 수 있었던 것: AI의 다음 도약은 스토리지에 달려 있다’를 읽어 보시기 바랍니다.
AI 팩토리는 데이터 센터와 많은 구성 요소를 공유하지만, 이러한 구성 요소는 AI 처리량을 지원하기 위해 다양한 방식으로 선택 및 통합됩니다.
AI 팩토리는 스토리지와 메모리에 일반적으로 계층형 모델을 사용합니다.
바로 이 지점에서 솔리다임이 전략적으로 중요한 역할을 합니다. 데이터 세트가 증가함에 따라 팀은 전력, 랙 풋프린트 및 운영 오버헤드를 급증시키지 않으면서 용량과 밀도를 확장해야 합니다. AI 팩토리 스토리지에 대한 자세한 내용은 ‘AI용 데이터 스토리지에서의 CMX(Context Memory eXtension) 이해’를 참고하시기 바랍니다.
데이터 센터는 디지털 서비스를 지원하는 기반 시설입니다. 이 시설은 적절한 물리적 보안, 전력 컨디셔닝, 냉각, 모니터링 및 운영을 통해 신뢰할 수 있는 컴퓨팅, 스토리지, 네트워킹을 제공하기 위해 존재합니다.
IEA의 설명은 간단명료합니다. 데이터 센터는 랙에 설치된 서버, 스토리지 시스템, 네트워킹 장비는 물론, 이러한 시스템을 운영하는 데 필요한 보조 인프라를 수용합니다.3
이러한 범용적 목적 덕분에 데이터 센터는 멀티 테넌시와 다양한 워크로드를 지원하는 데 뛰어나며 장기간 안정적인 운영이 가능합니다.
데이터 센터는 AI 모델을 대규모로 학습, 미세 조정, 배포 및 실행하는 데 필요한 인프라와 운영 서비스를 제공합니다. 컴퓨팅, 스토리지, 네트워킹 및 거버넌스가 함께 작동하여 AI 워크로드가 안정적이고, 안전하며, 비용 효율적으로 수행될 수 있도록 보장합니다.
데이터 센터의 핵심 구성 요소는 컴퓨팅, 스토리지, 네트워킹, 전력, 냉각, 물리적 보호 및 운영 관리를 포함하여 컴퓨팅 워크로드를 대규모로 안정적이고 안전하게 실행하는 데 필요한 IT 시스템과 시설 인프라입니다.
랙 장착형 컴퓨터는 요청을 처리하고, 애플리케이션을 호스팅하고, 파일을 저장하고, 데이터베이스를 실행하기 위해 지속적으로 가동됩니다. CPU, 가속기, 메모리 및 스토리지를 포함할 수 있습니다.
스토리지 미디어는 서버에서 수행되는 모든 프로세스의 데이터를 저장하며, 로컬 스토리지 용량이 부족할 경우 컴퓨팅 서버에 연결됩니다. Solidigm D7-PS1010과 같은 고성능 NVMe SSD는 지연 시간에 민감한 읽기 작업과 높은 처리량이 요구되는 환경에 가장 적합합니다. 랙 밀도를 극대화하고 전력 사용량을 최소화해야 하는 데이터 센터에서는 고용량 Solidigm D5-P5336 NVMe SSD가 안성맞춤입니다. HDD와 같은 레거시 스토리지 옵션은 물론, 테이프도 콜드 스토리지로 사용할 수 있습니다. 스토리지 옵션에 대해 자세히 알아보려면 ‘디스크 드라이브에 적합한 레거시’를 읽어 보시기 바랍니다.
서버 간 연결은 스위치, 라우터, 이더넷 및 광섬유 케이블이 담당합니다. 이러한 장비들은 또한 고대역폭 연결을 통해 서버를 인터넷에 연결합니다. 로드 밸런서는 요청이 균등하게 분산되도록 트래픽을 관리합니다. 이 장비는 일반적으로 데이터 센터 설계에서 랙 상단에 위치합니다.
데이터 센터는 모든 장비를 계속 가동하기 위해 상당한 양의 전력을 사용하며, 이러한 전력은 반드시 중단 없이 공급되어야 합니다. 실제로 전력은 데이터 센터의 최대 운영 과제입니다. 전력 공급선은 정상적인 운영을 위해 변전소에서 전력을 공급받습니다. 하지만 데이터 센터의 지속적인 가동을 보장하려면 정전 시 데이터 센터를 계속 작동시킬 수 있는 무정전 전원 장치(UPS)가 필수적인 백업 수단이며, 소규모 환경에서는 UPS가 배터리 역할을 합니다. 장시간 정전이 발생하는 경우에는 디젤 발전기가 추가적인 전원 공급 이중화를 제공할 수 있습니다.
냉각은 데이터 센터의 두 번째로 큰 과제입니다. 본질적으로 액체 냉각과 공랭식 냉각으로 구분되지만, 이 두 가지 접근 방식에는 수많은 세부적인 차이가 존재합니다.
공랭식: 대부분의 공랭식 시스템은 팬을 사용하여 서버를 통해 시원한 공기를 밀어내고 실내로 열을 내보냅니다. 전산실 공조기(CRAC)는 이중 마루 아래로 찬 공기를 공급하며, 인로우(In-row) 냉각 장치는 서버 사이에 배치할 수 있습니다. 어보브로우(Above-row) 냉각 방식은 이중 마루가 필요하지 않으며, 뜨거운 공기는 위로 끌어올리고 찬 공기를 랙 아래로 공급합니다. 오늘날 공랭식은 중간 밀도의 범용 엔터프라이즈 랙에 가장 적합합니다.
액체 냉각: 콜드 플레이트를 장치 인클로저에 부착하는 직접 액체 냉각(DLC)이나, 콜드 플레이트가 실리콘 부품에 닿는 직접 칩 냉각(DTC) 방식은 대부분의 사람들이 액체 냉각 시나리오에서 떠올리는 기본 시스템이 되었습니다. 데이터 센터의 액체 냉각을 위한 기타 옵션으로는 액침 냉각, 인로우 액체 냉각, 후면 도어 열교환기(RDHx)가 있습니다.
하이브리드 냉각: 이 접근 방식은 일부 랙의 밀도가 더 높거나 환경의 일부가 AI 포드로 구성되어 보다 집중적인 냉각이 필요한 경우, 액체 냉각과 공랭식 냉각을 혼합합니다. GPU 또는 CPU에는 직접 DTC 액체 냉각 솔루션을 적용하고, 서버 내부의 팬을 통해 메모리 및 스토리지 구성 요소를 냉각하는 형태로 구현될 수 있습니다.
통제된 접근, 감시, 현장 모니터링은 귀중한 데이터와 지식 재산(IP), 인프라를 악의적 행위자의 공격으로부터 보호합니다. 또한 규제 및 컴플라이언스 요구 사항을 충족하는 데도 필수적입니다.
조기 감지 및 소화 시스템은 시설 위험 기준에 부합해야 합니다. 여기에는 컴퓨터 부품이 전기 단락 위험에 노출되지 않도록 하기 위한 비액체식 소화 설비의 필요성이 포함될 수 있습니다.
여기에는 시스템의 각 구성 요소에 내장되어 마모, 유휴 시간 및 기타 운영 지표를 추적하는 기능이 포함됩니다. 또한 인프라의 장기적인 지속 가능성과 투자 보호를 보장하기 위해 데이터 센터 인프라 관리(DCIM) 소프트웨어, 관찰 가능성 도구, 알림, 사고 대응 및 변경 관리 프로세스를 활용하는 지속적인 모니터링이 포함될 수 있습니다.
데이터 센터는 IT 장비에 지속적이고 보호되는 전력과 냉각을 공급하고, 탄력적인 네트워크를 통해 해당 장비를 연결하며, 이를 체계적인 모니터링과 절차를 바탕으로 운영함으로써 애플리케이션이 안전하고 안정적으로 실행되도록 합니다.
AI 팩토리와 기존 데이터 센터는 기반 인프라를 공유하지만, 특히 AI 워크로드가 성능, 비용 및 확장 결정의 주요 동인이 되는 경우에는 목적, 아키텍처, 운영 지표 측면에서 크게 달라집니다.
전통적인 환경에서 스토리지는 흔히 용량, 복원력, 비용을 기준으로 규모가 결정됩니다.
AI 팩토리에서 스토리지는 종종 다음과 같은 역할을 합니다.
NVIDIA의 사이징 가이던스는 NVMe 로컬 스토리지가 병목 현상을 제거하여 GPU가 데이터에 최대한 빠르게 액세스할 수 있도록 해준다고 강조합니다.1 이것은 매우 ‘팩토리’적인 사고방식입니다. NVMe 스토리지는 생산이 계속 진행되도록 하기 위해 존재합니다.
데이터 센터 인프라는 전력을 많이 소모합니다. 이로 인해 의사 결정은 다음 요소를 중심으로 이루어집니다.
AI 팩토리는 제조업처럼 작동합니다.
AI 도입이 증가함에 따라, 경영진의 논의는 단위 경제성으로 옮겨가고 있습니다.
바로 이 지점에서 스토리지 결정이 측정 가능한 영향을 미칠 수 있습니다. I/O 스톨을 방지하여 GPU 유휴 시간을 줄이면, 동일한 GPU 플릿이 더 많은 결과물을 생성합니다.
AI는 단순히 ‘워크로드를 추가’하는 데 그치지 않습니다. 시설 및 운영에 대한 가정을 부각시킵니다.
전력망 용량과 지역 인허가는 점점 AI 인프라가 어디에서 확장될 수 있는지를 결정짓는 요인이 되고 있습니다. 공시 보고서와 전망은 데이터 센터의 성장과 전력 수요 증가 간의 연관성을 반복적으로 보여주고 있습니다.
GPU 인프라와 랙 밀도로 인해 랙당 전력 요구량이 증가하면서 팀은 다음을 확보해야만 합니다.
기존 환경에서는 스토리지 지연 시간 급증이 성능을 제한하는 요인이 됩니다.
AI 학습에서는 스토리지 스톨이 GPU 유휴 시간으로 직결됩니다. 이러한 이유로 아키텍처는 컴퓨팅에 가까운 NVMe 계층을 점점 더 강조하고 있습니다. 자세한 내용은 ‘AI 메모리 부족 시’를 참조하시기 바랍니다.
AI 클러스터는 지속적으로 통신하며, 다운타임은 제한적입니다. 동서 대역폭이 제한되면 학습 속도가 느려지고, 추론 지연 시간이 불규칙해지며, 운영 복잡성이 증가합니다.
AI는 데이터 과학, 플랫폼 엔지니어링, 보안, 법무, 제품에 이르기까지, 그 어느 때보다 더 많은 이해관계자의 참여를 필요로 합니다. 운영 모델(‘팩토리’ 개념)이 없으면, 팀은 끝없는 업무 인수인계와 취약한 일회성 구축의 늪에 빠지게 됩니다.
AI 팩토리와 데이터 센터의 차이는 단순히 용어상의 차이가 아니라 물류 관점과 더 큰 규모의 계획 프레임워크에서 비롯됩니다.
기업 리더들을 위한 실질적인 교훈은 AI를 그저 또 하나의 워크로드처럼 취급해서는 안 된다는 것입니다. 그렇게 취급한다면, 큰 비용이 드는 GPU 유휴 시간을 유발하는 전력 제약, 냉각 한계, 네트워크 연결, 스토리지 병목 현상과 같은 예측 가능한 데이터 센터 문제를 악화시킬 가능성이 높습니다.
하지만 AI 팩토리 마인드셋을 채택하면, 컴퓨팅 자원이 생산성을 유지하고 NVMe 스토리지가 전략적 가속기 역할을 하도록 파이프라인을 설계할 수 있습니다. 바로 이 지점에서 솔리다임 고용량 SSD와 고밀도 계층은 복잡성을 동일한 비율로 증가시키지 않으면서 AI 데이터 세트와 서비스를 확장하여 실질적인 운영 레버리지를 창출할 수 있습니다.
정확히 같지는 않습니다. AI 데이터 센터는 단순히 AI 워크로드를 실행하는 시설일 수 있는 반면, AI 팩토리는 엔드 투 엔드 처리량과 지속적인 반복에 최적화된 생산 방식의 운영 모델을 의미합니다.
RAG 지식 어시스턴트, 보안 분석, 개인화, 산업용 AI 및 문서 자동화 등에 사용됩니다. 즉, 기업 데이터와 가까운 위치에서 AI 모델을 학습, 미세 조정 또는 서비스해야 하는 모든 곳에 활용됩니다.
일반적으로 더 높은 랙 밀도와 더 많은 동서 방향 네트워킹, 더욱 까다로운 냉각 요구 사항, GPU 및 DPU와 같은 가속기가 데이터 부족을 겪지 않도록 성능에 더욱 민감하게 설계되는 스토리지 계층이 특징입니다.
데이터 센터는 전력을 조정 및 분배하고, 냉각 시스템을 통해 열을 제거하며, 네트워크를 통해 시스템을 연결하고, 운영 프로세스를 기반으로 신뢰성과 보안을 보장합니다.
스토리지 처리량은 GPU 활용도에 직접적인 영향을 미칩니다. 데이터가 충분히 빠르게 전달되지 않으면 가속기가 유휴 상태에 놓이고 AI 비용이 상승합니다. 로컬 NVMe는 이러한 스토리지 병목 현상을 제거하기 위해 주로 사용됩니다.
지속적으로 사용되는 가속기가 열을 발생시키므로 전력과 냉각이 가장 먼저 변화합니다. 그다음으로는 동-서(서버 간 또는 서버-스토리지 간) 대역폭을 위한 네트워크 패브릭이 변화하며, 스토리지 아키텍처가 그 뒤를 잇습니다. GPU 사용은 더 많은 NVMe 계층과 고밀도 SSD 랙에 의존합니다.
전력 제약, 열 핫스팟, 네트워크 초과 구독, 스토리지 병목 현상, 팀 간 조직적 마찰이 가장 일반적인 실패 요인입니다.
솔리다임은 AI 팩토리 확장을 위한 맞춤형 제품 로드맵을 고객에게 제공하는 성능 중심의 NVMe SSD를 제조합니다. 제품군으로는 액체 냉각 솔루션과 세계에서 가장 많이 사용되는 고용량 드라이브가 있으며, 122.88TB NVMe SSD(향후 더 큰 용량 출시 예정)도 제공합니다.
AI 라이프사이클의 엔드 투 엔드(데이터 수집 → 학습 → 배포)를 매핑하는 것부터 시작한 다음, 처리량을 고려하여 설계합니다. 컴퓨팅 자원과 가까운 곳에 NVMe 계층을 추가하고, 데이터 거버넌스와 MLOps 파이프라인을 표준화하며, 추론당 비용 또는 토큰당 비용과 같은 단위 경제성 지표를 채택합니다.
Scott Shadley는 솔리다임의 리더십 내러티브 및 에반젤리스트 이사로, 전산 스토리지, 스토리지 기반 AI, 양자 후 암호화를 포함한 새로운 스토리지 기술의 채택을 추진하는 데 주력하고 있습니다. Scott은 반도체 및 스토리지 분야에서 25년 이상의 경력을 쌓았으며, 엔지니어링 및 고객 중심 역할 모두에서 핵심적인 역할을 수행했습니다.
Cecily Whiteside는 솔리다임의 검색 및 콘텐츠 매니저입니다. 그녀는 기술, 라이프스타일, 건강 및 웰니스 분야의 웹사이트와 간행물에 글을 기고하고 있습니다. Cecily는 미국과 해외의 여러 매거진에서 편집장을 역임했으며, 그 외 매거진에서도 필자로 기고해 왔습니다.