
인공지능(AI) 연구에 점점 더 많은 과학기관이 참여하면서 GPU 보급률이 빠르게 증가하고 있다. 이는 GPU가 AI 학습에 필요한 막대한 컴퓨팅 자원을 가장 효과적으로 지원하기 때문이다. 그러나 x86 아키텍처와 비교하면 GPU 자원 관리 도구는 상대적으로 부족하여, 자원 할당과 사용 현황이 불투명해지는 문제가 발생한다. 이로 인해 많은 기관이 투자 효율성에 대한 의구심을 가지게 되고, 자원 확장 속도를 늦추는 경우가 많아 장기적으로 AI 발전에 부정적인 영향을 줄 수 있다.
이에 따라, 국가망센터(TWGC, Taiwan GPU Cloud) 프로젝트 경험과 GPU 자원 분배 기술에 정통한 인피니틱스(INFINITIX) 소프트웨어는 2018년 AI-Stack을 출시했다. AI-Stack은 다중 사용자를 위한 AI 컴퓨팅 플랫폼으로, 여러 GPU 서버의 컴퓨팅 자원을 효율적으로 스케줄링하고 관리할 수 있다. 연구, 재무, 구매 등 기관 내 다양한 관리자는 통계 그래프를 통해 GPU 자원 배치 현황을 쉽게 확인할 수 있으며, 이를 통해 활용도를 높이고 프로젝트 성과를 향상시킬 수 있다.
인피니틱스의 총괄 매니저 천원위(Chen Wenyu)는 “AI를 실제 적용하고 문턱을 넘어가기 위해서는 자원을 효과적으로 활용하는 것이 필수”라고 강조했다. AI-Stack은 자원 할당을 강화하여 각 부서의 비용 분담 근거를 마련해줄 뿐만 아니라, ‘자동 배포(Auto Provisioning)’ 기능을 갖추고 있어 연구자가 원하는 개발 환경을 단 1분 안에 구축할 수 있다. 이를 통해 소중한 GPU 자원을 신속히 가동하여 기관에 최대한의 기여를 할 수 있다.
자원 배분 효율 향상과 비용 근거 마련
고성능 GPU는 단가가 높아, 연구기관은 최대 성능을 위해 한 서버에 4~10장 이상의 GPU를 장착하는 경우가 많아 투자 비용이 높다. 따라서 관리자는 “모든 GPU가 매 순간 최대한 활용되길” 기대한다.
AI-Stack을 도입하면, 관리자는 각 부서가 사용한 GPU 자원과 지원한 연구 프로젝트를 명확히 파악할 수 있다. 이를 바탕으로 부서별 비용과 기관 기여도를 투명하게 산정할 수 있다. 또한 AI-Stack은 Tesla, Quadro, GeForce 등 GPU 유형별 분배를 지원하여, 작은 실험 프로젝트에는 GeForce, 모델 학습에는 Tesla를 할당하는 등 정확한 자원 배분을 통해 ROI를 극대화할 수 있다.
연구자는 프로젝트 진행 중 다양한 실험 환경을 시도하게 되며, 예상대로 결과가 나오지 않으면 OS, GPU, 드라이버, 컨테이너, 라이브러리, 개발 툴을 재구성하는데 반나절~하루 이상 소요될 수 있다. 반복되는 시행착오는 개발 기간을 늦추고 GPU 유휴 시간을 늘린다.
반면, AI-Stack은 연구자가 1~5분 이내에 개발 환경을 준비할 수 있도록 지원한다. 그래픽 인터페이스를 통해, 사용자는 할당량과 권한 범위 내에서 GPU 등급, 소프트웨어 스택(TensorFlow, PyTorch, Caffe2 등), SSH 키 및 계정 생성, Jupyter Notebook/Lab, TensorBoard 등 개발 툴을 선택할 수 있으며, 시스템은 선택된 설정을 자동으로 배포한다.
AI 학습 문턱 낮추고 프로젝트 실행 가속
자동 배포 기능은 여러 효과를 가져온다. 개발자는 신속히 실험 환경을 구축하고 환경에 대한 자율성을 확보할 수 있어, 복잡한 절차를 줄이고 AI 학습 문턱을 낮춰 연구에 집중할 수 있다.
관리자는 하드웨어 통합과 소프트웨어 최적화 덕분에 시스템의 고가용성 유지와 운영 관리 부담 감소 효과를 누릴 수 있으며, TensorFlow 설치 등 복잡한 요청도 신경 쓸 필요가 없다. AI-Stack 플랫폼은 연구 기관의 모든 구성원이 고르게 혜택을 누릴 수 있도록 설계되었다.
AI-Stack은 연산 및 스토리지 자원의 수평 확장을 지원하며, 인피니틱스는 스토리지 장비 업체와 협력하여, AI 컴퓨팅에 필요한 데이터를 원활히 저장 장치에 배치할 수 있도록 하고 있다. 각 계정별 스토리지 공간을 개발 환경에 매칭할 수 있어, 원본 데이터와 학습 완료 모델을 이동·다운로드할 필요 없이 개발자에게 바로 연결된다.
AI-Stack은 NFS(구), S3(중), CSI(신) 세 가지 세대 스토리지 프로토콜을 지원하며, 최적의 상태는 CSI 사용이지만, 모든 스토리지가 CSI를 지원하지 않기 때문에 S3나 NFS도 백업 옵션으로 활용 가능하다. 인피니틱스는 NVIDIA(컴퓨팅)와 NetApp(스토리지) 제품과의 통합 검증을 완료했다.
천원위는 “AI-Stack은 훈련뿐 아니라 추론(Inference)도 지원하며, 이를 위해 더 많은 통합 요소가 필요하다. 컴퓨팅이나 스토리지뿐만 아니라 수많은 엣지 노드 연결, 네트워크 구성, 보안 대응도 중요하다”라고 강조하며, 전략적 협력을 지속 모색하여 완전한 AI 생태계를 구축하고자 한다고 밝혔다.
도입 성과와 산학 협력
출시 이후 약 2년 동안 AI-Stack은 성균관대, 북과기대, 운캉대, 명지과기대 등 대학과 반도체 기업들에 채택되어 큰 의미를 가졌다. 천원위는 “기업이 해결하고자 하는 문제는 복잡하여, 얼굴인식 같은 범용 솔루션으로는 부족하다. 이때 산학 협력을 통해 연구 기관의 역량을 활용해 기업 맞춤형 솔루션을 개발한다. 기업이 연구비를 지원하면 학교는 컴퓨팅 자원과 연구 역량을 확충하고, 학생은 전문 기술과 경험을 쌓아 진로를 찾을 수 있다. 최종 연구 결과는 기업에 기술 이전되어 디지털 전환을 가속하며, 선순환 구조를 형성한다”고 설명했다.
MWC 2026: INFINITIX, MSI AI-vRAN을 통해 엣지 AI와 통신 인프라 융합 가속
인피니틱스, 어드밴텍과 협력 강화 산업용 AI 컴퓨팅의 새로운 표준을 정의하다