PRISM 인프라 운영 배경

GPU 인프라 운영

GPU 인프라 운영,
어디서부터 막히고 있나요?

자원 현황 파악 불가

어떤 GPU가 사용 중이고, 어디가 비어있는지 알 수 없습니다

자원 독점 · 연구 지연

특정 사용자나 작업이 GPU를 점유하면 전체 작업 흐름이 밀립니다

수동 관리의 한계

엑셀과 수기로 서버를 관리하며 장애 대응이 늦어집니다

자원 활용 현황 파악 어려움

보유한 GPU가 어떤 작업에 사용되는지 한 화면에서 확인하기 어렵습니다

GIGAFLOPS는 운영에 필요한 구성을 함께 설계합니다

통합 모니터링 화면

GPU, CPU, 메모리, 작업 상태를 한 화면에서 확인

Slurm 스케줄링 구성

자원 배분과 대기열 관리를 통해 GPU 작업 흐름을 정리

알림 규칙 설정

고객이 PRISM에서 이상 징후와 알림을 직접 확인

GPU 사용 현황 확인

작업, 사용자, 노드 상태를 함께 보며 운영 병목을 확인

GIGAFLOPS 주요 서비스 체험하기 체험하기

6개 노드 × 8 GPU = 48 GPU — 팀별 개별 운영과 Slurm 기반 통합 자원 관리를 비교합니다

10x
경과 0:00 | Jobs 0

개별 서버 운영

팀별 노드 할당
0%

대기열 0

-Avg Wait
0Done
0대기 중
VS

Slurm 통합 풀

통합 자원 관리
0%
Slurm Controller

대기열 0

-Avg Wait
0Done
0대기 중

스케줄링 활동

각 기능을 클릭하여 마음껏 체험해보세요!

PRISM 데모는 새 창에서 확인할 수 있습니다.

로컬 환경에서는 보안 정책상 iframe 표시가 제한됩니다.

데모 열기

CFD / Thermal Flow

데이터센터를
시각화하다

서버실 내부의 열 흐름을 CFD 시뮬레이션으로 확인합니다. 서버 배치, 냉각 조건, 열 집중 구간을 검토하기 위한 기술 영역으로 준비하고 있습니다.

데이터센터 서버실 3D 구조 시각화

Digital Twin / Server Room

서버실 구조를
3D로 확인하다

랙, 서버, 장비 위치를 3D 공간에서 확인해 자산 위치와 현장 구조를 더 빠르게 파악합니다. 운영자는 평면 목록이 아니라 실제 배치에 가까운 화면에서 상태를 이해할 수 있습니다.

민감 정보가 마스킹된 PRISM 서버 모니터링 화면

PRISM / Monitoring Link

시각화 화면에서
상태를 확인하다

PRISM은 서버, GPU, 작업, 알림 정보를 모니터링 화면으로 제공합니다. 3D 시각화와 연결하면 장비 위치와 운영 상태를 같은 화면 흐름에서 확인할 수 있습니다.

기술 데모 영상

CFD 시뮬레이션과 Omniverse 디지털 트윈을 영상으로 확인하세요

NVIDIA Omniverse / CFD

CFD 열전달 시뮬레이션

서버룸 내부의 열 흐름을 3D로 시각화하여 냉각 조건과 열 집중 구간을 검토합니다.

Surrogate / CFD 데이터 기반

Surrogate 기반 열 검토

CFD 해석 데이터를 바탕으로 배치, 부하, 냉각 조건 변화에 따른 열 흐름을 빠르게 추정하는 방향으로 확장하고 있습니다.

Digital Twin / PRISM 연동

3D 서버 클릭 → 상태 정보 팝업

Omniverse 씬에서 서버를 클릭하면 PRISM의 서버 상태 정보가 팝업으로 표시됩니다.

운영 현장에서 확인해야 할 항목

수치보다 중요한 것은 서버, 작업, 장애, 열 상태를 한 흐름에서 볼 수 있는 운영 구조입니다.

서버 상태Server

CPU, 메모리, 디스크, 네트워크 상태를 운영 화면에서 확인합니다.

GPU 상태GPU

GPU 사용률, 메모리, 온도, 전력, 오류 상태를 함께 확인합니다.

작업 흐름Slurm

작업 대기열, 사용자, 노드 상태를 연결해 클러스터 운영을 봅니다.

하드웨어 센서IPMI/BMC

전원, 팬, 온도, 섀시 이벤트 등 장비 수준의 이상 징후를 확인합니다.

장애 대응Alert

임계치와 규칙 기반 알림으로 반복 확인과 수동 대응 부담을 줄입니다.

열 흐름CFD

서버 배치와 냉각 조건에 따른 열 흐름 검토 영역을 준비하고 있습니다.

인프라 도입 과정을 단계별로 정리합니다

GIGAFLOPS는 컨설팅부터 구축, 모니터링 환경 구성까지 한 흐름으로 제공합니다.

1

컨설팅

요구사항 분석 및
현황 진단

2

맞춤형 구축

운영 환경에 맞춘 하드웨어 및
Slurm 설계

3

시스템 설치/배포

신속한 현장 설치 및
안정화

4

운영 환경 제공

PRISM을 통한 상태 확인,
알림 및 장애 대응 환경 구성

주요 기술 구성

HPC 인프라 운영에 필요한 주요 기술 구성

NVIDIA Omniverse
디지털 트윈 · 시각화
Slurm
클러스터 스케줄링
Prometheus
메트릭 수집 · 모니터링
PRISM
통합 모니터링 플랫폼
Docker
컨테이너 오케스트레이션
Kubernetes
컨테이너 배포 · 스케일링

GIGAFLOPS가 구축한 인프라

프로젝트 사례로 확인하는 인프라 구성 범위

AI·HPC 클러스터

양재 AI 허브 — GPU 클러스터 구축

H100 GPU 기반 AI 학습 클러스터 구성과 Slurm 스케줄링, PRISM 모니터링 환경 연동

자주 묻는 질문

Linux 기반 서버라면 Node Exporter 설치를 통해 연동할 수 있습니다. GPU 서버(NVIDIA), IPMI/BMC 지원 서버, Slurm 클러스터 환경까지 구성 범위에 맞춰 확인합니다.
규모에 따라 다르지만, 하드웨어 입고 후 Slurm 클러스터 설치 및 안정화까지 평균 2~4주가 소요됩니다. 컨설팅부터 모니터링 환경 구성까지 한 흐름으로 진행합니다.
네, 가능합니다. PRISM은 독립적으로 동작하며, Prometheus + Node Exporter 기반이라 기존 인프라에 에이전트 설치만으로 연동됩니다.
NVIDIA RTX GPU가 탑재된 워크스테이션에서 실행됩니다. 웹 스트리밍을 통해 브라우저에서도 3D 씬을 확인할 수 있도록 준비 중입니다.

왜 GIGAFLOPS인가?

GPU 서버 납품부터 클러스터 구축, 모니터링 환경 구성까지 — 통합 서비스 솔루션

영역 직접 구축 · 개별 도구 GIGAFLOPS 통합 솔루션
효율적인 자원관리수동 스케줄링, GPU 유휴 발생 Slurm 기반 작업 배분과 자원 현황 확인
모니터링 구성Grafana 직접 구축, 플러그인 별도 설치 PRISM 기반 GPU/IPMI/Slurm 상태 확인
서버 위치 확인장비 목록과 현장 위치가 분리됨 3D 시각화로 자산 위치와 상태를 함께 확인
알림 확인수동 대시보드 확인, 장애 대응 지연 규칙 기반 알림으로 이상 징후 확인
디지털 트윈 · CFD별도 검토 필요 NVIDIA Omniverse 기반 시각화와 열 흐름 검토 영역 확장
도입 및 운영구축, 모니터링, 대응 체계가 분리됨 구축 범위와 운영 방식을 함께 설계

다수의 파트너들이 GIGAFLOPS와 함께하고 있습니다

GIGAFLOPS 소식

전체보기 +

현재 인프라 구성을
GIGAFLOPS와 함께 검토하세요.

컨설팅부터 구축, 모니터링까지 운영 환경에 맞춰 검토합니다.

COMEUP 2025 부스 배치도

GIGAFLOPS 도입 문의

최고의 HPC 전문가가 신속하게 연락드리겠습니다.