About GIGAFLOPS
GPU 서버와 HPC 클러스터를
GPU 서버와 HPC 클러스터를
운영 환경에 맞게 구축합니다.
GIGAFLOPS는 GPU 서버 납품, 클러스터 구성, Slurm 설정, PRISM 모니터링 환경 구축까지
연구·개발 조직이 실제로 사용할 수 있는 인프라를 구성합니다.
SCROLL DOWN
Our Mission
도입 이후 바로 사용할 수 있는
도입 이후 바로 사용할 수 있는
클러스터 환경을 만듭니다.
고성능 컴퓨팅 환경은 서버, 작업 스케줄러, 사용자 정책, 모니터링이 함께 맞아야 합니다.
기가플롭스는 구축 범위와 운영 확인 항목을 명확히 정리하는 데 집중합니다.
Core Values
우리가 일하는 방식
-
구성 확인
서버, 네트워크, 스토리지, 사용자 흐름을 함께 확인합니다.
-
상태 확인
PRISM으로 서버, GPU, 작업, 알림 상태를 볼 수 있게 구성합니다.
-
운영 정리
도입 후 사용할 큐 정책, 권한, 점검 항목을 환경에 맞춰 정리합니다.
Our Difference
클러스터 도입 시 자주 확인하는 항목
서버가 들어온 뒤 실제 사용까지 이어지도록 구성과 확인 항목을 나눠 봅니다.
Check Point
서버와 GPU 상태를 어디서 확인할지
클러스터 운영자는 서버 부하, GPU 사용률, 온도, 전력, 알림 상태를 한 흐름에서 확인해야 합니다.
- PRISM 모니터링 구성서버, GPU, 전력, 온도 항목을 운영 화면에서 확인합니다.
- 알림 기준 설정운영자가 확인해야 할 이상 징후와 임계치를 정리합니다.
- 이력 기반 점검반복되는 장애나 성능 저하 구간을 기록으로 확인합니다.
Check Point
서버 위치와 장비 정보를 어떻게 연결할지
장비 목록만으로는 실제 랙 위치, 케이블, 현장 구조를 빠르게 파악하기 어렵습니다.
- 3D 서버실 시각화서버실 공간과 랙 위치를 시각적으로 확인합니다.
- 장비별 정보 연결서버 단위로 IP, 소유자, 구성 정보를 연결할 수 있습니다.
- 유지보수 이력 정리장비 위치와 장애 이력을 같은 흐름에서 볼 수 있게 준비합니다.
Check Point
GPU 작업을 어떤 기준으로 배분할지
사용자와 프로젝트가 늘어나면 작업 대기열, 큐 정책, GPU 사용 기준을 정리해야 합니다.
- Slurm 큐 구성사용자, 프로젝트, 장비 규모에 맞춰 큐 정책을 구성합니다.
- GPU 사용 현황 확인작업, 사용자, 노드 상태를 함께 확인합니다.
- 운영 정책 반영연구실·기관별 사용 규칙을 시스템 구성에 반영합니다.