NCP-AIO 문제 66

다음과 같은 데이터 센터 시나리오를 고려해 보세요. 16개의 GPU 서버에 PyTorch를 사용하여 대규모 분산 학습 작업을 배포해야 합니다. 각 서버에는 8개의 NVIDIA A100 GPU가 있습니다. 학습 데이터 세트는 1TB이며 네트워크 파일 시스템(NFS)에 저장되어 있습니다. 데이터 로딩 중에 상당한 성능 병목 현상이 발생합니다. 이 병목 현상을 완화하기 위한 가장 효과적인 전략은 무엇일까요? (두 가지를 선택하세요)

NCP-AIO 문제 67

BCM을 사용하여 NVIDIA DGX 시스템에 Kubernetes 클러스터 설치를 완료한 후 모든 워커 노드가 제대로 등록되고 준비되었는지 어떻게 확인할 수 있습니까?

NCP-AIO 문제 68

GPU 메모리를 충분히 요청했음에도 불구하고 CUDA 메모리 부족 오류로 인해 Run.ai 작업이 실패하는 문제를 해결하고 있습니다. 이 문제의 가장 가능성 높은 원인은 무엇일까요?

NCP-AIO 문제 69

대규모 학습 작업을 진행하는 동안 스토리지 시스템을 모니터링하다가 디스크 I/O 대기 시간('iowait')이 지속적으로 높게 나타나는 것을 발견했습니다. 이 지표는 무엇을 의미하며, 이를 완화하기 위해 어떤 조치를 취할 수 있을까요?

NCP-AIO 문제 70

여러 서버에 걸쳐 다수의 NVIDIA GPU를 사용하는 대규모 AI 추론 환경을 관리하고 있습니다. 전체 인프라의 GPU 사용률, 메모리 사용량 및 오류율을 추적할 수 있는 강력한 모니터링 솔루션이 필요합니다. 어떤 도구 조합이 가장 포괄적인 모니터링 기능을 제공할까요?