NCP-AIO 문제 31
시스템 관리자는 Kubernetes Job을 4개의 복제본으로 확장해야 합니다.
어떤 명령어를 사용해야 할까요?
어떤 명령어를 사용해야 할까요?
NCP-AIO 문제 32
AI 데이터 센터에서 학습 성능이 불안정한 문제가 발생하고 있습니다. 조사 결과 스토리지 I/O가 병목 현상의 원인으로 밝혀졌습니다. 다음 중 이 문제를 완화하는 데 도움이 될 수 있는 조치는 무엇입니까?
NCP-AIO 문제 33
방화벽 시스템의 액티브-패시브 고가용성(HA) 클러스터를 구성하기 위해 BCM을 사용하고 있습니다. 원활한 페일오버를 보장하기 위해 액티브 노드와 패시브 노드 간의 세션 동기화와 관련된 모범 사례는 무엇입니까?
NCP-AIO 문제 34
딥러닝 모델 학습에 필요한 데이터를 생성하기 전에 다양한 데이터 변환 단계를 거치는 BCM 데이터 파이프라인은 CPU와 GPU 리소스를 모두 사용합니다. 최근 업그레이드 후 CPU에서 실행되는 일부 단계에서 성능 저하가 발생하고 있습니다. 속도 저하를 유발하는 정확한 단계를 파악하고 리소스 사용 현황을 분석하고자 합니다. NVIDIA 환경이고 고급 프로파일링 도구를 사용할 수 없는 상황에서, 어떤 간편한 방법을 통해 성능 저하 원인을 파악할 수 있을까요?
NCP-AIO 문제 35
Kubernetes 클러스터에서 분산 TensorFlow 학습 작업을 실행하고 있습니다. 이 작업은 파라미터 서버와 여러 개의 워커 파드로 구성됩니다. GPU 활용도를 극대화하고 효율적인 통신을 보장하기 위해 파라미터 서버와 워커를 네트워크 토폴로지에서 최대한 가까운 노드에 배치하려고 합니다. 이를 달성하는 데 도움이 되는 Kubernetes 기능은 무엇일까요?
