서버에 들어갈 카드가 생겼다. 국산 NPU다. 그럼 기존 GPU를 뽑고 같은 자리에 끼우면 끝일까. 컴퓨터 부품 교체처럼 들리지만 실제로는 서버가 맡은 작업부터 뜯어봐야 한다. 모델을 처음 학습시키는 일과 만들어진 모델로 이용자에게 답을 내놓는 일은 요구하는 계산과 메모리, 도구가 다르다. 칩의 이름으로 일을 결정하면 순서가 뒤집힌다.
GPU는 그래픽 처리에서 시작했지만 대규모 병렬 계산과 넓은 소프트웨어 지원 덕에 AI 학습과 추론에 모두 쓰인다. NPU는 신경망 계산에 맞춰 설계한다. 특정 모델과 계산 정밀도, 동시에 들어오는 요청의 양에 맞으면 추론에서 전력이나 비용을 아낄 가능성이 있다. 그러나 지원하지 않는 연산이 하나 끼거나 메모리에 모델이 다 올라가지 않으면 성능표의 숫자는 작업대 위에서 힘을 못 쓴다.
속도계 하나로는 견적을 못 낸다
칩이 초당 수행하는 연산량은 재료의 강도표 같은 것이다. 완성된 서버가 일을 잘하는지는 따로 봐야 한다. 첫 답변까지 걸리는 시간, 여러 사람이 동시에 접속할 때 처리량, 실제 소비전력과 서버 대수, 고장 때 복구 방법을 같은 조건에서 비교해야 한다. NPU 자체의 단가가 낮아도 모델 변환과 운영 인력을 더 써야 하면 총비용이 뒤집힌다. 반대로 반복되는 추론 업무에 딱 맞추면 GPU 자원을 다른 작업에 돌릴 수 있다.
과학기술정보통신부는 독자 AI 파운데이션 모델 사업의 평가에서 업스테이지와 퓨리오사AI NPU가 실제 다음 서비스 환경에서 실증된 점을 언급했다. ‘실증’은 시험 환경을 실제 서비스에 붙여 가능성을 확인한다는 말이다. 모든 서비스에서 GPU를 이미 빼냈다는 뜻이 아니다. 정부는 같은 발표에서 고성능 GPU 지원을 확대하겠다고 했다. NPU 도입과 GPU 확보가 함께 진행되는 게 현장의 구성이다.
바꾸려면 모델부터 갖고 와야 한다
어떤 모델을 몇 명이 쓰는지, 답변 지연 허용치가 얼마인지 먼저 고정한다. 같은 요청 묶음을 GPU 서버와 NPU 서버에 각각 넣고 품질·속도·전력·장애 대응을 재야 비교가 된다. 모델 구조가 바뀌거나 요청 규모가 달라질 때의 재시험 비용도 넣는다. ‘GPU 대체율’ 하나만 발표하고 기준 모델과 작업량이 없다면 어떤 서버에서 가능한 얘긴지 알 수 없다.
소프트웨어도 설비의 일부다. 모델을 다른 칩에 올리려면 연산을 변환하고 답의 품질이 유지되는지 확인해야 한다. 메모리나 대역폭이 모자라면 여러 서버로 나눠야 하고, 그 사이 통신 비용이 생긴다. 칩을 꽂는 물리적 시간보다 지원 도구를 갖춰 운영하는 시간이 더 긴 경우도 있다. 성능이 나온 한 번의 시연과 매일 장애 없이 돌아가는 서비스는 다르다. 업체가 제시한 처리량도 모델 크기, 정밀도, 배치 조건을 함께 적어야 읽을 수 있다. 같은 숫자라도 요청을 하나씩 받는 상담 서비스와 한꺼번에 수천 건을 처리하는 작업에는 체감이 달라진다. 장비를 주문하기 전 서버 전체의 비용과 운영 조건을 견적서에 함께 올려야 한다.
국산 칩을 육성하면 공급망과 개발 도구를 넓힐 여지는 있다. 그래도 서버 구매의 마지막 기준은 실제 내 작업의 성적표다. 훈련 서버와 추론 서버를 한데 묶어 ‘GPU 전면 대체’라고 쓰면 설비를 뜯어보지도 않고 폐기 순서를 정한 셈이다. 맞는 추론 작업부터 시험해 보면 된다.
출처: https://english.msit.go.kr/eng/bbs/view.do?bbsSeqNo=42&mId=4&mPid=2&nttSeqNo=1292&sCode=eng ; https://www.msit.go.kr/eng/bbs/view.do?bbsSeqNo=42&mId=4&mPid=2&nttSeqNo=1163&sCode=eng




















댓글 남기기