
노르웨이의 2페타바이트 Huawei 플래시 스토리지와 주권 LLM 학습
노르웨이 국립도서관이 자국어 기반 주권(Sovereign) 대규모 언어 모델(LLM)을 구축하기 위해 2페타바이트 규모의 Huawei OceanStor Dorado 플래시 스토리지오、AI 학습 데이터 파이프라인에 투입하고 있다. 상용 LLM 제공업체가 노르웨이어 지역 언어 모델을 개발하지 않는 상황에서, 영어 중심 LLM은 지역 언어로 기록된 역사·뉴스·문화로 제대로 다루기 어렵다는 것이 핵심 배경이다.
노르웨이 국립도서관의 주권 LLM 프로젝트
노르웨이 국립도서관(Nasjonalbiblioteket)은 노르웨이어로 이해하는 대규모 언어 모델을 개발 중이며, AI 학습 데이터 파이프라인에 2PB 규모의 Huawei OceanStor Dorado 플래시 스토리지로 사용하고 있다. Marius Husnes 국립도서관 IT 플랫폼 책임자는 Huawei ID Forum 2026 Paris에서 상용 LLM 제공업체가 노르웨이어 지역 언어 LLM을 개발하지 않고 있다고 밝혔다. 자국어로 학습된 주권형 LLM이 없는 나라는 전 세계 자료와 영어 중심으로 학습된 LLM에 의존하게 되며, 이런 모델은 지역 언어로 기록된 역사, 뉴스, 문화로 제대로 알지 못한다.
노르웨이 문화부는 국립도서관에 주권 AI, 즉 LLM 구축을 맡겼다. 국립도서관은 노르웨이에서 가장 큰 디지털 책, 신문, 웹페이지 컬렉션을 보유하고 있다. 또한 출판된 모든 책과 방송 콘텐츠의 사본을 받을 권리가 있으며, 이 납본 의무는 책을 넘어 노르웨이 문화유산 전체로 수집·보존하는 역할로 확장된다.위신들과의 합의로 저작권이 있는 콘텐츠도 LLM 학습에 사용할 수 있으며, Husnes는 "민간 기업에는 이것이 없다"고 말했다.
데이터 보유량과 디지털화 기반
국립도서관은 2005년부터 컬렉션을 디지털화해 고유 데이터 20PB로 축적했다. 이 데이터는 3-2-1 방식으로 저장된다.
• 3개 사본
• 2개 미디어 유형
• 1개 오프사이트 보관
이 구조 때문에 전체 저장량은 약 60PB에 달한다. 디지털화 대상은 원문 텍스트, 소리, 동영상, 정지 이미지, 웹 콘텐츠로 포함한다. 많은 OCR 스캔이 이루지고, 대량의 메타데이터와 온라인 접근용 API도 생성되었다. 대부분의 데이터는 디지털 디스크와 테이프 아카이브로 구성된 보존 시스템에 저장된다.
아카이브에서 AI 파이프라인으로 데이터로 옮기는 문제
핵심 과제는 보존 시스템에 있는 데이터로 LLM 학습 시스템으로 전달하는 것이다. 병목은 컴퓨트가 아니라 데이터 품질, 정제, 파이프라인 처리량에 있다. 처리 과정은 국립도서관 내부 컴퓨팅 환경의 데이터 준비와 국가 슈퍼컴퓨터의 실제 학습 실행으로 나뉜다.
내부 환경은 다음 장비로 구성된다.
• Nvidia DGX H200 시스템
• 384코어 CPU 클러스터
• 총 2PB 플래시 용량의 여러 Huawei OceanStor Dorado 올플래시 어레이
Huawei 플래시 스토리지는 데이터 파이프라인과 학습 준비로 위한 저지연 스토리지로 사용된다. 파이프라인은 데이터 수집, 정제, 중복 제거, 포맷 정규화, 검증, 준비 단계로 포함한다.
학습 실행 환경: Sigma2 Olivia
파이프라인을 통과한 데이터는 실제 학습 실행을 위해 노르웨이 국가 슈퍼컴퓨터인 Sigma2 Olivia 시스템으로 전송된다. Olivia는 HPE Cray Supercomputing EX 시스템이다. 구성은 다음과 같다.
• 448개 GPU
• 64,512개 CPU 코어
• 5.3PB Cray ClusterStor E1000 스토리지 시스템
국립도서관의 온프레미스 AI 환경은 데이터로 준비하고, Olivia는 학습 실행을 담당한다.
서로 다른 스토리지 요구사항
보존 아카이브와 AI 파이프라인 스토리지는 요구사항이 다르다. 60PB 보존 시스템은 내구성과 비용에 최적화되어 있고, 빠른 I/O에는 최적화되어 있지 않다. 보존 시스템은 드문 접근을 전제로 설계되어 읽기 지연시간이 높다. AI 파이프라인 스토리지는 높은 처리량, 낮은 지연시간, 병렬 데이터 I/O로 위해 설계된다.
PB 규모 데이터셋을 아카이브에서 AI 데이터 파이프라인으로 옮기고 처리하는 방법은 팀이 직접 찾아야 했다. 아직 해결 중인 과제이다.
평가와 거버넌스의 과제
주권 노르웨이어 LLM을 평가할 표준 평가 도구가 없다. 노르웨이어에는 두 가지 문어 형태가 있고, 여러 방언과 역사적 변화가 존재한다. 국립도서관 팀은 자체 평가 도구로 구축 중이며,governance 측면에서도 주권 LLM 접근 권한을 누가 통제할지, 무엇에 사용할 수 있는지 누가 결정할지도 과제다. 이는 제도적·정치적 질문이며 쉬운 답이 없다.
유럽에서Huawei 스토리지의 실질적 역할
Huawei 스토리지는 유럽 시장에서 중요하고 실질적인 역할을 하고 있다. 주권 지역 언어 LLM을 개발하려는 국가는 Husnes와 협의하고 필요한 작업을 이해하는 것이 유익할 수 있다. 노르웨이는 영어권이 아닌 모든 국가가 마주할 문제로 다루는 작은 나라로 제시된다.
핵심 질문은 자국 언어, 문화, 역사로 반영하는 AI로 어떻게 구축할 것인가이다. AI에는 단순한 제작자뿐 아니라 관리자와 보관자가 필요하다.
실무적 시사점
이 사례에서 주목할 점은 세 가지다.
첫째, 스토리지 아키텍처의 이중성이다.PB모의 데이터로 보관하는 시스템과 AI 학습용 파이프라인은 설계 철학이 근본적으로 다르다. 장기 보존 시스템은 내구성과 비용을 우선하지만, AI 파이프라인은 처리량과 저지연을 핵심으로 한다. Norway 국립도서관은 이 두요건을 동시에 만족하기 위해 Huawei OceanStor Dorado로 AI 데이터 준비 단계에 투입했다.
둘째, 데이터 품질이 병목이라는 점이다. 컴퓨팅 자원이 충분해도, 데이터 정제와 파이프라인 처리량이 학습 효율을 결정한다. DGX H200 1대로도 학습이 가능한 이유도 충분한 고품질 데이터가 준비되어 있기 때문이다.
셋째, 주권 LLM의 의미이다. 영어 중심의 범용 LLM은 Oslo 연간 최고의 레스토랑 가이드로 몰라도, 1911년 노르웨이 소설의 문체로 모른다. 주권 LLM은 단순히 언어로 번역하는 것이 아니라, 그 언어로 기록된 문화·역사·왜곡을 온전히 이해하는 것을 목표로 한다.
핵심 요약
1. Norway 국립도서관은 20PB 자가 데이터로 보유하고 있으며, 3-2-1 백업으로 총 60PB 저장
2. 병목은 컴퓨팅이 아니라 데이터 품질과 정제 처리량이다
3. 내부 DGX H200 환경에서 데이터 준비 후, Sigma2 Olivia(448 GPU)에서 실제 학습
4. 보존 아카이브와 AI 파이프라인의 스토리지 요구사항은 근본적으로 다르다
5. 영어 중심 LLM은 지역 언어의 문화·역사로 온전히 이해하지 못한다
출처
• Blocks and Files: Norway's 2 petabytes of Huawei flash storage and LLM training
📚 출처
'AI 뉴스' 카테고리의 다른 글
| Figma 디자인 에이전트 공개 — 개발자가 알아야 할 핵심 정리 (0) | 2026.05.28 |
|---|---|
| 유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링 완벽 가이드 (0) | 2026.05.28 |
| AI 시대, 리더가 원하는 개발자란? — 코르카 AX 팀의 관점 (0) | 2026.05.27 |
| AI를 사용해 더 나은 코드를 더 천천히 작성하기 (0) | 2026.05.27 |
| Uber COO, tokenmaxxing에 쓰는 돈을 정당화하기가 점점 어려워지고 있다고 말해 (0) | 2026.05.27 |