HBF 추가한 메모리 계층 시뮬레이션
KV캐시 재사용 늘려 데이터 이동 병목 최소화
SK, HBF 표준화…삼성은 낸드 적층 기술 개발
![]() |
| 지난 8월 SK하이닉스가 샌디스크와 함께 차세대 스토리지 기술인 HBF의 첫 표준 규격을 OCP를 통해 공개했다고 밝혔다. [SK하이닉스 제공] |
[헤럴드경제=이정완 기자] 퓨리오사AI가 UC버클리 연구진과 공동으로 HBF(고대역폭플래시) 시뮬레이션 결과를 발표했다. LLM(대규모언어모델) 추론 환경에서 대용량 HBF를 추가하니 전체 작업시간이 기존 시스템 대비 최대 86% 감소했다. AI 에이전트 확산으로 인해 새로운 메모리 계층 필요성이 커지는 가운데 나온 연구라 주목을 받는다.
7일 업계에 따르면 퓨리오사AI와 UC버클리 연구진은 최근 ‘LLM 추론 서비스용 HBF 특성 분석’이란 제목의 논문을 공개했다.
연구진은 AI 에이전트 시대 도래로 인해 LLM의 추론 문맥이 길어지면서 HBF를 메모리 계층에 추가하는 시뮬레이션을 진행했다. AI의 추론이 활발해지면서 앞서 처리한 문맥의 중간 계산 결과인 KV캐시(Key-Value Cache) 저장 용량에 대한 요구가 커지고 있다.
지금까지는 HBM(고대역폭메모리) 용량이 부족하면 KV캐시를 서버 D램이나 SSD(솔리드스테이트드라이브)로 내보내야 했다. 시뮬레이션을 통해 AI 가속기 가까이에 HBF를 추가해 KV캐시 저장을 맡겼다.
![]() |
| 퓨리오사AI와 UC버클리 연구진이 활용한 H3 아키텍처. GPU당 HBM 8개+HBF 8개로 배치했다. [출처 arXiv] |
연구진은 AI 가속기 주변에 HBM 8개를 배치하고 뒤에 8개의 HBF를 연결한 가상 환경에서 LLM을 구동시켰다. 엔비디아 B200 GPU(그래픽처리장치) 연산 성능을 모델링한 시뮬레이터에서 스택당 용량은 HBM 24GB(기가바이트), HBF 375GB로 설정했다. 이 구성에서 GPU당 전체 HBM 용량은 192GB, HBF 용량은 3TB(테라바이트)에 달한다.
그 결과 전체 작업 완료 시간과 모델링한 에너지 소비량 모두 개선됐다. 대화를 길게 확장한 GLM-5.2 모델 대화 환경에서 전체 작업 완료 시간은 HBM 전용 시스템보다 86% 줄었다. 에너지 소비량도 기존 대비 60% 줄었다.
자주 사용하는 데이터나 새로 생성된 KV캐시는 HBM에 저장하지만 재사용이 예상되는 상대적으로 오래된 캐시는 HBF로 옮겨서 저장했다. KV캐시를 HBF에 더 오래 보관하고 재사용하면서 서버에서 다시 불러오거나 문맥을 재계산하는 부담을 덜 수 있었다.
최근 메모리업계는 HBM처럼 낸드 칩을 적층하는 HBF 시장 선점 경쟁에 돌입했다. 지난 8월 SK하이닉스는 OCP(Open Compute Project)를 통해 샌디스크와 함께 HBF 표준규격을 공개했다.
용량은 낸드 다이를 8단과 16단으로 쌓는 두 가지 스택 구성을 기준으로 최대 512GB까지 정의했다. 대역폭은 세 등급(Grade 1~3)으로 나눠 약 0.4TB/s에서 3.0TB/s까지 구현할 수 있도록 규정했다. 연구진도 샌디스크의 HBF 로드맵을 연구 배경으로 참고하고 샌디스크가 제시한 배치 구조를 비교해 시뮬레이션을 진행했다.
SK하이닉스는 HBM·서버 D램·SSD 등으로 구성된 현재 메모리·스토리지 계층에 HBF를 추가하는 방안을 추론 병목 해법으로 제시한다. 특히 HBM 대비 비용 효율을 높일 수 있다는 게 강점이다.
지난달 말 열린 헤럴드 기업포럼 2026에서 ‘AI(인공지능) 시대, 결국 메모리가 핵심이다’라는 주제로 발표한 임의철 SK하이닉스 설루션 AT 담당 부사장은 HBF에 대해 “HBM에 버금가는 대역폭과 낸드플래시에 버금가는 용량을 제공해 더 저렴한 가격에 처리량을 높이는 방향으로 생각하고 있다“고 설명했다.
삼성전자도 이름은 다르지만 낸드 칩을 수직으로 쌓는 차세대 기술을 개발하고 있다. 지난 8월 열린 미국 ‘FMS(Future of Memory and Storage) 2026’에서 온디바이스 AI에 최적화된 ‘zNAND-O(z낸드-O)’ 목업을 공개했다. 기존 V-NAND 기술에 ‘TSV(실리콘관통전극)’를 결합해 반도체 칩을 4단·8단으로 3D 패키징하는 방식이다.


