세계적 권위 컴퓨터 아키텍처 학회
SK하이닉스, PNM 결합 ‘NELSSA’ 소개
삼성전자, HBM 로직 다이에 연산 기능 추가
메모리 중심 AI 가속기 연구 본격화
![]() |
| IEEE(국제전기전자공학회)와 ACM(미국컴퓨터학회)가 공동 주최하는 마이크로아키텍처학회는 다음달 31일부터 11월 4일까지 열린다. [출처 MICRO] |
[헤럴드경제=이정완 기자] 삼성전자와 SK하이닉스가 다음달 그리스 아테네에서 열리는 세계적 컴퓨터 아키텍처 학회에서 인공지능(AI) 추론의 부담을 덜어줄 차세대 메모리 기술을 소개한다. 그래픽처리장치(GPU)에 집중된 연산 기능을 메모리가 일부 분담하는 게 핵심이다.
25일 업계에 따르면 다음달 31일부터 11월 4일까지 열리는 ‘마이크로(MICRO) 2026’에서 삼성전자와 SK하이닉스 연구진이 참여한 다수의 발표가 이뤄진다.
IEEE(국제전기전자공학회)와 ACM(미국컴퓨터학회)가 공동 주최하는 마이크로아키텍처학회는 반도체와 컴퓨터 아키텍처 분야에서 세계 최고 권위를 자랑한다. CPU·GPU·메모리 등의 설계와 성능 개선 기술을 주로 다룬다. 지난해 서울에서 열린 바 있는데 올해는 그리스 아테네에서 진행된다.
눈길을 끄는 건 메모리에 연산 기능을 결합한 발표다. SK하이닉스와 KAIST 연구진은 GPU와 메모리 근처 연산장치(PNM)를 결합한 대규모언어모델(LLM) 서비스 시스템 ‘NELSSA(넬사)’를 소개한다.
에이전트 AI 확산에 따라 AI가 처리해야 할 문맥 길이는 수백 토큰에서 수십만 토큰까지 다양해지고 있다. 짧고 긴 요청이 동시에 들어오면 GPU 메모리가 긴 문맥의 데이터로 채워져 전체 처리 효율이 떨어질 수 있다. NELSSA는 문맥 길이에 따라 짧은 요청은 GPU로 보내고 긴 요청은 PNM으로 보내 연산 부담을 나눈다.
연구진은 NELSSA를 실제 하드웨어 시제품으로 구현했다. PNM 장치를 CXL(컴퓨트익스프레스링크) 기반 인프라로 GPU와 연결한 결과 GPU만 사용하는 시스템보다 초당 토큰 기준 디코딩 처리량이 최대 5.5배 높아졌다고 제시했다.
삼성전자는 UC샌디에이고·연세대·엔비디아 등의 연구진과 함께 참여한 ‘AMMA(A Multi-Chiplet Memory-Centric Architecture)’를 소개한다. AMMA는 고대역폭메모리(HBM)를 중심으로 연산을 처리하는 가속기 구조다. 이 역시 GPU에만 연산을 집중시키지 않고 메모리가 일부 연산을 맡는 개념이다.
긴 문맥에서 다음 토큰을 생성하려면 메모리에 저장된 과거 정보를 반복해서 읽어야 한다. 이 과정에서는 GPU의 계산 능력보다 메모리에서 데이터를 가져오는 속도가 성능을 제한할 수 있다. AMMA는 GPU의 연산 다이를 HBM-PNM으로 대체해 메모리 대역폭을 높인다.
이 역시 시뮬레이션 결과 GPU만 사용했을 때보다 개선된 성능을 확인할 수 있었다. 엔비디아 H100 GPU 대비 연산 작업 지연 시간을 16분의 1로 줄일 수 있었다. 에너지 소비도 7분의 1로 줄었다.
두 회사는 이 밖에도 GPU 홀로 연산을 담당하지 않는 다양한 기술을 선보인다. SK하이닉스 연구진이 참여한 ‘C3’는 CPU와 범용 D램의 협력으로 LLM 연산을 가속하는 연구다. ‘DUALign’은 PNM 기반 LLM 서비스에서 데이터를 연산기 근처에 효율적으로 배치하는 문제를 다룬다.
삼성전자 연구진이 참여한 ‘SYMPHONY’는 3D D램 가속기에서 LLM 추론의 메모리 처리와 통신을 최적화하는 연구다. KAIST 연구진과 함께한 발표에선 LLM 시스템의 연산과 통신을 가능한 범위 내에서 함께 실행하는 연구 내용을 소개한다. 계산이 끝나고 통신하면 다음 계산까지 기다리는 시간이 필요한 만큼 시스템 효율을 높이기 위한 구상이다.

