Engi's Conpaper delivers stories about all the topics that are becoming global issues. 엔지의 콘페이퍼는 세상의 이슈가 되는 모든 토픽 이야기들을 전달합니다

AI 추론 혁명이 도래했습니다! The AI Inference Revolution Is Here

The AI Inference Revolution Is Here
Today’s tidal wave of queries is forcing hardware makers to pivot


오늘날 쏟아지는 문의 폭증으로 
하드웨어 제조업체들은 방향을 전환해야만 하고 있습니다.

* 추론(Inference)
이미 알고 있는 사실이나 전제를 바탕으로 논리적 결론을 이끌어내는 사고 과정입니다

2020년경부터 인공지능(AI)은 주로 더 크고 더 나은 모델을 훈련하는 데 집중해 왔습니다. 

대규모 언어 모델(LLM)은 수백만 개의 매개변수에서 수조 개의 매개변수로 급증했습니다. 이러한 노력은 효과적임이 입증되었습니다. 2020년에 출시된 OpenAI의 GPT-3의 가장 큰 버전은 유명한 지식 및 추론 벤치마크에서 단 43.9%의 정답률을 기록했습니다 . 그러나 불과 4년 후, GPT-40은 동일한 시험에서 88.7%의 정답률을 달성하여 인간 전문가와 거의 동일한 수준에 도달했습니다.

첨단 AI 연구소들은 여전히 ​​점점 더 큰 모델을 훈련시키고 있지만, 그 훈련 자체는 AI 논의에서 다소 뒷전으로 밀려났습니다. 2026년에는 추론, 즉 훈련된 모델을 사용하여 코드를 생성하고, 에세이를 쓰고, 심지어는 우리 자신의 모습을 엘프 이미지로 만드는 것이 AI의 핵심으로 떠오를 것입니다.

무어 인사이트 앤 스트래티지(Moor Insights & Strategy)의 수석 데이터 센터 분석가인 맷 킴볼 은 "마치 훈련이 구시대적인 이야기가 된 것 같다"며 "모든 최고정보책임자(CIO)들이 이야기하고 싶어하는 것은 추론뿐"이라고 말했습니다. 엔비디아 CEO 젠슨 황은 회사 GTC 2026 컨퍼런스에서 이러한 변화를 " 추론의 변곡점 "이라고 강조했습니다.

이러한 변화의 원인 중 하나는 매우 간단합니다. 논리 모델(LLM)이 유용해지면서 사람들이 이를 사용하기 시작했기 때문입니다. 게다가 오늘날 시장에 나와 있는 많은 모델은 추론 모델입니다. 이러한 모델은 사용자의 질문에 한 번만 응답하는 것이 아니라 여러 번 추론을 실행하며, ' 사고의 연쇄' 라고 불리는 과정을 통해 스스로에게 질문을 던집니다 . 추론 모델은 더 긴 출력을 생성하며, 추론 노력이 많이 드는 모델은 노력이 적거나 전혀 들지 않는 모델보다 최대 20배 더 많은 텍스트를 생성할 수 있습니다. 전 세계 추론 작업량을 더욱 증가시키는 요인으로, 에이전트형 AI 의 등장 으로 추론은 사용자의 질문에 대한 실시간 응답뿐만 아니라 사용자가 정의한 목표를 향해 자율적으로 작동하며 24시간 내내 실행됩니다.

반사되는 검은색 표면을 가진 안나푸르나 랩스 금속 프로세서 칩의 근접 사진 아마존의 트레이니움 칩은 원래 AI 학습용으로 설계되었습니다. 그러나 아마존 웹 서비스(AWS)는 AI 추론을 두 부분으로 나누어, 트레이니움은 연산량이 더 많은 부분을 담당하고, 세레브라스의 웨이퍼 스케일 엔진은 메모리 사용량이 더 많은 부분을 담당하도록 했습니다 .

반사되는 검은색 표면을 가진 안나푸르나 랩스 금속 프로세서 칩의 근접 사진 아마존의 트레이니움 칩은 원래 AI 학습용으로 설계되었습니다. 그러나 아마존 웹 서비스(AWS)는 AI 추론을 두 부분으로 나누어, 트레이니움은 연산량이 더 많은 부분을 담당하고, 세레브라스의 웨이퍼 스케일 엔진은 메모리 사용량이 더 많은 부분을 담당하도록 했습니다

추론 수요의 폭발적인 증가는 기술 대기업들 간의 예상치 못한 동맹으로 이어졌습니다. 아마존은 자체적으로 트레이니움 칩을 보유 하고 있음에도 불구하고, 오픈AI 와 아마존은 세레브라스 가 설계한 접시 크기의 칩을 배포했습니다 . 엔비디아는 논란이 많은 200억 달러 규모의 거래를 통해 AI 추론 스타트업 그록 의 핵심 인재와 지적 재산을 인수했습니다 . 그리고 앤트로픽은 LLM의 경쟁사인 스페이스XAI에 매달 10억 달러 이상을 지불하고 남는 컴퓨팅 자원을 임대하고 있습니다 .

겉보기에는 비슷해 보일지 몰라도, AI 학습과 AI 추론은 연산 방식이 다릅니다. 이러한 거대 기술 기업들의 움직임은 추론 수요를 충족하기 위해서는 불과 몇 년 전 전문가들이 예상했던 것과는 완전히 다른 하드웨어 구성이 필요할 것임을 시사합니다.

인공지능 추론은 인공지능 학습과 어떻게 다른가?
훈련되지 않은 LLM은 테이블 위에 뒤죽박죽 섞인 스크래블 타일과 같습니다. 하지만 낱장 글자 대신 단어의 조각인 토큰이 타일에 표시되어 있습니다. 거의 모든 것을 쓸 수 있는 모든 요소가 있지만, 그 어떤 것도 의미가 통하지 않습니다.

모델 훈련은 대규모 추측 게임을 통해 이 뒤죽박죽된 텍스트를 정리하는 과정입니다. 모델에게는 다음 단어가 숨겨진 실제 텍스트가 제시되고, 다음에 무엇이 올지 예측하도록 요청합니다. 각 예측 후에는 정답이 공개되고, 예측과 비교하여 그 차이를 통해 모델의 정확도를 계산합니다. 이 게임은 단일 문장이 아니라 수십억 개의 텍스트에 걸쳐 진행됩니다.

스크래블 게임은 감자칩 한 봉지와 음료 몇 잔만 있으면 즐길 수 있지만, AI 학습은 엄청난 연산 능력을 요구합니다. 모델은 역전파라는 과정을 통해 매개변수를 업데이트하는데, 이 과정은 수십억, 수조 개에 달하는 모델의 각 매개변수가 다음 예측을 개선하기 위해 어떻게 변화해야 하는지 반복적으로 계산합니다. 이것이 바로 거대 기술 기업들이 그 어느 때보다 더 큰 데이터 센터를 구축하는 이유입니다 .

결국 모델 개발자는 추가 학습이 비용 대비 효과가 없다고 판단하고, 추측 게임은 끝납니다. 역전파가 종료되고 매개변수가 고정되며, LLM은 사전 학습된 모델이 됩니다. 미세 조정(더 작고 특화된 데이터로 짧은 학습을 실행하는 과정)을 통해 최종적인 미세 조정이 이루어지고, 모델이 배포됩니다.

검은 배경 위에 무지개색 회로가 있는 금색 컴퓨터 칩을 클로즈업한 사진.엔비디아의 Groq 3 언어 처리 장치는 온칩 SRAM 메모리와 연산 블록을 필요한 순서대로 칩에 배치하여 데이터 이동을 최소화합니다.엔비디아

다음은 추론 단계입니다. 이 단계는 학습을 마친 모델을 사용하여 스크래블 타일(토큰)을 논리적인 순서로 출력하는 과정을 실행하는 것입니다.

AI 추론은 매개변수 업데이트에 사용되는 역전파 계산이 제거되므로 계산 부담이 적다고 생각할 수 있습니다. 하지만 추론 하드웨어 회사인 d-Matrix 의 창립자이자 CTO인 수딥 보자는 추론이 오히려 새로운 과제를 추가한다고 설명합니다.

이 모델들은 본질적으로 "자기회귀"적입니다. 즉, 다음 출력은 이전 출력에 따라 달라집니다. 보야는 "다음 토큰을 생성하려면 이전 토큰의 모든 가중치와 컨텍스트를 읽어야 합니다."라고 설명합니다. 컨텍스트에는 모든 프롬프트, LLM의 모든 응답, 그리고 업로드한 모든 파일이 포함됩니다. 방대한 데이터와 상당한 처리량이 필요합니다.

LLM(언어 학습 모델)은 사전 채우기(prefill)와 디코딩(decode)의 두 단계를 거쳐 응답을 생성합니다. 사전 채우기는 모델이 프롬프트를 읽는 단계입니다. 모델은 모든 토큰을 한 번에 처리하며, 각 토큰이 다른 모든 토큰과 어떻게 관련되는지 계산합니다. 이 작업을 ' 어텐션(attention)' 이라고 하며 , 이는 현대 LLM의 기반이 되는 트랜스포머 아키텍처의 핵심 특징입니다. 어텐션 덕분에 모델은 단어 자체에 반응하는 것이 아니라 문장, 단락, 더 넓은 맥락 속에서 단어를 인식하고 반응할 수 있습니다. 마치 스크래블 게임을 하기 전에 타일을 배열하는 것과 같습니다. 많은 플레이어가 타일을 이리저리 움직여보며 어떻게 연결될지 상상합니다. 셀프 어텐션(self-attention)도 이와 유사한 역할을 하지만, 물리적인 타일을 움직이는 대신 각 토큰이 다른 토큰에 쿼리를 보내고 토큰의 관련성을 나타내는 점수를 받습니다.

이러한 쿼리는 키와 값이라는 두 가지 유형의 벡터를 생성합니다. 이 벡터들은 일반적으로 KV 캐시라는 저장소에 저장됩니다. 모델이 새로운 토큰을 생성할 때마다 이러한 벡터를 다시 계산할 수도 있으므로 반드시 필요한 것은 아닙니다. 하지만 거의 모든 LLM(언어 학습 모델)은 연산량을 줄이기 위해 KV 캐시를 사용합니다. KV 캐시는 메모리에 저장되며, LLM이 대화를 이해하기 위해 참조할 수 있는 임시 저장소 역할을 합니다. 처음에는 작은 크기이지만, 수십 기가바이트까지 커질 수 있습니다.

사전 채우기는 쉽게 분할하여 병렬로 처리할 수 있는 문제입니다. 이것이 바로 LLM(로컬 메모리)의 인기가 급증하면서 GPU가 주요 AI 가속기로 자리 잡게 된 이유입니다. 그래픽 래스터화(화면의 모든 픽셀 색상을 계산하는 작업) 또한 대규모 병렬 처리가 가능하므로 GPU 아키텍처는 자연스러운 선택이었습니다.

장갑 낀 손이 커다란 금색 컴퓨터 프로세서 웨이퍼를 잡고 있다.세레브라스의 웨이퍼 스케일 엔진 칩은 메모리와 연산 장치를 모두 접시 크기의 칩에 나란히 배치함으로써 메모리 대역폭을 극대화합니다.

대뇌
다음은 디코딩 단계입니다. 이 단계에서 모델은 토큰을 하나씩 순차적으로 생성합니다. 각 단계에서 가장 최근 토큰을 가져와 키-값 캐시에 있는 모든 토큰과 비교하고, 이 정보를 사용하여 다음 토큰을 예측한 다음, 새 토큰의 키와 값을 캐시에 추가합니다. 그런 다음 이 과정을 토큰별로 순차적으로 반복합니다.

바로 이 부분에서 모델의 자기회귀적 특성이 추론 속도에 악영향을 미칩니다. 각 토큰을 예측하려면 메모리에서 전체 모델을 읽어와야 하는데, 이 모델은 수십에서 수백 기가바이트에 달하는 파라미터(모델이 학습 과정에서 얻은 정보를 나타내는 숫자)로 구성됩니다. 더욱 중요한 것은, 여기에 키-값(KV) 캐시를 저장하는 데 필요한 메모리 용량이 추가된다는 점입니다.

결과적으로, 이 모든 데이터가 메모리를 통과하는 데에는 추론 하드웨어가 사용할 수 있는 대역폭보다 더 많은 대역폭이 필요한 경우가 많습니다. 따라서 GPU의 컴퓨팅 부분 중 적어도 일부는 데이터를 기다리는 동안 유휴 상태로 있게 됩니다. 연구원들은 오픈 소스 LLM을 실행하는 Nvidia H100 GPU가 시간의 50~80% 동안 유휴 상태에 있다는 사실을 발견했습니다 .

추론에서 기억의 역할
메타(Meta)의 실리콘 엔지니어링 책임자를 역임하고 AI 스타트업 매제 스틱 랩스(Majestic Labs) 의 공동 창업자인 샤리아르 "샤" 라비(Shahriar "Sha" Rabii) 는 유휴 프로세서 때문에 많은 기업들이 AI 추론 성능 향상을 위해 메모리에 집중하고 있다고 말합니다. 그는 "GPU 기반 접근 방식에서는 컴퓨팅 자원을 과도하게 할당하는 반면 메모리는 부족해지는 문제가 발생합니다. 이것이 바로 대규모 메모리 확장을 요구하는 이유입니다."라고 설명합니다.

보야의 d-Matrix와 라비의 Majestic Labs는 모두 이러한 메모리 병목 현상에 초점을 맞추고 있습니다. 하지만 두 회사는 서로 다른 해결책을 구상하고 있습니다.

d-Matrix의 2세대 AI 가속기인 Raptor 는 컴퓨팅과 메모리 간의 거리를 최소화하여 추론 성능을 향상시키는 것을 목표로 합니다. 현재 대부분의 AI 추론 환경에서 사용되는 GPU는 고대역폭 메모리(HBM)를 GPU 주변에 배치하여 이를 구현합니다. 각 HBM은 DRAM 다이를 쌓아 올려 초고속 인터페이스를 통해 GPU에 연결한 구조입니다. 이는 학습에는 효과적이지만, 추론의 경우 이러한 방식으로 쌓을 수 있는 메모리 용량과 제공할 수 있는 대역폭에는 한계가 있습니다.

d-Matrix의 적층형 다이 아키텍처
기판 상에 솔더 범프로 연결된 적층형 로직 칩과 DRAM 칩의 다이어그램메모리 대역폭, 즉 메모리에서 로직으로 데이터를 읽어오는 속도는 AI 추론의 주요 병목 현상입니다. 스타트업 d-Matrix는 로직 다이를 메모리(이 경우 DRAM) 위에 직접 쌓아 올려 이 대역폭을 향상시키고 있습니다. 이를 통해 매우 짧은 상호 연결을 많이 사용할 수 있습니다.크리스 필팟

d-Matrix의 Raptor는 DRAM 다이에 AI 가속기를 쌓아 올려 이러한 병목 현상을 해결합니다. 메모리를 쌓는 대신, d-Matrix는 메모리와 연산 기능을 함께 쌓습니다. 보자는 이를 통해 데이터 이동 거리가 "밀리미터가 아닌 마이크로미터" 수준으로 줄어든다고 설명합니다. 마치 고층 빌딩을 짓는 것처럼, 수직으로 쌓아 올리면 동일한 물리적 공간에서 더 많은 작업을 수행할 수 있게 됩니다.

Majestic은 정반대의 접근 방식을 취합니다. 컴퓨팅과 메모리 사이에서 데이터가 이동해야 하는 거리를 최소화하는 대신, 높은 대역폭을 유지하면서 더 긴 배선 경로를 수용할 수 있도록 메모리 인터페이스를 개선하는 데 집중합니다. 더 긴 배선을 통해 Majestic은 GPU 바로 옆에 있지 않은 메모리 스택도 연결할 수 있어 HBM의 공간 제약을 극복할 수 있습니다.

"메모리 인터페이스는 물리적으로 작동할 수 있는 거리가 매우 짧습니다. HBM의 경우 최대 2~3mm에 불과합니다. HBM을 배치할 수 있는 유일한 공간은 주변부에 형성된 해안선과 같은 영역입니다."라고 라비는 말합니다.

Majestic은 자사의 메모리 인터페이스가 약 1미터 거리까지 비트를 전송할 수 있다고 주장합니다 . 이는 독자적인 구리 링크와 데이터를 조율하는 메모리 애그리게이터 칩을 통해 구현됩니다. Rabii는 "애그리게이터는 고속 인터페이스의 종단점이며, 수많은 범용 DRAM 칩으로 데이터를 분산시키는 역할을 합니다."라고 설명합니다. 이러한 특징 덕분에 Majestic은 단일 서버 랙에서 최대 128테라바이트의 DRAM 메모리를 지원할 수 있는데, 이는 약 20TB의 HBM3E를 지원하는 Nvidia의 GB300 NVL72 랙 보다 훨씬 큰 용량입니다 .

Majestic Labs의 메모리 집계 아키텍처
서버 GPU/CPU를 공유 DRAM 풀에 연결하는 메모리 애그리게이터 칩렛 다이어그램Majestic Labs는 독자적인 인터커넥트와 메모리 통합 칩을 통해 AI의 메모리 수요를 충족할 계획이며, 이를 통해 단일 랙에서 최대 128테라바이트의 저렴한 DRAM 메모리에 접근할 수 있게 됩니다.크리스 필팟

d-Matrix와 Majestic은 한 가지 공통점을 가지고 있습니다. 바로 HBM 대신 시중에서 구할 수 있는 DRAM을 사용한다는 점입니다. DRAM은 전 세계에서 가장 흔한 컴퓨터 메모리 유형으로, 스마트폰부터 자동차에 이르기까지 모든 곳에 사용됩니다. 메모리 분석가인 짐 핸디에 따르면 HBM은 DRAM보다 2~3배 비쌉니다. d-Matrix와 Majestic이 DRAM을 선택한 이유 중 하나는 바로 이러한 가격 경쟁력 때문입니다. 하지만 삼성 과 SK 하이닉스 같은 메모리 업계의 거물들을 포함한 HBM 지지자들은 가만히 있지 않고 있습니다.

최신 버전의 HBM 메모리인 HBM4가 현재 생산 중이며, 2026년 하반기 출시 예정인 엔비디아의 베라 루빈 GPU 에 사용될 예정입니다 . SK 하이닉스 의 메모리 시스템 연구 책임자인 김호식은 HBM4가 HBM의 최대 메모리 대역폭을 두 배로 늘리고 스택당 HBM 메모리 용량을 증가시켜 "현재 AI 추론을 제약하는 메모리 병목 현상을 결정적으로 해소할 것"이라고 밝혔습니다.

더 빠른 추론을 위한 칩 결합
엔비디아와 아마존 같은 주요 업체들은 모든 칩을 총동원하는 전략을 택하고 있습니다. 엔비디아의 GPU와 아마존의 트레이니움(Trainium) 학습 가속기는 추론 작업 부하의 일부, 즉 모든 컨텍스트 키와 값을 계산하는 사전 채우기 단계에서는 여전히 뛰어난 성능을 발휘합니다. 하지만 새로운 토큰을 생성하는 디코딩 단계의 속도를 높이기 위해서는 소규모 업체들이 개발한 메모리 중심의 새로운 아키텍처에 주목하고 있습니다.

엔비디아의 경우, 상대적으로 규모가 작은 업체는 Groq였습니다(SpaceXAI가 훈련시킨 LLM 제품군인 Grok과는 다른 회사입니다). 엔비디아는 2025년 말 Groq의 지적 재산권을 인수하고 인재를 영입했으며, 불과 3개월 후 엔비디아의 GTC 2026 컨퍼런스에서 젠슨 황 CEO는 엔비디아 Groq 3 언어 처리 장치( LPU )를 공개했습니다 . Groq의 아키텍처는 칩 아키텍처에 직접 내장된 메모리(이 경우 SRAM)에 의존합니다.

칩 설계자나 열성적인 PC 게이머 가 아니라면 SRAM에 대해 생각해 본 적이 없을 것입니다. SRAM은 컴퓨팅 칩 아키텍처에 긴밀하게 통합되어 프로세서와 동일한 실리콘 칩에 존재한다는 장점이 있지만, DRAM보다 밀도가 낮고 가격이 비싸다는 단점이 있습니다. 대부분의 칩에는 수십 메가바이트 정도의 SRAM만 포함되어 있습니다. 하지만 AI 추론 분야에서 메모리에 저장된 모델 가중치를 연산 영역으로 더 가까이 가져오는 수단으로 SRAM에 대한 관심이 새롭게 대두되고 있습니다.

엔비디아 의 하이퍼스케일 및 고성능 컴퓨팅 부문 부사장 겸 총괄 매니저인 이안 벅은 LPU가 자사의 GPU와는 완전히 다른 우선순위를 가지고 있다고 말합니다. LPU는 표준 GPU보다 순수 연산 능력은 훨씬 떨어지지만, 부동 소수점 연산 장치에 직접 연결된 500MB의 온칩 SRAM을 갖추고 있습니다. 그는 "핵심은 메모리 대역폭입니다. LPU는 GPU보다 7배 빠른 메모리 대역폭을 제공합니다."라고 설명합니다.

이론적으로는 Rubin GPU와 Groq LPU를 활용하여 사전 채우기(prefill)와 디코딩(decode) 작업을 모두 가속화함으로써 두 가지 장점을 모두 활용할 수 있습니다. Buck은 "모든 어텐션 연산과 컨텍스트 처리는 Vera Rubin [GPU] 랙에서 수행합니다."라고 설명하며, "모든 전문적인 계산, 즉 행렬 곱셈은 LPU에서 처리합니다."라고 덧붙였습니다. 이 회사는 데이터 센터 랙 크기의 시스템인 Groq 3 LPX에 256개의 LPU를 탑재했습니다.


엔비디아의 추론을 위한 두 개의 칩 접근 방식
엔비디아 루빈 GPU와 그로크 3 LPU 칩 레이아웃을 블록별로 비교한 다이어그램엔비디아는 추론 작업 부하를 두 개의 칩으로 분산시킬 계획입니다. 회사의 최신 Rubin GPU는 연산 집약적인 사전 채우기 단계를 처리하고, 온칩 SRAM이 풍부한 Groq 3 언어 처리 장치(LPU)는 메모리 집약적인 디코딩 단계를 처리할 것입니다.크리스 필팟

아마존 웹 서비스(AWS)는 세레브라스 (Cerebras) 와 계약을 체결하여 트레이니움(Trainium) 가속기를 세레브라스의 웨이퍼 스케일 엔진 3(WSE-3) 과 결합 했습니다. 세레브라스는 그로크(Groq)와 유사한 접근 방식을 취하지만 훨씬 더 큰 규모로 구현합니다. WSE-3는 실리콘 웨이퍼 전체를 4조 개 이상의 트랜지스터를 포함하는 단일 칩으로 변환합니다. 이 설계는 외부 메모리에 연결되지 않고 대신 각 웨이퍼에 44기가바이트의 SRAM을 내장합니다. 세레브라스에서 제품 마케팅 이사를 역임하다 현재 스페이스XAI로 이직한 제임스 왕 (James Wang) 은 "모델 가중치를 SRAM에 저장합니다 ."라고 말하며, "따라서 하나의 칩에서 400억에서 최대 800억 개의 파라미터를 지원할 수 있습니다."라고 덧붙였습니다.

아마존은 AWS Trainium 칩을 사전 데이터 입력에, Cerebras 칩을 디코딩에 사용할 계획입니다. 하지만 Cerebras 칩 자체만으로도 추론 작업을 수행할 수 있습니다. OpenAI는 WSE-3 칩을 GPT-5.3-Codex-Spark에 적용하여 초당 1,000개 이상의 토큰을 생성하는 코딩 모드를 구현했습니다. 참고로 OpenAI의 표준 GPT-5.4는 초당 50~125개의 토큰을 생성합니다.

아마존 웹 서비스의 투칩 추론 전략 
왼쪽은 아마존의 트레이니움 칩 개략도로, SRAM 메모리 블록과 논리 블록, 그리고 고대역폭 메모리가 포함되어 있습니다. 오른쪽은 세레브라스의 웨이퍼 스케일 엔진 개략도로, 소형 SRAM 메모리와 논리 블록이 바둑판 무늬로 배열되어 있습니다.아마존 웹 서비스(AWS)는 자사의 트레이니움(Trainium) 칩과 세레브라스(Cerebras)의 접시 크기만 한 웨이퍼 스케일 엔진(WSE)을 결합하여 AI 추론의 여러 부분을 처리합니다. 트레이니움 칩은 연산 집약적인 사전 채우기(prefill) 단계를 담당하고, 온칩 SRAM 메모리가 인터리브 방식으로 배치된 WSE는 메모리 대역폭이 제한적인 디코딩(decode) 단계를 처리합니다.크리스 필팟

세레브라스는 워크로드를 별도의 특수 칩으로 이동시키지 않고도 프리필(prefill) 작업을 처리할 수 있습니다. 이를 위해 여러 개의 WSE-3 칩을 네트워크로 연결하여 단일 메모리 풀을 구성합니다. 세레브라스는 문샷 AI의 키미 2.6과 같이 최대 1테라(1T)의 파라미터를 가진 모델을 처리할 수 있음을 입증했지만, 왕 대표는 "아키텍처 자체에는 처리할 수 있는 파라미터 수에 대한 내재적인 제한이 없다"고 말합니다.

이러한 전략적 차이에도 불구하고, 엔비디아와 AWS는 인공지능 추론의 미래는 다양한 종류의 칩을 결합하여 가장 큰 규모의 LLM(Long-Term Memory) 문제를 해결하는 시스템적 접근 방식에 달려 있다는 데 동의하는 듯합니다. 벅의 말처럼, "현대적인 인공지능 추론을 위해서는 모든 종류의 칩이 필요합니다."

더 적은 비트로 더 많은 것을 하는 법 배우기
엔비디아는 세계에서 가장 탐나는 GPU를 설계했기에 세계에서 가장 가치 있는 기술 기업이 되었습니다. 하지만 모든 관심이 AI 추론 하드웨어 개선에만 집중된 것은 아닙니다. AI 연구자들은 메모리와 컴퓨팅 구성 요소를 최대한 활용하기 위해 LLM 소프트웨어와 하드웨어를 함께 최적화하는 방법도 연구하고 있습니다.

대부분의 컴퓨터는 숫자를 32비트 또는 64비트 형식으로 저장합니다. 이 형식은 하나의 숫자를 표현하는 데 사용할 수 있는 비트 수를 결정합니다. 사용 가능한 비트 수가 너무 적으면 정보 손실 없이 숫자를 저장할 수 없습니다. LLM(로지스틱 회귀 모델)의 품질은 더 정밀한 숫자 형식을 사용할수록 향상되지만, 이는 추론 성능에 문제를 야기합니다. 더 정밀한 숫자는 비용이 많이 듭니다. 숫자를 나타내는 비트는 메모리 공간을 더 많이 차지하고 계산에 더 많은 칩과 에너지를 필요로 합니다.

AI 가속기 회사인 텐서다인 의 공동 창립자 질 백후스는 이로 인해 모델 크기와 수치 정밀도 사이에 긴장 관계가 발생한다고 말합니다. "크기가 x 이지만 8비트로 실행되는 모델을 선호하시겠습니까, 아니면 크기가 두 배이지만 4비트로 실행되는 모델을 선호하시겠습니까?" 두 모델의 크기는 메모리와 연산량 측면에서 거의 동일하지만, "4비트 방식은 말하자면 두 배 더 많은 시냅스를 제공합니다. 그리고 사람들은 4비트 방식이 그만한 가치가 있다는 것을 깨닫고 있습니다."

LLM(로지스틱 모델)을 보다 정밀한 숫자 형식에서 덜 정밀한 형식으로 변환하는 과정을 양자화 라고 하며 , 이는 수년 동안 사용되어 왔습니다. 그러나 연구자들은 모델의 품질을 대부분 유지하면서 모델을 양자화하는 새로운 방법을 발견하고 있습니다.

엔비디아는 최근 이러한 목적을 위해 새로운 4비트 숫자 형식인 NVFP4를 개발했습니다. AMD , 인텔 , 퀄컴은 엔비디아가 개발에 참여한 경쟁 4비트 숫자 형식인 MXFP4를 중심으로 경쟁하고 있습니다 . 엔비디아의 버크는 이를 "인공지능의 블랙홀"이라고 표현했습니다. 엔비디아에 따르면, DeepSeek-R1을 FP8에서 NVFP4로 양자화했을 때 7가지 주요 벤치마크 점수는 1% 미만으로 저하되었지만 성능은 3배 향상되었습니다 .

양자화는 빙산의 일각에 불과할 가능성이 높으며, AI 연구원과 스타트업들은 최적화를 위한 다양한 기회를 모색하고 있는데, 그중 일부는 AI 추론 하드웨어에 사용되는 실리콘을 획기적으로 변화시킬 수 있습니다.

검은색 기판에 중앙 녹색 프로세서 코어가 있는 TENSORDYNE TDN AIP 칩 텐서 다인 의 독창적인 AI 추론 방식은 로그 숫자 형식과 회사 고유의 네이피어 칩 하드웨어를 결합한 것입니다.

텐서다인은 로그의 속성, 즉 A와 B의 로그 곱하기는 A의 로그 더하기 B의 로그라는 사실을 활용한 로그 기반 숫자 시스템을 통해 AI 추론 속도를 높일 것으로 예상됩니다 . 숫자를 지수로 저장함으로써 칩은 곱셈 대신 덧셈을 수행할 수 있습니다. 이는 칩 성능에 중요한데, 곱셈 회로는 덧셈 회로보다 전력 소모가 많고 칩 면적도 더 많이 차지하기 때문입니다. 텐서다인은 자사의 랙 스케일 하드웨어인 네이피어(Napier)가 사용자당 초당 최대 1,300개의 토큰을 생성할 수 있으며, 동급 엔비디아 하드웨어보다 전력 소모가 1/10 도 안 된다고 밝혔습니다 .

캘리포니아주 산호세에 위치한 스타트업 Etched 는 LLM(Lung Evaluation Model)에서 사용되는 트랜스포머 아키텍처를 실리콘 칩에 직접 구현하는 AI 가속기를 설계하고 있습니다. 이 회사는 범용 GPU를 제작하는 대신, 효율적인 트랜스포머 계산에 필요한 연결을 칩에 내장하여 칩의 유연성은 떨어지지만 현재 LLM에서 가장 많이 수행되는 작업에 더욱 효율적으로 대응할 수 있도록 설계했습니다. Etched는 자사의 첫 번째 AI 가속기인 Sohu 가 Meta의 Llama 70B 모델을 초당 50만 토큰이라는 놀라운 속도로 실행할 수 있다고 밝혔 지만, 이러한 접근 방식은 일반적인 트랜스포머 아키텍처에서 벗어난 LLM은 실행할 수 없다는 한계도 가지고 있습니다.

이러한 아이디어들이 결실을 맺을지는 두고 봐야 합니다. Etched는 지난 8월에 첫 번째 랙을 출하했고 , Tensordyne은 2027년에 첫 번째 하드웨어를 출시할 수 있을 것으로 예상하고 있습니다. 그럼에도 불구하고, 이러한 스타트업들은 추론 성능에 대한 수요가 어떻게 기존과는 다른 아이디어들을 촉발하고 있는지를 보여줍니다.

추론은 누구나 할 수 있는 일입니다.
메모리에 연산 능력을 집약하거나, 인터페이스를 밀리미터에서 미터로 확장하거나, 실리콘 웨이퍼 전체를 SRAM에 사용하거나, 모델을 4비트로 압축하는 등 AI 추론 가속을 위한 접근 방식이 매우 다양하다는 점은 다음과 같은 질문을 제기합니다. 과연 어떤 방식이 승리하고 어떤 방식이 패배할까요?

하지만 전문가들은 그 질문이 적절하지 않을 가능성이 높다고 말합니다. 현재 AI에 대한 수요는 끊임없이 증가하고 있으며, AI 거품에 대한 우려가 업계를 휩쓸고 있지만 아직까지는 성장을 저해하지는 않고 있습니다.

반대로, Moor Insights & Strategy의 Kimball은 추론 기능이 장기적으로 AI 하드웨어에 대한 엄청난 수요를 견인할 수 있다고 생각합니다. 그 수요가 어디서 끝날지 불분명하기 때문입니다. 그는 "기업에 백만 개의 에이전트를 추가할 수도 있습니다."라고 말하며, "이러한 장치들은 24시간 내내 작동합니다. 우리처럼 오후 5시에 퇴근하는 것이 아니죠."라고 덧붙였습니다.

킴볼의 예상대로 AI 추론이 여전히 중요한 기술로 남을 것이라면, 그 발전 경로는 CPU와 유사할 가능성이 높습니다. CPU는 한 방향으로만 발전한 것이 아니라 여러 방면 에서 동시에 발전해 왔습니다. 트랜지스터 크기 축소 속도가 둔화되자, 칩과 시스템 아키텍처에 대한 혁신이 활발하게 이루어졌습니다. 오늘날 널리 보급되고 강력한 개인용 컴퓨터를 탄생시킨 개별 혁신 사례들을 나열하자면 수십 권의 책을 채울 수 있을 것입니다.

몇십 년 후, 인공지능 추론 혁신의 역사는 이와 비슷한 깊이를 보여줄 것입니다.


건설 로봇의 비약적인 발전 Construction Robots Just Took A Giant Leap Forward: Hello Holy Grail Of Robotics


댓글 없음: