마이크로소프트, AI 인프라를 유용한 지능으로 바꾸는 수율 과제 제시

 

마이크로소프트 애저 하드웨어 시스템 및 인프라 사장 라니 보르카르는 2026년 9월 1일 공식 블로그에서, AI 인프라의 다음 척도를 칩과 토큰의 용량이 아니라 유용한 지능의 수율로 보자고 제안했다. 얼마나 넣었느냐보다 그 인프라에서 실제로 쓸 수 있는 지능이 얼마나 나왔느냐를 묻자는 주장이다. 컨버지 다이제스트 보도에 따르면 같은 문제의식은 세미콘 타이완 2026 발표에서도 수율 과제라는 이름으로 나왔다.

수율이 묻는 것, 용량이 묻는 것

반도체 업계에는 설계가 얼마나 우아한지, 몇 년이 걸렸는지, 로드맵이 무엇을 약속했는지를 제쳐 두고 성과를 재는 말이 있다. 수율이다. 보르카르는 그 질문을 짧게 옮긴다. 유용한 산출을 얼마나 만들었는가. 60년 넘게 이 업계는 웨이퍼마다 쓸 수 있는 칩을 늘리는 쪽으로 그 질문을 밀어붙였고, 그 규율이 실험실의 트랜지스터를 현대 생활의 토대로 바꾸었다고 그는 적었다. 지금 그 질문을 AI에 들이대야 한다는 것이 글의 출발점이다.

들어가는 자원의 규모부터 다르다. 한때 국가가 쓰던 규모의 자본, 기가와트의 전력, 기록을 경신하는 팹과 데이터센터다. 그래서 이번 십 년을 가를 질문도 결국 무엇이 나오느냐다. 칩과 토큰에 그치지 않고, 감당할 수 있는 지능인지, 의미가 있는 일인지, 삶을 나아지게 하는 결과인지까지 보르카르는 산출의 범위를 넓힌다.

채택 속도만 보면 이야기는 낙관적이다. AI는 인터넷, PC, 스마트폰보다 빠르게 퍼졌다. 그러나 전 세계 노동인구 침투율은 18%이고, 그중 대부분은 채팅이다. 개별 프롬프트에 답하는 단계에서 추론, 계획, 도구 사용, 더 긴 에이전틱 작업으로 넘어가면 인프라 방정식이 달라진다. 에이전틱 작업 한 건은 일반적인 채팅 상호작용보다 토큰을 3,400배 넘게 쓸 수 있다고 마이크로소프트는 밝혔다. 에이전트 도입은 아직 초입인데 인프라는 이미 팽팽하다. 전력은 무엇을, 언제 지을 수 있는지를 제한하고, 패키지와 랙은 더 크고 촘촘해지며, 메모리는 더 빡빡한 제약으로 올라온다.

그동안의 합리적 대답은 더 넣는 것이었다. 패키지에 실리콘을 더 넣고, 옆에 메모리를 더 두고, 전력을 더 먹이고, 광섬유를 더 깔았다. 세대마다 의미 있는 진전은 있었다. 다만 새 이득이 이전보다 더 많은 투입을 요구하면 러닝머신 위에 선다. 계속 더하지 않으면 움직이지 않는다. 보르카르는 두 길을 같이 가자고 한다. 진화는 지금 아키텍처 안에서 효율, 가동률, 경제성을 세대마다 끌어올리는 일이다. 변환은 새 아키텍처, 새 소재, 시스템과 모델 설계의 다른 접근으로 곡선 자체를 바꾸는 일이다. CPU 클럭이 전력 벽에 닿자 멀티코어로 옮겼고, 평면 낸드가 한계에 닿자 메모리가 수직으로 쌓인 일을 그는 같은 종류의 전환으로 든다. 다음 장은 인프라를 얼마나 지었느냐가 아니라, 그 인프라로 지능을 얼마나 만들 수 있느냐로 정의된다고 정리한다.

병목은 보이는 층 밖에 있다

이 수율은 제조 현장에만 머물지 않는다. 데이터센터와 실리콘에서 모델, 그리고 그것들을 엮는 에이전틱 하네스까지 층마다 수율이 있고, 손실과 이득은 층을 지나며 곱해진다. 어느 한 층의 용량은 출발점일 뿐이다. 기술을 만든 뒤에도 더 빨리 배치하고 확장해야 하며, 깔아 둔 장비 전체의 가동률을 끌어올리는 도구가 필요하다. 진짜 척도는 그 층들이 시스템 전체에서 유용한 산출을 얼마나 함께 만드는가이다.

마이크로소프트가 대규모로 짓고 운영하며 얻은 교훈은 두 가지다. 가장 큰 제약은 그 제약이 드러난 층에서 풀리는 일이 드물다. 스택 전체를 대상으로 제약을 치면, 문제의 본질처럼 보이던 맞바꿈이 아키텍처가 만들어 낸 산물인 경우가 많다. 공동 설계는 그 배움을 층 사이로 넘겨, 한계처럼 보이던 것을 풀 수 있는 시스템 제약으로 바꾸자는 방법이다.

메모리가 첫 사례다. 흔히 공급 문제나 부품 문제로 보이지만 보르카르는 시스템 문제라고 본다. AI 추론에서 메모리는 이미 시스템 성능의 한계를 정한다. 더 큰 모델을 담고, 더 긴 맥락을 지키며, 연산이 굶지 않을 속도로 데이터를 대야 한다. 에이전트는 기준을 더 올린다. 생성, 검색, 도구 사용, 지속 메모리가 몇 분에서 몇 시간까지 이어지는 고리 안에서 함께 돈다. 메모리의 지평이 길어지고, 연산 가까이에 둬야 할 정보가 늘며, 그 정보는 이어지는 턴 전체에 걸쳐 쓸 수 있어야 한다. 규모를 유지한 채 이걸 효율적으로 하는 일이 다음 세대 인프라를 가른다고 그는 썼다.

애저 마이아를 만들며 본 것은, 메모리 병목이 한 층의 개선으로 사라지지 않는다는 점이다. 모델 구조와 데이터 사이언스, 압축은 생성 중 작업 맥락을 담는 KV 캐시를 줄일 수 있다. 소프트웨어는 메모리 계층을 더 잘 다루고, 실리콘은 데이터 이동 효율에 맞춰지며, 컴파일러는 데이터를 연산 가까이에 놓는다. 어느 하나만으로는 제약이 풀리지 않는다. 같이 하면 같은 메모리에서 꺼내는 유용한 지능이 늘어난다. 유용한 수율은 바이트를 더 붙이는 일이 아니라, 이미 가진 바이트마다 더 많은 유용한 지능을 뽑는 일이다.

클러스터로 눈을 옮기면 지능은 칩 하나에서 나오지 않는다. 수천 개 칩이 하나의 시스템으로 움직일 때 나온다. 링크 속도도 중요하지만, 생산성은 혼잡 관리, 장애 복구, 작업 배치, 프로그래밍의 복잡도, 실리콘과 시스템과 소프트웨어 사이의 경계에 달려 있다. 비싼 연산이 지능을 만들고 있는지, 놀고 있는지는 거기서 갈린다. 마이아를 설계할 때 마이크로소프트는 기존 네트워크 도면에서 출발하지 않았다고 밝혔다. 원하는 결과, 곧 장비군 규모의 효율적인 추론에서 출발해 실리콘과 네트워킹, 시스템 소프트웨어를 가로질렀다. 스케일업 망과 스케일아웃 망을 나누는 대신 2단 스케일업 네트워크를 만들었고, NIC 기능을 칩 안에 넣었으며, 맞춤 전송 계층을 만들었다. 밀집된 추론 클러스터에서 확장 가능하고 고른 성능이 나왔고, 하나의 망은 프로그래밍을 단순하게 하며 작업 유연성과 용량 활용을 높인다. 그 성능에 필요한 네트워크 장비도 줄어 시스템 전체를 돌리는 비용이 낮아졌다고 한다. 목표는 데이터를 더 빨리 옮기는 데 그치지 않는다. 더 많은 연산을 생산적인 상태로 두고, 와트와 달러마다 더 많은 토큰을 내는 것이다.

전력은 클러스터를 넘어 전력망의 문제이기도 하다. 랙은 수십 킬로와트에서 수백 킬로와트로 커졌고, 데이터센터 캠퍼스는 기가와트 규모로 돌아간다. 전력은 예전에 시스템이 꽂기만 하면 되는 입력이었다. 이제는 전력망에서 칩까지 설계의 대상이다. 솔리드스테이트 변압기와 800볼트 직류 배전은 전력이 인프라를 지나는 동안의 배전 손실을 줄일 수 있는 방안으로 언급된다. 전력과 냉각은 설계가 끝난 뒤의 하류가 아니라, 처음부터 제품 정의의 일부다. 그 공동 설계는 실리콘 안까지 들어간다.

Arm 기반 서버 CPU인 애저 코발트 200이 그 예다. 코어마다 전압과 주파수를 따로 두고, 소프트웨어로 가상머신별 전력 상한을 걸었다. 더 잘게 나눈 제어는 중요한 작업의 성능을 지키면서 전력을 골라 조정하게 하고, 같은 전력 한도 안에서 더 많은 서버를 돌릴 수 있게 한다. 컨버지 다이제스트는 이를 같은 메가와트 안에서 서버를 더 운영하는 방식으로 전했다. 하드웨어와 소프트웨어를 같이 설계하면 메가와트마다 고객 가치로 더 잘 바꿀 수 있다는 것이 보르카르의 정리다.

개발자와 투자자, 일의 사용자에게

컨버지 다이제스트는 마이크로소프트가 이 관계를 역량, 배치 속도, 가동률의 곱이 유용한 수율이라는 식으로 요약했다고 전한다. 거론된 지표는 달러당 토큰, 와트당 토큰, 시스템 처리량, 가동률, 지연이다. 가속기나 GPU를 더해도 메모리 병목, 네트워크 혼잡, 전력 제약, 배치 지연이 그 연산을 생산적으로 붙잡아 두지 못하면 추가 용량의 가치는 제한된다. 손실과 효율이 층을 따라 곱해지기 때문이다. 비교적 작은 가동률·배치 속도·네트워크 효율·전력 관리의 개선이 거대한 인프라 규모에서는 발자국이 커질 수 있다고 이 매체는 분석했다.

개발자에게 바뀌는 것은 모델 크기나 링크 속도만으로 인프라를 읽는 습관이다. KV 캐시를 줄이는 모델과 압축, 메모리 계층을 다루는 소프트웨어, 데이터를 연산 가까이에 놓는 컴파일러가 수율의 일부로 묶인다. 긴 에이전트 작업은 채팅과 다른 메모리 지평을 요구하므로, 도구 호출과 지속 메모리가 몇 분, 몇 시간 단위로 돌 때의 비용이 설계 변수가 된다. 프로그래밍이 단순해지고 작업 배치가 유연해지는 것도 성능 숫자의 바깥에 있는 수율이다. 놀고 있는 연산은 토큰을 내지 않는다.

투자자와 업계에는 용량 발표만으로 진전을 읽기 어려워진다는 신호다. 보르카르는 확충이 멈춘다고 말하지 않았다. 실리콘, 메모리, 광섬유, 전력은 계속 더 필요하다. 다만 진척의 잣대를, 그 자원에서 얼마나 생산적인 지능을 뽑는지로 옮기자는 쪽이다. 최고 성능을 볼지 지속적인 시스템 처리량을 볼지, 중복을 조금 줄이고 용량을 크게 늘릴지, 기능을 넓힐지 고객 배치를 훨씬 앞당길지는 그가 먼저 던져 둔 선택지다. 무엇을 최적화하는지 정하지 않으면 수율이라는 말도 빈칸으로 남는다.

일과 삶으로 번역하면 질문은 더 단순하다. 토큰과 지능은 결승선이 아니다. 만든 것은 다른 사람의 일을 위한 입력이 된다. 그 입력이 경제 전반의 생산성과 사람 삶의 가치로 얼마나 넓게 바뀌는지가 다음 문제다. 보르카르가 든 예는 과학자가 발견을 앞당기고, 임상의가 신호를 더 일찍 알아채고, 학생이 제때 도움을 받고, 소상공인이 새 성장 경로를 찾는 일이다. 그 순환이 퍼지려면 AI가 널리 접근 가능해야 하고, 규모가 커질수록 접근성은 효율에 달려 있다고 그는 적었다. 모든 사람과 회사가 지능에 접근해 그 위에 자기 가치를 만들 수 있는 상태를 그는 완전한 수율이라고 불렀다. 소비자에게 닿는 효과는 간접적이다. 같은 전력과 같은 메모리에서 더 많은 일이 나와야, 채팅을 넘는 에이전트 사용이 더 넓게 퍼질 여지가 생긴다.

아직 숫자로 닫히지 않은 것

이 글이 주지 않는 것도 분명하다. 3,400배라는 배수는 에이전틱 작업 한 건이 일반 채팅보다 토큰을 그만큼 넘게 ‘쓸 수 있다’는 표현으로 제시되며, 마이크로소프트는 이 수치의 근거를 밝히지 않았다. 모든 작업의 평균값으로 읽기보다는 부하가 어디까지 커질 수 있는지를 보여 주는 수치로 읽는 편이 안전하다. 마이아가 네트워크 장비를 얼마나 줄였는지, 코발트 200이 같은 전력 한도에서 서버를 얼마나 더 돌리는지에 대한 정량 수치는 공식 블로그와 컨버지 다이제스트 모두에 없다. 비용이 낮아졌다, 서버를 더 돌릴 수 있다는 방향만 있다.

제약의 성격도 합의된 목록이 아니다. 보르카르는 오늘의 제약 전부가 물리 법칙은 아니며, 시스템 다른 곳에서 내린 결정에서 물려받은 것도 있다고 본다. 그건 전통적인 경계를 넘어 일해야 바뀔 수 있다. 진화는 각 회사가 자기 영역에서 꾸준히 올리는 이득이고, 변환은 그 가정을 함께 깨고 시스템 전체를 다시 짤 때 온다고 그는 구분한다. 앞으로의 돌파구는 하이퍼스케일러와 실리콘 공급자, 장비 제조사와 소재 쪽 혁신 기업, 전력 사업자와 데이터센터 운영자, 모델을 만드는 쪽과 소프트웨어 개발자가 가로지르는 협력에서 나온다고 적었다.

정리

보르카르의 수율 과제는 칩과 토큰과 메가와트를 계속 쌓아가되, 그 투입이 쓸 수 있는 지능으로 얼마나 바뀌었는지를 진전의 정의로 삼자는 제안이다. 메모리에서는 같은 바이트에서 더 많은 지능을, 네트워크에서는 수천 개 칩이 놀지 않게 하는 하나의 망을, 전력에서는 전력망에서 코어까지 같은 한도 안의 더 많은 서버를 사례로 든다. 지켜볼 지점은 용량 발표의 규모보다, 에이전틱 부하가 커질 때 달러당·와트당으로 실제로 나오는 일이 늘어나는지, 그리고 그 산출이 채팅을 넘는 다른 일의 입력으로 퍼지는지이다. 층의 손실이 곱해진다면, 한 층의 개선만으로 전체 수율이 닫히지는 않는다.

출처: Microsoft 공식 블로그 — https://blogs.microsoft.com/blog/2026/09/01/the-yield-imperative-turning-ai-infrastructure-into-useful-intelligence/

교차 확인: Converge Digest — https://convergedigest.com/microsoft-useful-yield-ai-infrastructure/

댓글

이 블로그의 인기 게시물

테슬라, 오스틴에서 핸들 없는 사이버캡 로보택시 투입

구글, 제미나이 앱에 음악 생성 모델 Lyria 3.5 공개

앤트로픽, 페르마의 마지막 정리 형식화 완성