트렌드·인사이트

AI 칩 성능표도 매년 다시 써야 한다…MIT, 2018년부터 가속기 변화를 추적한 이유

MIT 링컨연구소 슈퍼컴퓨팅센터는 2018년부터 LAICS를 운영하며 AI 가속기 시장의 변화를 해마다 추적하고 있다.

칩 한 개의 속도보다 메모리, 연결망, 전력, 소프트웨어를 묶은 시스템 구성이 실제 경쟁력으로 옮겨가고 있다는 점이 이번 관측의 핵심이다.

AI 모델 경쟁에서 가속기 세대와 시스템 구성이 중요한 이유는 분명하다. 오늘의 AI 성능은 더 이상 단일 GPU나 특정 칩의 최고 연산 수치만으로 설명되지 않는다. 같은 모델이라도 어떤 메모리 구조를 쓰는지, 칩끼리 얼마나 빠르게 데이터를 주고받는지, 전력을 얼마나 안정적으로 공급하는지, 그리고 어떤 소프트웨어 스택으로 병렬화를 구현하는지에 따라 실제 훈련과 추론 성능이 달라지기 때문이다.

미국 MIT 링컨연구소가 이 문제를 장기 관측 대상으로 삼은 것도 같은 맥락이다. MIT 링컨연구소는 2026년 10월 6일 공개한 자료에서 링컨연구소 슈퍼컴퓨팅센터가 2018년부터 Lincoln AI Computing Survey, LAICS를 운영해 AI 가속기 시스템의 변화를 추적하고 있다고 밝혔다. 이 조사는 상용 AI 가속기의 공개 자료를 모아 성능과 전력 특성을 비교하고, 연구와 국가안보 분야의 컴퓨팅 투자와 조달 판단에 활용하는 데 목적을 둔다.


한 해만 지나도 비교표가 낡아지는 시장


LAICS의 출발점은 제품 홍보가 아니라 관측의 필요였다. MIT 링컨연구소 설명에 따르면 2018년 무렵부터 연구 논문과 기업 발표에서 새로운 AI 가속기가 급격히 늘었고, 정부 후원 기관들도 어떤 기술을 선택해야 하는지 질문하기 시작했다. 첫 조사에서는 57개 가속기를 다뤘지만, 2025년 최신 공개 논문에서는 120개가 넘는 가속기를 검토했다. 같은 분류 안에서도 칩, 카드, 시스템 단위가 뒤섞이고 세대교체 속도도 빨라져 정적인 성능표는 금방 의미를 잃는다.

이 변화는 AI 반도체 시장이 포화되기는커녕 오히려 세분화되고 있음을 보여준다. GPU, ASIC, FPGA, 데이터플로 가속기, CPU 기반 AI 확장 설계가 함께 경쟁하고, 추론용과 훈련용, 엣지와 데이터센터, 초저전력과 초대형 시스템이 서로 다른 조건에서 최적화를 시도한다. 따라서 “가장 빠른 칩”이라는 단일 질문보다 “어떤 작업을 어떤 전력과 연결 구조에서 얼마나 안정적으로 처리하는가”가 더 실질적인 비교 기준이 된다.


성능 향상은 칩 미세화만으로 설명되지 않는다


MIT 연구진의 기존 LAICS 논문은 최근 10년의 성능 향상을 단순한 반도체 미세공정의 결과로만 보지 않는다. 2022년 공개된 관련 논문에서는 각 정밀도 형식 안에서 최대 성능 향상이 10년간 약 1.5자릿수 규모로 나타났고, 성능 증가는 더 낮은 수치 정밀도 지원 확대와도 연결돼 있다고 분석했다. 다시 말해 같은 하드웨어라도 FP32에서 FP16, BF16, INT8, 나아가 FP8 같은 형식으로 내려갈수록 더 많은 연산을 처리할 수 있게 되면서 성능 지형 자체가 바뀌었다는 뜻이다.

이 지점에서 벤치마크를 읽는 방식도 달라진다. 기업이 제시하는 최고 연산량은 대개 특정 정밀도와 특정 조건을 전제로 한다. 실제 AI 개발에서는 모델 크기, 메모리 용량, 대역폭, 데이터 이동 비용, 소프트웨어 최적화 수준이 함께 작동한다. 숫자 하나만 보면 빠른 칩이, 실제 학습 시간이나 운영 비용에서는 반드시 우세하다고 말할 수 없는 이유다.


GPU 경쟁에서 시스템 경쟁으로 이동하는 이유


AI가 대형화할수록 병목은 연산 코어 밖에서 더 자주 생긴다. 모델 파라미터와 중간 활성값을 담아둘 메모리가 부족하면 더 많은 칩을 묶어야 하고, 그러면 칩 사이 통신 지연이 전체 훈련 속도를 끌어내린다. 전력 밀도가 높아질수록 냉각과 전원 설계도 성능 문제로 바뀐다. 결국 AI 인프라는 칩의 세대교체만이 아니라 메모리, 인터커넥트, 랙 구성, 전력 공급, 컴파일러와 라이브러리까지 포함한 시스템 공학의 문제로 재편된다.

이 흐름은 공식 벤치마크 설계에서도 확인된다. MLCommons의 MLPerf 훈련 벤치마크는 모델·소프트웨어·하드웨어를 함께 시험하는 전시스템 테스트라고 밝히고 있다. 비교의 단위를 칩 단품이 아니라 시스템 전체로 옮기지 않으면, 실제 현장에서 반복 가능한 성능을 설명하기 어렵다는 뜻이다. 벤치마크가 공정한 비교 규칙과 목표 정확도를 함께 요구하는 이유도 여기에 있다.


슈퍼컴퓨팅 현장에서는 전력과 연결망이 구매 기준이 된다


MIT 링컨연구소 슈퍼컴퓨팅센터의 운영 경험은 이 점을 더 선명하게 보여준다. 센터는 연구자들이 대규모 데이터 처리와 시뮬레이션, 모델 훈련에 쓰는 고성능 컴퓨팅 자원을 제공하며, 최근 업그레이드 시스템은 이전 세대보다 6배의 처리 성능과 20배의 대역폭을 제공한다고 설명한다. 2025년 공개된 TX-GAIN 역시 생성형 AI에 최적화된 대학급 AI 슈퍼컴퓨터로 소개됐는데, 이는 단순히 최신 GPU를 더 많이 꽂았다는 뜻이 아니라 대규모 학습을 감당할 수 있도록 시스템 전체를 조정했다는 의미에 가깝다.

글로벌 슈퍼컴퓨팅 지형도 비슷하다. TOP500의 2026년 6월 집계에서는 가속기나 코프로세서를 쓰는 시스템이 276개로 6개월 전보다 늘었고, Green500 상위권은 Grace Hopper와 인피니밴드 조합 같은 시스템 설계가 에너지 효율을 좌우하는 모습을 보여준다. AI 인프라 투자에서 이제 질문은 어느 회사 칩이 더 우월한가가 아니라, 어떤 작업을 어떤 규모와 전력 조건에서 가장 효율적으로 수행할 수 있느냐다.


매년 다시 쓰는 성능표가 필요한 이유


LAICS가 계속 필요한 까닭은 시장이 아직 표준화 단계에 도달하지 않았기 때문이다. 새로운 스타트업이 계속 등장하고, 기존 업체도 해마다 다른 정밀도 형식과 패키징, 연결 구조를 내놓는다. 어떤 제품은 공개 수치가 충분하지 않고, 어떤 제품은 벤치마크 조건이 달라 단순 비교가 어렵다. MIT 연구진이 공개 자료만을 모아 비교하고, 미공개 성능을 임의로 채우지 않는 태도를 유지하는 이유도 여기 있다.

따라서 AI 칩 성능표를 해마다 다시 써야 한다는 말은 과장이 아니다. AI 컴퓨팅은 반도체 한 품목의 경쟁이 아니라 시스템 전체의 조합 경쟁으로 바뀌고 있다. 소프트웨어 혁신이 여전히 중요하지만, 그것이 실제 성능으로 이어지려면 어떤 가속기 세대와 메모리, 연결망, 전력, 소프트웨어 스택 위에서 구현되는지를 함께 봐야 한다. MIT의 장기 추적은 바로 그 구조적 변화를 기록하는 작업에 가깝다.

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다