AI가 자체 추론 하드웨어 개발 가능성을 입증하다
AI is now capable of developing its own inference hardware
오픈소스 AI 가속기 'openTPU'가 공개되어, 인공지능이 스스로 추론에 필요한 하드웨어 설계부터 구현까지 전 과정을 보여줍니다.
AI가 추론에 필요한 칩의 설계부터 실제 작동 원리까지 전 과정을 투명하게 공개하여, 인공지능 아키텍처에 대한 근본적인 이해를 돕는다는 점이 중요해요.
- 하드웨어 설계(SystemVerilog), 명령어 세트, 시뮬레이터 등 전체 개발 과정이 투명하게 공개되며, 실제 카드와 시뮬레이터 결과가 비트 단위로 일치합니다.
- 단순한 성능 수치를 넘어, 대규모 언어 모델이 메모리 대역폭이나 연산 장치 같은 물리적 제약에 어떻게 직면하는지 근본적인 아키텍처 이해를 돕습니다.
- 현재 시스템의 성능은 메모리 대역폭(DRAM) 효율성에 크게 좌우되는 경향을 보이며, 디코딩 과정 최적화가 차세대 연구의 핵심 과제입니다.
AI 가속기인 openTPU는 인공지능 가 하드웨어 설계부터 시작하여 스스로 추론에 필요한 칩을 구축할 수 있음을 보여줍니다. 이 프로젝트는 AI 에이전트의 역량을 시험하며, 고수준의 개념에서 실제 작동하는 물리적 구현까지 전 과정을 다루고 있습니다.
openTPU는 시스템 레벨의 투명성을 제공합니다. 전체 가속기 구조가 하나의 모노레포지토리에 담겨 있으며, 하드웨어 설계(SystemVerilog), 명령어 세트, 비트 단위 시뮬레이터, 커널 언어 및 컴파일러, 그리고 실제 PCIe 카드를 구동하는 호스트 소프트웨어가 모두 공개되어 있습니다. 이를 통해 사용자는 파이썬의 행렬 곱셈부터 물리적인 와이어 레벨까지 AI 가속기가 작동하는 원리를 이해할 수 있습니다.
해당 시스템은 FPGA 카드에 다양한 최신 모델(예: LFM2.5-230M, Qwen3-0.6B 등)을 구동하며 성능을 측정했습니다. 결과는 /초 및 DRAM 대역폭 사용량 등을 보여주며, 특히 빌드 업데이트를 통해 이전 대비 프리필 속도가 크게 향상된 것이 확인되었습니다.
openTPU는 메모리 용량을 초과하는 (MoE) 모델도 지원합니다. 이 경우 전문가(expert)들을 호스트 스토리지에서 스트리밍하여 카드에 로드하고, 각 토큰마다 모든 전문가를 계산합니다. 또한 4비트 (FP4 값)를 사용하면 토큰당 바이트 수를 줄이고 디코드 속도를 최대 45%까지 높일 수 있습니다.
용어 풀이
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- Mixture-of-experts
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
openTPU는 어떤 수준까지 작동 원리를 보여주나요?
파이썬의 행렬 곱셈부터 물리적인 와이어 레벨까지 AI 가속기가 작동하는 원리를 이해할 수 있도록 전체 구조가 공개되어 있어요. 하드웨어 설계(SystemVerilog), 명령어 세트, 비트 단위 시뮬레이터 등 모든 개발 과정이 포함돼요.
openTPU는 어떤 장비에서 성능을 측정했나요?
FPGA 카드에 다양한 최신 모델(예: LFM2.5-230M, Qwen3-0.6B 등)을 구동하며 성능을 측정했어요. 벤치마크 결과로는 토큰/초 및 DRAM 대역폭 사용량 등이 확인되었어요.