아이폰에서 20B 모델이 돌아간다는 게 왜 대단한 일일까요
deepgrove.ai라는 팀이 'Maple-Preview'라는 언어 모델을 공개했어요. 숫자만 보면 얼마나 놀라운 일인지 감이 잘 안 올 수 있는데요, 총 200억 개(20B) 파라미터를 가진 MoE 모델이 아이폰에서 초당 120토큰 속도로 돌아간다는 이야기거든요. 보통 이 정도 크기의 모델은 고성능 GPU가 달린 서버에서 돌리는 게 상식이었어요. 그런데 주머니에 들어가는 스마트폰에서, 그것도 사람이 읽는 속도보다 훨씬 빠르게 텍스트를 뽑아낸다니 어떻게 가능한 걸까요?
비밀 1: 3진법(ternary) 양자화
이게 뭐냐면, 보통 AI 모델의 가중치(모델이 학습한 숫자들)는 16비트나 32비트 실수로 저장돼요. 숫자 하나에 2~4바이트를 쓰는 거죠. 그런데 ternary 방식은 가중치를 딱 세 가지 값, -1, 0, +1로만 표현해요. 세 가지 값이면 이론상 1.58비트면 충분하거든요(log2(3) ≈ 1.58). 메모리 사용량이 10분의 1 수준으로 줄어드는 셈이에요.
더 재미있는 건 속도예요. 가중치가 -1, 0, 1뿐이면 행렬 곱셈에서 실제 '곱셈'이 사라져요. 어떤 수에 1을 곱하면 그대로 두고, -1을 곱하면 부호만 바꾸고, 0을 곱하면 그냥 건너뛰면 되거든요. 곱셈이 덧셈과 뺄셈으로 바뀌는 건데, 칩 입장에서 훨씬 가벼운 연산이라 전력도 덜 먹고 속도도 빨라져요. 배터리와 발열이 중요한 스마트폰에서는 결정적인 차이죠.
비밀 2: MoE, 전문가를 나눠 쓰는 구조
MoE(Mixture of Experts)는 모델 전체를 하나의 거대한 뇌로 쓰는 대신, 여러 명의 '전문가' 네트워크로 쪼개놓은 구조예요. 토큰 하나를 처리할 때마다 라우터가 '이 문제는 3번, 7번 전문가가 잘 풀겠네' 하고 일부 전문가만 깨워서 일을 시키거든요. 그래서 전체 파라미터는 200억 개여도 실제로 한 번에 계산에 참여하는 파라미터는 그보다 훨씬 적어요. 저장 용량은 크지만 연산량은 작은 모델이 되는 거죠. 3진법 양자화로 '메모리' 문제를 풀고, MoE로 '연산량' 문제를 푸니까 스마트폰이라는 제약 안에 들어올 수 있었던 거예요.
업계 맥락: BitNet부터 애플 인텔리전스까지
사실 3진법 모델이라는 아이디어 자체는 마이크로소프트의 BitNet b1.58 연구로 유명해졌어요. '1비트급 모델도 처음부터 제대로 학습하면 성능이 크게 안 떨어진다'는 걸 보여줬죠. 다만 지금까지 공개된 ternary 모델들은 대부분 수십억 파라미터급의 작은 모델이었는데, 이번엔 20B급 MoE를 실제 아이폰에서 돌리는 데모까지 왔다는 점이 눈에 띄어요.
온디바이스 AI 경쟁 구도를 보면 애플은 애플 인텔리전스에서 3B급 자체 모델을 기기에서 돌리고, 구글은 픽셀에 Gemini Nano를 탑재하고 있어요. 커뮤니티 쪽에서는 llama.cpp나 애플의 MLX 프레임워크로 오픈소스 모델을 폰에서 돌리는 실험이 활발하고요. 공통된 방향은 하나예요. '클라우드에 안 보내고 기기 안에서 끝내자'는 거죠.
한국 개발자에게 주는 시사점
온디바이스 AI가 실용 수준이 되면 세 가지가 바뀌어요. 첫째, API 비용이 사라져요. 지금은 LLM 기능 하나 붙이면 호출량만큼 돈이 나가는데, 기기에서 돌리면 한계비용이 0이거든요. 둘째, 프라이버시 부담이 가벼워져요. 개인정보가 서버로 나가지 않으니 규제 대응도 한결 쉬워지고요. 셋째, 오프라인과 지연 시간 문제가 풀려요. 비행기 모드에서도 동작하고, 네트워크 왕복이 없으니 반응도 즉각적이죠.
물론 preview라는 이름처럼 아직 검증할 게 많아요. 한국어 성능은 어떤지, 긴 컨텍스트에서도 저 속도가 유지되는지, 발열과 배터리 소모는 어떤지 같은 것들요. 그래도 방향 자체는 분명해 보여요. 양자화와 MoE 기술이 이 속도로 발전하면, 몇 년 안에 '쓸 만한 모델은 기본적으로 폰에서 돈다'가 상식이 될 수 있거든요.
한줄 정리: 3진법 양자화로 메모리를, MoE로 연산량을 줄여서 20B급 모델을 아이폰에서 초당 120토큰으로 돌리는 시대가 열리고 있어요.
여러분이라면 온디바이스 LLM으로 어떤 앱을 만들어보고 싶으세요? 서버 없이 돌아가는 AI 기능, 어디에 제일 먼저 쓰일 것 같나요?
🔗 출처: Hacker News
"비전공 직장인인데 반년 만에 수익 파이프라인을 여러 개 만들었습니다"
실제 수강생 후기- 비전공자도 6개월이면 첫 수익
- 20년 경력 개발자 직강
- 자동화 프로그램 + 소스코드 제공