TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 30 READS

2.8조 파라미터 Kimi K3를 SSD로 스트리밍해 맥북에서 돌리기

2.8조 파라미터 Kimi K3를 SSD로 스트리밍해 맥북에서 돌리기
SOURCE IMAGE · HACKER NEWS

거대 언어 모델을 로컬에서 온전히 돌린다는 것은 사실상 데이터센터급 인프라를 전제로 한다. Moonshot AI가 내놓은 Kimi K3는 2.8조(2.8T) 파라미터 규모의 MoE(Mixture-of-Experts) 모델로, 권장 구성만 봐도 16개 노드와 약 4.8TB에 달하는 총 VRAM, 그리고 100만 토큰 컨텍스트 윈도를 요구한다. 금액으로 환산하면 200만 달러 수준의 설비다. Argonaut Labs가 공개한 ARGODRIVE Deltafin은 이 벽을 정면으로 마주한다. 이 프로젝트는 gavamedia/deltafin(MIT)의 포크로, K3의 방대한 가중치를 여러 개의 SSD에서 스트리밍하는 방식으로 애플 실리콘 맥북 프로에서 초당 약 1토큰의 속도로 모델을 구동한다.

품질을 깎지 않는다는 원칙

Deltafin이 스스로 규정한 정체성은 분명하다. 제품이 아니라 실험이며, 소비자 하드웨어를 어디까지 밀어붙일 수 있는지를 확인하는 연구다. 핵심 규칙은 '속도는 결코 품질을 낮추는 데서 나와서는 안 된다'는 것이다. 라우팅되는 16개 전문가(expert)를 하나도 가지치기하지 않고, 모든 토큰을 K3 본체가 직접 결정한다. Moonshot이 배포한 가중치의 바이트를 그대로 유지한다는 뜻이다.

속도의 상당 부분은 스펙터티브 디코딩(speculative decoding)에서 나온다. 작은 초안(draft) 모델이 다음 토큰을 미리 추측하고, K3가 그 추측을 일일이 검증한 뒤 승인한 것만 사용자에게 전달한다. 출력 자체는 K3가 단독으로 생성한 것과 동일하되, 검증을 통과한 구간만큼 시간을 아끼는 구조다. 기본 설치에는 Inferact의 Kimi-K3-DSpark 초안 모델이 포함되며, 디스크에서 6.635GiB, 런타임 적재 시 약 4.49GiB를 차지한다. Deltafin은 DSpark가 중복 보유한 K3 임베딩 사본을 별도로 실체화하지 않아 자원을 절약한다. 여유 공간이나 실시간 조건이 맞지 않으면 초안 없이 K3 단독 실행으로 조용히 되돌아간다.

3비트 압축과는 다른 선택

Deltafin은 자신과 대비되는 다른 접근을 명확히 짚는다. 일부 프로젝트는 K3를 '더 빠르게' 돌리는 것처럼 보이지만, 실제로는 전문가 은행을 약 3비트로 재인코딩해 용량을 줄인 결과라는 것이다. 영리한 엔지니어링이지만 목표가 다르다. 그렇게 압축된 가중치는 더 이상 Moonshot이 공개한 그 가중치가 아니며, 그 타협이 품질에 어떤 대가를 치르게 하는지는 배포사조차 측정한 적이 없다. Deltafin은 반대편 실험이다. 모든 전문가 바이트를 원본 그대로 두고, 물리적으로 허용되는 한도까지 속도만 끌어올린다.

디스크 공간이 부족한 경우를 위한 대안도 있다. 'setup --stream' 옵션은 상주 모델만 설치하고 필요한 전문가만 요청 시점에 내려받는다. 초기에는 로컬 캐시가 비어 있어 훨씬 느리지만, 실제로 사용하는 경로만 캐시로 쌓이면서 시간이 지날수록 디스크에 저장된 캐시만으로 구동할 수 있게 된다. 자신이 쓰는 부분만 보관하는 방식인 셈이다. 원시 텍스트 이어쓰기 속도를 높이는 Qwen은 선택적 애드온으로 제공되는데, 4.337GiB를 추가로 차지하며 코드 자동완성 같은 완성형 트래픽에만 도움을 준다. 한 사례에서 17토큰 완성이 동일한 출력으로 2.7배 빨라졌으나, 채팅 속도는 개선하지 않기에 기본에서 제외돼 있다.

실무자에게 주는 의미와 한계

통합 관점에서 Deltafin은 OpenAI 호환 네이티브 서버를 갖췄다. /v1/chat/completions, /v1/completions, /v1/models를 지원하고 SSE 스트리밍을 제공하며, 클라이언트는 http://127.0.0.1:8000/v1을 가리키고 비어 있지 않은 로컬 API 키만 넣으면 된다. 다만 이 서버는 텍스트 전용, 한 번에 한 생성, 항상 그리디(greedy)로 재현 가능한 결과만 내는 엄격하게 제한된 부분집합이다. 지원할 수 없는 요청은 무시하지 않고 OpenAI 형식의 오류로 거절한다. 기본 응답 상한은 100만 토큰이며 --max-tokens로 낮출 수 있고, 요청 JSON은 기본 128MiB로 제한된다. 자체 인증과 네트워크 경계를 추가하지 않는 한 서버는 루프백에 두는 것이 전제다.

결국 이 프로젝트의 가치는 벤치마크 수치보다 방향성에 있다. 200만 달러짜리 인프라가 필요한 프런티어 모델을 1만5,000달러 규모의 가정용 장비에서, 품질 타협 없이 사용 가능하게 만들려는 시도이기 때문이다. 물론 초당 1토큰이라는 속도는 긴 대화나 실시간 서비스에 쓰기 어렵고, 대화가 길어질수록 프리필과 캐시가 커져 완성형 작업보다 현저히 느려진다. 그럼에도 원본 가중치를 그대로 두고 스토리지 스트리밍과 검증형 초안 모델로 한계를 밀어붙이는 접근은, 자체 호스팅 AI를 고민하는 실무자에게 압축 양자화 일변도와는 다른 선택지를 보여준다. 프로젝트 코드는 MIT이지만 K3 가중치와 DSpark, Qwen 체크포인트는 각자의 상위 라이선스를 따르며, Deltafin은 Moonshot AI와 무관한 독립 프로젝트라는 점은 도입 전 확인해 둘 대목이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://github.com/argonautlabsai/deltafin
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...