매일 들어오는 글 가운데, TTJ가 한 번 더 읽어본 것들. 코딩과 AI 시대를 가로지르는 글로벌 동향을 한곳에 모았습니다.
## GPU 한 장으로 초거대 모델을 학습시킨다? 대규모 언어 모델(LLM)을 학습시키려면 보통 수십~수백 대의 GPU가 필요해요. GPT-3 급(1750억 파라미터) 모델을 학습하려면 수천 개의 A100 GPU를 몇 달간 돌려야 하는 수준이죠. 그런데 "GPU 한 장으로 1000억 파라미터 이상의 모델을 풀 정밀도로 학습할 수 있다"는 논문이 나왔어...