qwen2 로컬 모델 공짜로 돌려보기 - Modal 장비병이건 다른 말로 설명할 수 없다병이다지난 포스팅 중에 로컬모델 돌리기에서 언급했듯장비병이 심해서 RTX 3090 Ti PC를 구매했었고지금은 팔았다프론티어 모델보다 성능이 떨어지는 로컬모델을 구동하면한달에 전기요금이 3만원거의 프론티어모델 $20 구독료만큼 나온다무제한 토큰을 사용하고 싶어서 GPU 서버용으로 산건데무제한이지만 쓰는만큼 돈이 드니.. 거의 종량제가 아닌가..그래서 다시 팔았다성격도 급해서 느긋하게 구매자를 기다렸으면 샀던 가격 그대로 팔 수 있었을 것 같은데빨리 팔고 싶어서 손해보고 팔았다 로컬 AI 모델 구동하기-1난 예전부터 어떤 취미생활을 하든 장비부터 채이고보는 장비병이 있다.그래서 이번 AI에 대한 관심이 생겼을 때도 가장 먼저 눈에 들어온건 로컬 모델이다.머리로는 Cl.. 2026. 8. 21. 로컬 AI 모델 구동하기-3 핵심 요약컨텍스트 윈도우를 키우면 KV 캐시가 VRAM을 쓴다.27B Dense는 96K에서 128K로 넘어가는 순간 생성 속도가 1/4가 된다 35B MoE는 CPU로 오프로드하면서도 27B Dense 96K보다 빠르다중요한건 모델 크기만이 아니다 로컬 모델에 처음 관심을 가질 때 모델의 크기만 중요한 걸로 생각했다.그래서 '구동이 가능하다'라는 것만 보고 되는구나 라고 생각했다.하지만 실제 VRAM 사용량은 이렇다.VRAM = 모델 가중치 + KV 캐시 + 런타임 버퍼KV 캐시는 이전 토큰의 연산 결과를 저장해두는 공간이다.컨텍스트가 길수록 캐시가 커진다. 256K 컨텍스트라면 모델 크기와 맞먹는 수준의 VRAM이 추가로 필요할 수 있다.아무리 큰 모델을 구동할 수 있다 한들 컨텍스트 윈도우가 작으면.. 2026. 6. 17. 이전 1 다음