장비병
이건 다른 말로 설명할 수 없다
병이다
지난 포스팅 중에 로컬모델 돌리기에서 언급했듯
장비병이 심해서 RTX 3090 Ti PC를 구매했었고
지금은 팔았다
프론티어 모델보다 성능이 떨어지는 로컬모델을 구동하면
한달에 전기요금이 3만원
거의 프론티어모델 $20 구독료만큼 나온다
무제한 토큰을 사용하고 싶어서 GPU 서버용으로 산건데
무제한이지만 쓰는만큼 돈이 드니.. 거의 종량제가 아닌가..
그래서 다시 팔았다
성격도 급해서 느긋하게 구매자를 기다렸으면 샀던 가격 그대로 팔 수 있었을 것 같은데
빨리 팔고 싶어서 손해보고 팔았다
로컬 AI 모델 구동하기-1
난 예전부터 어떤 취미생활을 하든 장비부터 채이고보는 장비병이 있다.그래서 이번 AI에 대한 관심이 생겼을 때도 가장 먼저 눈에 들어온건 로컬 모델이다.머리로는 Claude나 ChatGPT와 같은 프론
localhost3000.space
Qwen 3.8
그러다가 Qwen 3.8이 나왔다
사실 Max같은건 나오든 말든 그리 관심이 없었다
그.런.데.
Qwen 3.8 27B가 나와버렸다.
위에서 말한 PC를 구매했을 때도 가장 만족하며 사용한게
Qwen 3.6 27B 였다
그리고 사람들이 극찬을 한다
Opus 4.6급이라느니....
물론 그 말이 사실일리는 없다
하지만 너무너무 궁금했다
그리고 다시 당근과 중고나라, 번개장터를 설치하고 매물을 찾고 있는 날 발견했다
Modal.com
일단 이건 광고가 아니다
일반인 상대로 광고를 주지 않는 것 같다(아마도..?)
우연히 AI 서버가 필요한 서비스를 만들어보는데
작은 모델을 구동할 GPU서버가 필요했다
그렇다고 내 맥미니를 서버로 쓰기도 그렇고..
Runpod이나 Vast.ai, Lambda Cloud 같은걸 쓰자니
수익이 날지 안날지도 모르는 서비스에 내 돈을 넣어두고싶지 않았다
물론 소액 넣어두고 안쓰면 안쓰는대로 서버리스 운영해도 됐지만..
그러던 중 클로드가 Modal.com을 추천했다
무료 크레딧
modal에 가입을 하면 GPU를 빌려쓸 때 쓰는 크레딧을 $10 그냥 준다
그것도 무료로 준다
그런데 여기에 결제 방법을 설정하면 그 무료 크레딧이 $30가 된다.
그래서 앞에서 말한 그 서비스의 모델을 여기에 올려놓고 서버리스로 돌아가게 했다.
작은 모델이라 콜드스타트도 얼마 없고
하지만 이용자도 얼마없고.....
막간을 이용해 써보실 분들은 써보시라 ㅎㅎ
로컬 모델 서버로
Modal.com을 알게된 시점은 Qwen 3.8 27B가 나오기 전 시점이다
하지만 장비병이 심해서 구매할만한 PC를 알아보기만 하고 Modal에서 돌려볼 생각을 못했다.
그러던 중 내가 만든걸 전체적으로 훑으며 점검하다가
앞에서 말한 마이스킨핏의 차례가 왔고
나에게 무료 #30어치 크레딧이 그대로 남아있다는 것을 알게됐다
바로 실행에 돌입했다.
설정
설정은 쉽다
클로드든 코덱스든 그록이든 열고
해.줘.
하면 된다
중간에 Proxy token이란걸 만들어달라고 하는데
우측 상단 프로필에서 setting을 클릭하면 왼쪽에 Tokens에 있다
만들어서 .env에 넣어주면 된다.
그럼 캡쳐에 있는 것처럼 앱을 만들어준다
그리고 pi cli나 opencode 등 에이전트에 엔드포인트로 붙이면 된다.

사용량
Modal.com에는 다양한 GPU가 있고 초당 요금이 책정되어 있다
그중에서 Qwen 3.8 27B를 Context Window 160K 정도로 쓰기위해 L40s 를 골랐다
정직하게 모델 올려서 돌리기만 하면 이론상 연속 15시간 사용이 가능하다
하지만 실제 사용은 모델을 로딩하는 콜드스타트 시간, 그리고 작업이 끝난 후 다음 작업을 기다리는 유휴시간을 빼면 그거보단 적게 사용할 수 있을 것 같다
더 작은 Context Window를 선택하고 L4로 내려도 구동은 가능하지만 속도가 더 느릴꺼라 그다지 경제적인 선택은 아닐 것 같다

성능
Qwen 3.8 27B Q4_K_M 모델로 mtp 적용하면 59 tok/s 정도 나온다
콜드스타트는 그때그때 다른데 75~120초 사이로 나오는 것 같다
이정도면 굳이 수백만원 PC를 사서 이 뜨거운 여름에 열기를 뿜뿜하며 전기를 퍼먹이는 것보다
한달에 15시간 정도만 로컬모델 찍먹하는 용도로 만족할 수 있을 것 같다.
번외
오픈소스 로컬모델에는 LLM만 있는게 아니다
그 중 요즘 아주 핫한 영상 생성 모델인 Minimax h3의 권장 사양은 H200 4장을 사용하는 것이다.
Modal.com에서는 이런 구성도 가능은 하다..
하지만 난 크레딧 아까워서 올라가는지 확인만해보고 실제 영상생성을 해보진 않았다
대신 VRAM 24gb급에서 해당 모델을 사용해보려는 시도들이 많길래 따라서 1개정도 만들어봤으나..
평소에 AI로 영상을 만들어본 경험이 없어서 프롬프트가 애매했는지 기대했던 퀄리티는 안나왔다
참고로 Minimax h3는 한국에서 다운로드가 막힌 라이센스지만
Modal.com은 서버가 한국에 있는게 아니라서 아무런 승인 절차 없이 사용할 수 있다
'Study > Tools' 카테고리의 다른 글
| Commandcode 리뷰 (0) | 2026.08.18 |
|---|