Mac Mini M4 Pro에 Ollama를 설치하여 Qwen38 및 GLM 모델을 로컬에서 실행하고 실제 VRAM 및 속도를 측정했습니다. 32k 컨텍스트가 테스트당 3GB의 추가 메모리를 사용하며, 웹 검색 도구의 일반적인 오류 해결 단계를 포함합니다.

시스템 준비 및 Ollama 설치

공식 웹사이트에서 macOS용 Ollama 설치 파일을 다운로드하는 것으로 시작했습니다. Apple Silicon M4 Pro 칩을 완벽하게 지원합니다. 설치가 완료된 후 ollama --version 명령을 통해 최신 버전을 확인하여 메모리 관리 효율이 최적화된 버전인지 확인했습니다.

중요한 단계는 모델 경로를 충분한 여유 공간이 있는 파티션으로 설정하는 것입니다. Qwen38과 같은 대형 모델은 수십 GB의 파일 크기를 가지기 때문입니다. OLLAMA_MODELS=/Volumes/AI_Disk 명령을 사용하여 모델 저장 공간을 시스템 드라이브와 분리했습니다. 이렇게 하면 메인 SSD가 너무 빨리 채워지는 것을 방지하고 수명에 영향을 미치는 읽기-쓰기 작업을 줄일 수 있습니다.

또한 chmod -R 755 /Volumes/AI_Disk 명령으로 해당 폴더의 접근 권한을 확인하여 Ollama가 Permission Denied 문제 없이 데이터를 가져올 수 있도록 했습니다. 많은 사람들이 이 부분을 간과하여 모델 로딩이 중간에 실패하는 경우가 많습니다. 따라서 다운로드 및 실제 성능 테스트 단계로 넘어가기 전에 공간을 준비하는 것이 중요한 기반입니다.

Qwen38 모델 다운로드 및 관리

Qwen38 모델을 테스트의 주요 대상으로 선택했습니다. 32k 토큰까지의 긴 컨텍스트를 지원하여 태국어 문서 분석 작업에 적합하기 때문입니다. ollama pull qwen38 명령을 사용하여 가중치 파일(Weights)을 다운로드했으며, 고속 인터넷에서 약 15분이 걸렸습니다.

로딩이 완료된 후 du -sh ~/.ollama/models/blobs/sha256-* 명령으로 실제 크기를 확인했습니다. 이 모델은 약 18GB의 저장 공간을 차지합니다. 할당된 32k 컨텍스트(KV Cache)를 포함하면 총 메모리가 21GB로 증가합니다. 이는 제 테스트 보고서의 데이터와 일치합니다.

ollama run qwen38 --num-ctx 32768 명령을 사용하여 최대 컨텍스트 크기로 모델을 실행했습니다. 이 설정으로 시스템은 KV Cache에만 3GB의 추가 RAM을 예약해야 합니다. 이는 이전 데이터를 잊지 않고 대화의 연속성을 유지하거나 긴 문서를 처리하는 데 필수적입니다.

실제 시스템 테스트

2026년 9월 2일, Mac Mini M4 Pro에서 resume-verify 테스트 스위트 실행하여 webui.siam2r.com/api/version의 API를 통해 시스템 상태를 확인했습니다. 결과는 200 상태 코드를 표시하여 서비스가 정상적으로 작동함을 확인했습니다.

1x1 픽셀 PNG 파일로 비전 엔드포인트를 테스트했습니다. Qwen3-VL-8B와 GLM-4.6v-flash 모두 3/3 테스트에서 200 코드로 통과하여, 이러한 모델이 Mac에서도 기본 이미지 처리를 지원함을 보여주었습니다.

그러나 LiteLLM의 search_web 함수를 실행할 때 실제 문제를 발견했습니다. 15:52:43에 "failed-to-parse tool-call args" 오류가 발생했습니다. 클라이언트 모델의 버그이지만, 이 문제가 제 주요 설정과 관련이 없으며 코드 수정이 필요하지 않음을 기록해야 합니다. 개발팀이 원천에서 해결하기를 기다리기만 하면 됩니다.

오류에서 얻은 교훈 및 해결 방법

얻은 중요한 교훈은 프로덕션으로 배포하기 전에 "Dry-run" 테스트를 하면 손상을 방지할 수 있다는 것입니다. 실제 실행 전에 시나리오를 시뮬레이션하기 위해 qwen38-deep32k-test 별칭을 사용했으며, 이를 통해 예상치 못한 메모리 사용 문제를 발견할 수 있었습니다.

Qwen38을 7.3GB 크기의 Qwen2.5VL과 동시에 실행하면 스왑이 과도하게 발생하여 시스템이 느려지는 것을 발견했습니다. 따라서 테스트 완료 후 사용하지 않는 모델을 즉시 언로드하는 predictive.sh 스크립트를 설계해야 했습니다.

또 다른 점은 임베딩 차원입니다. Nomic-embed-text가 768차원을, BGE가 1024차원을 사용한다는 것을 확인했습니다. 이러한 숫자를 이해하면 적절한 벡터 데이터베이스를 선택하는 데 도움이 됩니다. 차원이 일치하지 않으면 시스템이 명확한 오류 없이 잘못 작동하여 디버깅이 매우 어려워지기 때문입니다.

성능 요약 및 권장 사항

제 실제 데이터에 따르면 Qwen38 Deep 32k는 총 21GB의 메모리(가중치 18GB + KV Cache 3GB)를 사용하며, Fast 버전은 18GB만 사용하여 RAM이 적은 시스템에 적합합니다.

64GB 이상의 RAM을 갖춘 Mac Mini M4 Pro 사용자는 이러한 모델을 열 스로틀링에 크게 걱정하지 않고 원활하게 실행할 수 있습니다. 그러나 대형 모델을 실행하는 동안 Chrome이나 Xcode와 같은 RAM을 많이 사용하는 다른 애플리케이션은 닫는 것이 좋습니다.

마지막으로, Mac의 로컬 AI는 프라이버시 측면에서 클라우드보다 신뢰할 수 있고 안전한 결과를 제공한다고 확인합니다. 그러나 이는 시스템 리소스를 엄격하게 관리하는 대가입니다. 안정성을 원하는 개발자에게 로그와 VRAM 사용량을 정기적으로 모니터링하는 것은 필수적입니다.

이런 랩 작업을 계속 따라가고 싶다면 LINE @icafefx를 팔로우하거나 redhatai.net에서 무료 도구를 다운로드하세요.