Mac에서 Ollama를 통해 MLX Framework를 사용하여 Qwen3를 실행합니다. qwen38-deep 모델은 32k 토큰 컨텍스트에 RAM 21GB가 필요합니다. Alias 설정과 KV Cache 확인을 권장하여 모델의 자동 언로드를 방지합니다.

터미널을 통한 준비 및 설치

Mac에서 Qwen3를 사용하기 위해 Ollama 설치를 선택했습니다. Ollama는 현재 Apple의 MLX Framework를 가장 잘 지원하는 도구입니다. 첫 단계는 Ollama를 설치한 후 qwen38-chat 모델을 테스트 목적으로 가져오는 것입니다. 기본 명령어로 실행했습니다. 시스템 점검 결과, 이 모델의 API 버전이 200 상태 코드를 잘 응답하여 로컬 호스트와 모델 간 연결이 완벽하게 작동함을 확인했습니다. 더 깊은 추론(reasoning)이 필요한 경우 qwen38-deep 모델을 가져오는 것을 권장합니다. 리소스는 더 많이 사용하지만 기술적 작업에서 더 정확한 결과를 제공합니다. 터미널을 사용하면 작업 로그를 명확하게 볼 수 있고 GUI 도구 중 일부가 이러한 세부 정보를 숨기는 것보다 디버깅이 훨씬 쉽습니다. 공식 웹사이트에서 다운로드 및 설치할 수 있습니다.

VRAM 및 컨텍스트 윈도우 관리

Apple의 통합 메모리 시스템을 사용하는 Mac에서는 메모리 관리를 매우 중요하게 다뤄야 합니다. CPU와 GPU가 메모리를 공유하기 때문입니다. 제 테스트 데이터에 따르면 qwen38-deep 모델의 가중치(weights) 파일 크기는 18GB로 상당히 큽니다. 그러나 대형 문서 작업을 위해 컨텍스트 윈도우를 최대 32k 토큰으로 예약하려고 했을 때, 실제 사용 메모리는 21GB까지 증가했습니다. 추가된 부분은 대화 중 계산 데이터를 저장하는 데 필요한 약 3GB의 KV Cache입니다. RAM 16GB Mac을 사용하는 경우 시스템이 SSD로 스왑하지 않고 원활하게 작동하려면 컨텍스트 길이를 16k 또는 8k로 줄여야 할 수 있습니다. 그렇지 않으면 토큰 생성 속도가 현저히 떨어집니다.

실제 기기에서 테스트

2026년 9월 2일 Mac Mini M4 Pro에서 qwen38-deep32k-test 모델의 한계를 확인하기 위해 광범위한 테스트를 수행했습니다. 컨텍스트 윈도우를 32k까지 지원하도록 설정하고 3GB KV Cache를 사용했습니다. 20,049 토큰이라는 상당한 양의 프롬프트 데이터를 입력해 보았습니다. 모델은 성공적으로 처리했으며 계산된 대로 정확히 21GB의 메모리를 사용했습니다. 흥미로운 점은 실패에서 얻은 교훈입니다. 제 predictive.sh 스크립트가 이 모델이 현재 직접 호출되지 않는 프로덕션 라우트가 없음을 감지하여 자동으로 언로드했습니다. 이로 인해 새 명령이 들어올 때 모델을 다시 로드하는 데 시간이 낭비되었습니다. 또한 LiteLLM 시스템에서 도구 호출 인자 파싱 실패에 대한 경고도 발견했는데, 이는 복잡한 명령을 지원하려면 도구 구성을 약간 더 조정해야 함을 나타냅니다.

태국어 및 비전 기능 테스트

텍스트 대화 외에도 Qwen3의 비전 기능과 태국어 이해 능력을 테스트했습니다. 특히 qwen38-chat 모델로 Thai 5-key 테스트 세트를 사용했는데, 모델이 태국어 컨텍스트를 잘 이해하고 반응하며 HTTP 200을 성공적으로 반환했습니다. 임베딩 부분에서는 768의 nomic-embed-text와 1024의 embed-bge를 모두 테스트했는데, 둘 다 여전히 ollama/ 접두사를 사용하고 있어 API 호출 시 주의가 필요합니다. 비전 기능에 대해서는 18GB(MLX) 크기의 qwen38-fast 모델과 7.3GB(GGUF) 크기의 qwen2.5vl 모델을 하나의 워크플로우에서 이미지 처리를 가능하게 하도록 통합했습니다. 1x1 픽셀 PNG 파일을 통한 스모크 비전 라우트 테스트가 성공적으로 완료되어, MLX와 GGUF라는 서로 다른 프레임워크를 Mac에서 결합하는 것이 실제로 가능하며 안정성을 유지할 수 있음을 보여주었습니다. 다만 저장 장치에 개인 데이터 저장 공간을 더 사용해야 한다는 대가가 따릅니다.

이런 랩 작업을 계속 따라가고 싶다면 LINE @icafefx를 팔로우하거나 redhatai.net에서 무료 도구를 다운로드하세요.