오늘 아침 알람이 아닌 Docker Hub의 작업 큐 알림 소리에 깨어났습니다. 흐르는 눈물 같은 화면을 통해 시스템 작업들이 지나가는 것을 보았습니다.

127,680이라는 숫자가 무언가가 변했음을 알려주다

오늘 아침 Qdrant를 1.19.1 버전으로 업그레이드했습니다. 단순한 업데이트가 아니라 우리 전체 벡터 데이터베이스의 건강에 영향을 미치는 큰 수술이었습니다. 화면에 나타난 healthz와 readyz는 200 상태를 반환했으며, 이는 시스템이 완전히 준비되었음을 의미합니다. 그러나 잠시 숨을 멈추게 한 것은 12개 중 12개의 컬렉션이 모두 존재하고, 총 127,680개의 포인트를 보유하고 있다는 사실이었습니다. 우리 작은 홈랩에게는 매우 큰 숫자입니다.

이번 업그레이드는 단순히 버전 변경이 아니라, 백업으로 보관 중인 4.2GB 스냅샷의 무결성을 검증하는 과정이었습니다. 로고나 데이터 구조 부분에 단 하나의 에러도 없어야 했습니다. 왜냐하면 조금이라도 손상되면 미래의 데이터 검색이 완전히 엉뚱한 결과를 낼 수 있기 때문입니다. 이 모든 것이 짧은 시간 안에 발생했지만, 이마에 식은땀을 흘릴 만큼 압박감은 컸습니다.

두 개의 Docker Compose 설정으로 인한 두통, 커피 한 잔이 필요했다

이번 업그레이드가 매끄럽지 못했던 주요 원인은 서로 다른 두 Docker Compose 설정 아래에서 작동하는 5개의 컨테이너를 관리해야 했기 때문입니다. 시스템이 스스로 잘 관리할 수 있다고 생각했지만, 실제로는 주요 버전 변경 시 서비스 간 교차 의존성이 레이스 컨디션을 쉽게 유발했습니다.

포트와 마운트된 볼륨의 충돌을 방지하기 위해 모든 서비스를 일시적으로 중지해야 했습니다. 기술적으로 불가능할 정도로 복잡한 문제는 아니었지만, 높은 수준의 주의가 필요했습니다. 전환 기간 중 에러가 발생했는지 로그를 확인하는 데 대부분의 시간을 보냈습니다. 특히 Qdrant와 밀접하게 작동해야 하는 SearXNG 2026.9.5-c7f3080aa 버전의 경우 더욱 그랬습니다. q1부터 q4까지 모든 게이트를 에러 없이 통과한 것은 가장 안도되는 부분이었습니다.

과열된 GPU와 무거운 모델에서 얻은 교훈

백그라운드에서 Hub #9403이 05:48부터 RUNNING 상태로 실행되는 동안, Mac Mini M4 Pro의 리소스 사용량을 주의 깊게 관찰했습니다. 25GB 크기의 qwen38-chat:latest 모델이 GPU의 100%를 사용하며 32,768 토큰의 긴 컨텍스트 윈도우로 작동하고 있었고, 다른 쪽에서는 qwen2.5vl:7b 모델도 100%로 동일하게 무거운 작업을 수행하고 있었습니다.

멈추고 생각하게 만든 것은 이 정도의 열과 부하였습니다. 고성능 기기이지만, 이렇게 큰 모델을 두 개 동시에 장기적으로 실행하면 하드웨어 수명에 영향을 줄 수 있습니다. 때로는 시스템에 작업을 밀어넣는 데 너무 조급해져 적절한 로드 밸런싱을 고려하지 않는다는 것을 인정합니다. 다른 렌더링 기기의 16GB GPU가 메모리의 98-100% (15745/16311 MiB 및 14475/16311 MiB)를 사용 중인 것도 우리가 로드 분산에 대해 더 생각해야 한다는 경고 신호입니다. 단순히 하드웨어를 계속 추가하는 것만으로는 해결되지 않습니다.

작업 종료 전 마지막 점검과 다음 계획

오늘 아침 작업을 마무리하기 전에, 2026-09-05에 마지막으로 수정된 Cron System이 현재 워크플로우에 영향을 미치는 변경사항이 있는지 확인했습니다. 특히 icafeforex 슬롯 이브닝 큐가 Publisher 복사 거래를 실패시키는 부분에서, 거래 결과 자체가 아직 안정적이지 않아 시스템 안정성을 테스트하기 위해 작은 거래 포트를 분리해야 했습니다.

selftest 큐의 root_fix_d1_gate 부분에 대해 "Hold" 결정을 내린 것은 모든 것을 한 번에 완료하려고 강요하지 말아야 한다는 것을 받아들이는 좋은 예입니다. 잠재적인 버그가 숨어 있을 수 있는 작업을 서두르는 것보다 시스템이 안정화되기를 기다리는 것이 오늘 얻은 중요한 교훈입니다. 업그레이드 성공을 종점이 아닌, 주의 깊게 모니터링해야 하는 관찰 기간의 시작점으로 보고 있습니다.

모든 작업 완료 후의 느낌

이제 마치 마라톤을 막 끝낸 듯한 기분이 듭니다. Hub #9401과 #9402가 VERIFIED 상태를 표시하고 있지만, 4.2GB 스냅샷이 영원히 안전할지에 대한 작은 우려는 항상 마음속에 남아 있습니다. 집에 AI 랩을 가지는 것은 매일 새로운 장난감을 가지고 노는 것이 아니라, 빠르게 변화하는 기술의 불확실성과 함께 살아가는 법을 배우는 것입니다.

오늘 오후에는 미래에 OOM(Out of Memory)이 다시 발생하지 않도록 방지하기 위해 GPU 메모리 사용량을 더 세밀하게 모니터링하는 스크립트를 작성할 계획입니다. 127,680개 포인트 중 단 하나의 데이터 손실도 수년에 걸쳐 축적된 중요한 컨텍스트의 손실을 의미할 수 있기 때문입니다. 실수할 수 있음을 인정하고 그것을 사전에 방지하는 방법을 배우는 것이 이 랩이 지속 가능하게 계속 운영될 수 있는 이유입니다.

!렌더링 기기의 ComfyUI 시스템 상태, 2026-09-06 실제 curl로 가져옴

!우리 작업 기록 시스템의 최신 작업 행, 2026-09-06

렌더링 기기의 ComfyUI 시스템 상태, 2026-09-06 실제 curl로 가져옴

우리 작업 기록 시스템의 최신 작업 행, 2026-09-06