คืนนี้ผมตื่นมาตอนตีห้า ไม่ใช่เพราะฝันร้าย แต่เพราะเสียงพัดลมของการ์ดจอ 16GB ทั้งสองตัวที่ทำงานหนักจนแทบจะร้องเพลงประกอบชีวิต homelab ของผม เสียงหึ่งๆ นั้นบอกใบ้ว่าระบบกำลังเผาพลังสมองไปกับการสร้างภาพและประมวลผลโมเดลขนาดใหญ่พร้อมกัน ผมเดินออกมาดูหน้าจอ dashboard ที่แสดงสถานะเครื่อง เครื่องเรนเดอร์ และ เครื่องเก็บข้อมูล ส่วนตัว ตัวเลขที่ปรากฏทำให้ผมทั้งภูมิใจและหวาดระแวงไปในเวลาเดียวกัน

ภาพรวมของคืนที่ GPU ทำงานหนัก

เมื่อมองไปที่กราฟการใช้งาน การ์ดจอตัวแรกมี Utilization 100% เต็มที่ ขณะที่หน่วยความจำถูกใช้งานไป 15,745 MiB จากทั้งหมด 16,311 MiB ซึ่งเหลือพื้นที่ให้หายใจน้อยมาก ส่วนการ์ดตัวที่สองก็ใกล้เคียงกันด้วยค่า 98% และหน่วยความจำ 14,475 MiB ตัวเลขเหล่านี้ไม่ใช่เรื่องเล่นๆ มันหมายความว่าระบบกำลังทำงานหนักจนเกือบถึงขีดจำกัดทางกายภาพ ผมเห็นคิวงานใน ComfyUI ที่รันโมเดล FLUX คู่กับ qwen_image_edit พร้อมกัน ซึ่งปกติแล้วเราจะไม่ทำแบบนี้เพราะกลัวระบบจะล่ม แต่คืนนี้ผมตัดสินใจทดลองดูว่าถ้าดันให้มันทำงานเต็มศักยภาพ ผลลัพธ์จะเป็นอย่างไร

การที่หน่วยความจำถูกใช้ไปเกือบ 16GB ทั้งสองตัวนั้นเป็นสัญญาณเตือนภัยเงียบ ผมเคยเจอปัญหา OOM (Out of Memory) มาหลายครั้งจนแทบจะถอดใจ การที่ระบบยังยืนหยัดอยู่ได้โดยไม่ crash แสดงให้เห็นว่าสถาปัตยกรรมที่เราออกแบบมาเริ่มมีความเสถียรขึ้นบ้างแล้ว แต่ความกังวลยังคงอยู่ทุกวินาทีที่ตัวเลขกระพริบอยู่บนหน้าจอ มันเหมือนกับการขับรถเร็วเกินกำหนดในทางเปียกลื่น คุณรู้ว่ามันอันตรายแต่ก็อยากทดสอบขีดจำกัดของยางและระบบเบรก

คิวงานและจังหวะการเผาภาพ

สิ่งที่ทำให้ผมต้องตื่นมาดูคืออัตราการเผาภาพประมาณ 10 ชิ้นต่อชั่วโมง ซึ่งเป็นอัตราที่ถือว่าสูงมากสำหรับโฮมแล็บระดับนี้ ผมดูคิวงานใน n8n ที่เชื่อมต่อกับ ComfyUI เห็นว่า job #9403 กำลังรันอยู่ในขั้นตอน M3-M6 ซึ่งรวมถึง seed, prompt และ gates ต่างๆ งานก่อนหน้าอย่าง #9402 และ #9401 ล้วนผ่านสถานะ VERIFIED มาแล้ว แสดงว่า pipeline ของเราทำงานได้ต่อเนื่อง

การที่ภาพถูกสร้างออกมาได้เรื่อยๆ โดยไม่ติดขัดนั้นเป็นเรื่องน่าชื่นชม แต่ผมกลับรู้สึกกังวลกับคำว่า "พร้อมกัน" ในคิวงาน การรัน FLUX และ qwen_image_edit พร้อมกันทำให้ GPU ต้องสลับบริบทบ่อยครั้ง ซึ่งอาจส่งผลต่อประสิทธิภาพโดยรวมในระยะยาว ผมสังเกตว่าแม้จำนวนภาพจะออกมาเยอะ แต่คุณภาพบางชิ้นดูมีความไม่เสถียรเล็กน้อย ซึ่งเป็นผลข้างเคียงจากการที่ทรัพยากรถูกแบ่งปันอย่างหนาแน่น

บทเรียนจาก GPU Law และแนวคิด Borrow/TTL

ในระหว่างที่เฝ้าดูระบบทำงาน ผมคิดถึงหลักการ "GPU Law" ที่ผมตั้งไว้สำหรับโฮมแล็บนี้ ซึ่งเน้นเรื่องการบริหารจัดการทรัพยากรแบบ dynamic การมีระบบ borrow และ TTL (Time To Live) สำหรับ job ต่างๆ นั้นสำคัญมาก เพราะถ้าไม่มีกลไกนี้ งานบางตัวอาจยึดครอง GPU นานเกินไปจนงานอื่นต้องรอคอยหรือล้มเหลว

คืนนี้ผมเห็นคุณค่าของ TTL ชัดเจน เมื่อ job หนึ่งเสร็จสิ้น มันจะปล่อยทรัพยากรกลับสู่ pool ทันที ทำให้ job ถัดไปได้ใช้ต่อโดยไม่ต้องรอนาน การมีระบบ borrow ช่วยให้เราสามารถยืมทรัพยากรจากส่วนอื่นชั่วคราวเมื่อจำเป็น ซึ่งทำให้ throughput สูงขึ้นได้ แต่ความเสี่ยงคือถ้าการยืมนั้นผิดพลาด ระบบอาจเข้าสู่สถานะ deadlock ได้ ผมจึงต้องตรวจสอบ log อย่างใกล้ชิดเพื่อดูว่ามีการรอคอยกันผิดปกติหรือไม่

ความล้มเหลวและสิ่งที่เรียนรู้จากการเทรดเอง

นอกเหนือจากเรื่องเทคนิคแล้ว คืนนี้ผมยังรู้สึกท้อแท้กับผลประกอบการจากการเทรดด้วยตัวเอง ผลลัพธ์ไม่ได้นิ่งอย่างที่หวัง ทำให้ผมตัดสินใจแยกพอร์ตเทรดเล็กเพื่อลดความเสี่ยง แต่ในแง่ของ homelab ผมกลับพบว่าความพยายามที่จะควบคุมทุกอย่างด้วยตนเองนั้นมีความเสี่ยงสูงมาก การที่ GPU ทำงาน 100% นานเกินไปอาจทำให้ความร้อนสะสมและส่งผลต่ออายุการใช้งานในระยะยาว

บทเรียนสำคัญคือ "อย่าฝืนระบบเกินกว่าที่มันจะรับได้" แม้ตัวเลขจะดูสวยหรู แต่สุขภาพของเครื่องจักรสำคัญกว่า throughput ชั่วคราว ผมเรียนรู้ว่าการออกแบบระบบที่ดีต้องมีความยืดหยุ่นพอที่จะหยุดหรือชะลอเมื่อจำเป็น ไม่ใช่แค่ดันให้เร็วที่สุดเสมอไป ความล้มเหลวเล็กๆ น้อยๆ ในคืนนี้ทำให้ผมเห็นจุดอ่อนในกระบวนการ monitoring ที่ยังขาด alerting ที่ชัดเจนพอ

แผนถัดไปและความรู้สึกหลังผ่านคืนหนัก

หลังจากเฝ้าดูจนเช้า ผมตัดสินใจปรับลด concurrency ของ ComfyUI ลงครึ่งหนึ่ง เพื่อแลกกับความเสถียรและอายุการใช้งานของ GPU การยอมเสียความเร็วบ้างเพื่อ换取ความยั่งยืนนั้นเป็นสิ่งที่วิศวกรโฮมแล็บต้องเรียนรู้ ผมจะเพิ่มระบบ thermal throttling ที่เข้มงวดขึ้น และตรวจสอบ log ของ qwen38-chat:latest บน Mac Mini M4 Pro ซึ่งทำงานหนักเช่นกันด้วย context 32768 tokens

คืนนี้สอนให้ผมรู้ว่า การเป็นห้องแล็บ AI ในบ้านไม่ใช่แค่การสะสมอุปกรณ์ แต่คือการเข้าใจข้อจำกัดและเคารพมัน ผมรู้สึกภูมิใจที่ระบบยังยืนอยู่ได้ แต่ก็ตระหนักว่าต้องปรับปรุงอีกมาก เพื่อให้ homelab นี้สามารถทำงานได้อย่างยั่งยืนในระยะยาว โดยไม่ต้องตื่นมาเฝ้าทุกคืนแบบนี้

!หน้าจอ docker ps จากเครื่องเก็บข้อมูลส่วนตัว วันที่ 2026-09-06 คอนเทนเนอร์ระบบเราจริง

!หน้าจอ nvidia-smi จากเครื่องเรนเดอร์ของเรา วันที่ 2026-09-06 การ์ดวิ่งเกือบเต็มทุกตัว

หน้าจอ docker ps จากเครื่องเก็บข้อมูลส่วนตัว วันที่ 2026-09-06 คอนเทนเนอร์ระบบเราจริง

หน้าจอ nvidia-smi จากเครื่องเรนเดอร์ของเรา วันที่ 2026-09-06 การ์ดวิ่งเกือบเต็มทุกตัว