Model Quantization: บีบโมเดล AI ให้เล็กลง 75% แล้วรันบนโต๊ะคุณเอง
Quantization คือเทคนิคบีบอัดโมเดล AI ที่ลดขนาดได้ถึง 75% (โมเดล 70B จาก 140GB เหลือ 35GB) โดยคุณภาพหายไม่ถึง 1% — เข้าใจง่ายๆ ว่ามันทำงานอย่างไร ทำไมหน่วยความจำคือคอขวดตัวจริง และทำไม DGX Spark (128GB unified…