Checking image quality and reading AI metrics
แยกภาพที่ยังตัดสินไม่ได้ ฝึก precision และ recall จากข้อมูลสมมติ และอธิบายขอบเขตของผลประเมิน
G05 · บทแกน 60 นาที · ฝึกบนคอมพิวเตอร์
แยกภาพที่ยังตัดสินไม่ได้ ฝึก precision และ recall จากข้อมูลสมมติ และอธิบายขอบเขตของผลประเมิน
เป้าหมายและการเตรียมตัว
บทแกน G05 ใช้ 60 นาที: อ่าน 15 ตรวจภาพตามกรณี 15 คำนวณ 20 และสรุป 10 นาที ใช้ spreadsheet หรือ Python 3.10 ขึ้นไป เป้าหมายคืออธิบาย false positive/false negative และเลือกตัวชี้วัดที่สอดคล้องกับผลเสียของความผิดพลาด
ภาพไม่ชัดกับไม่มีวัตถุเป็นคนละเรื่อง
ก่อนประเมิน ให้ดูความคมชัด การบัง แสง ขนาดวัตถุ และมุมมอง ถ้าคุณภาพไม่พอให้ผู้ทบทวนตัดสินได้ ควรแยกเป็น “ประเมินไม่ได้” พร้อมเหตุผล ไม่บังคับให้เป็น “ไม่มีวัตถุ” เพราะจะเปลี่ยนคำตอบอ้างอิงโดยไม่มีหลักฐาน
ในใบงาน G05-image-review.csv มีคำบรรยายกรณีภาพสามแบบ ให้ตัดสินว่าใช้ตอบโจทย์ “มีกล่องอุปกรณ์สีส้มในภาพหรือไม่” ได้หรือไม่ กรณีนี้เป็นคำบรรยายสังเคราะห์ ไม่ใช่ชุดภาพทดสอบจริง ภาพเสมือนจริงเหนือบทใช้สื่อแนวคิดเท่านั้น
นับให้ตรงหน่วยที่ประเมิน
รอบนี้ใช้ หนึ่งคำตอบต่อภาพ ว่ามีกล่องหรือไม่ ไม่ใช่การวัดความถูกต้องของกรอบ object detection เมื่อมีคำตอบอ้างอิงที่ทบทวนแล้ว:
- TP: มีจริงและระบบบอกว่ามี
- FP: ไม่มีจริงแต่ระบบบอกว่ามี อาจทำให้ต้องส่งคนไปตรวจเกินจำเป็น
- FN: มีจริงแต่ระบบบอกว่าไม่มี อาจทำให้พลาดสิ่งที่ต้องตรวจ
- TN: ไม่มีจริงและระบบบอกว่าไม่มี
precision = TP / (TP + FP) ตอบว่าสิ่งที่แจ้งว่าพบถูกเท่าใด ส่วน recall = TP / (TP + FN) ตอบว่าสิ่งที่มีจริงพบได้เท่าใด ถ้าตัวหารเป็นศูนย์ ให้รายงานว่าไม่มีฐานคำนวณในชุดนั้น ไม่แต่งให้เป็น 100%
การประเมินกรอบจริงต้องนิยามการจับคู่กรอบ ชั้นวัตถุ และเกณฑ์ทับซ้อน เช่น IoU เพิ่มเติม จึงไม่เรียกคะแนนจากใบงานนี้ว่า mAP ของ detector
ทดลองสองการตั้งค่า
เปิด G05-predictions.csv มี 10 ภาพสมมติ พร้อม truth และผลสองการตั้งค่า pred_low, pred_high ค่า 1 คือมีวัตถุ ค่า 0 คือไม่มี ให้แยกนับ TP FP FN TN สำหรับแต่ละคอลัมน์ก่อนดูเฉลย
ถ้าใช้ Python เปิด terminal ในโฟลเดอร์ ZIP ที่แตกแล้ว รัน Windows ด้วย py -3 metrics.py หรือ Linux ด้วย python3 metrics.py โปรแกรมอ่าน CSV ใกล้ไฟล์สคริปต์และพิมพ์ JSON ไม่มีการติดตั้ง package ฝึกโมเดล หรือส่งข้อมูลออกไปภายนอก
โจทย์อภิปราย: การตั้งค่าที่พลาดน้อยลงอาจทำให้แจ้งเกินเพิ่ม ทีมมีความสามารถทบทวนกี่รายการ และผลเสียจากการพลาดกับแจ้งเกินต่างกันอย่างไร? เลือกด้วยเหตุผลตามงาน ไม่เลือกเพียงคะแนนที่สูงกว่า ตัวเลขสองคอลัมน์เป็นตัวอย่างที่กำหนดขึ้น ไม่รับประกันว่าปรับ threshold แล้วทุกโมเดลจะได้ผลเหมือนกัน
ส่ง metric brief และตรวจผล
ส่งตารางนับสองแบบ สูตร/ผล ตัวเลือกพร้อมเหตุผล และข้อจำกัดอย่างน้อยสามข้อ เช่นข้อมูลสมมติเพียง 10 ภาพ ไม่มีการวัดเวลา ไม่มีการทดสอบพื้นที่ใหม่
เกณฑ์: นับ/สูตร 35, วิเคราะห์ผลเสีย 30, คุณภาพและหน่วยประเมิน 20, ข้อจำกัด 15 เป้าหมาย 75/100 และต้องไม่อ้างคะแนนนี้เป็นผล detector พร้อมติดโดรน หากต้องวัด latency ในงานต่อไป ให้กำหนดเวลาเริ่ม–สิ้นสุด เครื่อง รุ่น warm-up และการรวม/ไม่รวม preprocessing ให้ชัด
อ่านต่อและบรรณานุกรม
- เครื่องมือฝึก confidence และตัวชี้วัด
- Computer Vision และ Edge AI
- scikit-learn developers. (ม.ป.ป.). Metrics and scoring — Precision, recall and F-measures. ใช้นิยามตัวชี้วัดการจำแนก
- NIST. (2023). AI RMF 1.0. ใช้ประกอบการรายงานบริบทและข้อจำกัด
สืบค้น 8 กันยายน 2569 รูป โจทย์ ตัวเลขและเกณฑ์เป็นสิ่งที่โครงการสร้างเพื่อการเรียน ไม่มีผลเทรนหรือการทดสอบภาคสนามในบทนี้