เกี่ยวกับโปรเจกต์
ทดลองให้เห็น
ไม่ใช่แค่เล่าให้ฟัง
ใครเขียน
ผมเป็น developer ที่ทำงานกับ backend และ web มาสิบกว่าปี ใช้ชื่อ QR4Tech ในงานส่วนตัว ไม่ได้ทำงานให้บริษัท AI ไหน และไม่ได้รับเงินจากใครในการทดสอบ
ทำไมทำบล็อกนี้
ทุกครั้งที่มีโมเดลใหม่ออกมา จะมี benchmark ตัวเลขเยอะแยะ แต่พอเอามาใช้กับงานตรงหน้า ความรู้สึกมันไม่ตรงกับตัวเลขเสมอ เลยอยากมีที่จดว่า “โจทย์นี้ prompt แบบนี้ ได้ผลแบบนี้” — สำหรับตัวเองย้อนกลับมาดู และเผื่อมีใครเจอโจทย์คล้ายกัน
วิธีอ่านบล็อกนี้
ทุกโพสต์มีโครงเดียวกัน: โจทย์ → Prompt ที่ใช้จริง → ผลลัพธ์ที่ได้ → วิเคราะห์ → คะแนน
Prompt ในกล่อง “Prompt” คือข้อความที่พิมพ์จริงไม่ได้แต่ง ส่วนกล่อง “Output” คือคำตอบของโมเดลที่ตัดมาเฉพาะส่วนสำคัญ
ความหมายของคะแนน
| คะแนน | ความหมาย |
|---|---|
| 5 | ดีเยี่ยม — ไม่มีอะไรต้องแก้ เอาไปใช้ได้เลย |
| 4 | ดี — มีจุดเล็กน้อยที่ต้องแก้ แต่ประหยัดเวลาชัดเจน |
| 3 | ผ่าน — ใช้ได้ แต่ต้องตรวจละเอียด |
| 2 | ต้องแก้ — มีปัญหาที่ถ้าไม่เจอจะพัง |
| 1 | ไม่ผ่าน — เขียนเองเร็วกว่า |
เกณฑ์แต่ละโพสต์ไม่เท่ากันเสมอ เพราะโจทย์ต่างกัน แต่ส่วนใหญ่จะมี ความถูกต้อง, ความเข้าใจโจทย์, ความเร็ว และการอธิบาย
Tag โมเดล
โพสต์ทุกโพสต์ติด tag โมเดลที่ทดสอบ (เช่น gpt-5, claude-4) และ tag หมวดโจทย์ (เช่น auth, sql) หน้า โมเดล รวมคะแนนเฉลี่ยต่อโมเดลไว้ให้ดูภาพรวม — แต่เฉลี่ยจากโจทย์ต่างกันก็ต้องดูด้วยวิจารณญาณ
วิธีติดตาม
- RSS: /rss.xml
- ไม่มี newsletter ไม่มีแจ้งเตือน — เปิด RSS reader แล้วรอโมเดลใหม่ออก
ข้อตกลง
คะแนนทั้งหมดเป็นความเห็นส่วนตัวจากการลองใช้จริงครั้งเดียวหรือไม่กี่ครั้ง ไม่ใช่ benchmark ทางการ โมเดลเดียวกันวันถัดไปอาจให้ผลต่างกัน และ prompt ที่ต่างกันเล็กน้อยก็เปลี่ยนผลได้มาก อ่านเป็นบันทึกของคนคนหนึ่ง ไม่ใช่ข้อสรุป