เกี่ยวกับโปรเจกต์

ทดลองให้เห็น
ไม่ใช่แค่เล่าให้ฟัง

ใครเขียน

ผมเป็น developer ที่ทำงานกับ backend และ web มาสิบกว่าปี ใช้ชื่อ QR4Tech ในงานส่วนตัว ไม่ได้ทำงานให้บริษัท AI ไหน และไม่ได้รับเงินจากใครในการทดสอบ

ทำไมทำบล็อกนี้

ทุกครั้งที่มีโมเดลใหม่ออกมา จะมี benchmark ตัวเลขเยอะแยะ แต่พอเอามาใช้กับงานตรงหน้า ความรู้สึกมันไม่ตรงกับตัวเลขเสมอ เลยอยากมีที่จดว่า “โจทย์นี้ prompt แบบนี้ ได้ผลแบบนี้” — สำหรับตัวเองย้อนกลับมาดู และเผื่อมีใครเจอโจทย์คล้ายกัน

วิธีอ่านบล็อกนี้

ทุกโพสต์มีโครงเดียวกัน: โจทย์ → Prompt ที่ใช้จริง → ผลลัพธ์ที่ได้ → วิเคราะห์ → คะแนน

Prompt ในกล่อง “Prompt” คือข้อความที่พิมพ์จริงไม่ได้แต่ง ส่วนกล่อง “Output” คือคำตอบของโมเดลที่ตัดมาเฉพาะส่วนสำคัญ

ความหมายของคะแนน

คะแนนความหมาย
5ดีเยี่ยม — ไม่มีอะไรต้องแก้ เอาไปใช้ได้เลย
4ดี — มีจุดเล็กน้อยที่ต้องแก้ แต่ประหยัดเวลาชัดเจน
3ผ่าน — ใช้ได้ แต่ต้องตรวจละเอียด
2ต้องแก้ — มีปัญหาที่ถ้าไม่เจอจะพัง
1ไม่ผ่าน — เขียนเองเร็วกว่า

เกณฑ์แต่ละโพสต์ไม่เท่ากันเสมอ เพราะโจทย์ต่างกัน แต่ส่วนใหญ่จะมี ความถูกต้อง, ความเข้าใจโจทย์, ความเร็ว และการอธิบาย

Tag โมเดล

โพสต์ทุกโพสต์ติด tag โมเดลที่ทดสอบ (เช่น gpt-5, claude-4) และ tag หมวดโจทย์ (เช่น auth, sql) หน้า โมเดล รวมคะแนนเฉลี่ยต่อโมเดลไว้ให้ดูภาพรวม — แต่เฉลี่ยจากโจทย์ต่างกันก็ต้องดูด้วยวิจารณญาณ

วิธีติดตาม

  • RSS: /rss.xml
  • ไม่มี newsletter ไม่มีแจ้งเตือน — เปิด RSS reader แล้วรอโมเดลใหม่ออก

ข้อตกลง

คะแนนทั้งหมดเป็นความเห็นส่วนตัวจากการลองใช้จริงครั้งเดียวหรือไม่กี่ครั้ง ไม่ใช่ benchmark ทางการ โมเดลเดียวกันวันถัดไปอาจให้ผลต่างกัน และ prompt ที่ต่างกันเล็กน้อยก็เปลี่ยนผลได้มาก อ่านเป็นบันทึกของคนคนหนึ่ง ไม่ใช่ข้อสรุป