Jev ฉลาดพอไหม? — บททดสอบความสามารถของโมเดล "ตัดสินใจ" (ตอนที่ 1)
Jev คืออะไร?
โมเดล AI ที่เราคุ้นเคย (LLM อย่าง GPT, Claude, Gemini, DeepSeek) ทำงานด้วยการ สร้างข้อความทีละคำ — คุณถาม มันเขียนคำตอบออกมาเป็นประโยค นั่นทรงพลังมากสำหรับงานเขียน สรุป แปล หรือคิดเป็นขั้นตอน
แต่ในซอฟต์แวร์จริง งานจำนวนมากไม่ได้ต้องการ "ข้อความ" — มันต้องการ การตัดสินใจ:
- ข่าวชิ้นนี้เป็นข่าวประเภทไหน?
- มันสำคัญระดับไหน (1–5)?
- เนื้อหานี้ควรทำต่อ หรือทิ้ง?
Jev (จาก TypeSafe AI) ถูกออกแบบมาเพื่อสิ่งนี้โดยเฉพาะ — มันไม่เขียนข้อความ แต่ เลือกคำตอบจากตัวเลือกที่เรากำหนด แล้วคืนค่าเป็นคำตอบที่มีชนิดชัดเจน (typed) พร้อมระดับความมั่นใจ (confidence) ทันที
มันมีคำถามอยู่ 3 แบบเท่านั้น:
- Choice — เลือก 1 จากตัวเลือกที่กำหนด (พร้อมความน่าจะเป็นของแต่ละตัว)
- Score — ให้คะแนนตามระดับที่นิยามไว้
- Noul — ใช่/ไม่ใช่ คืนเป็นความน่าจะเป็น 0–1
จุดที่น่าสนใจเชิงเศรษฐศาสตร์: Jev คิดเงินเฉพาะ input ส่วน output ฟรี และตอบเร็ว (หลัก ~1 วินาที) เพราะมันไม่ต้องไล่เขียนข้อความทีละคำ
คำถามหลักของเราคือ: โมเดลที่ "ตัดสินใจอย่างเดียว" แบบนี้ มันฉลาด/แม่นพอจะแทนงานที่วันนี้เราใช้ LLM ตัวใหญ่ทำอยู่ไหม? ตอนที่ 1 นี้เราเริ่มจากพื้นฐานที่สุด — มันเข้าใจภาษาและมีความรู้จริงหรือเปล่า ก่อนจะไปดูงานจริงในตอนที่ 2
MarketDX ทำอะไร?
MarketDX เป็นแพลตฟอร์มที่ แปลงข่าวการเงินเป็นกราฟผลกระทบ — อ่านข่าวแล้วบอกว่าข่าวนั้นกระทบสินทรัพย์/ธีมการลงทุนตัวไหน ทิศทางบวกหรือลบ และส่งต่อไปยังผู้เล่นที่เกี่ยวข้องอย่างไร เบื้องหลังมีงาน "ตัดสินใจ" แบบนี้อยู่เต็มไปหมด และหลายงานยิงทุกข่าวที่ไหลเข้ามา — ซึ่งแปลว่าถ้าลดต้นทุนต่อการตัดสินใจได้ ผลรวมมหาศาล จึงเป็นเหตุผลที่เราสนใจ Jev
หลักการทดสอบของเรา
ก่อนดูผล ต้องเข้าใจ 2 กติกาที่เรายึด เพราะมันเปลี่ยนวิธีอ่านผลทั้งหมด:
1. ตัดสินคุณภาพด้วยการ "อ่านเอง" (eyeball) ไม่ใช่ดูว่า "ตรงกับของเดิม" ของเดิมในระบบเราก็คือ LLM (ซึ่งบางทีก็ผิด) การวัดว่า Jev "ตรงกับ LLM เดิมกี่ %" จึงไม่ได้บอกว่า Jev ดีหรือแย่ — บอกแค่ว่ามันเหมือนของเดิมแค่ไหน เป้าหมายจริงคือ ให้ดีขึ้น ไม่ใช่เหมือนเดิม เราจึงอ่านผลลัพธ์จริงแล้วตัดสินเอง
2. เขียนคำถามให้โมเดลแบบไม่ "ใบ้คำตอบ" เราใส่ "นิยามงาน" ในคำถามได้ (เช่น บอกว่าให้ถือว่าความหมายเดียวกันแม้จะต่างที่ความสุภาพ) แต่เรา ไม่ใส่ตัวอย่างประโยคที่เฉลยคำตอบ เพราะนั่นทำให้ผลดูดีเกินจริง
บททดสอบ 1: ภาษา — เข้าใจ "ความหมาย" ข้ามภาษาไหม?
คำถามที่อยากรู้: ประโยค "กินข้าวหรือยังครับ" (สุภาพ) กับ "เฮ้ย แดกมายัง" (สแลงหยาบ) — Jev รู้ไหมว่ามันหมายความเดียวกัน? แล้วทำได้กี่ภาษา?
วิธี: เราสร้างประโยคเองใน 23 ภาษา (ไทย จีน ญี่ปุ่น อังกฤษ อาหรับ ฮินดี เกาหลี ฮกเกี้ยน ฯลฯ) แต่ละภาษามี 3 แบบ แล้วถาม Jev ว่าคู่ไหน "หมายความเดียวกัน":
- A vs B — สุภาพ ↔ สแลง (ความหมายเดียวกัน) → ควรได้คะแนนสูง
- A vs N — คล้ายกันมากแต่เจตนาต่าง (เช่น "กินข้าวมาหรือยัง" [ถาม] vs "กินข้าวมาแล้วเหรอ" [ทวงแบบรู้อยู่แล้ว]) → คลุมเครือ
- A vs C — คนละเรื่อง ("กินข้าวยัง" vs "หิวข้าวยัง") → ควรได้คะแนนต่ำ
ผล (ค่าเฉลี่ยทั้ง 23 ภาษา, คะแนน 0–1):
| คู่ประโยค | คะแนน "เหมือนกัน" | ตีความ |
|---|---|---|
| สุภาพ ↔ สแลง (เหมือนจริง) | 0.89 | ✅ รู้ว่าเหมือน |
| คล้ายแต่เจตนาต่าง | 0.64 | 🟡 ก้ำกึ่ง — ตามที่ควรเป็น |
| คนละเรื่อง | 0.20 | ✅ รู้ว่าต่าง |
อ่านผล: Jev ไล่ระดับได้ถูก (เหมือนชัด > ก้ำกึ่ง > ต่าง) เกือบทุกภาษา และทำได้ทั้ง 23 ภาษารวมสแลง — ไม่ใช่เก่งแค่อังกฤษ ที่น่าประทับใจคือมันแยก "หิว" ออกจาก "กินแล้ว" ได้ทั้งที่ประโยคหน้าตาคล้ายกันมาก
จุดอ่อนที่เจอ (มีจริง):
- ภาษาถิ่นข้อมูลน้อย (ฮกเกี้ยน) อ่อนสุด — แยกความหมายใกล้ ๆ ได้ไม่คมเท่าภาษาหลัก
- สำนวนกำกวม เช่น "have your tea" ในอังกฤษ (แปลว่ากินมื้อเย็นก็ได้ ดื่มชาก็ได้) — Jev เลือกความหมายตรงตัว
เกร็ดที่เจอระหว่างทาง: เรายิงคำถามเดิมซ้ำ 3 ครั้ง จำนวน token ที่คิดเงินเท่าเดิมทุกครั้ง → Jev ไม่มีส่วนลดแบบ cache (ต่างจาก LLM หลายเจ้า) ถ้าจะประหยัดต้องเขียนคำถามให้สั้น หรือรวมหลายคำถามในครั้งเดียว
บททดสอบ 2: ความรู้รอบโลก — ตื้นและลึก
คำถามที่อยากรู้: นอกจากเข้าใจภาษา มันมี "ความรู้" จริงไหม ทั้งความรู้ทั่วไปและความรู้เฉพาะทางเชิงลึก?
วิธี: ข้อสอบปรนัย 4 ตัวเลือก 75 ข้อ แบ่ง 3 ระดับ × 15 สาขา (บัญชี กฎหมาย การเงิน แพทย์ ฟิสิกส์ ประวัติศาสตร์ ปรัชญา ฯลฯ):
- ทั่วไป — ความรู้กว้าง ๆ
- ตื้น — ระดับที่นักศึกษาสาขานั้นควรตอบได้
- ลึก — เฉพาะทางจริง เช่น การลงบัญชีค่า R&D ระหว่างมาตรฐาน IFRS กับ US GAAP, ยุคยาโยยของญี่ปุ่น, Gettier problem ในปรัชญา, ทฤษฎี Modigliani–Miller ทางการเงิน
(เราสลับตำแหน่งตัวเลือกทุกข้อ กันไม่ให้เฉลยไปกองอยู่ตัวเลือกเดิม)
ผล:
| ระดับ | คะแนน |
|---|---|
| ทั่วไป | 15/15 |
| ตื้น | 30/30 |
| ลึก | 30/30 |
| รวม | 75/75 = 100% |
ความมั่นใจของ Jev เกือบทุกข้อ = ~1.00 และตอบถูกแม้ข้อเชิงลึกเฉพาะทาง
อ่านผลอย่างซื่อสัตย์: 100% น่าประทับใจ แต่ก็แปลว่า เรายังหา "เพดาน" ของมันไม่เจอ — ข้อสอบเชิงลึกของเราถึงจะเฉพาะทาง แต่ก็ยังเป็นความรู้ที่มีในตำรา เรายังไม่ได้ลองความรู้ที่กำกวม/มีข้อถกเถียง หรือโจทย์ที่ต้องใช้เหตุผลหลายชั้น สรุปได้แค่ว่า "ความรู้กว้างและลึกพอ" ไม่ใช่ "ไม่มีขีดจำกัด"
สรุปตอนที่ 1
สองบททดสอบพื้นฐานนี้ตอบคำถามว่า "Jev ฉลาดพอไหม" ได้ค่อนข้างชัด:
- เข้าใจภาษา/ความหมาย ข้าม 23 ภาษา รวมสแลงและ register ต่าง ๆ ได้แม่นและไล่ระดับความคล้ายได้จริง
- มีความรู้ ทั้งกว้างและลึกในหลายสาขา
- เร็ว (~1 วินาที) และคิดเงินเฉพาะ input
พอเห็นว่าพื้นฐานแน่น เราจึงกล้าเอาไปลองกับ งานจริงของ MarketDX — ซึ่งเป็นเรื่องของ ตอนที่ 2: เราเอา Jev ไปแทนงานตัดสินใจที่ยิงทุกข่าว ผลเป็นยังไง เจอกับดักอะไร แก้ยังไง และถ้าเทียบต้นทุนกับ LLM เดิม (DeepSeek / OpenAI / Gemini) มันคุ้มแค่ไหน