Skip to main content

Command Palette

Search for a command to run...

Jev ฉลาดพอไหม? — บททดสอบความสามารถของโมเดล "ตัดสินใจ" (ตอนที่ 1)

Updated
•3 min read•View as Markdown

Jev คืออะไร?

โมเดล AI ที่เราคุ้นเคย (LLM อย่าง GPT, Claude, Gemini, DeepSeek) ทำงานด้วยการ สร้างข้อความทีละคำ — คุณถาม มันเขียนคำตอบออกมาเป็นประโยค นั่นทรงพลังมากสำหรับงานเขียน สรุป แปล หรือคิดเป็นขั้นตอน

แต่ในซอฟต์แวร์จริง งานจำนวนมากไม่ได้ต้องการ "ข้อความ" — มันต้องการ การตัดสินใจ:

  • ข่าวชิ้นนี้เป็นข่าวประเภทไหน?
  • มันสำคัญระดับไหน (1–5)?
  • เนื้อหานี้ควรทำต่อ หรือทิ้ง?

Jev (จาก TypeSafe AI) ถูกออกแบบมาเพื่อสิ่งนี้โดยเฉพาะ — มันไม่เขียนข้อความ แต่ เลือกคำตอบจากตัวเลือกที่เรากำหนด แล้วคืนค่าเป็นคำตอบที่มีชนิดชัดเจน (typed) พร้อมระดับความมั่นใจ (confidence) ทันที

มันมีคำถามอยู่ 3 แบบเท่านั้น:

  • Choice — เลือก 1 จากตัวเลือกที่กำหนด (พร้อมความน่าจะเป็นของแต่ละตัว)
  • Score — ให้คะแนนตามระดับที่นิยามไว้
  • Noul — ใช่/ไม่ใช่ คืนเป็นความน่าจะเป็น 0–1

จุดที่น่าสนใจเชิงเศรษฐศาสตร์: Jev คิดเงินเฉพาะ input ส่วน output ฟรี และตอบเร็ว (หลัก ~1 วินาที) เพราะมันไม่ต้องไล่เขียนข้อความทีละคำ

คำถามหลักของเราคือ: โมเดลที่ "ตัดสินใจอย่างเดียว" แบบนี้ มันฉลาด/แม่นพอจะแทนงานที่วันนี้เราใช้ LLM ตัวใหญ่ทำอยู่ไหม? ตอนที่ 1 นี้เราเริ่มจากพื้นฐานที่สุด — มันเข้าใจภาษาและมีความรู้จริงหรือเปล่า ก่อนจะไปดูงานจริงในตอนที่ 2


MarketDX ทำอะไร?

MarketDX เป็นแพลตฟอร์มที่ แปลงข่าวการเงินเป็นกราฟผลกระทบ — อ่านข่าวแล้วบอกว่าข่าวนั้นกระทบสินทรัพย์/ธีมการลงทุนตัวไหน ทิศทางบวกหรือลบ และส่งต่อไปยังผู้เล่นที่เกี่ยวข้องอย่างไร เบื้องหลังมีงาน "ตัดสินใจ" แบบนี้อยู่เต็มไปหมด และหลายงานยิงทุกข่าวที่ไหลเข้ามา — ซึ่งแปลว่าถ้าลดต้นทุนต่อการตัดสินใจได้ ผลรวมมหาศาล จึงเป็นเหตุผลที่เราสนใจ Jev


หลักการทดสอบของเรา

ก่อนดูผล ต้องเข้าใจ 2 กติกาที่เรายึด เพราะมันเปลี่ยนวิธีอ่านผลทั้งหมด:

1. ตัดสินคุณภาพด้วยการ "อ่านเอง" (eyeball) ไม่ใช่ดูว่า "ตรงกับของเดิม" ของเดิมในระบบเราก็คือ LLM (ซึ่งบางทีก็ผิด) การวัดว่า Jev "ตรงกับ LLM เดิมกี่ %" จึงไม่ได้บอกว่า Jev ดีหรือแย่ — บอกแค่ว่ามันเหมือนของเดิมแค่ไหน เป้าหมายจริงคือ ให้ดีขึ้น ไม่ใช่เหมือนเดิม เราจึงอ่านผลลัพธ์จริงแล้วตัดสินเอง

2. เขียนคำถามให้โมเดลแบบไม่ "ใบ้คำตอบ" เราใส่ "นิยามงาน" ในคำถามได้ (เช่น บอกว่าให้ถือว่าความหมายเดียวกันแม้จะต่างที่ความสุภาพ) แต่เรา ไม่ใส่ตัวอย่างประโยคที่เฉลยคำตอบ เพราะนั่นทำให้ผลดูดีเกินจริง


บททดสอบ 1: ภาษา — เข้าใจ "ความหมาย" ข้ามภาษาไหม?

คำถามที่อยากรู้: ประโยค "กินข้าวหรือยังครับ" (สุภาพ) กับ "เฮ้ย แดกมายัง" (สแลงหยาบ) — Jev รู้ไหมว่ามันหมายความเดียวกัน? แล้วทำได้กี่ภาษา?

วิธี: เราสร้างประโยคเองใน 23 ภาษา (ไทย จีน ญี่ปุ่น อังกฤษ อาหรับ ฮินดี เกาหลี ฮกเกี้ยน ฯลฯ) แต่ละภาษามี 3 แบบ แล้วถาม Jev ว่าคู่ไหน "หมายความเดียวกัน":

  • A vs B — สุภาพ ↔ สแลง (ความหมายเดียวกัน) → ควรได้คะแนนสูง
  • A vs N — คล้ายกันมากแต่เจตนาต่าง (เช่น "กินข้าวมาหรือยัง" [ถาม] vs "กินข้าวมาแล้วเหรอ" [ทวงแบบรู้อยู่แล้ว]) → คลุมเครือ
  • A vs C — คนละเรื่อง ("กินข้าวยัง" vs "หิวข้าวยัง") → ควรได้คะแนนต่ำ

ผล (ค่าเฉลี่ยทั้ง 23 ภาษา, คะแนน 0–1):

คู่ประโยค คะแนน "เหมือนกัน" ตีความ
สุภาพ ↔ สแลง (เหมือนจริง) 0.89 ✅ รู้ว่าเหมือน
คล้ายแต่เจตนาต่าง 0.64 🟡 ก้ำกึ่ง — ตามที่ควรเป็น
คนละเรื่อง 0.20 ✅ รู้ว่าต่าง

อ่านผล: Jev ไล่ระดับได้ถูก (เหมือนชัด > ก้ำกึ่ง > ต่าง) เกือบทุกภาษา และทำได้ทั้ง 23 ภาษารวมสแลง — ไม่ใช่เก่งแค่อังกฤษ ที่น่าประทับใจคือมันแยก "หิว" ออกจาก "กินแล้ว" ได้ทั้งที่ประโยคหน้าตาคล้ายกันมาก

จุดอ่อนที่เจอ (มีจริง):

  • ภาษาถิ่นข้อมูลน้อย (ฮกเกี้ยน) อ่อนสุด — แยกความหมายใกล้ ๆ ได้ไม่คมเท่าภาษาหลัก
  • สำนวนกำกวม เช่น "have your tea" ในอังกฤษ (แปลว่ากินมื้อเย็นก็ได้ ดื่มชาก็ได้) — Jev เลือกความหมายตรงตัว

เกร็ดที่เจอระหว่างทาง: เรายิงคำถามเดิมซ้ำ 3 ครั้ง จำนวน token ที่คิดเงินเท่าเดิมทุกครั้ง → Jev ไม่มีส่วนลดแบบ cache (ต่างจาก LLM หลายเจ้า) ถ้าจะประหยัดต้องเขียนคำถามให้สั้น หรือรวมหลายคำถามในครั้งเดียว


บททดสอบ 2: ความรู้รอบโลก — ตื้นและลึก

คำถามที่อยากรู้: นอกจากเข้าใจภาษา มันมี "ความรู้" จริงไหม ทั้งความรู้ทั่วไปและความรู้เฉพาะทางเชิงลึก?

วิธี: ข้อสอบปรนัย 4 ตัวเลือก 75 ข้อ แบ่ง 3 ระดับ × 15 สาขา (บัญชี กฎหมาย การเงิน แพทย์ ฟิสิกส์ ประวัติศาสตร์ ปรัชญา ฯลฯ):

  • ทั่วไป — ความรู้กว้าง ๆ
  • ตื้น — ระดับที่นักศึกษาสาขานั้นควรตอบได้
  • ลึก — เฉพาะทางจริง เช่น การลงบัญชีค่า R&D ระหว่างมาตรฐาน IFRS กับ US GAAP, ยุคยาโยยของญี่ปุ่น, Gettier problem ในปรัชญา, ทฤษฎี Modigliani–Miller ทางการเงิน

(เราสลับตำแหน่งตัวเลือกทุกข้อ กันไม่ให้เฉลยไปกองอยู่ตัวเลือกเดิม)

ผล:

ระดับ คะแนน
ทั่วไป 15/15
ตื้น 30/30
ลึก 30/30
รวม 75/75 = 100%

ความมั่นใจของ Jev เกือบทุกข้อ = ~1.00 และตอบถูกแม้ข้อเชิงลึกเฉพาะทาง

อ่านผลอย่างซื่อสัตย์: 100% น่าประทับใจ แต่ก็แปลว่า เรายังหา "เพดาน" ของมันไม่เจอ — ข้อสอบเชิงลึกของเราถึงจะเฉพาะทาง แต่ก็ยังเป็นความรู้ที่มีในตำรา เรายังไม่ได้ลองความรู้ที่กำกวม/มีข้อถกเถียง หรือโจทย์ที่ต้องใช้เหตุผลหลายชั้น สรุปได้แค่ว่า "ความรู้กว้างและลึกพอ" ไม่ใช่ "ไม่มีขีดจำกัด"


สรุปตอนที่ 1

สองบททดสอบพื้นฐานนี้ตอบคำถามว่า "Jev ฉลาดพอไหม" ได้ค่อนข้างชัด:

  • เข้าใจภาษา/ความหมาย ข้าม 23 ภาษา รวมสแลงและ register ต่าง ๆ ได้แม่นและไล่ระดับความคล้ายได้จริง
  • มีความรู้ ทั้งกว้างและลึกในหลายสาขา
  • เร็ว (~1 วินาที) และคิดเงินเฉพาะ input

พอเห็นว่าพื้นฐานแน่น เราจึงกล้าเอาไปลองกับ งานจริงของ MarketDX — ซึ่งเป็นเรื่องของ ตอนที่ 2: เราเอา Jev ไปแทนงานตัดสินใจที่ยิงทุกข่าว ผลเป็นยังไง เจอกับดักอะไร แก้ยังไง และถ้าเทียบต้นทุนกับ LLM เดิม (DeepSeek / OpenAI / Gemini) มันคุ้มแค่ไหน

More from this blog

MCP Optimization: ลด round-trip ของ resolver ด้วย Jev (ตอนที่ 3)

ปัญหาที่ MCP เจอทุกวัน: การปิงปอง MarketDX เปิดให้ผู้ช่วย AI (เช่น Claude) เรียกข้อมูลตลาดผ่าน MCP — ชุด "เครื่องมือ" ที่ LLM เรียกใช้ได้เอง ค้นหุ้น ดึงงบ สกรีน ฯลฯ ฟังดูง่าย แต่มีขั้นตอนหนึ่งที่แพงเง

Sep 18, 20266 min read57

เอา Jev มาทำงานจริง — ผล ต้นทุน และบทเรียน (ตอนที่ 2)

งานที่เราเลือกลอง MarketDX แปลงข่าวการเงินเป็นกราฟผลกระทบ หัวใจคือขั้นตอน "อ่านข่าวแล้วจัดประเภท + ประเมิน" ที่ยิง ทุกข่าว ที่ไหลเข้ามา — เป็นงาน LLM ที่ volume สูงสุดในระบบ ถ้าแทนได้คือประหยัดก้อนใหญ

Sep 18, 20264 min read71

MarketDX

6 posts