Skip to main content

⚖️ เปิดตัว OpenThai 2.0 Legal

ประกาศเมื่อ 24 กรกฎาคม 2569 (2026)

OpenThai 2.0 Legal — โมเดลภาษาไทยด้านกฎหมายแบบเปิด

AI กฎหมายไทยที่จำตัวบทได้ขึ้นใจ — สร้างโดยคนไทย เพื่อคนไทย

โครงการ OpenThai ขอประกาศเปิดตัว OpenThai 2.0 Legal โมเดลภาษาขนาดใหญ่แบบเปิด (open-weight) ที่พัฒนาขึ้นเพื่องานกฎหมายไทยโดยเฉพาะ พร้อมเปิดให้ดาวน์โหลดน้ำหนักโมเดลได้ฟรีบน Hugging Face

โมเดลนี้ออกแบบมาสำหรับทนายความ ที่ปรึกษากฎหมายภายในองค์กร ทีมกำกับดูแล ผู้พัฒนาเทคโนโลยีทางกฎหมาย และหน่วยงานภาครัฐ ที่ต้องการคำตอบด้านกฎหมายและคำพิพากษาไทยที่เชื่อถือได้และอ้างอิงแหล่งที่มาได้

ทดลองใช้งาน

ทดลองใช้โมเดลจริงได้ทันทีผ่านเว็บเบราว์เซอร์ โดยไม่ต้องติดตั้งอะไรเลย

ทดลองใช้งานสด + เอกสารฉบับเต็มiapp.co.th/openmodels/openthai2p0-legal

หน้าดังกล่าวมีเดโมโต้ตอบครบทั้งสามโหมด (ปิดตำรา / อ้างอิงตัวบท RAG / เขียนวิเคราะห์) พร้อม API ที่โฮสต์ให้ใช้ฟรีถึง 24 สิงหาคม 2569 (ต้องมี iApp API key ซึ่งสมัครฟรี)

ดาวน์โหลดโมเดล

OpenThai 2.0 Legal 30B-A3B — Hugging Facehuggingface.co

iapp/openthai2.0-legal-thaillm-nemotron-3-nano-30b-a3b

🌟 จุดเด่น

  • น้ำหนักโมเดลเปิด ติดตั้งใช้งานเองได้ — โมเดล Mixture-of-Experts ขนาด 30B ที่ทำงานจริงเพียง ~3B พารามิเตอร์ต่อโทเคน รันได้บน GPU เพียงตัวเดียวที่มี VRAM ขั้นต่ำ 24 GB ด้วย NVFP4 (4-bit)
  • อ้างอิงตัวบทจริง — ส่งคืนชื่อกฎหมายและ มาตรา ที่ถูกต้องในรูปแบบ JSON พร้อมต่อยอดกับระบบ RAG และเครื่องมือร่างเอกสารได้ทันที
  • จำประมวลกฎหมายได้จากความจำ — เมื่อถามโดยไม่ใส่ตัวบทมาในคำถาม ยังจดจำและอ้างอิงมาตราที่ถูกต้องได้ โดยแม่นกว่า Qwen3.6-35B ซึ่งใหญ่กว่ามากราว 4 เท่า ในหมวดประมวลกฎหมายแพ่งและพาณิชย์
  • เขียนได้อย่างนักกฎหมาย — ชนะ Qwen3.6-35B ครบทั้งสี่ด้าน ของการประเมินการเขียนวิเคราะห์ทางกฎหมาย
  • ตั้งอยู่บนแหล่งกฎหมายไทยจริง — ฝึกฝนบนตัวบทกฎหมายและคำพิพากษาศาลฎีกาที่เผยแพร่ต่อสาธารณะ

📊 ผลการทดสอบมาตรฐาน

ผลการทดสอบ OpenThai 2.0 Legal เทียบกับ Qwen3.6-35B และโมเดลฐาน Nemotron

การประเมินOpenThai 2.0 LegalQwen3.6-35BNemotron-3-30B (ฐาน)
Closed-book: จำกฎหมายได้เอง
แพ่งและพาณิชย์ (n=3,729)0.070.020.001
ภาษี — ประมวลรัษฎากร (n=50)0.400.360.31
Open-book: ใช้ตัวบทที่ให้มา (RAG)
แพ่งและพาณิชย์ อ้างจากบริบท (n=3,729)0.990.990.98
ภาษี echo (n=50)0.840.840.64
ภาษี เลือกมาตราท่ามกลางตัวลวง (n=50)0.690.640.45
การเขียนวิเคราะห์ (คำพิพากษาศาลฎีกา)
ความถูกต้องของการอ้างอิง (n=72)0.250.090.02
สรุปข้อวินิจฉัยถูกต้อง (n=72)0.570.500.31
ครอบคลุมประเด็นสำคัญ (n=72)0.600.550.27
คุณภาพการเขียน (n=72)0.460.430.13

คะแนนอยู่ระหว่าง 0 ถึง 1 ยิ่งสูงยิ่งดี แถวที่เป็นการอ้างอิงใช้ตัวให้คะแนน citation-F1 ของ NitiBench ส่วนข้อวินิจฉัย ความครอบคลุม และคุณภาพการเขียน ตัดสินโดย Gemini 3.1 Flash Lite ทุกโมเดลถูกรันใหม่ทั้งหมดภายใต้โปรโตคอลเดียวกัน คือรันครั้งเดียว ปิดโหมดคิด และตรวจการอ้างอิงด้วยโปรแกรม

ℹ️ ขอบเขตของข้อความ

นี่คือความสามารถในการจดจำกฎหมายไทยแบบ closed-book ที่ดีที่สุดเท่าที่วัดได้ในกลุ่มโมเดลที่นำไปติดตั้งใช้งานเองได้ ทั้งนี้ยังมีบริการคลาวด์แบบปิดที่ทำคะแนนได้สูงกว่า

🧾 รายละเอียดโมเดล

ชื่อโมเดลopenthai2.0-legal-thaillm-nemotron-3-nano-30b-a3b
โมเดลฐานNVIDIA Nemotron-3-Nano-Omni-30B-A3B-Reasoning (สกัดเฉพาะแกนข้อความ, MoE แบบผสม Mamba2-Transformer)
จำนวนพารามิเตอร์30B ทั้งหมด, ~3B ทำงานจริงต่อโทเคน
ความยาวบริบททดสอบที่ 32,768 (สถาปัตยกรรมรองรับถึง 256k)
ภาษาไทย (หลัก), อังกฤษ (การให้เหตุผล)
ความละเอียดbfloat16 safetensors 17 ชาร์ด · NVFP4 สำหรับ GPU ตัวเดียว 24 GB
เครื่องมือฝึกNVIDIA NeMo (Megatron-Bridge สำหรับ CPT/SFT, NeMo-RL สำหรับ GRPO)
การให้บริการvLLM (ยืนยันแล้ว) และ NVIDIA NIM (รองรับ API แบบ OpenAI)
สัญญาอนุญาตNVIDIA Open Model Agreement

🔬 ฝึกฝนมาอย่างไร

ขั้นตอนการฝึก: โมเดลฐาน 30B → CPT → SFT → GRPO → เปิดตัว

สามขั้นตอนบนแพลตฟอร์ม NVIDIA NeMo

  1. CPT (การฝึกต่อเนื่อง) — ฝังตัวบทกฎหมายลงในน้ำหนักโมเดล ฝึกอ่านตัวบทเต็มของทุกมาตราทั้งสองทิศทาง รวม 360,985 แบบฝึก ราว 800 ล้านโทเคนกฎหมายไทย
  2. SFT (การปรับแต่งแบบมีผู้สอน) — สอนการตอบแบบอ้างอิงแหล่งที่มาในรูปแบบ JSON ที่กำหนด รวม 16,436 ตัวอย่างคำตอบข้อสอบและบทวิเคราะห์เนติบัณฑิต
  3. GRPO (การเรียนรู้แบบเสริมกำลัง) — ใช้ค่า citation F1 ของชุดทดสอบเป็นรางวัล หักคะแนนการอ้างอิงที่ผิดหรือขาดหาย รวม 8,568 คำถามที่ให้คะแนน ราว 68,500 ร่างคำตอบ

🚀 เริ่มใช้งาน

รันด้วย vLLM บน 2 GPU

vllm serve iapp/openthai2.0-legal-thaillm-nemotron-3-nano-30b-a3b \
--tensor-parallel-size 2 --trust-remote-code \
--max-model-len 32768 --enforce-eager

หรือเรียกผ่าน API ที่โฮสต์ให้ (ฟรีถึง 24 ส.ค. 2569 ด้วย iApp API key ที่สมัครฟรี)

from openai import OpenAI
client = OpenAI(base_url="https://api.iapp.co.th/v3/llm/openthai2p0-legal",
api_key="YOUR_IAPP_API_KEY")

r = client.chat.completions.create(
model="openthai2.0-legal",
messages=[{"role": "user", "content": "ลักทรัพย์ในเวลากลางคืน ผิดมาตราใด"}],
max_tokens=1024,
)
print(r.choices[0].message.content)

🔗 ใช้งานร่วมกับ RAG (แนะนำอย่างยิ่ง)

โมเดลเก่งที่สุดเมื่อตัวบทกฎหมายอยู่ในคำถาม ความแม่นยำการอ้างอิงแบบ open-book สูงถึง 0.99 เทียบกับ 0.07–0.40 จากความจำล้วน งานจริงจึงควรใช้คู่กับระบบค้นคืนเอกสารเสมอ

OpenThaiRAG — เฟรมเวิร์ก RAG สัญชาติไทยopenthai.aieat.or.th/openthairag

คู่มือ: ใช้งานร่วมกับ Open WebUI และ OpenThaiRAGiapp.co.th

ชุดข้อมูลกฎหมายไทยที่แนะนำสำหรับสร้างคลังค้นคืน: WangchanX-Legal-ThaiCCL-RAG, NitiBench และตัวบทฉบับทางการจาก สำนักงานคณะกรรมการกฤษฎีกา

⚠️ ข้อจำกัดและการใช้งานอย่างรับผิดชอบ

  • คุณภาพของระบบค้นคืนมีผลโดยตรง — หากระบบค้นคืนส่งมาตราผิดมา คำตอบก็จะผิดตาม
  • การแยกมาตราที่ใกล้เคียงกันคืองานที่ยากที่สุด — เป็นด้านที่ได้คะแนนต่ำที่สุดของทุกโมเดล รวมถึงของเรา
  • ขอบเขตความรู้ — ฝึกบนกฎหมายลายลักษณ์อักษรของไทยและข้อหารือของกรมสรรพากร สาขาเฉพาะทางหรือการแก้ไขล่าสุดอาจยังบางกว่า
  • ต้องมีผู้เชี่ยวชาญกำกับดูแล — ผลลัพธ์เป็นเครื่องมือช่วยตัดสินใจ มิใช่คำปรึกษาทางกฎหมาย ควรตรวจสอบการอ้างอิงทุกครั้งกับตัวบทฉบับปัจจุบัน

🙏 ผู้ร่วมพัฒนา

พัฒนาโดยทีม OpenThai (AIEAT / iApp Technology) บนแพลตฟอร์ม NVIDIA Nemotron และ NeMo ร่วมกับโครงการ ThaiLLM และ NVIDIA

การประเมินผลใช้ NitiBench (VISAI-AI, MIT) และข้อมูล SFT สร้างจาก WangchanX-Legal-ThaiCCL (VISTEC, MIT)