คู่มือเริ่มต้น · Audinote

ASR + LLM สำหรับธุรกิจไทย: จากถอดเสียงเป็นข้อความสู่คำแปลและงานที่ทำต่อได้

เข้าใจหน้าที่ของ Speech-to-Text และ LLM พร้อมตัวอย่างเวิร์กโฟลว์ประชุม บริการลูกค้า คอนเทนต์ และวิธีเลือกผลลัพธ์ให้ตรงงาน

ASR หรือ Speech-to-Text เปลี่ยนเสียงพูดเป็นข้อความ ส่วน LLM ช่วยจัดระเบียบ ตีความตามบริบท แปล และสรุปข้อความนั้น เมื่อใช้ร่วมกัน ผลลัพธ์จึงไม่จบที่ไฟล์ถอดเสียง แต่ไปต่อเป็นบันทึกประชุม คำบรรยายวิดีโอ หรือรายการติดตามงานได้ อย่างไรก็ตาม คุณภาพของขั้นถัดไปขึ้นอยู่กับความถูกต้องของข้อความต้นทางเสมอ

ASR กับ LLM ทำหน้าที่ต่างกันอย่างไร

ASR รับเสียงและส่งคืนคำพูดพร้อมเวลาและช่วงผู้พูดตามความสามารถของระบบ ส่วน LLM รับข้อความนั้นไปเรียบเรียง สรุปประเด็น หรือแปลภาษา ถ้าคำว่า ‘ห้าหมื่น’ ถูกถอดเป็น ‘ห้าแสน’ สรุปที่อ่านลื่นก็ยังผิด จึงต้องแยกการตรวจบทถอดเสียงออกจากการตรวจสรุป

ตัวอย่างสายงานประชุม: เสียงต้นฉบับ → บทถอดเสียง → ตรวจชื่อคนและตัวเลข → สรุปมติและงาน → ให้เจ้าของงานยืนยัน ก่อนส่งให้ทีมอื่น

เลือกผลลัพธ์ตามงาน ไม่ใช่ตามจำนวนฟีเจอร์

ทีมประชุมต้องการมติ ผู้รับผิดชอบ และวันส่ง ทีมคอนเทนต์ต้องการคำพูดที่ตรวจแล้วพร้อมเวลาเพื่อทำ SRT ทีมบริการลูกค้าต้องการหมวดปัญหาและตัวอย่างสายที่ควรตรวจต่อ ส่วนทีมวิจัยต้องการคำอ้างอิงที่ย้อนกลับไปยังเสียงได้

เริ่มด้วยคำถามเดียวว่า ‘หลังได้ข้อความแล้วใครจะทำอะไรต่อ’ แล้วออกแบบรูปแบบผลลัพธ์ให้บุคคลนั้นใช้ได้จริง

ทดสอบกับภาษาไทยและข้อมูลจริงขององค์กร

นำตัวอย่างที่มีสำเนียง เสียงแทรก และคำเฉพาะมาทดสอบ ตรวจตัวเลข ชื่อผู้พูด และการสลับภาษาไทย–อังกฤษแยกจากคะแนนความแม่นยำเฉลี่ย คำที่มีผลต่อการตัดสินใจควรมีขั้นตอนตรวจด้วยคน

สำหรับข้อมูลลูกค้า ผู้ป่วย หรือคู่สัญญา ให้กำหนดสิทธิ์เข้าถึง ระยะเวลาเก็บ และวัตถุประสงค์ก่อนส่งไฟล์ไปประมวลผล

เช็กลิสต์เริ่มต้น

  • เลือกงานนำร่องหนึ่งประเภทและนิยามผลลัพธ์ที่ต้องใช้
  • เก็บตัวอย่างเสียงที่ได้รับอนุญาตและมีความยากจริง
  • วัดทั้งความถูกต้องของบทถอดเสียงและเวลาในการตรวจแก้
  • ระบุผู้ตรวจสรุปหรือคำแปลก่อนใช้งานภายนอก