![]() |
การระบุและแก้ไขส่วนที่แตกต่างของบทถอดความระหว่างเสียงบันทึกการประชุมรัฐสภาไทยและรายงานการประชุม |
---|---|
รหัสดีโอไอ | |
Title | การระบุและแก้ไขส่วนที่แตกต่างของบทถอดความระหว่างเสียงบันทึกการประชุมรัฐสภาไทยและรายงานการประชุม |
Creator | ณัฐณรงค์ พ่วงศรี |
Contributor | อติวงศ์ สุชาโต, โปรดปราน บุณยพุกกณะ, ชัย วุฒิวิวัฒน์ชัย |
Publisher | จุฬาลงกรณ์มหาวิทยาลัย |
Publication Year | 2555 |
Keyword | การรู้จำเสียงพูดอัตโนมัติ, การประชุมรัฐสภา, Automatic speech recognition, Legislative bodies -- Thailand |
Abstract | ข้อมูลเสียงพูด (Speech utterance) และคำบรรยายเสียง (Transcription) ที่มีความถูกต้องเป็นส่วนสำคัญที่ใช้ ในการพัฒนาระบบรู้จำเสียงพูดอัตโนมัติ (Automatic speech recognition) โดยเฉพาะอย่างยิ่งกับระบบที่นำไปใช้ในการถอดความการประชุมรัฐสภา สำหรับในประเทศไทยนั้น สำนักงานเลขาธิการสภาผู้แทนราษฏร ได้จัดทำรายงานการประชุมและจัดเก็บข้อมูลเสียงบันทึกระหว่างการประชุมไว้ตลอดช่วงสมัยประชุม ทำให้มีข้อมูลดังกล่าวเป็นจำนวนมากเพียงพอที่จะนำมาใช้ในการพัฒนาระบบรู้จำเสียงพูดอัตโนมัติอย่างไรก็ตามเนื่องจากข้อมูลทั้งสองส่วนยังมีความไม่สอดคล้องกันเกิดขึ้นในบางจุด ดังนั้น วิทยานิพนธ์นี้จึงนำเสนอวิธีในการระบุส่วนที่แตกต่างกันที่เกิดขึ้น กฎที่ได้จากการวิเคราะห์ หลักเกณฑ์การจัดทำรายงานการประชุมสภา และส่วนที่แตกต่างกันที่เกิดขึ้นจริงถูกนำมาใช้วิเคราะห์ประโยคจากรายงานการประชุม เพื่อสร้างประโยคสมมติฐานขึ้นมาเพิ่มเติม จากนั้น ประโยคจากรายงานการประชุมและประโยคสมมติฐานจะถูกนำไปผ่านกระบวนการปรับแนวเสียง (Force alignment) เพื่อประเมินความน่าจะเป็นของแต่ละประโยคซึ่งประโยคที่มีความน่าจะเป็นสูงที่สุด จะถูกเลือกเป็นคำบรรยายเสียงสำหรับข้อมูลเสียงพูดสำหรับใช้ใน กระบวนการระบุส่วนที่ไม่ตรงกัน จากการทดลองพบว่าระบบที่พัฒนาขึ้น มีค่าความแม่นยำในการระบุส่วนที่แตกต่างกัน 72.6% และคำบรรยายเสียงที่ได้จากประโยคที่มีความน่าจะเป็นสูงที่สุด มีความถูกต้องตรงกับข้อมูลเสียงพูดในระดับหน่วยเสียงย่อ 96.5% โดยเมื่อเปรียบเทียบกับคำบรรยายเสียงที่ได้จากรายงานการประชุมพบว่า สามารถลดความไม่ตรงกันได้ถึง 26.8% |
URL Website | cuir.car.chula.ac.th |