การจำแนกประเภทเสียงที่เป็นมืออาชีพ หมายถึงเทคโนโลยีของการจำแนกข้อมูลเสียงเป็นหมวดหมู่เฉพาะซึ่งใช้กันอย่างแพร่หลายในการจดจำคำพูดการดึงข้อมูลเพลงการตรวจสอบความปลอดภัยและสาขาอื่น ๆ หลักการและขั้นตอนพื้นฐานของมันรวมถึงการประมวลผลล่วงหน้าการสกัดคุณลักษณะการฝึกอบรมตัวจําแนกและการตัดสินใจจำแนกประเภท ฯลฯ
หลักการพื้นฐานและขั้นตอนการจำแนกเสียง
การประมวลผล proprocessing: รวมถึงการสุ่มตัวอย่างการหาปริมาณการกรองและการดำเนินการอื่น ๆ ของสัญญาณเสียงเพื่อปรับปรุงคุณภาพและอัตราส่วนสัญญาณต่อสัญญาณสัญญาณของสัญญาณ วิธีการประมวลผลล่วงหน้าทั่วไปรวมถึงการกรองโดเมนความถี่และการกรองแบบปรับตัว
ectraction การแยกส่วน: โดยการวิเคราะห์สัญญาณเสียงข้อมูลสำคัญที่สะท้อนถึงลักษณะและหมวดหมู่ของมันจะถูกสกัด คุณสมบัติทั่วไปรวมถึงคุณสมบัติของโดเมนเวลา (เช่นพลังงานระยะเวลาสั้น ๆ และอัตราการข้ามศูนย์) คุณสมบัติโดเมนความถี่ (เช่นสเปกตรัม) และคุณสมบัติ cepstrum (เช่นค่าสัมประสิทธิ์ Cepstrum ความถี่ MEL)
การฝึกอบรม classifier : ใช้การเรียนรู้ของเครื่องหรือแบบจำลองการเรียนรู้อย่างลึกซึ้งสำหรับการฝึกอบรม แบบจำลองทั่วไป ได้แก่ เครื่องเวกเตอร์สนับสนุน, ป่าแบบสุ่ม, เครือข่ายประสาทแบบ convolutional และเครือข่ายประสาทแบบเรียกซ้ำ ฯลฯ
การตัดสินใจจำแนกประเภท : จำแนกข้อมูลเสียงใหม่ตามรูปแบบที่ผ่านการฝึกอบรม
สถานการณ์แอปพลิเคชันทั่วไป
voice การจำแนกอารมณ์ความรู้สึก : ระบุอารมณ์ในการพูดเช่นความสุขความโศกเศร้าความโกรธ ฯลฯ
voice คำสั่งการจำแนกประเภท : ระบุคำสั่งเสียงเฉพาะเช่น "เปิดทีวี", "เล่นเพลง" ฯลฯ
การจำแนกประเภท Speaker : ระบุลำโพงที่แตกต่างกัน
การเลือกปฏิบัติสไตล์ดนตรี : ระบุสไตล์ดนตรีเช่นคลาสสิกแจ๊สร็อค ฯลฯ
การเลือกปฏิบัติภาษา: ระบุภาษาหรือภาษาต่าง ๆ
ตัวบ่งชี้การประเมินผล
ตัวบ่งชี้การประเมินผลของอัลกอริทึมการจำแนกเสียงรวมถึงความแม่นยำการเรียกคืนและคะแนน F1 ความแม่นยำสะท้อนให้เห็นถึงสัดส่วนของตัวอย่างที่จัดประเภทอย่างถูกต้องโดยตัวจําแนกเป็นตัวอย่างทั้งหมดการเรียกคืนสะท้อนให้เห็นถึงสัดส่วนของตัวอย่างบวกที่จัดประเภทอย่างถูกต้องโดยตัวจําแนกเป็นตัวอย่างที่เป็นบวกทั้งหมดและคะแนน F1 เป็นค่าเฉลี่ยของความแม่นยำและการเรียกคืนซึ่งสามารถสะท้อนประสิทธิภาพของตัวจําแนก
Dec 18, 2024
การจำแนกเสียงระดับมืออาชีพ
ส่งคำถาม
