YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

การประเมินและเปรียบเทียบโมเดลจดจำเสียงพูดภาษาไทยสำหรับผู้สูงอายุ (Thai Elderly ASR Evaluation)

เอกสารสรุปผลการประเมินประสิทธิภาพและแจกแจงสเกลความแม่นยำ (Accuracy Distribution) ของโมเดล ASR รวมถึงเปรียบเทียบระหว่าง NeMo Pre-trained (ก่อน Fine-tune) และโมเดลที่ผ่านการ Fine-tune ด้วยชุดข้อมูลฝึกสอนเกณฑ์ต่างๆ


1. ตารางสรุปภาพรวมประสิทธิภาพโมเดล (Overall Performance)

สถาปัตยกรรม (Architecture) ชุดข้อมูลที่ใช้ฝึกสอน (Training Data Criteria) ชุดข้อมูลประเมิน ความแม่นยำคำ %
(Thai Word Acc)
ความแม่นยำอักษร %
(Char Acc)
WER
(คำผิด)
CER
(อักษรผิด)
RTF
(ความเร็ว/วินาที)
NeMo Pre-trained
(115M Params)
Pre-trained Only (ก่อน Fine-tune) Evaluation Set (19,200) 93.61% 97.81% 0.0639 0.0219 -
--- --- --- --- --- --- --- ---
NeMo Fine-tuned
(115M Params)
Acc 100% Only (ข้อมูลถอดถูกต้อง 100%) Test Only (3,840) 95.78% 98.27% 0.0422 0.0173 0.0259s
Train + Test (19,200) 95.88% 98.34% 0.0412 0.0166 0.0242s
Acc 50–99% Only (ข้อมูลถอดถูกต้อง 50–99%) Test Only (3,840) 97.79% 99.16% 0.0221 0.0084 0.0254s
Train + Test (19,200) 98.20% 99.31% 0.0180 0.0069 0.0244s
All Data (ข้อมูลทั้งหมดรวมทุกเกณฑ์) Test Only (3,840) 99.04% 99.59% 0.0096 0.0041 0.0238s
Train + Test (19,200) 99.56% 99.80% 0.0044 0.0020 0.0235s
--- --- --- --- --- --- --- ---
Whisper (CT2)
(809M Params)
Acc 100% Only (ข้อมูลถอดถูกต้อง 100%) Test Only (3,840) 97.34% 99.14% 0.0266 0.0086 0.1570s
Train + Test (19,200) 97.46% 99.19% 0.0254 0.0081 0.1547s
Acc 50–99% Only (ข้อมูลถอดถูกต้อง 50–99%) Test Only (3,840) 98.28% 99.51% 0.0172 0.0049 0.1561s
Train + Test (19,200) 98.68% 99.61% 0.0132 0.0039 0.1555s
All Data (ข้อมูลทั้งหมดรวมทุกเกณฑ์) Test Only (3,840) 98.61% 99.59% 0.0139 0.0041 0.1567s
Train + Test (19,200) 99.13% 99.72% 0.0087 0.0028 0.1455s

2. การแจกแจงระดับสเกลความแม่นยำทุกๆ 5% (Accuracy Scale Distribution)

ตารางแสดง จำนวนไฟล์เสียง ที่ตกลงในแต่ละช่วงความแม่นยำ (สเกลละ 5%)

2.1 เปรียบเทียบรวมทุกโมเดล (ชุดข้อมูล 19,200 ไฟล์เท่ากัน)

ช่วงสเกลความแม่นยำ (%) NeMo Pre-trained NeMo (Acc 100%) NeMo (Acc 50–99%) NeMo (All Data) Whisper (Acc 100%) Whisper (Acc 50–99%) Whisper (All Data)
0 – 5% 63 102 51 7 90 38 27
5 – 10% 0 0 0 0 0 0 0
10 – 15% 4 5 0 0 1 0 0
15 – 20% 3 5 6 1 2 0 0
20 – 25% 9 12 3 2 4 0 0
25 – 30% 25 48 20 4 24 16 11
30 – 35% 65 86 44 10 59 40 20
35 – 40% 8 5 2 0 2 1 0
40 – 45% 40 54 21 5 21 20 11
45 – 50% 2 1 0 0 0 0 0
50 – 55% 98 197 77 16 81 51 32
55 – 60% 52 48 10 1 33 4 7
60 – 65% 175 142 50 7 89 43 22
65 – 70% 228 215 109 36 149 109 59
70 – 75% 155 135 52 11 79 39 24
75 – 80% 304 298 126 33 205 81 72
80 – 85% 594 512 252 75 305 159 116
85 – 90% 700 530 214 79 278 124 101
90 – 95% 377 268 125 35 187 80 55
95 – 100% 16,288 16,537 18,038 18,878 17,591 18,395 18,643
รวมทั้งสิ้น (ไฟล์) 19,200 19,200 19,200 19,200 19,200 19,200 19,200

2.2 ชุดข้อมูล Test Only (รวมทั้งหมด 3,840 ไฟล์)

ช่วงสเกลความแม่นยำ (%) NeMo (Acc 100%) NeMo (Acc 50–99%) NeMo (All Data) Whisper (Acc 100%) Whisper (Acc 50–99%) Whisper (All Data)
0 – 5% 19 14 4 20 9 11
5 – 10% 0 0 0 0 0 0
10 – 15% 0 0 0 0 0 0
15 – 20% 1 0 0 0 0 0
20 – 25% 3 1 1 2 0 0
25 – 30% 8 2 0 1 1 0
30 – 35% 18 13 4 12 11 7
35 – 40% 1 0 0 0 0 0
40 – 45% 12 7 3 8 7 4
45 – 50% 0 0 0 0 0 0
50 – 55% 38 13 6 16 13 11
55 – 60% 7 4 0 5 2 3
60 – 65% 30 10 4 12 8 5
65 – 70% 48 31 16 38 27 14
70 – 75% 31 14 6 15 14 7
75 – 80% 73 40 19 57 27 29
80 – 85% 99 54 27 64 43 35
85 – 90% 119 52 41 53 38 37
90 – 95% 49 33 14 34 23 16
95 – 100% 3,284 3,552 3,695 3,503 3,617 3,661
รวมทั้งสิ้น (ไฟล์) 3,840 3,840 3,840 3,840 3,840 3,840

3. สรุปข้อสังเกตและผลกระทบของการ Fine-tune

  1. เปรียบเทียบ NeMo Pre-trained (ก่อน Fine-tune) vs NeMo Fine-tuned:
    • NeMo Pre-trained (รวม 19,200 ไฟล์): ความแม่นยำคำอยู่ที่ 93.61% (Char Acc 97.81%)
    • หลัง Fine-tune ด้วย All Data (NeMo M3): ความแม่นยำเพิ่มขึ้นเป็น 99.56% (เพิ่มขึ้นก้าวกระโดดถึง +5.95%)
  2. การกระจุกตัวในกลุ่ม 95-100%:
    • กระบวนการ Fine-tune ดึงจำนวนไฟล์ที่ทายแม่นยำสูง (95-100%) จาก 16,288 ไฟล์ เพิ่มขึ้นเป็น 18,878 ไฟล์ (คิดเป็น 98.32% ของไฟล์เสียงทั้งหมด)
  3. สรุปความเร็วและความแม่นยำ:
    • NeMo (All Data) เป็นโมเดลที่สมบูรณ์แบบที่สุด มีความแม่นยำสูงสุด 99.56% และมีความเร็วการประมวลผลสูงสุด RTF 0.0235 วินาที/ไฟล์
Downloads last month
55
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support