Instructions to use CYP777/thai-elderly-nemo-3models with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- NeMo
How to use CYP777/thai-elderly-nemo-3models with NeMo:
# tag did not correspond to a valid NeMo domain.
- Notebooks
- Google Colab
- Kaggle
YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
การประเมินและเปรียบเทียบโมเดลจดจำเสียงพูดภาษาไทยสำหรับผู้สูงอายุ (Thai Elderly ASR Evaluation)
เอกสารสรุปผลการประเมินประสิทธิภาพและแจกแจงสเกลความแม่นยำ (Accuracy Distribution) ของโมเดล ASR รวมถึงเปรียบเทียบระหว่าง NeMo Pre-trained (ก่อน Fine-tune) และโมเดลที่ผ่านการ Fine-tune ด้วยชุดข้อมูลฝึกสอนเกณฑ์ต่างๆ
1. ตารางสรุปภาพรวมประสิทธิภาพโมเดล (Overall Performance)
| สถาปัตยกรรม (Architecture) | ชุดข้อมูลที่ใช้ฝึกสอน (Training Data Criteria) | ชุดข้อมูลประเมิน | ความแม่นยำคำ % (Thai Word Acc) |
ความแม่นยำอักษร % (Char Acc) |
WER (คำผิด) |
CER (อักษรผิด) |
RTF (ความเร็ว/วินาที) |
|---|---|---|---|---|---|---|---|
| NeMo Pre-trained (115M Params) |
Pre-trained Only (ก่อน Fine-tune) | Evaluation Set (19,200) | 93.61% | 97.81% | 0.0639 | 0.0219 | - |
| --- | --- | --- | --- | --- | --- | --- | --- |
| NeMo Fine-tuned (115M Params) |
Acc 100% Only (ข้อมูลถอดถูกต้อง 100%) | Test Only (3,840) | 95.78% | 98.27% | 0.0422 | 0.0173 | 0.0259s |
| Train + Test (19,200) | 95.88% | 98.34% | 0.0412 | 0.0166 | 0.0242s | ||
| Acc 50–99% Only (ข้อมูลถอดถูกต้อง 50–99%) | Test Only (3,840) | 97.79% | 99.16% | 0.0221 | 0.0084 | 0.0254s | |
| Train + Test (19,200) | 98.20% | 99.31% | 0.0180 | 0.0069 | 0.0244s | ||
| All Data (ข้อมูลทั้งหมดรวมทุกเกณฑ์) | Test Only (3,840) | 99.04% | 99.59% | 0.0096 | 0.0041 | 0.0238s | |
| Train + Test (19,200) | 99.56% | 99.80% | 0.0044 | 0.0020 | 0.0235s | ||
| --- | --- | --- | --- | --- | --- | --- | --- |
| Whisper (CT2) (809M Params) |
Acc 100% Only (ข้อมูลถอดถูกต้อง 100%) | Test Only (3,840) | 97.34% | 99.14% | 0.0266 | 0.0086 | 0.1570s |
| Train + Test (19,200) | 97.46% | 99.19% | 0.0254 | 0.0081 | 0.1547s | ||
| Acc 50–99% Only (ข้อมูลถอดถูกต้อง 50–99%) | Test Only (3,840) | 98.28% | 99.51% | 0.0172 | 0.0049 | 0.1561s | |
| Train + Test (19,200) | 98.68% | 99.61% | 0.0132 | 0.0039 | 0.1555s | ||
| All Data (ข้อมูลทั้งหมดรวมทุกเกณฑ์) | Test Only (3,840) | 98.61% | 99.59% | 0.0139 | 0.0041 | 0.1567s | |
| Train + Test (19,200) | 99.13% | 99.72% | 0.0087 | 0.0028 | 0.1455s |
2. การแจกแจงระดับสเกลความแม่นยำทุกๆ 5% (Accuracy Scale Distribution)
ตารางแสดง จำนวนไฟล์เสียง ที่ตกลงในแต่ละช่วงความแม่นยำ (สเกลละ 5%)
2.1 เปรียบเทียบรวมทุกโมเดล (ชุดข้อมูล 19,200 ไฟล์เท่ากัน)
| ช่วงสเกลความแม่นยำ (%) | NeMo Pre-trained | NeMo (Acc 100%) | NeMo (Acc 50–99%) | NeMo (All Data) | Whisper (Acc 100%) | Whisper (Acc 50–99%) | Whisper (All Data) |
|---|---|---|---|---|---|---|---|
| 0 – 5% | 63 | 102 | 51 | 7 | 90 | 38 | 27 |
| 5 – 10% | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 10 – 15% | 4 | 5 | 0 | 0 | 1 | 0 | 0 |
| 15 – 20% | 3 | 5 | 6 | 1 | 2 | 0 | 0 |
| 20 – 25% | 9 | 12 | 3 | 2 | 4 | 0 | 0 |
| 25 – 30% | 25 | 48 | 20 | 4 | 24 | 16 | 11 |
| 30 – 35% | 65 | 86 | 44 | 10 | 59 | 40 | 20 |
| 35 – 40% | 8 | 5 | 2 | 0 | 2 | 1 | 0 |
| 40 – 45% | 40 | 54 | 21 | 5 | 21 | 20 | 11 |
| 45 – 50% | 2 | 1 | 0 | 0 | 0 | 0 | 0 |
| 50 – 55% | 98 | 197 | 77 | 16 | 81 | 51 | 32 |
| 55 – 60% | 52 | 48 | 10 | 1 | 33 | 4 | 7 |
| 60 – 65% | 175 | 142 | 50 | 7 | 89 | 43 | 22 |
| 65 – 70% | 228 | 215 | 109 | 36 | 149 | 109 | 59 |
| 70 – 75% | 155 | 135 | 52 | 11 | 79 | 39 | 24 |
| 75 – 80% | 304 | 298 | 126 | 33 | 205 | 81 | 72 |
| 80 – 85% | 594 | 512 | 252 | 75 | 305 | 159 | 116 |
| 85 – 90% | 700 | 530 | 214 | 79 | 278 | 124 | 101 |
| 90 – 95% | 377 | 268 | 125 | 35 | 187 | 80 | 55 |
| 95 – 100% | 16,288 | 16,537 | 18,038 | 18,878 | 17,591 | 18,395 | 18,643 |
| รวมทั้งสิ้น (ไฟล์) | 19,200 | 19,200 | 19,200 | 19,200 | 19,200 | 19,200 | 19,200 |
2.2 ชุดข้อมูล Test Only (รวมทั้งหมด 3,840 ไฟล์)
| ช่วงสเกลความแม่นยำ (%) | NeMo (Acc 100%) | NeMo (Acc 50–99%) | NeMo (All Data) | Whisper (Acc 100%) | Whisper (Acc 50–99%) | Whisper (All Data) |
|---|---|---|---|---|---|---|
| 0 – 5% | 19 | 14 | 4 | 20 | 9 | 11 |
| 5 – 10% | 0 | 0 | 0 | 0 | 0 | 0 |
| 10 – 15% | 0 | 0 | 0 | 0 | 0 | 0 |
| 15 – 20% | 1 | 0 | 0 | 0 | 0 | 0 |
| 20 – 25% | 3 | 1 | 1 | 2 | 0 | 0 |
| 25 – 30% | 8 | 2 | 0 | 1 | 1 | 0 |
| 30 – 35% | 18 | 13 | 4 | 12 | 11 | 7 |
| 35 – 40% | 1 | 0 | 0 | 0 | 0 | 0 |
| 40 – 45% | 12 | 7 | 3 | 8 | 7 | 4 |
| 45 – 50% | 0 | 0 | 0 | 0 | 0 | 0 |
| 50 – 55% | 38 | 13 | 6 | 16 | 13 | 11 |
| 55 – 60% | 7 | 4 | 0 | 5 | 2 | 3 |
| 60 – 65% | 30 | 10 | 4 | 12 | 8 | 5 |
| 65 – 70% | 48 | 31 | 16 | 38 | 27 | 14 |
| 70 – 75% | 31 | 14 | 6 | 15 | 14 | 7 |
| 75 – 80% | 73 | 40 | 19 | 57 | 27 | 29 |
| 80 – 85% | 99 | 54 | 27 | 64 | 43 | 35 |
| 85 – 90% | 119 | 52 | 41 | 53 | 38 | 37 |
| 90 – 95% | 49 | 33 | 14 | 34 | 23 | 16 |
| 95 – 100% | 3,284 | 3,552 | 3,695 | 3,503 | 3,617 | 3,661 |
| รวมทั้งสิ้น (ไฟล์) | 3,840 | 3,840 | 3,840 | 3,840 | 3,840 | 3,840 |
3. สรุปข้อสังเกตและผลกระทบของการ Fine-tune
- เปรียบเทียบ NeMo Pre-trained (ก่อน Fine-tune) vs NeMo Fine-tuned:
- NeMo Pre-trained (รวม 19,200 ไฟล์): ความแม่นยำคำอยู่ที่ 93.61% (Char Acc 97.81%)
- หลัง Fine-tune ด้วย All Data (NeMo M3): ความแม่นยำเพิ่มขึ้นเป็น 99.56% (เพิ่มขึ้นก้าวกระโดดถึง +5.95%)
- การกระจุกตัวในกลุ่ม 95-100%:
- กระบวนการ Fine-tune ดึงจำนวนไฟล์ที่ทายแม่นยำสูง (95-100%) จาก 16,288 ไฟล์ เพิ่มขึ้นเป็น 18,878 ไฟล์ (คิดเป็น 98.32% ของไฟล์เสียงทั้งหมด)
- สรุปความเร็วและความแม่นยำ:
- NeMo (All Data) เป็นโมเดลที่สมบูรณ์แบบที่สุด มีความแม่นยำสูงสุด 99.56% และมีความเร็วการประมวลผลสูงสุด RTF 0.0235 วินาที/ไฟล์
- Downloads last month
- 55
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support