NativeCall 品質報告 · 2026 年 8 月 23 日實驗
已量度的通話品質:日語辨識結果與顧客評價
在相同的日語公開測試音訊上,候選方案 D 的字元錯誤率為 2.61%,歷史對照組 C 為 15.29%。這是以電話音訊條件完成的實測辨識結果,讓我們以數據評估通話品質。
歷史對照組 C
15.29% CER
字元錯誤率,越低越好
候選方案 D
2.61% CER
字元錯誤率,越低越好
測試範圍:2026 年 8 月 23 日,5 段不同日語音訊,每段重複 3 次,並經 8 kHz 電話音訊編碼模擬。這是歷史語音辨識元件測試;完整方法及這項測量的範圍列於下方。
查看四種語言的全部結果與測試方法 ↓歷史通話播放紀錄 · 2026 年 8 月 29 日至 9 月 1 日
翻譯開始播放的時間
傳回 App 撥話者 · 中位數
1.36 秒
傳回 App 撥話者 · p95
4.276 秒
這 33 個回合有完整起訖紀錄,由系統記錄的說話結束,計至伺服器記錄翻譯開始播放。測量涵蓋辨識後的翻譯與播放流程,比單獨的辨識時間更接近實際通話流程。
測量範圍與樣本詳情
樣本為先前選出的 10 通電話,共保留 115 個計時回合;其中 34 個有這項測量,81 個缺少起訖紀錄。33 個往 App 撥話者方向;往電話接聽者方向只有 1 個,為 1.315 秒,因此沒有以該方向計算百分位數。事件在伺服器的播放開始時結束,不包括其後的裝置、網絡及聲音到達時間,也不衡量翻譯準確率。
測試方案以匿名組別標示;我們不公開供應商或模型名稱。組別只用於區分歷史實驗配置。
歷史實驗:全部測試結果
每種語言只有 5 段不同的 FLEURS 公開音訊,每段重複 3 次;每個模型及語言有 15 次測試。重複測試不等於 15 段獨立音訊。
候選模型並非在所有語言都較好:它在這批日語和英語音訊的錯誤率較低,普通話和廣東話的錯誤率則較高。以下保留全部八組結果,沒有將不同模型的最佳數字拼成單一服務成績。
| 語言/測試組別 | 錯誤率 | 完成測試 | 辨識 p50 | 辨識 p95 |
|---|---|---|---|---|
| 英語 · 歷史對照組 A | 7.50% WER | 15/15 | 279 ms | 411 ms |
| 英語 · 候選方案 D | 6.67% WER | 15/15 | 484 ms | 664 ms |
| 普通話 · 歷史對照組 B | 5.52% CER | 15/15 | 241 ms | 330 ms |
| 普通話 · 候選方案 D | 6.21% CER | 15/15 | 277 ms | 625 ms |
| 廣東話 · 歷史對照組 B | 2.34% CER | 15/15 | 225 ms | 323 ms |
| 廣東話 · 候選方案 D | 3.13% CER | 15/15 | 193 ms | 489 ms |
| 日語 · 歷史對照組 C | 15.29% CER | 15/15 | 不作比較 | 不作比較 |
| 日語 · 候選方案 D | 2.61% CER | 15/15 | 208 ms | 433 ms |
測試方法與數字範圍
WER 是詞錯誤率,CER 是字元錯誤率:將插入、刪除和替換的編輯次數加總,再除以參考文本的詞或字元總數,越低越好。英語以詞計算,日語、普通話和廣東話以字元計算。不同語言和單位不宜直接比較,也不能把 100% 減去錯誤率稱為翻譯準確率。
評分先統一 Unicode、標點、中文繁簡體及口語/阿拉伯數字格式。這會忽略部分書寫差異;機械分數無法判定意思、安全性或任務是否完成。
測試將音訊經過 8 kHz 單聲道 G.711 μ-law 編碼/解碼,再以每 100 ms 一幀的即時速度送出;沒有經過真實電話網絡,也沒有加入任務腳本、語料提示或熱詞。p50 是中位數,p95 是第 95 百分位數。時間由音訊送出結束起算,到辨識服務回報完成為止,不包括翻譯、語音合成或播放。
對照組 C 的測試程式加入固定等待時間,沒有可比較的完成事件,因此不公布其完成延遲。表中的「對照組」只指當時的實驗設定,不代表目前正式服務的路由。這個小型樣本沒有經獨立審核,也不足以推算真實電話的整體表現。
這些數字衡量語音辨識和所列的伺服器播放開始事件;它們不等同於翻譯意思的準確率,亦不包括伺服器播放開始事件之後的裝置、網絡及聲音到達時間。
來源與下一輪測量
Google FLEURS · 下載已去識別的測試彙總 JSON
彙總檔記錄測試日期、匿名測試組別、樣本數、計分方法及原始分數檔的 SHA-256 摘要,方便核對版本。後續測試需要更多不重複的公開音訊、預先固定的參考文本,以及從說話結束到對方實際收到翻譯聲音的測量。