從錄音、AI 轉錄到質性分析的工具整理(本篇文章從2019年開始陸續更新中,歡迎各種討論、推薦)

做質性研究或訪談的研究生,應該都曾經被逐字稿折磨過。

訪談一小時,聽打可能需要三、四個小時;遇到收音不清楚、多人同時說話、專有名詞,或受訪者講話速度很快,時間還會繼續往上加,我最近一次的訪談是8個小時,真的是謝了。

逐字稿真的是一座地獄,而且打完逐字稿,研究才正要開始,校對、整理、編碼與分析。

這篇文章最早整理的是我十多年前開始使用的逐字稿工作流程。這些年,工具從人工聽打慢慢走向 AI 語音辨識,我自己也從學生變成研究助理,工作上依然需要處理大量訪談與逐字稿。

所以,我重新整理了一次目前的做法。

這篇不只列出工具,而是想回答三個比較實際的問題:

  • 錄音結束後,怎麼比較快得到初稿?

  • AI 辨識錯誤很多時,要用什麼工具校對?

  • 完成逐字稿後,怎麼接到 MAXQDA 做質性分析?

先提醒:如果訪談內容涉及個人資料、醫療、政治立場、工作經驗或尚未公開的研究資料,選工具時不能只看辨識率,還要確認錄音會被傳到哪裡、保存多久,以及是否會被拿來改善模型。


一、先決定你是哪一種需求

情境一:中文訪談,希望快速取得初稿

可以先使用雅婷逐字稿、SubEasy 等中文語音辨識服務產生初稿,再搭配 oTranscribe 或 Express Scribe 校對。

AI 不一定能直接交出可以分析的逐字稿,但只要能先辨識出大致內容,就可能省下一部分從零聽打的時間。

情境二:錄音不能上傳外部平台

如果研究資料有嚴格的隱私規範,應優先使用研究機構提供的院內服務,或選擇可以在本機處理的工具。

oTranscribe 和 Express Scribe 本身不會替你辨識語音,但很適合人工聽打與校對。這類工具雖然比較辛苦,但能讓資料留在自己的電腦上。

情境三:英文、日文或其他語言

可以選擇支援該語言的 AI 轉錄服務,先用一小段錄音測試,再決定是否付費。

不要只看服務宣稱支援多少語言。真正需要測試的是:

  • 受訪者的口音

  • 錄音環境

  • 專有名詞

  • 多人對話

  • 中英或多語言穿插

  • 講者辨識是否正確

支援某種語言」和「能正確處理你的訪談」是兩件不同的事


情境四:已經有逐字稿,要開始編碼分析

可以將整理完成的 DOCX、TXT、RTF、Markdown 或其他文字格式匯入 MAXQDA,再進行編碼、備忘錄、關鍵字整理及主題分析。


二、我目前建議的逐字稿流程

一套比較完整的流程大致如下:

錄音 → AI 轉錄初稿 → 人工對照錄音校正 → 統一格式 → 去識別化 → 匯入 MAXQDA → 編碼與分析

AI 轉錄只是其中一步,並不是按下按鈕就能直接得到研究資料。

在校對階段,至少要特別檢查:

  • 受訪者姓名與身分資訊

  • 地名、機構名及專有名詞

  • 數字、日期與否定句

  • 講者標示

  • 聽不清楚的段落

  • 笑聲、停頓或重要的非語言訊息

  • AI 自行補出、但錄音中其實不存在的內容

如果逐字稿要進入正式研究分析,目前仍然無法省略人工校對。


三、語音辨識與逐字稿工具

1. 雅婷逐字稿:中文語音辨識

雅婷逐字稿是由台灣人工智慧實驗室開發的語音轉文字服務,針對台灣的語言與口音情境進行設計。

我過去使用時,中文辨識效果在同類工具中算是相對實用。它適合會議、訪談、課堂或其他需要快速留下文字紀錄的情境。

不過,免費額度與功能可能隨時間調整,使用前還是要查看目前的方案。辨識效果也會受到口音、環境雜音、麥克風距離及多人交談影響。

Android:
https://play.google.com/store/apps/details?id=tw.ailabs.Yating.Transcriber&hl=zh_TW

iOS:
https://apps.apple.com/tw/app/雅婷逐字稿/id1343659994

適合誰?

  • 訪談主要使用中文

  • 希望先取得可以校對的初稿

  • 在意台灣口音的辨識表現

  • 已確認研究資料可以使用該服務處理


2. oTranscribe:一邊聽、一邊校對

oTranscribe 不是自動語音辨識服務,而是一個協助人工聽打與校對的網頁工具。

它把播放器和文字編輯區放在同一個畫面,可以直接用鍵盤控制播放、暫停、倒退及調整速度,不必一直在播放器和 Word 之間切換。

更正一下原文的說法:oTranscribe 第一次需要開啟網頁,但其經典版會將錄音與逐字稿保留在本機瀏覽器中,不會把內容上傳到遠端伺服器,也具有離線使用設計。

不過,資料主要存在瀏覽器儲存空間。清除瀏覽資料、換電腦或瀏覽器故障,都可能讓內容消失,使用時一定要定期匯出備份。

網頁:
https://otranscribe.com/

適合誰?

  • 想自己人工聽打

  • 已經有 AI 初稿,需要逐句校對

  • 不希望把錄音上傳到雲端轉錄服務

  • 不想安裝額外軟體


3. Express Scribe:適合長時間人工聽打

Express Scribe 是可以安裝在電腦上的聽打輔助軟體。它能調整播放速度、設定快捷鍵,也可以搭配腳踏板操作。

如果錄音不能上傳雲端,或 AI 辨識結果實在太差,Express Scribe 是比較傳統但可靠的做法。

它不會自動幫你完成逐字稿,重點是讓人工聽打時少一點反覆切換視窗的痛苦。

下載:
https://www.nch.com.au/scribe/index.html

適合誰?

  • 需要離線工作

  • 經常處理很長的錄音

  • 習慣用快捷鍵控制播放

  • 因資料隱私而必須人工轉錄


4. 聲音轉文字工具:社群自製方案

以前研究室戰友曾找到「瑞課的日常生活」分享的聲音轉文字工具。

它的效果仍需要依照錄音內容調整,但如果可以先產生一部分文字,再放到 oTranscribe 裡繼續校對,即使只減少一部分人工輸入,也可能讓工作舒服一些。

使用教學:
https://www.youtube.com/watch?v=w539oyC816s

能夠自己開發出系統真的很厲害。不過,這類社群工具可能因套件、平台或權限改變而失效,使用前要先確認目前是否仍能運作,也不要直接用敏感訪談資料測試。


5. SubEasy:朋友推薦的 AI 轉錄工具

剪接師朋友最近推薦我使用 SubEasy,說它的語音辨識效果還不錯。它可以上傳音訊或影片,自動產生逐字稿,也提供線上編輯功能。

目前免費版已有基本轉錄額度,適合先用短檔案測試。我使用時可以將結果輸出成 TXT 和 Word,對單純需要文字稿,或準備將 DOCX 匯入 MAXQDA 的人來說,已經算是實用。

不過,如果需要 SRT、VTT 等字幕格式,或講者辨識、較高準確度及其他進階功能,仍要以當下帳號介面和方案說明為準。這類服務的免費額度與匯出限制經常調整,正式使用前最好再確認一次。

我目前還沒有使用不同口音、多人對話及混合語言做完整比較,因此先把它列為朋友推薦、等待進一步測試的工具,而不是直接判定哪一家的辨識效果最好。

官網:
https://www.subeasy.ai/

適合誰?

  • 想先免費測試 AI 轉錄

  • 主要需要 TXT 或 Word 逐字稿

  • 希望取得初稿後再人工校對

  • 想將 Word 文件接到 MAXQDA 繼續整理

同樣要提醒:如果處理的是研究訪談,使用前仍要確認平台的資料保存、第三方處理及模型訓練政策,不要直接用含有受訪者身分資訊的錄音試用。


6. Subanana:多語言轉錄工具,測試中

最近收到 Subanana 共同創辦人的來信,才注意到這項由香港團隊開發的網頁版語音轉文字服務。

Subanana 主打多語言轉錄、講者辨識、自動標點與分段,並可匯出 SRT、VTT、TXT、DOCX、XLSX 和 Markdown 等格式。DOCX 可以接到 MAXQDA,對後續編碼可能比較方便。

我已經註冊並簡單操作過,第一印象是介面清楚、上手速度快。

不過,目前免費版主要用來預覽辨識結果,無法完整匯出逐字稿,因此我還沒有完成包含匯出、講者辨識與 MAXQDA 銜接的完整測試。

我特別想測試的是:

  • 中文、英文與日文的辨識差異

  • 中英日穿插時的處理方式

  • 多人對話的講者辨識

  • DOCX 匯入 MAXQDA 後的格式

  • 專有名詞與自訂詞彙

  • 錄音及逐字稿的保存與刪除機制

需要注意的是,Subanana 的一般檔案轉錄模式目前仍可能要求使用者選擇一種主要來源語言。因此,「支援多種語言」不一定等於「可以完整保留同一段錄音中的多語言切換」。

另外,研究訪談通常涉及受訪者資料。使用任何外部雲端轉錄服務前,都要先閱讀隱私政策,確認研究倫理審查、受訪者同意書及所屬機構是否允許使用。

官網:
https://subanana.com/


四、逐字稿完成後:使用 MAXQDA 進行質性分析

MAXQDA 是什麼?

MAXQDA 是質性與混合研究常用的分析軟體,可以整理訪談、建立編碼、撰寫備忘錄、比較不同受訪者,也能處理文字、表格、音訊與影片。

它支援 DOCX、TXT、RTF、Markdown 等文字格式,也可以匯入音訊、影片及字幕資料。

如果你要進行主題分析、紮根理論、內容分析或焦點團體研究,MAXQDA 可以幫助你把大量逐字稿整理成比較有系統的資料。

官網:
https://www.maxqda.com/taiwan/dingxing-yanjiu-ruanjian

匯入前的整理建議

在把逐字稿匯入 MAXQDA 以前,可以先統一格式:

訪談者:
請問您第一次參與這項工作的時間是什麼時候?

受訪者 A:
大概是 2020 年左右,當時……

另外建議:

  • 每位受訪者使用一致的代碼

  • 先移除姓名、電話和其他可識別資訊

  • 每次發言分成獨立段落

  • 聽不清楚處統一標示,例如 [聽不清楚 00:12:35]

  • 保留必要的時間碼

  • 建立原始檔、校對稿和分析稿的版本區分

格式先整理好,後面的自動編碼、搜尋與比較都會輕鬆很多。


五、資料隱私:不要只看辨識準確率

研究用錄音和一般會議紀錄不同。訪談可能包含:

  • 姓名及聯絡方式

  • 健康與醫療資訊

  • 工作場所與職務

  • 政治立場

  • 家庭或創傷經驗

  • 尚未公開的研究發現

在使用 AI 轉錄工具以前,至少應確認:

  1. 錄音會不會離開自己的電腦?

  2. 資料會傳到哪個國家或地區?

  3. 平台會保存多久?

  4. 刪除帳號後,備份資料多久才會清除?

  5. 內容會不會被用來訓練或改善模型?

  6. 是否有第三方 AI 或雲端供應商參與處理?

  7. 受訪者同意書是否涵蓋這種處理方式?

  8. 所屬學校或研究機構是否允許使用?

我目前在研究單位工作,正式研究資料仍會優先使用機構內部提供的轉錄服務。外部工具則以自有錄音、公開素材或完成去識別化的資料測試。

AI 很方便,但研究倫理和受訪者信任不能一起外包出去。


六、其他研究整理工具

Draw.io:製作研究流程圖

質性研究不一定會使用大量統計圖表,但流程圖、概念圖或研究架構圖,有時能讓論述更清楚。

https://app.diagrams.net/

中文錯別字檢查

逐字稿完成後,可以再利用錯字檢查工具做第一輪掃描。不過,人名、地名、方言與口語內容很容易被誤判,不能直接接受所有修正。

教育部相關工具:
https://coct.naer.edu.tw/spcheck/

中研院中文錯別字系統:
http://sunlight.iis.sinica.edu.tw/spcheck/

研究方法淺談

https://open.firstory.me/story/ckqxkfgz9s3st08284tl06gpp/platforms

如果對研究方法,或是這些方法到底有什麼意義之類的,可以輕鬆聽聽Podcast~~

兩人背景是政大傳播研究所跟英國東倫敦戲劇表演研究所,歡迎有興趣的朋友給予回饋^^


切記:AI 可以幫忙,但逐字稿仍需要人

從完全人工聽打,到現在可以先用 AI 產生初稿,逐字稿工具確實進步了很多。

不過,研究者真正需要的通常不是一份「看起來像文字」的輸出,而是一份能夠忠實呈現訪談、保護受訪者,而且可以進入後續分析的研究資料。

所以目前最實際的期待,不是 AI 完全取代人工,而是:

讓我們少花一點時間重複播放,留下更多時間理解受訪者真正說了什麼。

如果你也正在逐字稿地獄裡,希望這篇整理能讓你爬得快一點。

也歡迎分享你正在使用的轉錄工具。尤其是中英日混用、多人對話、方言或特殊口音的經驗——這些大概仍是下一代轉錄工具最需要解決的問題。

我相當期待能有無痛處理逐字稿的那一天!!!!

創作者介紹
創作者 Ni砸惑舖-生存不易|好好聲活 的頭像
Ni砸惑舖

Ni砸惑舖-生存不易|好好聲活

Ni砸惑舖 發表在 痞客邦 留言(2) 人氣( 23335 )