翻譯記憶(,縮寫為 TM),又稱翻譯記憶體或翻譯記憶庫,是輔助人工翻譯的電腦軟體資料庫。
使用翻譯記憶庫的軟體有時也常被稱為翻譯記憶體管理器(Translation Memory Managers, TMM)或者譯者工作臺(Translator's Workstation)。翻譯記憶庫多見於電腦輔助翻譯工具、文字編輯器、專用術語管理系統(Terminology Management Systems)、多語辭典,甚至純機器翻譯的輸出之中。
一個翻譯記憶單元包含源語言的一個句段(Segment)及其對應的翻譯結果。這些句段可以是文字區塊、章節、一個或是數個句子,或是詞語。個別的字詞常被視為專用術語來處理,一般而言不在翻譯記憶的處理領域之中(儘管翻譯記憶庫依舊可以包含單一字詞為其單元)。目前市場上已有許多企業使用翻譯記憶庫的技術來輔助建立多語言文件。
運作原理
譯者首先將一段來源文字(即需要翻譯的文字)匯入翻譯記憶庫,程式會分析這段文字,並在資料庫中尋找是否與過去曾翻譯過的文字相符。如果找到相符的舊有翻譯(Legacy translation pairs),系統便會將其呈現給譯者檢閱。譯者可以選擇接受、拒絕或是修改舊有翻譯。若加以修改,修改後的新版本也會被記錄並存入資料庫中。
某些翻譯記憶系統只會搜尋 100% 相符的文字,即完全與資料庫內精確比對的資料才會被提出;其他系統則支援模糊比對原理,能找出相似的區段,並以特別的標記呈現給譯者以便辨認。一般而言,翻譯記憶系統主要從資料庫中反向搜尋來源語言。
完全無相符(No match)的文字區段必須由譯者手動翻譯。這些新翻譯的文字會被存進資料庫,未來的翻譯若遇到重複出現的來源文字,便能自動匹配。
翻譯記憶庫在文章字詞重複率高的情況下(例如技術文件、軟體介面或使用手冊)運作效果極佳。對於從既有文件逐步增修的翻譯專案,翻譯記憶庫也非常有幫助。相對地,翻譯記憶庫較少應用於文學或創意寫作中,因為這類文本的句型與用詞重複率極低。不過,這類資料收集後仍可用於用語索引(Concordance)搜尋,並在品質驗證和校對時發揮作用(例如將來源語言與目標語言並排匯出,便於確認是否有漏翻的文字)。
優勢與限制
主要優勢
翻譯記憶系統最適合應用於技術文件或具備高度專有辭彙的文本。其主要優勢包含:
- 完整性:確保文件被完整翻譯,避免遺漏(翻譯記憶通常不接受記憶區段內的目標語言留空)。
- 一致性:確保翻譯文件的一致性,包括通用定義、語法、措辭及專用術語。這在多名譯者共同協作大型專案時尤為重要。
- 簡化流程:譯者無須自行處理多種不同排版格式的檔案,只需透過翻譯記憶軟體提供的單一介面即可進行翻譯,隨後由軟體自動生成對應的排版檔案。
- 提升效率:翻譯記憶庫會「記憶」已翻譯過的素材,譯者對於重複的文字只需翻譯一次,從而大幅加速整體作業。
- 降低成本:在長期的翻譯專案或文件修訂(例如軟體更新後的使用手冊)中,由於大量重複內容已被記憶,能顯著節省翻譯的時間與金錢成本。
主要障礙
然而,引入並使用翻譯記憶系統也面臨一些限制:
- 語境脫節風險:「翻譯記憶」的概念基於文句的回收再利用。但翻譯時需兼顧上下文(即意譯),若將句子拆解為獨立的翻譯單元(Translation Unit),在處理具備強烈前後文關聯的文本時,容易導致語句不通順。
- 流程重整:為了發揮翻譯記憶的最大效益,企業的本土化(Localization)和翻譯流程通常必須被重新規劃。
- 格式支援限制:並非所有翻譯記憶軟體都支援所有文件格式,且可用的文件過濾器可能無法完美解析特定檔案。
- 學習成本與投資:軟體本身具備學習曲線,且前期需投入資金購買授權。此外,將過去的人工翻譯資料匯入並建立初始記憶庫,亦需耗費大量人力與時間。
- 維護成本:翻譯記憶庫的維護需要人工介入。若維護不當或納入錯誤翻譯,該錯誤的翻譯會在未來的比對中反覆出現,導致可用性與品質下降。
翻譯記憶軟體功能
匯入與分析
系統可將外部的文字檔與既有翻譯傳輸到記憶庫中。匯入的來源檔案可以是原生格式,也可以是業界標準的翻譯記憶檔案。分析過程包含:
- 文句分析(Textual parsing):正確辨識文句的標點符號與結尾(如句號、問號、冒號等),並將不須翻譯的符號或代碼給予特定標記以保護其不被更改。
- 句法分析(Linguistic parsing):從文章中萃取出專用術語與詞組,幫助簡化文句。
- 區段化(Segmentation):找出最有用的翻譯單元。系統會根據可定義的規則進行拆解,例如將一個冒號前後的文字視為一個完整的段落或拆分為兩個翻譯單元。
- 平行對齊(Alignment):將來源語言與目標語言文字進行平行對應與對齊。對齊的效果往往仰賴演算法來修正區段化可能產生的錯誤。
- 術語抽出:利用統計分析文字的重複性,從文件中萃取未知的專有術語。
文字記憶
「文字記憶」(Text Memory)是基於 tm 標準而定義的概念,包含文件的作者記憶與翻譯記憶。在翻譯過程中,系統為每一個文字單元賦予唯一辨識碼,若未來來源文件發生局部異動,沒有被更改的文字單元將能直接沿用至新的目標語言版本中,不需譯者額外檢閱。
翻譯記憶相關標準
為了讓不同翻譯軟體供應商之間的資料能互相通用,業界制定了多項標準:
- TMX:Translation Memory eXchange(翻譯記憶交換格式)。這是翻譯社群最廣泛採納的標準,允許不同翻譯軟體之間互換翻譯記憶庫。
- TBX:TermBase eXchange(術語庫交換格式)。允許含有詳細詞彙資訊的術語資料進行互換,核心架構由 ISO 12620 等標準提供。
- SRX:Segmentation Rules eXchange(分段規則交換格式)。用於加強 TMX 標準,使應用程式之間交換的翻譯記憶資料能更有效率地被運用。
- XLIFF:XML Localisation Interchange File Format(XML 本地化交換檔案格式)。提供所有當地語系化供應商都能瞭解的單一檔案交換格式。
- tm:基於 XML 的翻譯記憶標準格式。
翻譯記憶軟體列表
市面上有許多針對不同需求開發的電腦輔助翻譯(CAT)與翻譯記憶軟體。
自由且開放原始碼軟體
- OmegaT
- Open Language Tools
- Transolution
專屬商業軟體
- TRADOS
- Wordfast
- MemoQ
- Across
- Déjà Vu
- STAR Transit
- AidTrans Studio
- MultiTrans
集中式翻譯記憶系統
集中式系統通常將記憶庫儲存於伺服器端,便於大型團隊協同作業:
- Lingotek
- Idiom WorldServer
- GlobalSight
參見
- 電腦輔助翻譯
- 電腦輔助翻譯工具的對比
- 机器翻译
- 语料库
- 平行文本
外部資料
- [http://www.xml.com/pub/a/2004/01/07/xmltm.html Translating XML Documents with xml:tm]
- [http://www.issco.unige.ch/ewg95/node149.html Translation memories overview]
- [https://web.archive.org/web/20061008181201/http://nl.ijs.si/eamt00/proc/Planas.pdf Extending translation memories] (PDF 格式)
评论 (0)