跳到主要內容

Concise Tutorial: 開始Concise的第一步


Concise是一套文字探索軟體,使用簡單的文字分析功能發掘文本間的關聯模式。Concise很容易上手,這邊不過是提供大家一點進入的要訣,以便快速地開始使用Concise。如果我有力氣的話,後續的Tutorial也會接著寫出來。

1.) 載入語料(資料)

在語言學、計算語言學、以及部份的數位人文學、部分的圖書資訊學當中,只要研究範疇涉及語言,通常都把資料稱作語料(corpus)。這些語料往往是一堆記錄的文字,像是演講稿、對話、訪談的逐字稿等等,或是本來就是文字記錄的資料,像是報紙、圖書等等,當然也可以是某些抽象物體的文字描述。在集結語料之後,也經常像資料庫那樣把這些語料的集合稱作語料庫,英文同樣是corpus,或是複數形式的corpora。也因為處理的都是文字,這種分析的方法也常被稱作文本分析(text analysis)。


LoadCorpus

Concise提供兩種方式來載入語料,Load Corpus Files和Load Raw Document(s)。兩者的區別在於,Corpus是已經分詞處理過的語料,而Raw Document則是未經分詞處理的檔案。下面將用一個簡單的例子來說明兩者的差別。

美牛即將進口,國人請自行注意。 
美 牛 即將 進口 , 國人 請 自行 注意 。

如果這兩個句子分別是準備載入的語料檔案,那麼上面的必須用未分詞的Raw Document方式來載入,目的是將完整的中文拆成一個個詞。下面的這句已經是分過詞的句子,並用空白字元隔開,因此兩種方式都可以。不過,使用Corpus File的方式比較快,畢竟少了一個分詞的動作。至於原本就是用空白字元當作單詞邊界的語言,像是英文、法文等等,好像沒這個問題。

一旦進行載入的動作,Concise將進行檔案的轉換,依照偏好設定(參見第三部分)過濾語料後,將其轉換成Concise corpus的格式。

2.) Corpus Manager 語料總管

載入語料之後,Concise會開啟語料總管。你可以在此檢視載入語料的初步狀態,如語料所含的字數和段落數,當然還有檔案名稱與路徑。

CorpusManager

請注意,標點符號仍舊被當作字,會被納入這邊的字數計算。

段落數也不是精確的。載入的檔案若是純文字檔,則會將換行符號當作段落符號;若是Microsoft Word檔案,則依據Word檔案定義的段落;如果是XML,則會依據Preferences偏好設定中的XML設定來決定段落的定義。

在Corpus Manager中可以進行語料檔的管理,新增、刪除或者是將其存成Concise Corpus檔案。強烈建議各位在確定語料需保留的資料後,將其存成Concise Corpus格式。開啟Concise Corpus不再需要檔案轉換,能夠加快載入的動作。

3.) Preferences 偏好設定

現行Concise 0.2.1a的偏好設定中,有三個部份決定了語料檔案如何被讀進來。

檔案偏好(File Preferences)

Default File Encoding 預設檔案編碼

在現行的Mac系統中,大部份的純文字檔案應該是採用UTF-8來進行的;在Windows上則不太一定。如果你也是繁體中文的使用者,若是UTF-8不行,通常用Big5或Big5-HKSCS就能解決。

FilePreferences

Chinese Segmentation Custom Dictionaries 分詞用的辭典

Concise中已經內建教育部所提供的詞彙(六萬多個詞目)。如果你覺得這些不夠,或是和你專門領域的特殊字彙差太多,你也可以新增自己的辭典。

注意:辭典檔案是個UTF-8編碼的純文字檔,副檔名是.dic。


標籤偏好(Tag Preferences)

標籤偏好決定了文本中需要保留的內容。注意:更動標籤設定將重新轉換語料檔案。

TagPreferences

Non-embedded Tag 非內嵌的標籤

常見的標籤標注方式,用<和>包圍的標籤。有特殊需求的,請參考SGML中的定義。


Embedded Tag 內嵌標籤

內嵌標籤的使用常見於各大語料庫的檔案中,例如

看_V 山_N ,_P 看_V 水_N 。_P

其中,「_」即是內嵌標籤,分隔前面的單詞和後面屬性(詞性)。

看\V 山\N ,\P 看\V 水\N 。\P

這句用的則是另一種常見的內嵌標籤「\」。


Skip Tags 忽略標籤

忽略整個標籤包覆範圍的文字,只需要輸入標籤內容即可。例如TEI的格式中,<teiHeader>和</teiHeader>涵蓋的通常是語料檔的屬性,在分析時可以忽略這一部份,此時就可以使用忽略標籤的定義來過濾這個部分。只要輸入標籤名稱,也就是teiHeader即可。同樣的,如果不需要標題<head>和</head>所夾住的部份,也可以用此來過濾。注意,忽略標籤的設定是有大小寫區分的。


XML偏好(XML Preferences)

設定特定的段落標籤以及特定的單詞標籤。如果沒有任何設定,將會把整個文件當作一團連續的文本來處理。

XMLPreferences


4.) 存成Concise Corpus格式

一旦載入檔案進入Concise後,會自動依據上述偏好設定轉換成Concise Corpus格式。這是經過gzip壓縮後的純文字檔,檔案大小會減少許多。所有的Concise功能都依靠這些預先轉換的語料來進行。也因為不用每次都進行過濾,進行重復的動作時,速度會比前一個版本快上不少。

SaveCorpusFilesTo

儲存時選擇的是「資料夾」,將採用和載入語料檔案相同的檔名,並將副檔名更改為.ccorpus。

一旦儲存成Concise Corpus格式後,標籤或檔案偏好的更動將不再有任何作用。不過其他的檔案仍然可以更動。


現行您可以前往Concise的官方網站,下載最新版的Concise

留言

熱門文章

差不多食譜實驗:小烤箱烤長茄子? Oven-roasted Long Aubergine?

發佈了「 差不多食譜:小烤箱烤茄子 Oven-roasted Aubergine 」之後,有位朋友在YouTube上留言問說,這個方法也可以用在市場上比較常看到的那種長茄子嗎?當時我只能回答不知道,因為沒試過。現在我有答案了!結果是一半一半!

差不多食譜:香煎南瓜片 Pan-fried Pumpkin

托爺爺的福,在萬聖節那碗「 南瓜盅飯 」後,我還有個老家的南瓜可以用。但要怎麼好好運用這顆南瓜,卻是個不小問題。差不多食譜曾經試過「 醋漬南瓜 」、「 牛奶南瓜 」,還有「 南瓜濃湯 」幾種運用新鮮南瓜的料理,難度雖然都不高,看起來卻都不像平時會出現在餐桌的家常菜。這次我們不妨搞得家常一點,用廚房裡都會有菜刀和煎鍋 (除非你家不開伙) ,來弄個超級家常的「香煎南瓜片」。

上車睡覺、下車尿尿

台灣人對於旅遊的形容,往往是「上車睡覺、下車尿尿」。這是因為行程被極度壓縮,試圖要在最短的時間裡面看最多的東西,於是每個景點都只是蜻蜓點水般匆匆帶過,停留的時間往往等同於排隊上廁所的時間。 這個紫南宮的行程已在「人山人海的紫南宮」當中提到過,只是當初沒寫到為什麼要去參觀紫南宮。事實上,紫南宮最富盛名的是可以借錢的土地公。然而,這點對我們家人而言一點吸引力都沒有,反倒是那號稱七星級的廁所,才是吸引我們前往參拜的重點。或許你會說:「有沒有搞錯,開一個鐘頭的車去上廁所!」沒錯,行程就是這麼規劃的。 在過年期間要到紫南宮上廁所還不是件容易的事。首先,你必須先開車到紫南宮,這大概是最容易的部份。接著,你就得面臨搶停車位窘境。 過年期間,不論哪個景點都是人山人海,免費停車位更是難找。紫南宮雖然提供一大片停車場,在過年期間卻也不敷使用,每台進入停車場的車都虎視眈眈,只要哪邊出現一個車位,起碼就有四、五台車等著。 好不容易停好車,接下來就得穿越那群要去借錢、還錢、拜拜的人群。在那個地方,怎麼前進的都不知道,反正總會有人把你向前推進。 好不容易到達造價上億的廁所,人山人海的盛況依舊。還好這群並非全部都來上廁所,要不然廁所早就被塞爆了。聽老爸老媽說,上次他們來的時候廁所裡面都沒人,還可以在裡面拍照、欣賞噴水。但這次裡面卻塞了不少人,我也不好意思拿著那麼大的一台相機拍人家上廁所的模樣,只能拍拍外觀。 由於是在盛產竹筍的竹山鎮,廁所的外觀也用竹筍作為造型,每個竹筍下方都是一間造價昂貴的廁所。一個令我覺得很貼心的設計在於,廁所不僅僅只是男廁/女廁,還有一個殘障廁所,方便行動不便的人。 雖然招牌寫著「金筍迎客」,但是看起來那個筍子明明就是不鏽鋼的,除非把它理解成金屬。我還特地爬上廁所的樓頂,想說能不能看到些什麼特別的風景。可是過年期間,看到的除了人群還是人群。 上完廁所後,簡單徒手祭拜了提供廁所的土地公,我們又再次穿越那重重的人群。不過,我還是偷偷跑去滾了一下那個象徵「財源滾滾」的金元寶。最後,又踏上那個停車戰場,從容地離去。 我不奢望有賺大錢的機會,只要生活能過得去,偶爾還能買些奢侈品犒賞自己就夠了。不過這個願望似乎也不簡單!