跳到主要內容

Concise 0.3.6 preview!

新的 Concise 0.3.6 即將釋出,現在先放個預覽的版本出來。新版本有幾項特點,將會在底下敘述。在觀看的同時,也別猶豫去下載新的版本回來玩玩。
A Preview version of Concise 0.3.6 is out.  There are several highlights described below.  Don't hesitate to give it a try.

The Workspace 工作空間


「工作空間」(workspace)的概念從 Concise 0.3.0 開始推出,作為檔案管理的新模式。工作空間的推出讓檔案共享成為可能,因為所有需要的檔案都存在裡面(將來應該會把原始檔案一併納入)。除此之外,新的 Concise 也能讓您同時在多個工作空間中進行文字處理(見下圖)。
As introduced in Concise 0.3.0, "Workspace" creates a new way of (corpus) file management.  This make workspace-sharing possible.  Moreover, you may even work on multiple workspaces at the same time (see below).  



體驗散佈圖的魅力 Experience Dispersion Plots: Concordance Plotter & Document Viewer


Concise 0.3.6 改變了散佈圖的顯示方式。在 Concordance Plotter 當中,散佈圖顯示關鍵詞在每個文件中出現的位置,告訴您那些關鍵詞會在文件的哪個部分被提到,在哪些部分特別集中,而哪些部分幾乎不曾提及。如果你需要比較詳細的資訊,可以打開 Document Viewer(文件顯示器),右方同樣會顯示關鍵詞的散佈圖,在內文也會用色塊標出。
Concise 0.3.6 change the way to display dispersion plot.  Dispersion plot at Concordance Plotter shows where the search word occurs in the document which the current entry belongs to.  That way you can see where mention is made most of your search word in each document.  If you are interested in detailed context, Document Viewer also provides dispersion plot (right hand side).  


詞性標注 Part-of-speech tagging


Concise 0.3.6 可以進行自動的詞性標注,這得感謝 Stanford Log-linear Part-Of-Speech Tagger。目前預設的模型是 chinese-distsim.tagger,你可以從 Stanford 下載其他的模型。
Auto part-of-speech (詞性)  tagging is enabled in Concise 0.3.6.  Thanks to Stanford Log-linear Part-Of-Speech Tagger.  The default model is "chinese-distsim.tagger".  You can download other models directly from Stanford.


有了這個功能後,現在的 Concise 便擁有處理原始(未分詞)中文文件的能力。整個輸入的過程,可以用三個階段來說明:

  • 用MMSeg進行分詞(可以指定自己的詞典)
  • 詞性標注
  • 對文件進行索引
Concise now has the capacity to handle raw (un-tokenized) Chinese documents.  This is a three-stage procedure:
  • Word Segmentation (tokenize) with MMSeg (specify custom dictionaries)
  • Part-Of-Speech Tagging
  • Indexing

類碼化(實驗性) Lemmatisation: an experimental feature



類碼還處於試驗階段,沒有辦法保證結果。
Lemma is in experimental stage.  The result may be incorrect.

類碼指的是一套詞彙的名義形式。舉例來說,在英文裡頭 run, runs, ran, running 都是同樣語義的詞形,而 run 是這些詞形的類碼。但是在中文裡頭,我覺得還是把類碼當作詞彙類別的群組會比較適當。
A lemma (plural lemmas or lemmata) is the canonical form of a set of words.  In English, for example, run, runs, ran and running are forms of the same lexeme, with run as the lemma.  However, in Chinese, I think lemma is better to be understood as the category or group of a set words.


來試試吧!Give it a try!

留言

熱門文章

差不多食譜實驗:小烤箱烤長茄子? Oven-roasted Long Aubergine?

發佈了「 差不多食譜:小烤箱烤茄子 Oven-roasted Aubergine 」之後,有位朋友在YouTube上留言問說,這個方法也可以用在市場上比較常看到的那種長茄子嗎?當時我只能回答不知道,因為沒試過。現在我有答案了!結果是一半一半!

差不多食譜:香煎南瓜片 Pan-fried Pumpkin

托爺爺的福,在萬聖節那碗「 南瓜盅飯 」後,我還有個老家的南瓜可以用。但要怎麼好好運用這顆南瓜,卻是個不小問題。差不多食譜曾經試過「 醋漬南瓜 」、「 牛奶南瓜 」,還有「 南瓜濃湯 」幾種運用新鮮南瓜的料理,難度雖然都不高,看起來卻都不像平時會出現在餐桌的家常菜。這次我們不妨搞得家常一點,用廚房裡都會有菜刀和煎鍋 (除非你家不開伙) ,來弄個超級家常的「香煎南瓜片」。

上車睡覺、下車尿尿

台灣人對於旅遊的形容,往往是「上車睡覺、下車尿尿」。這是因為行程被極度壓縮,試圖要在最短的時間裡面看最多的東西,於是每個景點都只是蜻蜓點水般匆匆帶過,停留的時間往往等同於排隊上廁所的時間。 這個紫南宮的行程已在「人山人海的紫南宮」當中提到過,只是當初沒寫到為什麼要去參觀紫南宮。事實上,紫南宮最富盛名的是可以借錢的土地公。然而,這點對我們家人而言一點吸引力都沒有,反倒是那號稱七星級的廁所,才是吸引我們前往參拜的重點。或許你會說:「有沒有搞錯,開一個鐘頭的車去上廁所!」沒錯,行程就是這麼規劃的。 在過年期間要到紫南宮上廁所還不是件容易的事。首先,你必須先開車到紫南宮,這大概是最容易的部份。接著,你就得面臨搶停車位窘境。 過年期間,不論哪個景點都是人山人海,免費停車位更是難找。紫南宮雖然提供一大片停車場,在過年期間卻也不敷使用,每台進入停車場的車都虎視眈眈,只要哪邊出現一個車位,起碼就有四、五台車等著。 好不容易停好車,接下來就得穿越那群要去借錢、還錢、拜拜的人群。在那個地方,怎麼前進的都不知道,反正總會有人把你向前推進。 好不容易到達造價上億的廁所,人山人海的盛況依舊。還好這群並非全部都來上廁所,要不然廁所早就被塞爆了。聽老爸老媽說,上次他們來的時候廁所裡面都沒人,還可以在裡面拍照、欣賞噴水。但這次裡面卻塞了不少人,我也不好意思拿著那麼大的一台相機拍人家上廁所的模樣,只能拍拍外觀。 由於是在盛產竹筍的竹山鎮,廁所的外觀也用竹筍作為造型,每個竹筍下方都是一間造價昂貴的廁所。一個令我覺得很貼心的設計在於,廁所不僅僅只是男廁/女廁,還有一個殘障廁所,方便行動不便的人。 雖然招牌寫著「金筍迎客」,但是看起來那個筍子明明就是不鏽鋼的,除非把它理解成金屬。我還特地爬上廁所的樓頂,想說能不能看到些什麼特別的風景。可是過年期間,看到的除了人群還是人群。 上完廁所後,簡單徒手祭拜了提供廁所的土地公,我們又再次穿越那重重的人群。不過,我還是偷偷跑去滾了一下那個象徵「財源滾滾」的金元寶。最後,又踏上那個停車戰場,從容地離去。 我不奢望有賺大錢的機會,只要生活能過得去,偶爾還能買些奢侈品犒賞自己就夠了。不過這個願望似乎也不簡單!