MeCab 의 사전 구조와 범용 텍스트 변환 툴로서의 이용

$Id: dic-detail.html 65 2007-01-30 00:52:53Z taku-ku $;

개요

단어 사전의 구조를 이해하는 것으로, MeCab (을)를 범용적인 텍스트 변환 툴로서 이용할 수 있습니다. 예를 들면, 히라가나 to 카타카나 변환, 로마자 to 히라가나 변환, Auto Link 등을 MeCab 만으로 실행할 수 있습니다

파일

단어 사전을 구축하려면, 최저 이하의 파일을 작성할 필요가 있습니다.

*.csv 파일

단어 사전입니다

엔트리는, 이하와 같은 CSV 그리고 추가합니다.

test,1223,1223,6058,foo,bar,baz

최초의4 개는 필수 엔트리로, 각각

되고 있습니다. 코스트치는 short int (16bit 정수) 의 범위에 거둘 필요가 있습니다.

5 컬럼눈 이후는, 유저 정의의 CSV 필드입니다. 기본적으로 어떤 내용이라도 CSV (이)가 허락하는 한 추가할 수 있습니다.

matrix.def

최초의 행에 연접표의 사이즈( 전건 사이즈, 후건사이즈) (을)를 씁니다. 그 다음은, 연접표의 전건의 문맥 ID, 후건의 문맥ID (와)과, 거기에 대응하는 코스트를 씁니다.

어느 단어 A, B 하지만 연접을 이룰 때,

됩니다. 즉, 단어 사전에 등록했다 ID 하지만 연접표를 참조할 때의 키가 됩니다. 코스트치는 short int (16bit 정수) 의 범위에 거둘 필요가 있습니다.

100 120
0 0 1
0 1 10
0 2 5

상기의 예에서는, 전건의 문맥의 사이즈가100, 후건의 문맥의 사이즈가 120 되어 있습니다. 또, 전건 문맥 0 (으)로부터 후건문맥 1 에의 천이 코스트가 10 되고 있습니다.

char.def

미지어 처리의 룰입니다. 이쪽 (을)를 봐 주세요.

이하가 최저한의 설정 (DEFAULT (와)과 SPACE) 입니다

DEFAULT 1 0 0
SPACE   0 1 0
0x0020 SPACE

unk.def

미지어에 대한 품사열의 테이블입니다. 이쪽 (을)를 봐 주세요.

이하가 최저한의 설정 (DEFAULT (와)과 SPACE) 입니다

DEFAULT,0,0,0,*
SPACE,0,0,0,*

사전의 컴파일

다음의 커멘드를 실행하는 것으로, 해석용의 바이너리 사전을 작성합니다.

% /usr/local/libexec/mecab/mecab-dict-index 

사례 연구법

example 디렉토리에 몇개의 응용예가 있습니다.

Auto Link

Hatena Keyword (와)과 같은 Auto Link (을)를 실장해 보겠습니다

히라가나 to 카타카나 변환 툴


$Id: dic-detail.html 65 2007-01-30 00:52:53Z taku-ku $;