미지어 처리의 정의
$Id: unk.html 65 2007-01-30 00:52:53Z taku-ku $;
개요
미지어 처리(
사전에 실려 있지 않은 단어의 형태소 해석의 처리)
에 붙어 유저가 재정의할 수 있습니다.
설정 파일
배포 사전의 디렉토리에 있다 char.def
(와)과 unk.def
그렇다고 한다2
개의 파일
(을)를 변경합니다.
char.def
미지어 처리의 룰입니다.
이쪽
(을)를 봐 주세요.
unk.def
미지어에 대한 품사열의 테이블입니다.
이쪽
(을)를
봐 주세요.
사례 연구법
숫자의 연속을1
개의 형태소로 한다
-
사전 (*.csv
파일)
(으)로부터 숫자의 엔트리를 삭제합니다.
ipadic
의 경우는,Noun.number.csv
중에서, 로마 숫자의 엔트리를 소거합니다.
- char.def
(을)를 수정해, 숫자의 연속이 미지어가 되도록(듯이) 합니다.
..
NUMERIC 1 1 0
..
- unk.def
(을)를 수정해, 숫자의 코스트를 작게 합니다.
4
컬럼눈의 코스트치를 0
이하의 작은 값으로 설정합니다.
NUMERIC,1204,1204,0,
명사,
수,*,*,*,*,*
-
사전을 컴파일 합니다.
% /usr/local/libexec/mecab/mecab-dict-index
ASCII
문자열은, 스페이스/
탭만 으로 분할한다 (kakasi
(와)과 동일 동작)
-
사전 (*.csv
파일)
(으)로부터 아스키 문자열을 포함하는 것 엔트리를 삭제합니다.
- char.def
(을)를 수정해, 스페이스, 기호를 제외한 문자를 동일자종(ASCII)
에 맙피
그 합니다.다른 엔트리도 동시에 체크해,0x0021..0x007E
의 영역을
다른 자종에 매핑 하지 않게 해 주세요.
ASCII 1 1 0
0x0021..0x007E ASCII
- unk.def
(을)를 수정해,ASCII
의 코스트를 작게 합니다.
4
컬럼눈의 코스트치를 0
이하의 작은 값으로 설정합니다.
ASCII,1192,1192,0,
명사,
사행 변격활용 접속,*,*,*,*,*
-
사전을 컴파일 합니다.
% /usr/local/libexec/mecab/mecab-dict-index
$Id: unk.html 65 2007-01-30 00:52:53Z taku-ku $;