개방적인 형태소 해석기로서 Juman, ChaSen 하지만 존재한다. 각각의 기본적인 개발 이념은 이하이다
Juman 이전의 상용적으로 배포되고 있던 형태소 해석기는, 사전이나 품사 체계 연접 규칙은 거의 고정되고 있어, 유저 자신 자유롭게 정의할 수 없었다. Juman 하 이러한 정의 모두 외부에 내 자유로운 정의가 가능하게 되었다.
사전은 비교적 입수하기 쉽지만, 연접 코스트나 단어 발생 코스트의 정의는 일손에 의해서 실시하지 않을 수 없었다. 해석 미스를 발견할 때마다 부작용이 없는 범 위로 연접 코스트를 수정할 필요가 있어, 개발비가 크다.
또, Juman (은)는 일본어의 형태소 해석으로서 개발되고 있었으므로, 미지어 처리가 일본어에 특화되고 있어, 미지어 처리의 정의를 스스로 줄 수 없다. 또, 품사는2 계층까지 고정되고 있어, 품사 체계에는 일종의 제한이 있다.
ChaSen 의 공헌의1 개는, 통계 처리 (HMM) 에 의해서 연접 코스트나 단어 발생 코스트를 추정하게 된 점에 있다. 이 처리 덕분에, 해석 미스를 축적하는 것만으로 자동적으로 코스트치를 추정할 수 있게 되었다. 한층 더, 품사 계층도 무제한하게 되어, 품사 체계를 포함해( 진짜 의미로) 자유롭게 정의할 수 있게 되었다.
그러나, 복잡한 품사 체계로 하면 할수록, 데이타스파스네스의 문제가 발생한다. HMM (을)를 사용하는 경우, HMM 의 내부 상태(Hidden Class) (을)를 1 개에 고정한다 필요가 있기 위해, 각 품사로부터 내부 상태에의 「변환」이 필요하다. 단순하게는 각 품사를1 개의 내부 상태에 할당하면 좋지만, 활용까지 포함해 품사를 모두 전개하면, 그 수는 500 에도 미쳐, 저빈도의 품사에 대해 신뢰도가 높은 추정량을 얻을 수 없다. 반대로, 빈도의 높은 「조사」등의 품사는 어휘도 포함해 내부 상태로 하지 않으면 높은 정도를 얻을 수 없다. 복잡한 품사 체계로 하면 할수록, 내부 상태의 정의가 곤란하게 된다. 즉, 현상의( 복잡한) 품사 체계를 취급하려면, HMM 그럼 역부족이며, 그것을 보조하기 위한 일손 코스트가 커지고 있다.
또, ChaSen 에는 코스트치 추정 모듈이 부여되어 있지 않다. NAIST 의 내부에서는 이용할 수 있는 것 같지만, 상기의 이유로부터 설정해야 할 파라미터가 많이, 잘 다루는 것이 곤란하다.
한층 더, ChaSen 도 미지어 처리도 하드 코딩 되고 있어 자유롭게 정의할 수 없다.
HMM 하, 유일한 내부 상태를 정의할 필요가 있었다. 한편 CRF (은)는 오바락 프를 포함한 복수의 내부 상태를 정의하는 것이 가능하다. 이 기능에 의해, 가는 품사 계층과 엉성한 품사 계층의 확률치를 혼합한다고 했다, 「스무딩」이 자연스럽게 한편 자동적으로 실현될 수 있다. 이것은, 복잡한 품사 체계를 취급하는데 있어서 편리한 기능이며, 일손 처리를 큰폭으로 간략화할 수 있다.
CRF 의 채용에 의해, 품사 체계, 단어장, 사전의 변경에 대해 유연하게 한편 저비용으로 대응할 수 있게 된다. 한층 더, CRF 하, HMM 의 1/3 정도의 학습 코파스로 동일한 정도의 성능을 얻을 수 있는 것을 알고 있다. 즉, 새로운 도메인에의 적용이라고 하는 것에도 저비용으로 대처할 수 있을 것이다.
또, CRF 하, 지금까지의 최소 코스트법으로서 정식화할 수 있기 위해, 해석 속도의 열화는 없다.
MeCab 0.90 하, 코스트 추정 프로그램도 포함 배포한다. 최소한의 설정에서도 높은 정도를 얻을 수 있는 usability-를 제공한다.
해석 결과:
상 Juman,
하 ChaSen
(이)라는 비교.
seg:
원승리 쓰기의 정도, top:
품
사까지 포함한다, all:
활용까지 모두 포함한다
E-HMMs
하지만 현상의 MeCab/ChaSen

MeCab 0.90 그럼, 유저가 미지어 처리의 전략을 자유롭게 정의 가능해진다. 기본적인 전략으로서 자종에 근거해요 승리 쓰기를 실시한다. 자종 그 자체의 정의( 어느 문자 코드가 어느 자종에 대응할까), 각 자종에 대해요 승리 쓰기의 정의 ( 그룹화 할까, N 문자씩 정리한다 인가), 원 이겨 써 된 것에 어떠한 품사를 할당할까. (이)라고 있던 것이 유저 자신으로 정의할 수 있다.
자종을 표현하기 위한 내부 코드에 Unicode (을)를 이용하고 있어, 미지어 처리의 언어비의존성이( 부분적으로) 실현될 수 있다.
또, 미지어 처리의 파라미터도 CRF 에 의해 추정된다. ChaSen (이)나 Juman 에 비하면, 미지어에 대한다 해석 정도의 향상을 기대할 수 있다
해석예
MeCab 0.81 의 해석 결과
호리에몬씨를 만났다.
호
명사,
일반,*,*,*,*,
호,
호,
호
리에
명사,
고유 명사,
인명,
명,*,*,
리에,
리에,
리에
몬
명사,
고유 명사,
일반,*,*,*,
몬,
몬,
몬
씨
명사,
접미,
인명,*,*,*,
씨,
시,
시
에
조사,
격조사,
일반,*,*,*,
에,
니,
니
회
동사,
자립,*,*,
5단·와행 촉음편,
연용타 접속,
만난다,
악,
악
조동사,*,*,*,
특수·타,
기본형,
,
타,
타
.
기호,
구두점,*,*,*,*,
.,
.,
.
MeCab 0.90 의 해석 결과 ( 주변의 문맥을 고려하면서 「호리에몬」을 올바르게 해석할 수 있다)
호리에몬씨를 만났다.
호리에몬
명사,
고유 명사,
인명,
일반,*,*,* 0,10
씨
명사,
접미,
인명,*,*,*,
씨,
시,
시 10,12
에
조사,
격조사,
일반,*,*,*,
에,
니,
니 12,14
회
동사,
자립,*,*,
5단·와행 촉음편,
연용타 접속,
만난다,
악,
악
14,18
조동사,*,*,*,
특수·타,
기본형,
,
타,
타 18,20
.
기호,
구두점,*,*,*,*,
.,
.,
. 20,22
형태소 해석기의 일은, 조잡하게 말하면 「입력문을 형태소에 단락짓는다」와 (와)과에 있다. 그러나 「본부장」과 같이 단독의 해를 얻을 수 없는 경우가 있다. ( 본/ 부장 or 본부/ 장). 또 긴 복합어가 정의되고 있을 때, 그 구성어가 출력되지 않는다고 하는 문제도 있다.
MeCab 0.90 그럼, 「입력문을 형태소에 단락짓는다」라고 하는 기능과는 다른 「입력문으로부터 형태소를 추출한다」라고 하는 기능을 제공한다. 「형태소를 추출한다」기능을 실현하려면, 입력문의 모든 부분 문자열의 「형태소인것 같음」을 산출할 필요가 있다. MeCab 0.90 그럼 이 「형태소인것 같음」을 「형태소 주변 확률」 그렇다고 하는 형태로 산출한다. 자세한 것은 언어 처리 학회 2005 에서 발표 (이)가 끝난 상태
이하가 해석예이다
본부장 본부 명사, 고유 명사, 지역, 일반,*,*, 본부, 모트브, 모트브 0.026441 본부 명사, 일반,*,*,*,*, 본부, 혼브, 혼브 0.619559 * 본 명사, 고유 명사, 인명, 성,*,*, 본, 모트, 모트 0.010897 본 명사, 일반,*,*,*,*, 본, 폰, 폰 0.046961 본 접두사, 명사 접속,*,*,*,*, 본, 폰, 폰 0.292945 부장 명사, 일반,*,*,*,*, 부장, 브쵸우, 브쵸 0.352623 장 명사, 일반,*,*,*,*, 장, 나비, 조- 0.013549 장 명사, 접미, 일반,*,*,*, 장, 나비, 조- 0.624362 *
* 하지만 붙은 것이 실제의 해석 결과. 「형태소인것 같음( 형태소 주변 확률) 」도 동시에 출력된다
「형태소등 해들 」은 입력문에 의해서 바뀌는 것에 주의받고 싶다.
마츠모토씨를 만난다. 마츠모토 명사, 고유 명사, 인명, 성,*,*, 마츠모토, 마트모트, 마트모트 0.989497 * 씨 명사, 접미, 인명,*,*,*, 씨, 산, 산 0.998228 * 에 조사, 격조사, 일반,*,*,*, 에, 니, 니 0.990367 * 만난다 동사, 자립,*,*, 5단·와행 촉음편, 기본형, 만난다, 아우, 아우 0.999387 * . 기호, 구두점,*,*,*,*, ., ., . 0.999999 * EOS 마츠모토시에 간다. 마츠모토 명사, 고유 명사, 지역, 일반,*,*, 마츠모토, 마트모트, 마트모트 0.919221 * 마츠모토 명사, 고유 명사, 인명, 성,*,*, 마츠모토, 마트모트, 마트모트 0.073882 시 명사, 접미, 지역,*,*,*, 시, 시, 시 0.886151 * 시 명사, 일반,*,*,*,*, 시, 시, 시 0.110607 에 조사, 부사화,*,*,*,*, 에, 니, 니 0.013169 에 조사, 격조사, 일반,*,*,*, 에, 니, 니 0.986618 * 간다 동사, 자립,*,*, 5단·카행 촉음편, 기본형, 간다, 이크, 이크 0.966972 * 간다 동사, 자립,*,*, 5단·카행 촉음편 유크, 기본형, 간다, 유크, 유크 0.030681 . 기호, 구두점,*,*,*,*, ., ., . 0.999997 * EOS
상기와 같이 「마츠모토」의 형태소인것 같음은 주변의 문맥으로 변화한다
해석기와 파라미터( 사전, 연접 코스트) 하지만 완전하게 독립에 설계되므로, 이하의 사전에 대한 파라미터를 개별적으로 배포한다. 다만, 라이센스는 개개의 사전에 준한다