自然言語処理スレッド その3at TECH自然言語処理スレッド その3 - 暇つぶし2ch■コピペモード□スレを通常表示□オプションモード□このスレッドのURL■項目テキスト6:デフォルトの名無しさん 09/02/28 19:31:31 mecab の ipa (naist-jdic) は文法体系ってか品詞体系だと思うけど、 あの体系自体は機械処理に向けて作られたものなので、 考えて進まないくらいならあれでやっていいと思うが。 7:デフォルトの名無しさん 09/03/06 14:05:39 文書の重要度 (まともらしい、スパムらしいなど) はどう計ればいいですか。 人間が学習させると、未知の文書、外国語の文書に対応できません。 圧縮してサイズが激減する物は、重要でないと言えると思いますが 減らない物が重要とは言えないです。JPGが重要文書になってしまいます。 もし日本語の特徴を学習してしまうと、アラビア語、バルト語、ムー大陸語に対応できません。 人間が認識可能であるらしいこと、価値ある文書であるらしいことを判別したいんです。 8:デフォルトの名無しさん 09/03/06 14:10:49 無理 9:7 09/03/06 14:27:54 無理って事は無いと思うんです。 たとえば、英語なら使われる文字は40文字程度、日本語なら6000文字程度など限定的ですし、 平仮名や、「は」「が」が良く出現するとかの特徴で言語らしい判別は出来そうですが。 次ページ最新レス表示レスジャンプ類似スレ一覧スレッドの検索話題のニュースおまかせリストオプションしおりを挟むスレッドに書込スレッドの一覧暇つぶし2ch