形態素解析と日本語処理at TECH
形態素解析と日本語処理 - 暇つぶし2ch287:デフォルトの名無しさん
07/09/05 19:11:28
>>276
anthy-agent にひらがな入力する方法はないのかな。

288:デフォルトの名無しさん
07/12/19 18:41:14
質問です!!
yahoo!の形態素解析使ってるんですがreadingがうまく表示されません。
surface pos readingと表示させようとしたら
美しい 形容詞 形容詞 となぜか、readingにも品詞が入ってるみたいな気がします。
reading単体で使ってもなぜか品詞が返ってきます。

どなたか助けてください。。。

289:デフォルトの名無しさん
07/12/19 18:42:48
ageマス。

290:デフォルトの名無しさん
07/12/19 18:43:54
必死で申し訳ありませんが、ルビーを使ってます。

291:デフォルトの名無しさん
08/02/04 10:20:29
形態素まで行かずに単語分解だけをしようと思います
言語を文書から自動生成したい

こんなのありますよ 参考に

辞書不要の形態素解析エンジン「マリモ」とは URLリンク(www.atmarkit.co.jp)

292:デフォルトの名無しさん
08/02/04 10:24:54
各文書を特徴づける重要語を計算して、
どの文書でも重要でない単語を無視すれば良い単語帳が作れるはず

TF・IDF法
URLリンク(nlp.nagaokaut.ac.jp)

293:デフォルトの名無しさん
08/02/04 11:16:52
URLリンク(d.hatena.ne.jp)
ここなかなかいいよ

294:デフォルトの名無しさん
08/02/04 12:16:30
類似語とそうでないものを判別するにはどうすればいいですか

類似語 
勝利 大勝利

類似語でない
本人 日本人
カウント アカウント
京都 東京都


295:デフォルトの名無しさん
08/02/04 12:18:23
お前が今分けた手順でおk

296:デフォルトの名無しさん
08/02/04 12:25:33
>>295
自動化したいのですが こういうやつはどうやればできますか
URLリンク(labs.preferred.jp)

297:デフォルトの名無しさん
08/02/04 12:35:09
類似語が分類できるならば、単語分解もそこに含まれるから
類似語の分類をするルーチン作ろうぜ

298:デフォルトの名無しさん
08/02/04 13:47:37
単語らしさはどうやって判定したらいいですか
あと形態素解析はあまり有効でない気がします
何故ならば日本語研究が必須になってしまう為です 韓国や中国に対応できないし

素解・・・あり得ない
形態素・・・ある
本語・・・あり得ない
日本語・・・ある

というのを数値的に表したいものです

299:デフォルトの名無しさん
08/02/04 22:40:26
日本語の文法の知識が全くない状態から、品詞分解とその接続を求めることは出来るのでしょうか

300:デフォルトの名無しさん
08/02/04 22:46:53
類似単語が判れば、それを同一視することで類似文書が判りますね
1単語のズレのある類似文書から品詞分解が判りますかね
たとえば
僕は釣りをします → 僕 は 釣り を します
私は料理をしますわ → 私 は 料理 を しますわ → 僕 は 料理 を します

とすると、釣りと料理は同じ分類だと判明します

301:デフォルトの名無しさん
08/02/04 22:51:21
>>298
文法研究をすっ飛ばして考えるなら、
文章のログから部分共通文字列を探せば見つかるような気がする。

302:デフォルトの名無しさん
08/02/05 00:22:01
圧縮接尾辞配列っていいみたいだけどわかる人いますか

303:デフォルトの名無しさん
08/02/05 00:57:54
圧縮接尾辞配列ってブロックソーティング、Burrows-Wheeler変換やるみたいだね

304:デフォルトの名無しさん
08/02/05 06:37:27
バカ過ぎる



305:デフォルトの名無しさん
08/02/05 09:54:40
>>294
京都と東京都は、地名として考えたら類似じゃない?

306:デフォルトの名無しさん
08/02/05 11:15:02
狂都
東狂都

307:デフォルトの名無しさん
08/02/05 11:42:17
圧縮接尾辞配列を調べたけど、大規模なインディックスにはむかないと思う
インディックスサイズが小さくできても
ウェブページのようにメモリに全て載せられないなら検索速くならないし・・・

308:デフォルトの名無しさん
08/02/05 11:44:29
向いているのはCHMの代わりになる位だな 
ファイルサイズ小さくできてサイズの3~5倍のメモリ消費ですむだろうから

309:デフォルトの名無しさん
08/02/05 11:55:19
↓こう書いてあるけど絶対にこの方針ではgoogleの足下にも及ばないと予測する


「Googleの弱点を克服したアルゴリズムによる検索エンジンを世界で初めて実装した」
Sedue:圧縮接尾辞配列を実装した初の商用検索エンジン
URLリンク(itpro.nikkeibp.co.jp)

310:デフォルトの名無しさん
08/02/05 19:13:35
>>309
接尾語処理なんて、google以前から大抵の検索エンジンでやってたことなのに・・・


311:デフォルトの名無しさん
08/02/05 20:19:16
suffix arrayでぐぐっとけ、カスが

312:デフォルトの名無しさん
08/02/05 22:12:20
バカ過ぎる(笑)

313:デフォルトの名無しさん
08/02/06 12:52:48
各単語の出現確率を調べておきもっとも確率の高い分割をもとめればいいと思う

たとえば、日本語はご存じの通り、文章が単語で区切られていません、なら

日 本語 は ご 存じ の通 り、 文 章が 単 語で区 切られて い ま せん の確率は0.01%

日本語 は ご存じ の 通り 、 文章 が 単語 で 区切られて いません だと10%

とか計算できればよい

314:デフォルトの名無しさん
08/02/06 21:24:05
>>313
ひょっとしてマルコフ連鎖のことを言いたい?

315:デフォルトの名無しさん
08/02/06 22:35:11
文字列をビット単位で連鎖の統計取ればデータ蓄積量の多さによっていつかは統計的な形態素解析器ができるはず!!!!111

316:デフォルトの名無しさん
08/02/07 04:54:43
>>314
マルコフ連鎖とは違う
前後の繋がりだけではなく、すべての分割に対してもっとも確率が上がるもの

317:デフォルトの名無しさん
08/02/07 05:05:06
もっとも単語になりやすそうな部分で区切ることで計算量は減らせるはず
たとえば、文書が1単語となる確率が高いなら、次のように分割され残りの文書は短い



たとえば、日本語はご存じの通り、

文章

が単語で区切られていません

318:デフォルトの名無しさん
08/02/07 05:16:59
first loaded.

319:デフォルトの名無しさん
08/02/07 05:30:29
 
日本語¥n+xは¥n+x単語¥n+xに¥n+x拠って¥n+x区切られ¥n+xます¥n+x。 
ですが¥n+x、¥n+x詳細¥n+xの¥n+x作成¥n+xは¥n+x大変¥n+xな¥n+x事¥n+xでしょう¥n+x…   


320:デフォルトの名無しさん
08/02/07 07:21:39
>>316
だからマルコフ連鎖をA*探索したのとどう違うんだって?

321:デフォルトの名無しさん
08/02/07 21:14:40
naist-jdic マダ-?

322:デフォルトの名無しさん
08/02/07 23:29:31
>>320
前後のつながりだけじゃないって書いてるじゃん。

323:デフォルトの名無しさん
08/02/07 23:36:23
>前後の繋がりだけではなく、すべての分割に対してもっとも確率が上がるもの
ここをもうちょっと formal な形で言わないと伝わらないと思われ
どういう確率モデルを想定しているのか。つーか俺にも伝わってない
単語分割をマルコフ連鎖でモデル化したのなら >320 の指摘通りだと思うのだが

324:デフォルトの名無しさん
08/02/10 16:31:23
このへんとか
URLリンク(www.amazon.co.jp)


325:デフォルトの名無しさん
08/02/10 16:37:25
>>324
ああ、その本はいい本だよ。B4のゼミとかに丁度いいんじゃないかな。

326:デフォルトの名無しさん
08/02/11 08:21:36
結局313が何を言いたかったのかは謎なまま時は過ぎてゆく…

327:デフォルトの名無しさん
08/02/23 13:44:46
音声の検索システムできた。

328:デフォルトの名無しさん
08/02/23 14:13:43
ソースうp

329:デフォルトの名無しさん
08/03/27 07:31:14
>MySQLおよびPostgreSQLで日本語キーワードインデック
>スを実現しているもの(Sennaおよびtextsearch-ja)は、
>現在バックエンドエンジンとしてMecabを推奨してい
>るようです。

あるフォーラムあらのコピーですが、本道だとすると、
すごいですね?! AppleのOSXの日本語処理もMecab?

Mecabの一人勝ちか。

330:デフォルトの名無しさん
08/03/29 01:45:22
>>329
>AppleのOSXの日本語処理もMecab?

そうなん?
Mac OS X には Language Analysis Manager というのがあるけど。
ありゃ、リファレンスを見ると Leopard から deprecated だな。

331:デフォルトの名無しさん
08/04/05 11:11:05
>>330
おっと、ちょっと調べたら確かにMeCabが使われてるね。知らんかった。

332:デフォルトの名無しさん
08/04/05 23:48:58
なさけねえな、Apple
スピーチ周りでVocaloid時代を十数年先取りしてた企業のくせに
自社技術捨ててオープン物に蔵換えか
そろそろジョブズ氏ねよ

333:デフォルトの名無しさん
08/04/07 06:31:49
>>332
初音ミクのApple版でも出せってかw
まー形態素解析ってメインは日本語とかでしょ。アジア方面はもともと「二の次」感が。

オープンソースで手に入る共通な技術があったなら使わせてもらう、というのが流れ
なのかなあと。もう何から何まで自家製というんじゃなくて、企業として独自性を
打ち出す部分だけ頑張る、みたいな感じなんじゃないかな。

334:デフォルトの名無しさん
08/04/07 19:37:41
しょうがないよ、マック信者は舶来物信者だから、アジア方面に力を入れないほうが売れるんだよ。

335:デフォルトの名無しさん
08/04/09 21:10:16
ただのりあぽーか。

336:デフォルトの名無しさん
08/04/22 02:47:39
blog界隈で信者のMac IMEを褒めたたえる声が目立つと思ったら、
オープンものに頼った結果ってことか。
奴らの言う最先端とやらは素晴らしい技術力だことで(呆

MS-IMEの糞っぷりも失笑ものだが、
Macの信仰のしどころの間違いっぷりは抱腹絶倒だな

337:デフォルトの名無しさん
08/04/22 07:44:33
Mac に IME なんて無いけどな。

338:デフォルトの名無しさん
08/04/27 00:53:20
今はもうInput Method EditorのEはつけずにIMって呼び方のほうが一般的じゃない?


最新レス表示
レスジャンプ
類似スレ一覧
スレッドの検索
話題のニュース
おまかせリスト
オプション
しおりを挟む
スレッドに書込
スレッドの一覧
暇つぶし2ch