10/11/10 15:37:52
集合知プログラミングのクラスタリングのプログラムロジックをPerlに移植した上で、
過去半年の英米圏で発表された科学論文系のプレスリリース約12000件のクラスタリングを
やってみたところ、プログラムがまったく動作しなかった。
元テキストで使われている英単語から辞書を作成したところ、辞書の大きさは約6万件。
これを元に記事ごとの単語頻出度を抽出させたんだが、1記事6万件の単語フィールドだと
普通のプログラムだと処理しきれないみたい。
集合知プログラミングのサンプルデータだとちゃんと処理できたのだが、
URLリンク(kiwitobes.com)