PDF・Word・Excel の中身を横断検索する
厚生労働省が公開している人事・労務の文書 – 件(PDF・Word・Excel)を収録しています。 検索も文書の解析も、すべてこのブラウザの中で動いています。 サーバーには検索の仕組みがありません。
その場で中身を読み取り、上の検索対象に加わります。数ページなら数秒、100ページの PDF で20〜30秒ほどかかります。
ファイルは送信されません。解析もベクトル化も、このブラウザの中だけで完結します。
| サーバー | 静的ファイルを返すだけ。検索用のサーバープロセスもデータベースもありません。 |
|---|---|
| キーワード検索 | BM25。空白区切りで複数指定すると AND 検索になり、一致した語を色付けします。 |
| 意味検索 | 日本語向け埋め込みモデル Ruri v3 30m(名古屋大学・Apache-2.0)を ONNX Runtime Web で実行。 |
| ベクトルの作り方 | 収録文書の – 区画分は手元の GPU で計算し、int16 に量子化して配布(–)。ブラウザは質問文だけを計算します。 |
| 2019年版との違い | 当時は AWS Elasticsearch に常時課金していました。今回はサーバー側の費用がゼロです。 |