全文検索デモ

PDF・Word・Excel の中身を横断検索する

デモ一覧へ
DEMO

キーワード検索と意味検索を、同じ質問で並べて比べる

厚生労働省が公開している人事・労務の文書 – 件(PDF・Word・Excel)を収録しています。 検索も文書の解析も、すべてこのブラウザの中で動いています。 サーバーには検索の仕組みがありません。

準備しています…
キーワード検索は読み込みの完了を待たずに使えます。

キーワード検索

入力した語がそのまま含まれる箇所を探す(2019年版と同じ方式・BM25)
質問を入力してください。

意味検索

語が一致しなくても意味の近い箇所を探す(Ruri v3・256次元)
質問を入力してください。

手元の PDF・Word・Excel を、この枠に放り込んでみてください

その場で中身を読み取り、上の検索対象に加わります。数ページなら数秒、100ページの PDF で20〜30秒ほどかかります。

ファイルは送信されません。解析もベクトル化も、このブラウザの中だけで完結します。

収録している文書の一覧(– 件)

仕組み

サーバー静的ファイルを返すだけ。検索用のサーバープロセスもデータベースもありません。
キーワード検索BM25。空白区切りで複数指定すると AND 検索になり、一致した語を色付けします。
意味検索日本語向け埋め込みモデル Ruri v3 30m(名古屋大学・Apache-2.0)を ONNX Runtime Web で実行。
ベクトルの作り方収録文書の – 区画分は手元の GPU で計算し、int16 に量子化して配布(–)。ブラウザは質問文だけを計算します。
2019年版との違い当時は AWS Elasticsearch に常時課金していました。今回はサーバー側の費用がゼロです。
意味検索は万能ではありません。 型番や固有名詞の完全一致、「この語を必ず含む」という絞り込みは苦手で、そこはキーワード検索の役目です。 実務ではこの2つを組み合わせます。左右に並べているのは、その使い分けを見ていただくためです。