インターネット上の情報は、公開が終了すると急速に見えなくなる。しかし、「現在アクセスできない」ことと「過去に存在しなかった」ことは同じではない。かつて運営していたモンゴル語辞書サイトをめぐって、この違いを象徴するような事例が起きている。
20年以上前のモンゴル語辞書サイト
かつて、@niftyのホームページサービス上でモンゴル語辞書サイトを運営していた。URLは次のものである。http://homepage3.nifty.com/itako/mon_jiten019.html
このサイトはすでに閉鎖されており、現在このURLから内容を閲覧することはできない。ところが、その痕跡は学術文献に残っている。
津山工業高等専門学校紀要第56号に掲載された「モンゴル語‐日本語変換に関する基礎的検討」では、この旧サイトのURLが参考文献として掲載されている。
論文:https://www2.tsuyama-ct.ac.jp/images/kyousyokuin/kiyou/kiyou2014k02.pdf
つまり、現在ウェブサイトそのものが消えていても、少なくとも論文が執筆された時点で、このURLが参照対象となっていたことは学術文献の側に記録されている。
Google AIによる「存在しない」という回答
ところが現在、「ITTAKOモンゴル語辞書」というキーワードで検索すると、GoogleのAIによる回答で「そのようなサイトは存在しない」という趣旨の説明が表示されることがある。これは奇妙な現象である。
実際にはサイトが過去に存在し、そのURLが外部の研究論文にも参考文献として記録されている。それにもかかわらず、現在そのURLにアクセスできないため、検索AIが「現在存在しない」という状態から「そのようなサイトは存在しなかった」と推定しているように見える。
ただし、Googleの内部処理がどのような理由でこの回答を生成しているのかは外部から確認できない。そのため、ここで言えるのは、少なくとも検索結果上では「閉鎖済みのサイト」と「存在したことのないサイト」が適切に区別されていない、ということである。
「現在存在しない」と「過去に存在しなかった」は別である
ウェブ上の資料を扱う場合、この二つは明確に区別する必要がある。
あるURLに現在アクセスできないことから確認できるのは、現在その場所でコンテンツが提供されていないという事実にすぎない。
そこから、「そのウェブサイトは存在したことがない」という結論を導くことはできない。
紙の本で考えれば分かりやすい。絶版になり、書店で購入できなくなった本について、「現在売られていないから、その本は存在しなかった」と結論することはない。ウェブサイトにも同じことが言える。
しかしウェブの場合、公開終了後には検索インデックスからページが消え、リンクも失われ、ドメインやホームページサービスそのものが廃止されることがある。そのため、年月が経過するほど「存在していたこと」を通常の検索だけから確認するのが難しくなる。
学術論文に残ったURLは一種の史料になる
今回の場合、重要なのは旧サイトのURLが第三者による研究論文に記録されていることである。
ウェブサイト自身は消えても、そのサイトを参照した論文、書籍、リンク集、掲示板、ウェブアーカイブなどには痕跡が残ることがある。
こうした外部資料は、過去のウェブを復元する際の史料となる。
特に研究論文の参考文献にURLが掲載されている場合、その論文が作成された当時、そのURLが執筆者によって参照資料として認識されていたことが確認できる。
もちろん、参考文献にURLがあるだけで、当時のページ内容のすべてを復元できるわけではない。しかし、「そのURLで何らかの資料が公開されていた」という事実を検討するための重要な手掛かりになる。
AI検索時代に生じる「デジタル史料」の問題
検索エンジンは従来、検索可能なページを一覧として提示する役割を担ってきた。これに対して生成AIを組み込んだ検索では、検索結果をもとにAIが一つの説明を組み立てる。
この仕組みには利便性がある一方、過去のウェブを扱う場合には注意が必要である。
現在の検索インデックスに十分な情報が残っていなければ、「確認できない」という状態が、「存在しない」という断定に変換される可能性があるからである。
これは歴史資料の扱いとしては大きな違いである。
歴史研究では、資料が見つからないことは通常、「現時点で確認できない」という意味にとどまる。不存在を証明するためには、それとは別の根拠が必要になる。ウェブの歴史についても、本来は同じ慎重さが必要である。
消えていく初期ウェブ
1990年代後半から2000年代にかけて、多くの個人サイトが作られた。
当時は個人がHTMLを直接書き、プロバイダーのホームページスペースに公開する形が一般的だった。ブログやSNSが普及する以前、専門的な知識や趣味の情報が個人サイトに大量に蓄積されていた時代である。
しかし、その多くは現在ではアクセスできない。
サービスの終了、契約の解約、サーバー移転、ドメイン変更などによって、当時のURLは次々と失われている。
そのため、現在のウェブ検索だけを利用して2000年前後のインターネットを調査すると、実際に存在していた情報のかなりの部分が最初から存在しなかったように見えてしまう。
ウェブ検索は、インターネットの完全な歴史記録ではない。
「検索で出ない」は「存在しなかった」ではない
今回の「ITAKOモンゴル語辞書」の例は、小さな出来事ではあるが、デジタル資料を扱う際の基本的な問題を示している。
サイトは閉鎖された。
元のURLにはアクセスできない。
通常のGoogle検索でも、当時のページそのものは容易には見つからない。
それでも、そのURLは研究論文の参考文献に残っている。
したがって、現在の検索結果だけを根拠として「そのようなサイトは存在しない」と断定することはできない。
むしろ、この事例が示しているのは別のことである。
インターネットにも歴史があり、その歴史を調べるためには、現在のウェブだけではなく、過去の論文、書籍、ウェブアーカイブ、リンク記録などを史料として扱う必要がある。
生成AIによる検索が一般化するほど、この区別は重要になるだろう。
AIが「知らない」ことと、その対象が「存在しなかった」ことは、まったく別の問題なのである。