取得とインデックス
混同されやすい、取得層と索引層の用語です。
- クロールcrawl
- クローラーがURLへアクセスし、レスポンスを取得すること。取得できたかどうかは、検索結果に表示されるかとは別の問題です。
- インデックスindex
- 取得した内容を検索対象として登録すること。取得できていてもインデックスされないことがあります。
- noindex
- ページ内のメタタグまたはレスポンスヘッダーで、検索結果への表示を拒否する指示。ページが取得されて初めて読まれます。
- robots.txt の disallow
- クローラーに対する取得の拒否。取得されないため、ページ内の noindex は読まれません。noindex とは別の仕組みです。
- canonical
- 同一または類似内容の複数URLのうち、代表とするURLを指定する指示。自己参照、他ページ参照、欠落、多段参照で挙動が異なります。
- ソフト404
- 内容が存在しないにもかかわらず、HTTPステータス200を返す状態。ステータスと内容が食い違うため、検出が難しい不具合です。