llms.txt・構造化データ・FAQ…AIに正しく読まれるサイトの技術要件を解説

llms.txt・構造化データ・FAQ

「llms.txtを置けばAIに読まれやすくなる」「FAQの構造化データを入れればChatGPTに引用される」。AI検索対策(GEO/AIO/LLMO)が注目されるにつれて、こうした技術的な施策が営業トークとして飛び交うようになりました。しかし、Googleの公式ドキュメントやOpenAIのクローラー仕様を確認すると、「効果があるもの」「害はないが効果も限定的なもの」「むしろ逆効果になりうるもの」がはっきり分かれます。本記事では、llms.txt・構造化データ・FAQ・robots.txt・プレビュー制御といった「AIに正しく読まれるための技術要件」を、一次情報にもとづいて整理します。Web担当者が制作会社や社内エンジニアに依頼する際の、優先順位の判断材料としてご活用ください。

目次

前提:AI検索における「技術要件」の位置づけ

まず押さえておきたいのは、Googleの生成AI機能(AIによる概要・AIモード)に表示されるための追加の技術要件は存在しないという事実です。Google Search Centralの公式ドキュメントは、「ページがインデックスされ、スニペット付きでGoogle検索に表示できる状態であること」以外に特別な条件はないと説明しています(出典:Google Search Central, 2025)。

さらに2026年5月に公開された「生成AI機能向けの最適化ガイド」では、「生成AI検索向けに構造化データは必須ではなく、追加すべき特別なschema.orgマークアップもない」と明記され、llms.txtの設置やAI専用のMarkdown版ページ、コンテンツの細切れ化(チャンク化)には特別な効果がないことが示されました(出典:Google Search Central, 2026)。

つまり、技術面でやるべきことの本質は「AI向けの特別な何か」ではなく、通常のクローラーに正しく読まれ、内容が正確に解釈される状態を作ることです。この視点で、話題の施策を一つずつ見ていきます。

llms.txtとは何か、設置すべきか

llms.txtの概要

llms.txtは、2024年9月にAnswer.AIのJeremy Howard氏が提案したファイル形式で、サイトのルート(例:example.com/llms.txt)にMarkdown形式でサイトの概要と主要ページの一覧を置き、大規模言語モデル(LLM)がサイト内容を効率よく把握できるようにするというものです。robots.txtやsitemap.xmlの「AI向け版」として紹介されることが多く、仕様はllmstxt.orgで公開されています。

主要なAIは現時点で読んでいない

重要なのは、この仕様を主要なAI企業が公式に採用した事実がないことです。GoogleのJohn Mueller氏は2025年6月、「現時点でllms.txtを使っているAIシステムはない」と述べ、各社のチャットボットはページそのものを取得しているがllms.txtは取得していないと説明しました(出典:Search Engine Roundtable, 2025)。前述のGoogleの2026年ガイドでも、llms.txtに特別な扱いはないと明記されています。

実務上の判断

設置して害になるものではありませんが、効果を期待して予算や工数をかける施策ではありません。開発者向けドキュメントサイトなど、サイト構造が複雑で主要ページを明示したい場合に「おまけ」として置く程度にとどめ、優先度は後述の構造化データや本文の明確化より下に置くのが妥当です。

構造化データ:AI向けに「必須」ではないが、やる価値はある

Googleの立場

構造化データ(schema.orgのマークアップ)は、ページの内容を機械が解釈しやすい形で補足する仕組みです。Googleは、生成AI機能のために構造化データは必須ではないとする一方で、リッチリザルトの表示資格を得るためにSEO施策の一部として引き続き実装することを推奨しています(出典:Google Search Central, 2026)。2025年5月のSearch Centralブログでも、「構造化データはページに表示されている内容と一致させること」が、AI検索でコンテンツを良好に表示するための項目として挙げられています(出典:Google Search Central Blog, 2025)。

守るべきルール:見えている内容と一致させる

Googleの構造化データに関する一般ガイドラインでは、マークアップはユーザーに見える内容を正確に反映している必要があり、ページに表示されていない情報をマークアップすることや、無関係・誤解を招く内容を記述することは禁止されています。違反すると手動による対策の対象になることもあります(出典:Google Search Central, 構造化データの一般ガイドライン)。「AIに評価されたいから」と、ページにない受賞歴や評価を構造化データだけに書くのは逆効果です。

中小企業サイトで優先すべき構造化データ

種類 主な用途 設置場所の目安
Organization 社名・ロゴ・所在地・連絡先・公式SNSなど運営者情報 全ページ共通(ヘッダー/フッター)
LocalBusiness 店舗・事業所の住所・営業時間・電話番号 店舗ページ・会社概要
Article/BlogPosting 記事のタイトル・公開日・更新日・著者 ブログ・お知らせ
Person 執筆者・監修者の氏名・肩書・資格 著者プロフィールページ
Product/Service 商品・サービスの名称・価格・提供範囲 商品・サービス詳細ページ
BreadcrumbList サイト内の階層構造 全ページ

記述形式はGoogleが推奨するJSON-LDを使い、Search Consoleの「拡張」レポートやリッチリザルトテストでエラーがないことを確認してください。

FAQ:構造化データより「本文にQ&Aがあること」が重要

FAQのリッチリザルトは2023年に大幅縮小

以前は、FAQPage構造化データを入れると検索結果にQ&Aが展開表示される「FAQリッチリザルト」が多くのサイトで使えました。しかしGoogleは2023年8月、FAQリッチリザルトの表示対象を「よく知られた権威ある政府機関・医療系サイト」に限定し、HowToリッチリザルトは廃止すると発表しました。既存のマークアップをあえて削除する必要はなく、サポート外の構造化データは無視されるだけだとも説明されています(出典:Google Search Central Blog, 2023)。

したがって、一般企業のサイトでは「FAQPageマークアップを入れたから検索結果が目立つ」という効果はすでに期待できません。

それでもFAQセクションを作るべき理由

一方で、ページ本文に質問と回答のセットがあることは、AI検索対策として引き続き有効です。Pew Research Centerが2025年7月に公表した調査では、質問形式の検索では60%でAIによる概要が表示されており、1〜2語の検索(8%)と比べて圧倒的に高い割合でした(出典:Pew Research Center, 2025)。ユーザーが実際に投げかける質問文を見出しにし、その直後に端的な回答を置く構成は、AIにとっても人間にとっても「答えを見つけやすいページ」になります。

FAQを作る際のポイントは次のとおりです。

  • 実際に顧客から受けた質問をそのまま使う(検索者の言葉と一致しやすい)。
  • 回答の1文目で結論を述べ、補足は2〜3文目以降に書く。
  • 1ページに詰め込みすぎず、テーマごとに関連ページへ分散させる。
  • 回答内の数字や条件には、根拠(法令・公式資料・自社データ)を添える。

robots.txtとクローラー制御:意図せずAIから除外していないか

AI関連クローラーの整理

AI検索に自社サイトを読んでもらうには、各社のクローラーがアクセスできる状態である必要があります。主なクローラーと役割は次のとおりです。

クローラー名 運営 役割 robots.txt
Googlebot Google 通常検索・AIによる概要・AIモードの共通クローラー 従う
Google-Extended Google Geminiなどの学習・グラウンディング用の制御トークン。検索やAIによる概要の表示には影響しない 従う
OAI-SearchBot OpenAI ChatGPTの検索機能で参照するサイトの収集 従う
GPTBot OpenAI モデル学習用データの収集 従う
ChatGPT-User OpenAI ユーザー操作に応じたページ取得 ユーザー起点のため適用されない場合がある

OpenAIは2025年12月にクローラーのドキュメントを改訂し、OAI-SearchBotとGPTBotはrobots.txtに従うこと、ChatGPT-Userはユーザーが開始した操作のためrobots.txtのルールが適用されない場合があることを明記しました(出典:OpenAI, 2025)。

よくある設定ミス

  • 生成AIによる無断学習を防ぐつもりで「GPTBot」を拒否した際に、まとめて「OAI-SearchBot」も拒否してしまい、ChatGPTの検索結果に表示されなくなっている。
  • WordPressのセキュリティプラグインやCDNのボット対策が、AI関連クローラーを一律にブロックしている。
  • テスト環境のnoindex設定が本番公開後も残っている。

「学習には使わせたくないが、検索・回答での引用はされたい」という方針なら、GPTBotのみを拒否し、OAI-SearchBotとGooglebotは許可するといった切り分けが必要です。

プレビュー制御:nosnippet・max-snippetの影響を理解する

Googleは、既存のプレビュー制御(nosnippet、data-nosnippet、max-snippet)がAIによる概要やAIモードにもそのまま適用されると説明しています。noindexを指定すればAI機能からも完全に除外されます(出典:Google Search Central, 2025)。

注意すべきは、これらの指定が通常の検索結果のスニペット(説明文)にも同時に影響することです。「AIに要約されたくない」という理由で全ページにnosnippetを付けると、通常の検索結果の説明文も表示されなくなり、クリック率の低下につながりかねません。有料会員向けの記事など、本当に保護したい部分だけをdata-nosnippet属性で囲むといった限定的な使い方をおすすめします。

AIに正しく読まれるHTMLの基本

特別なファイルや仕掛けよりも効果が確実なのが、HTMLそのものの品質です。次の項目を確認してください。

  1. 見出し階層を正しく使う:h1は1ページに1つ、h2・h3で論理的な階層を作る。見出しは「質問」または「結論が分かる文」にする。
  2. 本文はHTMLとして取得できる状態にする:重要な文章が画像内の文字やJavaScript実行後にしか表示されない構造だと、クローラーによっては内容を取得できないことがあります。主要なテキストはサーバーから返されるHTMLに含めるのが安全です。
  3. 表・リストを使う:料金、比較、手順などはtableやol/ulで記述すると、AIが事実として抜き出しやすくなります。
  4. 公開日・更新日を明示する:本文とArticle構造化データの両方に記載し、情報の鮮度を伝える。
  5. XMLサイトマップを最新に保つ:新規・更新ページが速やかに発見される状態にする。
  6. 画像にalt属性を付ける:Googleの生成AI機能は関連する画像・動画も回答に組み込むため、画像SEOの基本も有効です(出典:Google Search Central, 2026)。
  7. Core Web Vitalsを確認する:ページ体験はGoogleがAI検索で評価される基本項目として挙げている要素の一つです。

技術要件チェックリスト(優先順位つき)

  • 【必須】Search Consoleで主要ページがインデックスされ、エラーがないことを確認する。
  • 【必須】robots.txtでGooglebot・OAI-SearchBotを拒否していないことを確認する。
  • 【必須】noindex・nosnippetが意図したページだけに設定されていることを確認する。
  • 【推奨】Organization・LocalBusiness・Article・Personの構造化データをJSON-LDで実装し、表示内容と一致させる。
  • 【推奨】主要ページに本文FAQ(質問見出し+結論先出しの回答)を設ける。
  • 【推奨】見出し階層・表・リスト・alt属性・更新日表記を整える。
  • 【任意】llms.txtを設置する(効果は期待せず、コストをかけない範囲で)。

よくある質問

Q1. llms.txtはまったく意味がないのですか?

現時点では、Googleが公式に「特別な扱いはしない」と明記し、John Mueller氏も主要なAIシステムが読んでいないと述べています(出典:Google Search Central, 2026/Search Engine Roundtable, 2025)。将来的に採用が広がる可能性は否定できませんが、今は「あっても困らないが効果は見込めない」施策です。工数は構造化データや本文の改善に優先的に使ってください。

Q2. FAQPageの構造化データはもう削除したほうがよいですか?

削除は必須ではありません。Googleは2023年8月の発表で、サポート外になった構造化データをあえて削除する必要はないとしています(出典:Google Search Central Blog, 2023)。ただし、マークアップの内容がページに表示されているQ&Aと一致していることは引き続き必要です。本文に存在しない質問を構造化データだけに書くことは避けてください。

Q3. ChatGPTに学習されたくないが、ChatGPT検索には出たい場合はどうすればよいですか?

robots.txtでGPTBotのみを拒否し、OAI-SearchBotは許可する設定にします。OpenAIのドキュメントでは、GPTBotは学習用、OAI-SearchBotは検索機能での参照用と役割が分けられています(出典:OpenAI, 2025)。ただしOpenAIは両クローラーが1回のクロール結果を共用する場合があるとも説明しているため、方針を厳密に分けたい場合は定期的にドキュメントの更新を確認してください。

参考資料・出典

まとめ

AIに正しく読まれるサイトの技術要件は、「AI向けの特別なファイル」ではなく、通常のクローラーに正確に読まれる基本の積み重ねです。Googleは追加の技術要件はないと明言し、llms.txtやAI専用マークアップには効果がないとしています。一方で、表示内容と一致した構造化データ、本文に置いた質問と結論先出しの回答、正しいクローラー制御、整ったHTML構造は、通常のSEOとAI検索対策(GEO/AIO/LLMO)の両方に効きます。まずはSearch Consoleとrobots.txtの確認から始め、優先順位に沿って整備を進めてください。

神戸・大阪・東京から全国のWeb集客を支援する株式会社グッドラフでは、無料のサイト診断を行っています。お問い合わせからお気軽にご相談ください。構造化データやクローラー設定を含む技術面の整備は、ホームページ制作・SEO対策の両サービスで対応しています。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

目次