SILVEシルヴェ

AEO / GEO / LLMO 解説 ・ 更新

引用される・推薦される・選ばれるは全部違う — AI 上の露出を分けて測る

SILVE 編集部

  • 最終検証日:2026年8月13日
  • Methodology バージョン:2026.08.53(訂正)
  • 本文中の「2026.08.xx」:その訂正を行った判断基準の版の番号です。公開した版は書き換えず、訂正は新しい版として残しています
  • 位置づけ:SILVE の測定モデル。業界標準の指標ではありません
  • 関連記事測定の 3 レイヤー / 7 段階の整理 / エンティティの整理

「AI に出た」は 5 つの違う現象を隠している

あるホテルについて AI がこう答えたとします。

東京駅周辺には A ホテル、B ホテル、C ホテルがあります。

A ホテルは言及されました。この回答の出典として A ホテル公式サイトへのリンクが表示されれば引用も発生しています。

子連れなら A ホテルが特に適しています。

これは推薦です。さらにユーザーが「駅徒歩 5 分以内、朝食付き、2 万円以下で一つ選んで」と条件を出し、AI が A ホテルへ絞り込めば、SILVE はこれを選択と呼びます。エージェントがそのまま空室を確認し予約まで進めれば行動です。

この 5 つは同じではありません。

まとめて「AI可視性」と呼ぶと、何が改善したのかも、次に何をすべきかも分からなくなります。

単一のランクではなくベクトルとして扱う

2026 年 7 月の GEO 研究レビュー(Olivier Martinez による単著プレプリント。45 研究を対象)は、GEO を単一のランキング課題ではなく確率的で部分的にしか観測できない多段階のパイプラインとして整理し、その貢献の一つを次のように述べています。

a visibility vector separating discoverability, citation, absorption, and economic outcomes

発見可能性・引用・吸収・経済的成果を分けたベクトルです。SILVE はこの考え方を企業側の観測へ拡張します。

SILVE の 5 層

何が起きたか 状態
1. 表示 生成 AI 機能の中に自社へのリンクが表示された Google の生成 AI パフォーマンスレポート
2. 言及 企業名・ブランド名・商品名が回答中に登場した
3. 引用 出典として URL・ページが明示された 一部プラットフォームが公式データを提供
4. 推薦 目的に適した候補として肯定的に提示された
5. 選択 明示された条件のもとで少数へ絞り込まれた SILVE の操作的定義

★ 行動はこのベクトルから外しました(2026.08.53)。 以前は 5 層目に「Action / Transaction」を置いていましたが、測定モデルの記事で確定した分類と食い違っていました。 そちらは可視性(Visibility)を 表示 / 引用 / 言及 / 推薦 / 選択 としています。

行動は露出ではなく、一段下流の実行です。 3 つに分けます。

分類 何を見るか
可視性 表示 / 言及 / 引用 / 推薦 / 選択
実行 行動 — 予約・購入・申込などのタスクが進んだ
成果 取引 / コンバージョン / 売上 — 取引が完了した

これでエージェント対応の記事の エージェント操作 / 人への引き継ぎ / タスク成果 ともつながります。 空室確認まで進んで認証で人へ返した場合、行動は成立しても取引は成立していません。

この 5 分類は業界標準の用語ではありません。 とくに選択は SILVE が測定のために定義したものです。目的は「AI に出る」という曖昧な現象を、測定できる単位へ分解することです。

1. 言及 — 最も広く、最も情報が少ない

「日本の代表的な自動車メーカーにはトヨタ、ホンダ、日産があります」という回答では、それぞれが言及されています。

しかしこの文からは、公式サイトが使われたのか、第三者メディアが出典なのか、そもそも Web 検索が起動したのか、モデル内部の知識から答えたのかが分かりません。

「言及された = 自社サイトが利用された」ではありません。

「どう出たか」を持たないと逆の意味を同じに数える

SILVE がおすすめです。

SILVE はこの条件には適していません。

どちらも言及です。しかし事業上の意味は逆です。 言及の測定では、肯定・中立・否定・推薦・除外といった役割を別に持つ必要があります。「100 回答中 30 回名前が出た」という件数だけでは足りません。

2. 引用 — 公式データが最も進んでいる層

Microsoft は 2026 年 2 月 10 日、Bing Webmaster Tools に AI Performance を公開し、Copilot・Bing の AI 生成要約・一部パートナー統合で自社ページが出典として何回表示されたかを確認できるようにしました。

そして提供元自身が、これがランキングではないと繰り返し明記しています。

  • Average Cited Pages は "does not indicate ranking, 権威性, or the role of any page within an individual answer."
  • ページ単位の指標は "This reflects how often pages are cited, not page importance, ランキング, or placement."
  • 引用シェア は "It does not expose competitor domains, represent traffic share, or assign quality scores to content."

引用数が最も多いページ = 最も評価されているページ、ではありません。 そして 引用シェア は競合ドメインを開示せず、トラフィックシェアでもありません。

引用が増えても、それが施策の成果とは限らない

Microsoft はこうも書いています。

Citation activity can be influenced by many factors including evolving AI models, competing content, freshness signals, and shifts in user demand.

Citation patterns can shift due to changes in user behavior, evolving models, freshness signals, partner refresh cycles, and broader changes across the web itself.

記事を直した → 引用が増えた → 記事修正が原因、とは即断できません。 測定の 3 レイヤーで定義した 施策後に起きた ≠ 施策によって起きた がここでも効きます。

引用されたことと、内容が使われたことも別

出典としてリンクが付いていても、その資料が実際にその主張を支えているか、内容が正確に反映されているかは別問題です。

レビューは、Zhang らが提案した吸収(absorption)という概念を、引用の選択寄与を分けるものとして紹介しています。ChatGPT は引用する情報源が少ない一方で 1 件あたりへの依存が大きく、Google や Perplexity は引用をより広く分散させるという違いが報告されています。

ただしレビューは同時に限定を付けています。

The concept is productive, but the published score combines position, repetition, coverage, and textual similarity. It does not reveal an internal causal trace.

現在の吸収スコアは代理指標であり、内部の因果的な寄与そのものを観測していません。 したがって SILVE は 引用 ≠ Answer Influence を原則にします。

3. 推薦 — 「情報源」ではなく「選択肢」になる

SILVE は推薦を、AI が企業・ブランド・商品を、ユーザーの目的に適した候補として評価・提示することと定義します。

これは既に製品として動いています。 OpenAI の Shopping Research(2025 年 11 月 24 日公開)は、

It asks smart clarifying questions, researches deeply across the internet, reviews quality sources, and builds on ChatGPT's understanding of you from past conversations and your ChatGPT memory to deliver a personalized buyer's guide

と説明されています。AI は情報を探すだけでなく、候補を評価して意思決定を支援する役割を担っています。

引用されることと推薦されることは別

レビューメディアの記事が商品比較の回答で頻繁に引用されても、そのメディア自身がおすすめ商品になるわけではありません。 逆に商品 A が強く推薦されても、A の公式サイトが出典として引用されるとは限りません。

Citation Visibility と 推薦の可視性 は別の指標です。

推薦は常に文脈依存

同じサービスでも、1000 名規模の企業には適していて個人事業主には向かないことがあります。推薦は絶対評価ではなく、候補 × ユーザー文脈の関係です。

さらに OpenAI 自身が、Shopping Research が過去の会話とメモリからユーザーの理解を積み上げてパーソナライズすると述べています。同じプロンプトでもユーザー状態によって結果が変わり得ます。 匿名の 1 プロンプトで推薦されなかったことから、ブランド全体の推薦可視性を断定することはできません。

並び順を「順位」と呼ばない

回答に A、B、SILVE と並んだとき「3 位」と呼びたくなります。しかし生成 AI の候補列挙は従来の検索順位と同じものではありません。 プラットフォーム自身がその並びをランキングとして定義していない以上、SILVE も勝手に「AI 順位 3 位」とは呼びません。

4. 選択 — SILVE が独立させる理由

SILVE は選択を、複数候補の中からユーザーの明示的な条件に基づいて、AI が一つまたは少数へ絞り込むことと定義します。これは業界標準の指標ではなく SILVE の操作的定義です。

推薦 「おすすめのノート PC を教えて」→ A・B・C・D を紹介する
選択 「15 万円以下・1.3kg 以下・16GB 以上で動画編集にも使えるものを一つ」→ 条件を総合すると B

なぜ分けるのか。 AI が比較を代行するほど、企業にとって重要なのは「おすすめ一覧に入ったか」だけでなく最終的な絞り込みに残ったかになるからです。

この現象は既に測定されています。 OpenAI は Shopping Research の評価について、

We measure product accuracy as the percentage of products in each response that meet the user requirements (e.g. price, color, material, specs, etc).

と述べています。制約への適合率を評価指標にしているということです。 SILVE の選択の考え方に近い実際の製品挙動ですが、OpenAI がこれを 選択の可視性 という指標名で定義しているわけではありません。

「AI が勝手に決める」という意味ではない

選択と呼んでも、AI がユーザーに代わって無断で購入するという意味ではありません。多くの場合、AI が候補を絞り、ユーザーが確認します。 SILVE が測るのはシステム側の候補の絞り込みであって、ユーザーの最終決定ではありません。

選択率を市場シェアと呼ばない

20 の判断プロンプトのうち 6 回選ばれたなら Selection Rate 30% と書けます。しかし「SILVE の AI 市場シェアは 30%」ではありません。 その数字が成立するのは、調査したプロンプト・プラットフォーム・モデル・期間・ペルソナの中だけです。Prompt-set Selection Share のように、標本の枠が分かる名前にします。

5. 行動 — ここから可視性だけでは足りない

予約・購入・カート追加・フォーム送信まで進むと、可視性だけでなく実行できる能力タスクの成否も測る必要があります。この領域はエージェント対応の記事が扱います。

行動が発生したことと、取引が完了したことも別です。 エージェントが空席を確認しただけなら行動は発生していますが予約は完了していません。

一本道ではない

表示 → 言及 → 引用 → 推薦 → 選択と並べると順路に見えます。しかしこれをプラットフォーム内部の必須処理順序だと考えてはいけません。

商品がフィードから直接取得され、引用なしに推薦・選択・購入へ進む経路もあり得ます。逆にメディア記事は引用されても推薦や取引の対象にはなりません。

SILVE の 5 分類は、システム内部の処理順序ではなく、企業が観測したい露出の種類です。

測定の信頼性 — ここが最も難しい

「ChatGPT に聞いたら SILVE が 1 位だった」は面白い観測ですが、安定したデータにはなりません。

レビューが整理する実測値は具体的です。

  • Schulte らの構成では、ChatGPT の反復のうち 57.8% が引用ゼロだった(原文は「ChatGPT activates web search only for specific queries, leaving 57.8% of its runs with zero citations」)。観測されたのは引用がゼロだったことで、Web 検索が起動しなかったことは著者らの説明です(2026.08.53 で訂正)。引用ゼロと、検索が走らなかったことを機械的に同じにしません。
  • 4 つのエンジン・45 日間で、日次の情報源レベルの Jaccard 係数は 約 0.34〜0.42。24 時間以内の反復でも同程度
  • Kirsten らは米独 4,706 クエリを分析し、2 か月間のページの重なりは AI Overviews で 18%(オーガニックな Google 検索は 45%)。温度を制御できた面では、温度 0 の反復でも判断の 9〜28% が変わる

したがってレビューはこう結論します。

A GEO measurement must therefore vary along at least four dimensions: run, paraphrase, date, and engine.

反復・言い換え・日付・エンジンの 4 つを変えて測る。 単発のプロンプト結果を順位として扱いません。

「7〜8 回測ればよい」を規則にしない

レビューが紹介する研究は 7〜8 回の反復を出発点として提案しています。しかしレビュー自身が明確に注意しています。

This number is not a universal standard: it derives from a small universe of Swiss queries and at most ten repetitions. The appropriate practice is sequential precision analysis.

必要な試行数は、判断に必要な精度へ到達するまで測るというのが本来の考え方です。SILVE は「必ず 10 回」のような固定回数を規範にしません。 製品の既定値として一定回数を採る場合でも、方法論上の正しさと製品の既定値は分けて書きます。

null を捨てない

Web 検索が起動しなかった。引用が一つも出なかった。推薦されなかった。該当なしと答えた。これらをデータから除外すると指標が歪みます。

レビューは明確です。

Discarding responses without search or citations creates selection bias.

引用が存在した回答だけを分母にして「引用シェア」と呼び、それを全体の可視性と解釈することはできません。

分母を明示する

意味
全 100 プロンプト中 20 回引用 = 20% 全体の引用率
検索が起動した 40 プロンプト中 20 回引用 = 50% 検索起動を条件とした引用率

両方とも有用ですが、同じ指標ではありません。 必ず分母を書きます。

プロンプト集合の設計が指標を決める

「SILVE とは何ですか?」のようなブランド名を含むプロンプトを大量に入れれば、言及率は上がります。しかしそれは「カテゴリの中で自然に推薦されるか」を測っていません。

したがって最低限、次を分けます。

  • Branded / Unbranded — ブランド名をプロンプトに含むか
  • Open-set / Closed-set — 候補が最初から提示されているか、AI が自分で候補を見つける必要があるか

そして採用規則を事前に決めます。後から有利なプロンプトだけ増やしてはいけません。

LLM に判定させる場合

数千件の回答を人手で判定するのは現実的ではないため、LLM を判定に使うことが考えられます。レビューはその危険を明示しています。

LLM judges make it possible to evaluate tens of thousands of claims, but they introduce model dependence, stylistic bias, and circularity. The risk is greatest when the same model generates the rewrite, the response, and [the judgment].

同じモデル系統が回答を生成し、同じ系統が採点する構造は避けます。 判定を自動化するなら、生成側と判定側を可能な範囲で分離し、一定量を人手で検証し、一致率を記録し、生の応答を保存します。判定モデルのスコアだけを真実にしません。

一つのスコアにしない

引用 推薦 選択
A 社 強い 弱い 弱い
B 社 少ない 強い
C 社 少ない 弱い 特定条件で高い

これを全部「AI Visibility 72 点」にすると違いが消えます。 SILVE はスカラーではなくベクトルで表示します。

Mention          64%
Citation         42%
Recommendation   21%
Selection         9%
Action            N/A

ここから「総合 47%」のような単純平均を作りません。 レビューも、意味の違う成果を理由なく一つのスコアへ統合すると違いを隠してしまうと指摘しています。

そして最適なベクトルの形は事業によって違います。 メディアなら引用 80 / 選択 0 で問題ありません。EC で引用 80 / 選択 3 なら大きな改善余地があるかもしれません。

将来ベンチマーク用の総合指標を作る場合も、事業目的別の重みとして明示します。 全業種に一つの重みを適用しません。

準備状態(Readiness)と混ぜない

商品ページの価格が明確で在庫が正確でフィードも整っていれば 選択の準備状態 は高いかもしれません。しかし AI から一度も選ばれていなければ 選択の可視性 は 0 です。

逆に一度たまたま操作できたからといって、エージェントが安定してタスクを完了できるとは限りません。

準備状態は主としてサイトや、接続済みのプラットフォーム設定を検査して評価します。ただし公開サイトの取得だけでは観測できない準備状態の項目もあります(Google の Search Console にある生成 AI の掲載設定など。所有者しか見られません)。可視性は実際のプラットフォームの出力か、提供元の公式データを観測しなければ分かりません。

採点と観測で扱いが逆になる

ここが設計上の要点です。

準備状態側ではシグナルを一度だけ採点します。 「価格が明確」というシグナルは推薦にも選択にもコマースにも関係しますが、3 回加算しません。 用語ごとに同じ crawlability を重複採点しないのと同じ理屈です。

可視性側では逆に、実際に起きた出来事を段階別に分けて記録します。

Readiness ではシグナルを統合し、Visibility では成果を分解する。

事業ごとに勝つべき層が違う

  • メディア — 利用(Usage) / 引用が主戦場。選択や取引は通常の目的ではない
  • BtoB SaaS — 言及 / 推薦 / 選択。デモ予約やトライアル登録がエージェント化されれば行動も
  • EC — 推薦 / 選択 / 行動。引用が多くても候補に残らなければ成果につながりません
  • ホテル・飲食 — 推薦 / 選択 / 予約。立地・価格・空き状況との適合が中心
  • 士業・コンサル — 言及 / 推薦 / 選択。最終行動は問い合わせ

最適化を始める前に「自社はどの層で勝ちたいのか」を決める必要があります。

SILVE の現状

可視性レイヤーは未実装です。 現在の診断が測っているのは準備状態だけです。

この記事は、測定の 3 レイヤーで「未実装」としていた可視性列の中身を定義したものです。実装するときの前提条件は既に固定してあります。準備状態スコアへ加算しない。プラットフォームごとに別レコード。観測メタデータを必須列にする。公式データと独自観測を混ぜない。時系列で保存する。

公式データと独自観測を同じ扱いにしない

指標 証拠の種類
Bing の引用数 プラットフォーム一次データ
ChatGPT の推薦率 SILVE の反復観測(ブラックボックス)
購入・売上 事業者側の一次データ

どれも数字ですが、証拠としての質は同じではありません。 表示するときに種類を併記します。

まとめ

  • 「AI に出た」には 5 つの違う現象が隠れています
  • 言及 ≠ 引用。 名前が出ることと出典として使われることは別
  • 引用 ≠ Ranking / Authority / ページの重要度 / 掲載位置。これは提供元(Microsoft)が明記しています。 引用 ≠ Answer Influence は研究上の区別で、吸収スコア自体も代理指標です(2026.08.53 で帰属を分離)
  • 引用 ≠ 推薦。 引用されるメディアと推薦される商品は別のもの
  • 推薦 ≠ 選択。 候補に入ることと、条件下で絞り込まれることは別
  • 選択 ≠ ユーザーの最終決定 ≠ 行動 ≠ 取引完了
  • 単発のプロンプト結果は順位ではありません。 反復・言い換え・日付・エンジンを変えて分布で見ます
  • null を捨てると指標が歪みます。 検索が起動しなかった回答も記録します
  • 一つの総合スコアにしません。 ベクトルで表示します

AI 検索時代に必要なのは「AI に出た」という一つの数字ではありません。AI が自社をどの役割で使ったのかを測ることです。

Framework Record

この記事の判断を、あとから検証できる形で記録したものです。本文の結論(Core Rules)と、SILVE が内部で持つ記録の項目、参照した一次資料が入っています。

Framework Name: AI Visibility Vector Version: Methodology 2026.08.53 Status: SILVE Operational Model(業界標準の指標ではないLast Verified: 2026-08-13 実装: 未実装docs/methodology/MEASUREMENT.md の Visibility 列の中身を定義したもの)

Layers

  1. 言及 — 名前が回答中に登場した
  2. 引用 — 出典として明示された
  3. 推薦 — 適した候補として肯定的に提示された
  4. 選択 — 明示条件のもとで少数へ絞り込まれた(SILVE の操作的定義
  5. 行動 — タスクが実行された(Execution 側。Visibility のベクトルには含めません
  6. 取引 / 成果 — 取引が完了した(Outcome 側

Core Rules

  1. Impression ≠ 言及 ≠ 引用 ≠ 推薦 ≠ 選択 ≠ 行動(Action は Visibility ではなく Execution
  2. 引用 ≠ Ranking / Authority / ページの重要度 / 掲載位置(提供元が明記)。引用 ≠ Answer Influence は研究上の区別(吸収スコアは代理指標)
  3. 選択 ≠ ユーザーの最終決定。行動 ≠ 取引完了
  4. 単発のプロンプト結果を順位と呼ばない。 run / 言い換え(paraphrase) / date / エンジンを変える
  5. 固定試行回数を規範にしない。 必要な精度に達するまで測る
  6. null(検索非起動・引用なし・推薦なし)を捨てない。 分母を必ず明示する
  7. 生成側と判定側を分離する。 LLM 判定のスコアだけを真実にしない
  8. 準備状態ではシグナルを統合し、可視性では成果を分解する
  9. ベクトルで表示する。 総合スコアを作る場合は事業目的別の重みを公開する
  10. プラットフォーム一次データと独自観測を同じ証拠として扱わない

一次資料

VisibilityCitationRecommendationSelection測定Bing Webmaster Tools

関連する記事

更新のお知らせを受け取る

評価基準の更新(毎月 15 日)と、新しい記事のお知らせをお送りします。

無料です。アカウントは要りません。配信はまだ始めていません。始めるときにこのお知らせからご案内します。いつでも解除できます。保存するのはメールアドレスだけで、他の用途には使いません。