山君GEO logo 阜阳山君网络科技有限公司 · GEO 优化团队
山君GEO · 数据研究 2026-07-24 fysjai.com →
CN-GEO引用生态报告

Data Research · Release 2026.07

国内生成式 AI
引用生态全景报告

从平台规模、信源结构、问题类型、页面特征与时间新鲜度五个层面,拆解国内生成式 AI 的可观察引用模式,并形成可执行的 GEO 数据挖掘路线。

数据版本 默认口径 精确去重 报告形式 离线单文件 HTML更新时间
原始引用观察
精确去重引用
标准问题
AI 平台
规范信源
规范页面

关键率指标

所有比例仅描述当前报告样本,点击可查看对应分析模块与分母说明。

全局分析口径

筛选会联动带有“联动”标记的图表;平台总览类图表始终保留全量比较。

正在载入分析口径…

01数据底座与分析适用性

先理解题库的分类逻辑,再确认样本规模、字段可用性、链接可解析性和处理状态。后续每类分析按照所需字段确定样本边界。

本章用途:建立问题分类、引用观察、规范页面与分析口径之间的阅读顺序。

01.1 · Question taxonomy

620 个问题覆盖 6 个研究维度、31 个有效类型

先说明题库如何组织。当前每个问题继承一个原始目录标签,行业、意图、时效、风格和场景属于不同观察角度。

标准问题
研究维度
有效问题类型
未分类问题

分类边界:31 个有效类型与 1 个未分类存量桶合计形成 32 个目录组合。未分类是数据治理状态,其中多为带年份或促销节点的高时效问题。

查看 32 类代表问题按研究维度、类型与题数展开
研究维度问题类型题数代表问题

代表问题取每个原始类别中编号最早的实际问题;题数以 620 个标准问题为统计粒度。

01.2 · Processing funnel

214,119 条原始观察经过精确去重后保留 189,845 条唯一记录

展示原始记录、去重记录、有效 URL 与规范页面之间的数量关系。让读者理解每一层数据粒度。

有效 URL 以 HTTP(S) 且完成规范化为准;规范页面按 canonical_url 汇总。重复观察在原始层保留,汇总层默认去重。

01.3 · Field availability

核心标识完整,内容与时间元数据按平台选择性提供

比较关键字段的有效值覆盖率。字段未知只限定依赖该字段的分析。

分母为 214,119 条原始引用观察;发布时间可用表示已成功规范化为日期。

01.4 · Analysis applicability

不同分析任务拥有各自的可用样本边界

按照分析所需字段计算可用比例。说明每类结论覆盖了多少记录。

引用观察统计可使用全部记录;页面、域名、标题、摘要、位置和时间分析分别应用对应字段条件。

01.5 · Platform availability

平台提供的引用元数据具有稳定的结构差异

对照 12 个平台的六类字段可用率。平台差异反映采集接口与展示能力边界。

深色表示该平台字段可用率更高。字段未知记录继续用于不依赖该字段的统计。

01.6 · Processing status

采集状态、清洗状态和页面冲突采用不同处理方式

将常见状态映射到明确的保留、排除或复核规则,防止多个百分比被合并成一项总缺失率。

每项使用自己的分母,记录级状态与页面级状态不相加。

02AI 平台引用全景

平台样本规模与问题覆盖存在显著差异。规模、覆盖、信源广度和单问题密度需要同时观察。

本章用途:识别各平台的引用供给强度、覆盖边界,以及同产品 Web/移动端的结构差异。

02.1 · Citation scale
口径联动

头部平台贡献了更密集的样本,平台规模差距需与问题覆盖共同解释

排序比较平台引用量和样本引用份额。建立平台样本权重基线。

样本引用份额的分母为 12 个平台在当前原始或精确去重口径下的引用总量,用于描述本报告样本结构,不能外推为市场份额。

02.2 · Question coverage

六个平台覆盖接近完整,长尾平台的比较范围更窄

比较问题覆盖数和覆盖率。约束跨平台结论的可比范围。

覆盖率分母为数据集内 620 个标准问题。

02.3 · Source breadth

引用量、信源数与页面数共同刻画平台的检索广度

观察平台规模与信源广度关系。区分“高频集中”与“广泛覆盖”。

横轴为规范信源数,纵轴为去重引用量,气泡大小为规范页面数。

02.4 · Per-question density口径联动

单问题引用密度呈长尾分布,中位数比均值更适合横向比较

展示各平台每问题引用数的五数概括。识别典型密度与极端高值。

箱体依次表示下四分位数、中位数和上四分位数,须线表示最小值与最大值。

02.5 · Terminal pairs口径联动

同产品电脑端与移动端的样本体量并不一致

对照具备双端数据的产品。支持终端差异研究与采集配额规划。

移动端样本引用占比以产品双端当前口径引用合计为分母;问题覆盖差以电脑端覆盖问题数为分母。只纳入同时存在电脑端与移动端记录的产品家族。

03信源生态与集中度

9,878 个规范信源已经形成完整的一级类型地图。域名规模、引用贡献、主体自有来源渗透、头部集中与生态归属共同解释信源供给结构。

本章用途:先判断各类信源在生态中的规模与影响,再识别平台偏好、稳定信源和新增内容进入头部生态的难度。

03.1 · Source taxonomy overview固定口径:全局精确去重

域名规模与引用贡献共同揭示九类信源的生态位置

对照每个一级类型的域名占比和去重引用占比。识别少量域名形成高影响的集中型供给,以及域名多、单站贡献分散的长尾型供给。

规范主域名
拥有明确一级类型的域名
拥有明确类型的信源去重引用
品牌与企业官网引用占比
主体自有来源引用占比

正在载入逐域治理范围…

类型结构使用可关联规范域名的信源表去重引用作为分母。主体自有来源包括品牌与企业官网、政府与公共机构。

03.2 · Official source penetration
固定口径:全局精确去重

12 个平台对企业官网与公共机构来源的引用强度差异明显

把各平台去重引用拆分为品牌与企业官网、政府与公共机构两部分,并以平台全部去重引用作为分母。用于观察不同平台对主体自有信息的可见依赖程度。

正在载入平台差异与置信度敏感性…

03.3 · Top sources平台 / 类型 / 口径联动

头部信源排名会随平台与信源类型发生明显变化

按当前筛选条件展示头部信源,并同时显示样本引用份额。形成平台级信源优先名单。

样本引用份额使用当前平台、信源类型和记录口径下的全部可关联信源引用作为分母;问题覆盖率使用当前筛选集合覆盖的问题数作为分母。图中仅展示 Top 20,分母保留完整集合。

03.4 · Source types
平台 / 口径联动

二级类型继续拆解各类内容与服务供给

比较二级信源类型的引用规模和样本构成率。观察一级生态内部的内容角色、服务形态和平台差异。

构成率以当前平台和记录口径的全部类型引用合计为 100%。全库逐域治理包含 500 个人工复核、55 个历史映射、8,644 个模型辅助标注和 679 个政府域名规则分类。

03.5 · Pareto

头部少量信源吸收了较高比例的去重引用

展示信源排名与累计引用份额。评估头部集中度和长尾扩展空间。

累计份额按精确去重引用量排序计算。

03.6 · Source × platform

同一头部信源在 12 个平台上的引用强度分布不均

对照头部信源的平台分布。寻找平台偏好与跨平台扩展线索。

选取全局去重引用量最高的 16 个信源;颜色为平台内去重引用数。

03.7 · Ecosystems

已归属信源与未归属生态长尾结构

对照已归属生态规模,并拆解生态归属空缺长尾的头部与低频结构。

信源表去重引用来自未归属生态信源
未归属生态域名仅产生 1 至 5 条引用
未归属生态 Top 50 的引用占比

已归属生态引用规模

未归属生态信源 Top 10

“未归属生态”仅描述集团或内容生态标签尚未标注。信源类型分类覆盖与未分类长尾见 03.1。

完整版 · 联系获取

以下为完整深度分析

已公开 关键率指标 · 问题覆盖总览 · 平台分布 · 信源生态(第 1–3 章)。八端偏好迁移、跨平台共识、问题标签供给、内容形态与机会空间等深度交叉分析,需联系管理员获取或业务咨询后查看。

  • 第四章 · 四大 AI 产品的信源偏好与终端差异
  • 第五章 · 跨平台重合与共识
  • 第六章 · 问题类型与场景差异
  • 第七章 · 内容形态与页面表现
  • 第八章 · 发布时间覆盖与内容新鲜度
  • 第九章 · GEO 机会地图
  • 第十章 · 结论、行动建议与方法说明
阜阳山君网络科技有限公司 · GEO 优化团队 出品 · 让品牌被 AI 看见