打开一张“AI 生态图”,常能看到数百个公司 Logo 被分进芯片、模型、应用和资本几个方框。它看起来热闹,却往往回答不了三个基本问题:谁依赖谁、关系发生在什么时候、信息从哪里来。
真正有用的生态图不是海报,而是一份可查询、可追溯、可更新的关系数据。图只是最后的视图,底层应当是一张带证据的网络。
## 先写清这张图要回答什么
“绘制全球 AI 生态”几乎一定会失控。先确定使用者和问题,例如:寻找某城市里能提供视觉模型部署的合作伙伴;识别一个开源模型周围最活跃的工具项目;观察创业公司对少数云或模型 API 的依赖。
问题决定边界。可以按地区、时间、技术层或目标用户限定范围。还要规定纳入门槛:成立但没有产品的公司算不算,个人开源项目是否纳入,已经停止维护的仓库如何标记。
边界必须写进图谱说明。否则“没有出现在图上”很容易被误读成“这个对象不存在”。
## 节点不要只有公司
AI 创业生态包含多种对象:公司、开源项目、模型、数据集、云平台、研究机构、投资者、社区和产品。把它们全部压成“企业”,会丢掉最重要的结构。
每个节点至少记录唯一 ID、名称、类型、地区、首次与最后观察时间、状态和来源。名称只是显示字段,不能充当主键;同一组织可能改名,同名项目也可能互不相关。
节点属性与关系要分开。“某公司使用某模型”是一条带证据的边,不应塞进公司的标签文本。结构化数据让同一底图可以生成多种视图。
## 连边要有方向、类型和证据
常见关系包括投资、收购、创始或任职、API 依赖、模型衍生、数据使用、技术集成、联合发布和客户案例。每类关系的含义不同,不能统一画成没有方向的细线。
一条可靠的边可以包含起点、终点、关系类型、开始时间、结束时间、证据 URL、抓取时间和置信度。官方公告能证明一项合作被宣布,却未必证明产品仍在运行;代码依赖能说明技术引用,也不等于商业合作。
对“使用”“合作”“支持”这类模糊动词建立判定规则。找不到来源的关系宁可进入待核验队列,也不要为了让图更密而猜测。

## 用多源数据互相校正
单一数据源总有盲区。公司官网适合确认产品与团队自述,GitHub 能观察代码贡献与依赖,Hugging Face Hub 提供模型、数据集和 Space 的公开元数据,OpenAlex 则把论文、作者、机构和主题组织成连接图。
融资数据库适合交易线索,却可能受披露偏差影响;社交媒体更新快,但噪声与改名多。采集时保存原始记录和时间戳,不要只留下清洗后的结论。
公开 API 也会变化。Hugging Face 提供 Hub API 和 webhook,OpenAlex 提供作品、作者、机构、主题等实体端点。调用要遵守速率限制,并把抓取脚本、字段版本和失败日志纳入数据管道。
## 实体消歧是最费时间的工作
“ABC AI”“ABC.ai”和一个 GitHub 组织可能属于同一主体,也可能只是名字相似。自动匹配可先比较官网域名、社交账号、仓库链接、团队成员和地区,再由人工处理低置信度候选。
不要只用字符串相似度合并。公司被收购后,品牌、法人和产品可能分别延续;开源项目也可能分叉。为每次合并保留依据,并允许撤销。
同样要识别一对多关系:一个模型有多个量化版本,一个项目迁移过仓库,一个创始人在不同时间属于不同组织。时间字段能防止把历史状态误画成当前结构。
## 从网络指标读出结构
节点数量只说明收集了多少对象。网络分析更关心连接方式。
度数高的节点连接很多对象,可能是平台或聚合器;介数中心性高的节点经常位于不同群体的最短路径上,可能承担桥梁作用;社区发现算法能找出内部连接紧密的模块;依赖集中度则提示某个生态是否过度依赖单一云、模型或分发入口。
这些指标不是价值排名。一个基础库连接很多项目,不代表商业收入最高;处于网络边缘的新团队也可能技术独特。数值要结合节点类型和原始证据解释。
多层图比单层图更诚实。研究合作网络、开源贡献网络和商业交易网络可以共享节点,却不必强行合并成一种关系。2020 年提出的多层创新生态框架也强调区分知识生态与商业生态,再识别社区和角色。
## 时间轴比静态截图更重要
创业生态变化很快。保存每次快照,可以观察新节点进入、关系断开、项目休眠和中心性变化。一次突然增加的连接可能来自真实增长,也可能只是数据源扩大,必须在发布说明中区分。
为关系设置 `observed_at` 与有效期,定期复查高影响边。官网删除了合作页不一定代表合作终止,但应触发核验。明确标注“宣布”“完成”“活跃”“未知”,比用一条永久连线可靠。

## 可视化要服务阅读任务
全网图适合看整体结构,局部邻域适合研究某个节点,时间动画适合看变化,路径视图适合追踪依赖。不要把所有信息一次塞在一张画布里。
颜色只表示一种稳定维度,例如节点类型;大小可以表示连接数,但应设置上限,避免巨型节点遮住其余内容。边类型用筛选器或分面切换,标签按缩放级别出现。
每个节点应能打开来源与更新时间。没有证据入口的交互图只是更漂亮的黑箱。
## 一套八步工作流
1. **定义问题**:写出使用者、决策和时间范围。
2. **建立 schema**:列出节点、关系、时间和证据字段。
3. **选取种子**:从已知模型、组织或项目开始扩展。
4. **采集多源数据**:保存原始响应、URL 和抓取时间。
5. **消歧与去重**:自动提出候选,人工确认疑难项。
6. **构建多层网络**:分开研究、开源、商业与依赖关系。
7. **计算并核验**:检查中心性、社区和异常连接的原始证据。
8. **发布与更新**:提供筛选、来源、版本说明和反馈入口。
## 图谱的价值在绘制过程
一张可靠的 AI 创业生态图不会宣称覆盖一切。它公开边界,允许关系带不确定性,并能随时间修正。
绘制过程中,人们会发现真正缺失的连接:技术团队找不到场景伙伴,应用依赖单一模型,研究成果没有进入开发工具,或一批 Logo 之间根本没有可验证关系。这些发现比最终海报更重要,因为它们能转化为下一步调查与合作问题。
## 延伸阅读与数据入口