State of AI 报告:100万亿token实证研究

概述

OpenRouter 基于 100 万亿 token 的实证数据,分析了全球大语言模型的使用模式、技术趋势和应用分布。

研究背景

数据来源

  • 平台:OpenRouter(多模型AI推理平台)
  • 数据量:100 万亿 tokens
  • 时间跨度:约2年(重点关注2025年)
  • 覆盖范围:全球用户和开发者

里程碑事件

2024年12月5日,OpenAI 发布 o1 推理模型,标志着从单步模式生成到多步推理的转变。


关键发现

1. 开源 vs 闭源模型

开源模型采用模式:

  • 开源模型(OSS)权重公开可用
  • 社区驱动模型 vs 专有模型的采用趋势
  • 中国模型 vs 其他地区模型的发展对比

2. 代理式推理 (Agentic Inference)

新趋势

出现了多步、工具辅助推理模式的兴起,用户越来越多地将模型作为大型自动化系统的组件使用,而非单轮交互。

3. 任务分类分析

主要应用类别:

  • 编程 (Programming):来自 /Computers & Electronics/Programming
  • 角色扮演 (Roleplay):来自 /Games/Roleplaying Games
  • 翻译 (Translation):来自 /Reference/Language Resources/*
  • 通用问答 (General Q&A):来自 /Reference/General Reference/*
  • 生产力/写作 (Productivity/Writing):来自 /Business & Industrial/Business Services/Writing & Editing Services
  • 教育 (Education):来自 /Jobs & Education/Education/*
  • 文学/创作 (Literature/Creative Writing):来自 /Books & Literature/*

4. 地理分布模式

全球使用模式分析:

  • 50%+ 的使用量来自美国以外
  • 区域偏好和本地模型供给的影响
  • 不同地区的模型选择差异

5. 成本效益分析

有效成本 vs 使用动态:

  • 使用量与有效成本的对应关系
  • 基于平均输入+输出token和缓存效果的成本计算
  • 实际应用中LLM采用的经济敏感性

6. 留存模式

“玻璃鞋”效应 (Glass Slipper Effect):

核心发现

识别出基础用户群:早期用户的参与度持续时间远长于后期用户。

特点:

  • 用户需求与模型特征的早期匹配创造持久适配
  • 这种”灰姑娘效应”表明早期用户与模型形成了更深层的连接

技术架构

GoogleTagClassifier

内容分类方法:

  • 约 0.25% 的随机样本进行分类
  • 使用 Google Cloud Natural Language API
  • 分层、语言无关的分类系统
  • 置信度分数 < 0.5 的类别被排除

分类映射:

GoogleTagClassifier 输出 → 精简的标签集合
每个标签 → 高级别类别(1:1映射)

模型变体分析

开源 vs 专有

  • 开源 (OSS):权重公开可用
  • 闭源:仅通过受限API访问

地区起源

  • 中国模型:在中国、台湾或香港开发的组织
  • RoW模型:北美、欧洲和其他地区

Token类型

  • Prompt tokens:输入文本
  • Completion tokens:模型生成输出
  • Reasoning tokens:原生推理能力模型的内部推理步骤

数据和元数据

OpenRouter 平台

数据收集:

  • 每个请求的执行针对用户选择的模型
  • 结构化元数据记录结果”生成”事件
  • 匿名化请求级元数据(不暴露用户内容)

隐私保护设计:

  • 每个生成记录包括:
    • 时间信息
    • 模型和提供商标识符
    • Token使用量
    • 系统性能指标
    • 地理路由信息
    • 延迟
    • 使用上下文(流式传输、取消、工具调用等)

分析工具

  • Hex 分析平台
  • 版本化 SQL 查询
  • 可重现的转换和最终图表生成

区域分析

地理分割

用户区域确定:

  • 基于与每个账户关联的账单位置
  • 账单数据反映用户的支付方式或账户注册国家/地区
  • 比基于IP的位置信息更可靠

限制:

  • 一些用户使用第三方账单或共享组织账户
  • 企业账户可能在单一账单实体下聚合多个地区的活动

时间框架和覆盖范围

观察性数据

该数据集是观察性的:反映了 OpenRouter 平台的真实世界活动,该平台本身受模型可用性、定价和用户偏好影响。

平台规模:

  • 支持超过 300+ 活跃模型
  • 超过 60 个提供商
  • 服务数百万开发者和最终用户
  • 50%+ 使用量来自美国以外

研究意义

对模型构建者的启示

  1. 开源模型采用:理解社区驱动模型的发展趋势
  2. 应用领域分布:识别主要驱动活动的应用域
  3. 用户行为模式:了解不同地区和时间的使用变化

对AI开发者的启示

  1. 代理式推理趋势:工具辅助多步推理的兴起
  2. 任务特定优化:针对不同类别的优化策略
  3. 成本效益平衡:经济敏感性分析

对基础设施提供商的启示

  1. 地理分布规划:基于使用模式的区域布局
  2. 性能优化:延迟和吞吐量的优化
  3. 成本管理:基于使用模式的定价策略

未来趋势

推理架构演进

从 单步模式生成 到 多步推理 的转变:

  • 内部多步思考
  • 潜在规划
  • 生成最终输出前的迭代优化

应用领域扩展

  • 编程辅助的持续重要性
  • 创意角色扮演的意外流行
  • 编码辅助类别的增长

全球采用模式

  • 开源模型采用的实质性增长
  • 地区特性和本地模型供给塑造整体需求
  • 不同地区的采用模式差异

结论

核心观点

开发者和最终用户与LLM”在野外”的互动方式是复杂和多面的。

关键洞察:

  1. 基础用户群的重要性:早期用户的长期价值
  2. 代理式推理的兴起:从单轮到多步自动化系统
  3. 地区差异的影响:地理因素对采用模式的影响
  4. 成本效益的敏感性:经济因素在采用决策中的作用

相关资料


参考信息

论文引用:

  • Malika Aubakirova (a16z)
  • Alex Atallah, Chris Clark, Justin Summerville (OpenRouter Inc.)
  • Anjney Midha (a16z)

发布时间: 2025年12月