State of AI 报告:100万亿token实证研究
概述
OpenRouter 基于 100 万亿 token 的实证数据,分析了全球大语言模型的使用模式、技术趋势和应用分布。
研究背景
数据来源
- 平台:OpenRouter(多模型AI推理平台)
- 数据量:100 万亿 tokens
- 时间跨度:约2年(重点关注2025年)
- 覆盖范围:全球用户和开发者
里程碑事件
2024年12月5日,OpenAI 发布 o1 推理模型,标志着从单步模式生成到多步推理的转变。
关键发现
1. 开源 vs 闭源模型
开源模型采用模式:
- 开源模型(OSS)权重公开可用
- 社区驱动模型 vs 专有模型的采用趋势
- 中国模型 vs 其他地区模型的发展对比
2. 代理式推理 (Agentic Inference)
新趋势
出现了多步、工具辅助推理模式的兴起,用户越来越多地将模型作为大型自动化系统的组件使用,而非单轮交互。
3. 任务分类分析
主要应用类别:
- 编程 (Programming):来自
/Computers & Electronics/Programming - 角色扮演 (Roleplay):来自
/Games/Roleplaying Games - 翻译 (Translation):来自
/Reference/Language Resources/* - 通用问答 (General Q&A):来自
/Reference/General Reference/* - 生产力/写作 (Productivity/Writing):来自
/Business & Industrial/Business Services/Writing & Editing Services - 教育 (Education):来自
/Jobs & Education/Education/* - 文学/创作 (Literature/Creative Writing):来自
/Books & Literature/*
4. 地理分布模式
全球使用模式分析:
- 50%+ 的使用量来自美国以外
- 区域偏好和本地模型供给的影响
- 不同地区的模型选择差异
5. 成本效益分析
有效成本 vs 使用动态:
- 使用量与有效成本的对应关系
- 基于平均输入+输出token和缓存效果的成本计算
- 实际应用中LLM采用的经济敏感性
6. 留存模式
“玻璃鞋”效应 (Glass Slipper Effect):
核心发现
识别出基础用户群:早期用户的参与度持续时间远长于后期用户。
特点:
- 用户需求与模型特征的早期匹配创造持久适配
- 这种”灰姑娘效应”表明早期用户与模型形成了更深层的连接
技术架构
GoogleTagClassifier
内容分类方法:
- 约 0.25% 的随机样本进行分类
- 使用 Google Cloud Natural Language API
- 分层、语言无关的分类系统
- 置信度分数 < 0.5 的类别被排除
分类映射:
GoogleTagClassifier 输出 → 精简的标签集合
每个标签 → 高级别类别(1:1映射)
模型变体分析
开源 vs 专有
- 开源 (OSS):权重公开可用
- 闭源:仅通过受限API访问
地区起源
- 中国模型:在中国、台湾或香港开发的组织
- RoW模型:北美、欧洲和其他地区
Token类型
- Prompt tokens:输入文本
- Completion tokens:模型生成输出
- Reasoning tokens:原生推理能力模型的内部推理步骤
数据和元数据
OpenRouter 平台
数据收集:
- 每个请求的执行针对用户选择的模型
- 结构化元数据记录结果”生成”事件
- 匿名化请求级元数据(不暴露用户内容)
隐私保护设计:
- 每个生成记录包括:
- 时间信息
- 模型和提供商标识符
- Token使用量
- 系统性能指标
- 地理路由信息
- 延迟
- 使用上下文(流式传输、取消、工具调用等)
分析工具
- Hex 分析平台
- 版本化 SQL 查询
- 可重现的转换和最终图表生成
区域分析
地理分割
用户区域确定:
- 基于与每个账户关联的账单位置
- 账单数据反映用户的支付方式或账户注册国家/地区
- 比基于IP的位置信息更可靠
限制:
- 一些用户使用第三方账单或共享组织账户
- 企业账户可能在单一账单实体下聚合多个地区的活动
时间框架和覆盖范围
观察性数据
该数据集是观察性的:反映了 OpenRouter 平台的真实世界活动,该平台本身受模型可用性、定价和用户偏好影响。
平台规模:
- 支持超过 300+ 活跃模型
- 超过 60 个提供商
- 服务数百万开发者和最终用户
- 50%+ 使用量来自美国以外
研究意义
对模型构建者的启示
- 开源模型采用:理解社区驱动模型的发展趋势
- 应用领域分布:识别主要驱动活动的应用域
- 用户行为模式:了解不同地区和时间的使用变化
对AI开发者的启示
- 代理式推理趋势:工具辅助多步推理的兴起
- 任务特定优化:针对不同类别的优化策略
- 成本效益平衡:经济敏感性分析
对基础设施提供商的启示
- 地理分布规划:基于使用模式的区域布局
- 性能优化:延迟和吞吐量的优化
- 成本管理:基于使用模式的定价策略
未来趋势
推理架构演进
从 单步模式生成 到 多步推理 的转变:
- 内部多步思考
- 潜在规划
- 生成最终输出前的迭代优化
应用领域扩展
- 编程辅助的持续重要性
- 创意角色扮演的意外流行
- 编码辅助类别的增长
全球采用模式
- 开源模型采用的实质性增长
- 地区特性和本地模型供给塑造整体需求
- 不同地区的采用模式差异
结论
核心观点
开发者和最终用户与LLM”在野外”的互动方式是复杂和多面的。
关键洞察:
- 基础用户群的重要性:早期用户的长期价值
- 代理式推理的兴起:从单轮到多步自动化系统
- 地区差异的影响:地理因素对采用模式的影响
- 成本效益的敏感性:经济因素在采用决策中的作用
相关资料
- 原文PDF下载
- OpenRouter平台
- 技术深度学习
- Qwen3模型解读 - 具体模型分析
参考信息
论文引用:
- Malika Aubakirova (a16z)
- Alex Atallah, Chris Clark, Justin Summerville (OpenRouter Inc.)
- Anjney Midha (a16z)
发布时间: 2025年12月