AMD 官方开发者平台近期在 Radeon Cloud 上推出了全新的 Token Factory,面向所有开发者免费开放 4 款主流 AI 模型 API。依托 AMD ROCm 算力集群与优化路由器调度,这一服务免绑信用卡、免海外验证,实测高可用表现出众。对比常遇限流的英伟达 NIM,AMD 展现了更高的工程诚意与更稳的体验。
同时 AMD 原生提供了 OpenAI 与 Anthropic 双协议兼容,目前 OpenCode 已经深度集成,直接填入 Key 即可开工。
一、核心速览
Base URL:https://developer.amd.com.cn/radeon/api/v1
OpenAI 兼容端点为 /chat/completions,Anthropic 兼容端点为 /messages。
4 款公用免费模型:
| 模型 | 上下文 | 定位 |
|---|---|---|
| DeepSeek-V4-Flash | 100 万 Token | 284B MoE 架构,主打极速代码编写与深度推理 |
| DeepSeek-V4-Flash-Vision-Exp | 100 万 Token | 实验性全模态视觉模型 |
| Qwen3.8-Flash-Next | 256K | 通义千问最新高速推理版本 |
| MiniCPM5-1B | 128K | 面壁智能 1B 极速端侧语言模型 |
生态集成:Agent 直接添加 Key 即可流畅使用。特别提示,目前 ZCode 暂不支持该接口。
免费政策:官方标注为 Public Free Model APIs,免绑信用卡,调用返回的 Points 仅作为相对使用量统计,不产生真实扣费。
Key 格式:以 sk- 开头的标准密钥字符串。
二、有限速,建议搭配 FreeRouter 组建模型矩阵
使用教程见 FreeRouter 让所有 Agent 只配置一次。

免费限额与限速规则
- 每日免费额度:每天提供 1.000000 pts(点数) 的配额(Daily allowance)。该点数仅用于统计每日 API 调用消耗,不产生实际费用,且每日固定时间重置。
- Token 与点数消耗比:实测调用 DeepSeek-V4-Flash 消耗约 8,311 Tokens 仅占用了约 0.001173 pts(占比约 0.12%)。按此比例换算,每天 1.0 pts 的额度理论上足以支持数百万 Token 的轻量 / 日常对话与测试。
- 速率限制:RPM Limit 为 20,即每分钟最多允许 20 次请求。
是否严重影响使用体验?
这取决于具体的使用场景。
几乎不影响体验的场景(轻量与交互式)
- 日常对话与个人使用:接入个人桌面客户端(如 Cherry Studio、NextChat)或沉浸式翻译等单人交互场景,正常打字和阅读速度下很难达到每分钟 20 次的上限,配合充裕的每日点数,体验非常流畅。
- 轻量自动化测试:单线程或控制好间隔的自动化脚本、个人开发调试等,不会触发限流。
会显著影响体验的场景(重度并发受限)
- 高并发或 Agent 复杂工作流:配置在多智能体协同、并发抓取总结或多步骤自主工作流中,短时间内会发起密集的子任务请求,20 RPM 很容易频繁触发
429 Too Many Requests。 - 团队共用或对外服务:每个账号只有单个固定的 20 RPM 速率池,无法承受多人同时调用或作为后端生产服务。
搭配 FreeRouter 的多平台免费模型轮询机制,可以大大提升可用额度及使用体验。
三、3 步极速获取 AMD API Key
第一步:访问官网并注册登录
访问 AMD 官方开发者平台控制台 👉 developer.amd.com.cn/radeon/tokenfactory
点击右上角登录,支持国内手机号验证码或邮箱直接登录,无需资质审核与绑定信用卡。
第二步:复制专属 API Key
登录后,在 Token Factory 页面点击任意一款免费模型卡片,例如 DeepSeek-V4-Flash-0731。在展开的模型详情弹窗中,点击 API Key 右侧的复制按钮,即可获得 sk- 开头的专属密钥。

第三步:配置环境变量
在本地终端或服务器环境中配置:
export AMD_API_KEY="sk-your-copied-api-key-here"
export OPENAI_BASE_URL="https://developer.amd.com.cn/radeon/api/v1"
或者手动在 Agent 界面配置(以 DeepSeek Harness 为例):

强烈推荐用 FreeRouter 组建免费模型矩阵
单个平台再稳也有限速和额度上限,把它们叠起来才是可用的方案。配置方法见 3 步搞定 FreeRouter 免费模型矩阵。