文章导读
想要 给Codex加上视觉功能 ?当我们为 Codex 换上速度快、Agent 能力极强的 DeepSeek-V4-Flash 作为底层模型时,会面临一个痛点: DeepSeek-V4-Flash 是纯文本模型,默认无法看图。
在日常编程场景中,读图是刚需——无论是还原 UI 截图、分析复杂的报错弹窗,还是核对页面布局,光靠文字描述既低效又容易出错。
🎯 核心摘要 :本文将教你如何用 5 分钟、通过 3 个简单步骤,快速 给Codex加上视觉功能 。我们将结合开源插件 vision-skill 与便宜好用的通义千问 qwen3-vl-flash 模型,让你的 Codex 瞬间拥有“看图写代码”的能力!
📚 本文目录(点击跳转)
- 为什么需要给 Codex 加上视觉功能?
- 技术原理:vision-skill 搭配 qwen3-vl-flash
- 接入前准备工作
- 第 1 步:在阿里云百炼获取 API Key
- 第 2 步:让 Codex 自动安装与配置
- 第 3 步:发送图片验证识图功能
- 常见问题解答 (FAQ)
为什么需要给 Codex 加上视觉功能?
接上 DeepSeek-V4-Flash 之后,Codex 成了顶级的“代码大脑”,能读能写,但偏偏是个“盲人”。如果你只写纯后端逻辑,这没问题;但只要涉及前端开发,对着设计稿干活,它就卡壳了。
给Codex加上视觉功能 的思路,就像是在工地上进行精细分工:
- DeepSeek-V4-Flash 像是一个聪明的工头,负责逻辑推理和编写代码;
- 外挂视觉模型 则是专职的“质检员”,负责把画面看懂,并翻译成详细的文字汇报给工头。
技术原理:vision-skill 搭配 qwen3-vl-flash
感谢开源社区,目前已经有非常成熟的现成方案。核心由两部分组成:
- vision-skill 插件 :这是一个开源技能包(GitHub 仓库: asuojun/claude-vision-skill )。它的作用是给没有原生识图能力的主模型外接一双「眼睛」——能够读取本地或网络图片,调用外部视觉 API,并将看到的画面转化为描述塞回给 Codex。
- 通义千问 qwen3-vl-flash :这是我们选用的“眼睛”本体。它专门针对图文多模态(VL)场景设计,日常读取 UI 和截图完全够用。最重要的是: 它极其便宜,且新用户有免费额度 。它按 Token 计费(输入仅 0.15 元 / 百万 tokens),远比按张收费的模型划算。

接入前准备工作
在开始之前,请确认你已经具备以下条件:
- [x] 已完成基础配置 :建议先阅读 Codex 接入 DeepSeek-V4-Flash 。
- [x] 阿里云百炼账号 :如果还没有,请前往阿里云官网免费注册。
- [x] 创建 API Key :我们将在下一步进行操作。
第 1 步:在阿里云百炼获取 API Key
首先,我们需要获取一把调用视觉模型的“钥匙”。
⚠️ 安全警告 :API Key 相当于你的数字钱包密码! 千万不要 把它发在公开教程、微信群或提交到 GitHub 公开仓库中,以免被盗刷额度。
- 登录 阿里云百炼控制台 。
- 在左侧导航栏找到并进入 API-KEY 管理 。
- 点击创建新的密钥,并 复制保存 下来。
第 2 步:让 Codex 自动安装与配置
这是最爽的一步——你不需要自己敲代码安装,直接把活儿交给 Codex 本身!
打开 Codex,将下面这段提示词(Prompt) 修改好你的 API Key 后 ,直接粘贴发给它:
代码示例: 帮我全局安装 asuojun/claude-vision-skill(https://github.com/asuojun/claude-vision-skill), 按照 README 的说明进行配置。 视觉模型请选择阿里云百炼的 qwen3-vl-flash, API Key 是 sk-xxxxxxxxx(请在此处替换为你刚刚创建的真实 API Key)。
Codex 收到指令后,会自动去下载仓库、检查本地环境、并写入相关配置。全程自动化,你只需喝口水等待即可。
第 3 步:发送图片验证识图功能
配置完成后,怎么确认已经成功给 Codex 加上视觉功能了呢?
很简单: 直接在对话框里发一张截图给它 (比如一张网页 UI 或者报错截图),并问它:“图片里有什么?”
如果它能准确用文字描述出图片中的内容、颜色、按钮位置或是报错代码,恭喜你,你的 Codex 已经成功长出了“眼睛”!
(注:如果验证失败,请回头检查第 1 步的 API Key 是否复制完整,或者让 Codex 重新排查一遍 vision-skill 的配置。)
常见问题解答 (FAQ)
Q:DeepSeek-V4-Flash 自己真的不能看图吗? A:是的,它是纯文本模型。这正是我们需要通过外挂方案来 给Codex加上视觉功能 的原因。
Q:这个方案后续使用会很贵吗? A:非常便宜。视觉模型是按 token 计费的,以 qwen3-vl-flash 为例,输入只要 0.15 元 / 百万 tokens。日常写代码看看截图,成本几乎可以忽略不计,而且新用户还有免费额度。
Q:必须用 qwen3-vl-flash 吗? A:不一定。 vision-skill 采用了兼容 OpenAI 的标准格式,理论上任何支持视觉 API 的模型都能无缝接入。本文推荐 qwen3-vl-flash 主要是因为性价比极高,非常适合日常看 UI 稿。
相关文章
继续阅读同一主题下的文章,可以把购买、支付、套餐、账号和到账问题串成完整流程。