Agent · AI 工具实战
Codex 配置 Deepseek,装上这个Skill,deepseek也能识图啦
让纯文本模型拥有“眼睛”,效率再上一个档次
🏆 本文由 AI 方格式 创作
上一篇文章介绍了 Codex配置DeepSeek,无需第三方代理,无门槛安装的教程。现在因各种原因无法使用 Codex家的模型的朋友,也可以用上 Codex 了。
1Deepseek 很给力,但有个缺陷
这次 Deepseek 很给力啊,价格便宜,加上这次 V4-Flash 正式版发布,性能又是一大提升。而且 据OpenCode 团队披露,Deepseek V4-Flash 在它这个平台单日 Token 消耗达到了8 万亿,创单日历史纪录。
但它有一个唯一的缺陷:它是一个纯文本的模型,不能识图。
但是对于编程开发、Bug 修改、UI 识别等情况下,识图就很重要了。毕竟在这些场景下通过纯文字描述去处理不是很方便,如果能直接通过截图,它能理解的话,那就方便快捷,效率能提升不少。
2开源识图 Skill:Claude Vision
这里就介绍一个开源的识图 Skill——claude-vision-skill。不要看它本身是给 Claude 使用的,没关系,它可以安装到任何 Agent,Agent 会自动去适配。
https://github.com/asuojun/claude-vision-skill

— Skill 仓库页面
这个 Skill 主要是让没有识图能力的模型获得识图能力。
原理:通过把图片发给有识图能力的模型,然后用文字描述返回,接着 Deepseek 获取这个文字描述进行处理,所以需要配置一个识图的模型。
内置推荐千问(qwen3.5-omni-plus、qwen-vl-max):阿里云百炼,因为新用户 100 万 Token 免费,约 0.02 元/次。

— 内置推荐千问模型
也可以用其他支持 OpenAI 兼容格式的识图模型。
3如何安装与配置
如何安装?这个很简单,直接把仓库地址丢给 Codex就可以,它会帮你进行安装配置。

— 将仓库地址交给 Codex 自动安装
默认用的是阿里千问的识图模型(qwen3.5-omni-plus),新用户 100 万 Token,差不多可以用7000 次左右的识图。
获取阿里千问 API Key,进入阿里千问工作台,创建 API Key,复制输入即可。
https://platform.qianwenai.com/home/api-keys

— 阿里千问工作台创建 API Key
4安装成功,实测效果
安装成功之后,就可以直接使用了。

— 安装成功即可使用
测试一下,我现在让它识别一下这张图里的内容。

— 测试识别的图片
效果如下,识别的内容完全对得上。

— 识别结果完全匹配
这下就给 Deepseek 装上了“眼睛”,让它也有了识图能力,效率又提升了一个档次。
总结
通过开源 Skill 给 Deepseek 补上识图能力,成本极低、效果立竿见影。从此编程、调试、UI 识别都能直接上图说话,让纯文本模型真正“看见”世界。
我是 AI 方格式,一个致力于 AI 知识、项目经验分享的博主,尽可能让你能从我的文章中了解到你需要的内容。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
点赞在看转发
THANKS FOR READING
评论 (0)