首页 / 资讯中心 / 文章详情

Wardrobe如何一眼找出照片里所有衣服?OpenAI视觉API结构化输出实现原理

Wardrobe如何一眼找出照片里所有衣服?OpenAI视觉API结构化输出实现原理 ★ FEATURED ARTICLE
Wardrobe如何一眼找出照片里所有衣服OpenAI视觉API结构化输出实现原理【免费下载链接】wardrobeYour clothes, extracted and organized with gpt-image.项目地址: https://gitcode.com/gh_mirrors/wardro/wardrobeWardrobe 是一个开源的 AI 衣橱整理工具拖入一张穿搭照片它就能通过 OpenAI 视觉 API 自动识别出照片里的每一件衣服裁出干净的单品图并归档进本地 JSON 数据库。本文带你用零代码理解它一眼找出所有衣服背后的结构化输出原理。先看效果一张照片进整面衣橱出先看最终成果。一张照片里的所有衣服处理完后会以网格形式出现在这样的衣橱库里支持按上装、外套、裤装、鞋子等分类筛选Wardrobe 的核心能力包括全量识别用 OpenAI Responses API 检测照片中的每一件衣物✂️单品提取调用 OpenAI Images API 生成电商级干净单品裁切图模特成片可选生成模特上身的时尚大片预览数据本地原图、任务、生成图片和 JSON 数据库全部保存在本地data/目录核心原理用 JSON Schema 让模型按格式说话AI 图像识别常见的坑是模型返回的答案很随意——这次是散文下次是坏掉的 JSON。Wardrobe 的解法是利用 OpenAI 的结构化输出能力调用前先声明一份严格的 JSON Schema让模型只返回符合格式的数据。在 scripts/import-job-api.mjs 的openAIAnalyze函数中模型同时收到两样东西任务描述文本找出图中每一件独立可穿衣物每件给一条记录并用 1000×1000 归一化坐标给出紧密包围框JSON Schema契约定义返回值的精确格式。这份 Schema 的关键点非常直观字段类型说明items数组0–8 条一张图最多识别 8 件衣服识别不到就是空数组name字符串单品建议名称如条纹 Polo 衫part枚举五选一上装 / 外套 / 下装 / 配饰 / 鞋子color字符串主色必须匹配#RRGGBB十六进制格式tags字符串数组1–4 个小写细节标签如casual、cottonboundingBox对象x、y、width、height均为 0–999 的整数归一化到 1000×1000 画布配合strict: true模型连多余字段都不能多写。这意味着无论照片多复杂返回结果永远是一份可以直接消费的结构化数组——不需要脆弱的文本解析也不会这次认了 3 件、下次只认 1 件还带格式错误。从坐标到裁切bounding box 如何落地模型说清了衣服在哪那怎么把它切出来服务端逻辑很简单见 cropDetectedItem先用sharp把图片规范化自动旋转、统一 sRGB、输出 PNG把 0–999 的 x、y、width、height 换算成真实像素在包围框四周自动外扩约 8% 的留白避免切掉领口或下摆执行裁剪保存为crop.png推入人工审核队列。如果模型给出了越界坐标normalizeBoundingBox 会悄悄把它收敛到合法区间——这是健壮性设计的第一道保险。裁剪完成后就会进入下图界面里的人工审核环节确认单品图完整无误后在右侧面板编辑名称、颜色、标签再生成模特大片这套机器先认、人工再确认的流程状态机实现见 import-flow.jsx是 Wardrobe 不翻车的最大原因。它把整条流水线拆成三步每一步都有审核卡点crop裁剪审核模型检测出的裁切garment单品重绘调用 gpt-image 重绘一张正面电商级单品图指定随机色键背景色再在本地抠成透明 PNG 并自动校验残留色点modeled模特成片把单品与你自己上传的参考照合成一张 3:2 时尚大片。快速上手如何本地跑起 Wardrobe环境要求很低Node 22 即可git clone https://gitcode.com/gh_mirrors/wardro/wardrobe cd wardrobe npm install cp .env.example .env npm run dev⚠️ 注意导入功能有两个开关缺一个都会保持禁用——在.env里写入OPENAI_API_KEY把一张你自己的 PNG 参考照放到data/model-reference.png。启动后访问localhost:5173即可。关键配置项整理自 README.md变量默认值用途OPENAI_API_KEY必填OpenAI 访问密钥OPENAI_VISION_MODELgpt-5.4-mini负责认衣服的视觉模型本文主角OPENAI_IMAGE_MODELgpt-image-2单品重绘与模特成片的图像生成模型小结结构化输出为什么值得学Wardrobe一眼找出所有衣服的原理其实是一套可以迁移到任何 AI 项目的通用思路文本描述任务、Schema 约束格式让模型的创造力和工程的可靠性各司其职坐标归一化到 0–999让模型输出小整数比真实像素值准得多关键步骤加人工卡点识别并非百分百确定一个审核环节就能兜住大部分失败。核心实现集中在 scripts/import-job-api.mjs一次就能读完整条识别 → 裁切 → 重绘 → 成片的流水线。【免费下载链接】wardrobeYour clothes, extracted and organized with gpt-image.项目地址: https://gitcode.com/gh_mirrors/wardro/wardrobe创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站