01 / CONTEXT 用户痛点与背景
灵感出现的地方,
往往不是 AI 对话框。
设计师在 Pinterest、素材站或项目网页看到参考图后,通常要先保存图片,再切换到 AI 工具重新上传和解释需求。真正耗时的不是模型识图,而是上下文在多个工具之间不断断裂。
01
离开现场
参考图来自浏览过程,生成提示词却必须跳到另一个工具。
02
重复说明
每次都要重新上传、说明用途,并补充输出格式要求。
03
结果不稳定
通用图片描述难以直接生图,也容易遗漏构图、材质和光影。
02 / APPROACH 我做了什么
不是重新做一个模型,
而是把方法变成稳定体验。
我把原本依赖对话的反推 Skill,拆成固定入口、结构化输出、继续修改和本地历史。用户不需要理解背后的提示词工程,也能获得一致的结果。



交互策略 · 原位完成
把功能放回图片旁边。
我选择浏览器扩展而不是上传网页。用户右键选择参考图后,结果卡片直接出现在原图附近,浏览、判断、修改和复制始终发生在同一个上下文中。
03 / OUTCOME 最终效果
把“看起来像”,
拆成可编辑的视觉语言。
模型返回的不只是一段长文本,而是一份可校验的数据结构。界面分别呈现核心提示词和视觉标签,让用户能直接复制,也能继续调整、保存和恢复历史结果。
STRUCTURED RESULT
约 260–360 字中文提示词
画面事实被组织为连贯、具体、可以直接粘贴到生图工具的自然语言。
subject[]composition[]lighting[]palette[]style[]
原位完成
不离开正在浏览的页面
可继续改
从一次答案变成可协作初稿
可追溯
历史记录支持恢复、复制与删除
