做了一个不用写 Prompt 的图片 Agent,主打草图 / 线稿生成,聊聊我为什么做 formind.app

yaphetsyan 2026-08-26 14:33 1

最近自己做了一个 AI 图片产品:


Formind


它目前最核心的能力,是把照片快速生成成草图、线稿、线描风格的图片。


但我其实不太想把它定义成一个单纯的「 Photo to Line Drawing 」工具,也不希望它只是另一个 AI Image Generator 。


我更希望它最终变成一个:


一站式的图片 Agent 。


你不需要学习 Prompt ,不需要研究模型,也不需要反复在不同 AI 网站之间切换。


你只需要告诉它你想做什么,剩下的事情交给 AI 。




为什么最开始选择「草图 / 线稿」这个方向?


这两年 AI 生图工具很多。


但我自己真正去用的时候,经常会遇到一个问题:


大部分 AI 图片产品,本质上还是在让用户“操作模型”。


打开一个网站之后,第一件事通常是:



Please enter your prompt.



然后还有一堆参数:



  • Model

  • Style

  • CFG

  • Steps

  • Aspect Ratio

  • Negative Prompt

  • Seed


对于 AI 玩家来说,这些东西可能很有意思。


但对于大部分普通用户来说,他们其实根本不关心这些。


比如一个用户想把自己的照片转换成线稿。


他的需求其实非常明确:



我就想把这张照片变成一张好看的线稿。



他并不想研究:



“high quality pencil sketch, clean line art, monochrome, detailed contour, white background...”



所以我开始想:


AI 图片工具为什么一定要让用户写 Prompt ?


于是 formind 最开始选择了一个非常具体的场景:


Photo → Line Drawing / Sketch


上传一张图片,直接生成。


没有 Prompt 。


没有复杂参数。


不用知道背后是什么模型。




但做着做着,我发现「生成一次」其实远远不够


这是我后来对这个产品最大的认知变化。


最开始我的产品逻辑很简单:


上传图片 → AI 生成线稿 → 下载。


听起来没什么问题。


但真正使用之后,会发现用户很少第一次就完全满意。


比如生成之后你可能会觉得:



  • 线条太复杂了

  • 想简单一点

  • 人脸细节不够像

  • 背景不想要

  • 想只保留人物

  • 想变成更像铅笔画

  • 想改成漫画线稿

  • 某个地方生成错了

  • 想把某个元素删掉

  • 想换一个风格


传统 AI 工具的解决方案通常是:


重新写 Prompt ,再生成一次。


但我觉得这个交互方式其实很反人类。


因为真实世界里,我们和设计师沟通也不会这样。


你不会每次都重新写一份完整需求。


你可能只是说:



“这里简单一点。”




“背景去掉。”




“人物保留,线条再干净一些。”




“这个地方不太对,再改一下。”



所以我开始觉得:


AI 图片产品真正应该做的,不是“一次生成”,而是“持续修改”。




所以我现在更愿意把 formind 定义成「 Image Agent 」


我的理想交互其实非常简单。


比如你上传一张照片。


先生成一张线稿。


如果不满意,可以直接继续修改:



线条简单一点。



然后:



去掉背景。



然后:



保留头发细节。



然后:



改成适合小朋友涂色的线稿。



然后:



还是太复杂,再简单一点。



AI 应该知道:


你是在修改刚才那张图片。


而不是每一次都让你重新上传、重新描述、重新生成。


这也是我觉得 Image Agent 和普通 AI Image Generator 最大的区别。


普通生图工具更像:


Prompt → Image


我希望 formind 最终变成:


Image → Edit → Edit → Edit → Final Result


或者更准确一点:


Idea → Agent → Result




我越来越觉得,Prompt 可能只是 AI 产品的一个过渡阶段


现在很多 AI 产品都在强调 Prompt 。


甚至出现了 Prompt Engineering 。


但站在普通用户的角度,我其实一直觉得这件事情有点奇怪。


比如我使用 Photoshop 的时候,我不需要先学习:



“如何正确描述我要删除背景。”



我只需要点击 Remove Background 。


AI 应该让软件变得更简单,而不是让用户学习一种新的“编程语言”。


所以 formind 现在有一个比较明确的产品原则:


能不让用户写 Prompt ,就尽量不让用户写 Prompt 。


比如:


照片 → 线稿


照片 → 草图


去背景


删除人物


删除物体


增强画质


扩图


头像


证件照


这些需求,本身就是 Prompt 。


用户点击「 Photo to Line Drawing 」的时候,其实已经告诉系统他想干什么了。


剩下的 Prompt 、模型选择、参数、工作流,我觉得都应该交给产品完成。




未来我想做的其实不是 100 个 AI 小工具


现在市面上有很多 AI Tool 网站。


首页可能放着:


AI Image Generator
Remove Background
Image Enhancer
Remove Object
AI Avatar
Photo to Anime
Photo to Sketch
……


一眼看过去有几十个工具。


formind 现在也有一些类似能力。


但我后来越来越觉得:


如果只是把 100 个 AI 工具放在一起,它依然只是一个工具箱。


我真正想做的是把这些能力连接起来。


举个例子。


你上传一张照片,说:



我想把它做成一本儿童涂色书里面的插画。



Agent 可以自动完成:


照片识别

删除复杂背景

人物主体提取

转换线稿

降低线条复杂度

增强轮廓

输出适合打印的图片


用户不需要知道这里用了几个模型。


甚至不需要知道中间发生了什么。


他只需要看到最后的结果。


这才是我理解的一站式 Image Agent 。




为什么我还是选择从「线稿」开始?


因为我觉得做 AI 产品很容易掉进一个坑:


什么都想做。


AI 生图可以做。


AI 编辑可以做。


换脸可以做。


头像可以做。


商品图可以做。


视频也可以做。


如果一开始就做一个“万能 AI 图片平台”,其实用户很难理解:



你到底解决什么问题?



所以 formind 目前还是会把:


Photo to Line Drawing / Sketch


作为最核心的入口。


先把一个非常具体的需求做好。


包括:



  • 人像转线稿

  • 宠物转线稿

  • 建筑转线稿

  • 产品转线稿

  • 照片转铅笔画

  • 照片转 Coloring Page

  • 图片转漫画线稿


但是在线稿生成完成之后,希望用户不要停在这里。


而是可以继续和 Agent 沟通、修改、生成,直到最终得到自己真正想要的结果。




做这个产品之后,我现在最大的思考


以前我觉得 AI 图片产品竞争的是:


谁的模型效果更好。


现在越来越觉得不是。


因为模型会快速迭代。


今天某个模型领先,几个月之后可能又换一个。


如果你的产品价值只是:



“我接入了最新的 XX 模型。”



这个优势其实非常短暂。


我现在更关注的是另外几个问题:


1. 用户能不能不用学习 Prompt ?


2. 用户第一次生成不满意之后,能不能很自然地继续修改?


3. AI 能不能理解当前图片和之前的修改历史?


4. 产品能不能自动决定应该调用哪个模型、哪个工具?


5. 用户最终关心的是“模型”,还是“结果”?


我自己的答案越来越倾向于:


用户根本不应该关心模型。


模型最终应该像数据库、CDN 、云服务器一样,变成底层基础设施。


用户只需要说:



我想要这个。



然后 Agent 帮他完成。




目前 formind 还在比较早期的阶段。


核心方向是:


Photo to Line Drawing / Sketch + Image Agent


网站: https://www.formind.app


如果 V2EX 有做 AI 、独立开发、设计或者图片产品的朋友,欢迎试一下。


我现在尤其想听听大家对一个问题的看法:


你觉得未来 AI 图片产品的主要交互方式,会继续是 Prompt → Image ,还是会逐渐变成类似 Agent 一样,围绕一张图片不断沟通和修改?


另外也非常欢迎直接吐槽产品。


如果你打开网站之后 30 秒就关掉了,我其实更想知道:


是什么让你决定关掉它?


这个反馈可能比“支持一下”对我更有价值。

最新回复 (0)
    没有回复
* 帖子来源V2EX
返回