节点赞助商

yaphetsyan

做了一个不用写 Prompt 的图片 Agent,主打草图 / 线稿生成,聊聊我为什么做 formind.app

  •  
  •   yaphetsyan · 5h 53m ago · 152 views

    最近自己做了一个 AI 图片产品:

    Formind

    它目前最核心的能力,是把照片快速生成成草图、线稿、线描风格的图片。

    但我其实不太想把它定义成一个单纯的「 Photo to Line Drawing 」工具,也不希望它只是另一个 AI Image Generator 。

    我更希望它最终变成一个:

    一站式的图片 Agent 。

    你不需要学习 Prompt ,不需要研究模型,也不需要反复在不同 AI 网站之间切换。

    你只需要告诉它你想做什么,剩下的事情交给 AI 。


    为什么最开始选择「草图 / 线稿」这个方向?

    这两年 AI 生图工具很多。

    但我自己真正去用的时候,经常会遇到一个问题:

    大部分 AI 图片产品,本质上还是在让用户“操作模型”。

    打开一个网站之后,第一件事通常是:

    Please enter your prompt.

    然后还有一堆参数:

    • Model
    • Style
    • CFG
    • Steps
    • Aspect Ratio
    • Negative Prompt
    • Seed

    对于 AI 玩家来说,这些东西可能很有意思。

    但对于大部分普通用户来说,他们其实根本不关心这些。

    比如一个用户想把自己的照片转换成线稿。

    他的需求其实非常明确:

    我就想把这张照片变成一张好看的线稿。

    他并不想研究:

    “high quality pencil sketch, clean line art, monochrome, detailed contour, white background...”

    所以我开始想:

    AI 图片工具为什么一定要让用户写 Prompt ?

    于是 formind 最开始选择了一个非常具体的场景:

    Photo → Line Drawing / Sketch

    上传一张图片,直接生成。

    没有 Prompt 。

    没有复杂参数。

    不用知道背后是什么模型。


    但做着做着,我发现「生成一次」其实远远不够

    这是我后来对这个产品最大的认知变化。

    最开始我的产品逻辑很简单:

    上传图片 → AI 生成线稿 → 下载。

    听起来没什么问题。

    但真正使用之后,会发现用户很少第一次就完全满意。

    比如生成之后你可能会觉得:

    • 线条太复杂了
    • 想简单一点
    • 人脸细节不够像
    • 背景不想要
    • 想只保留人物
    • 想变成更像铅笔画
    • 想改成漫画线稿
    • 某个地方生成错了
    • 想把某个元素删掉
    • 想换一个风格

    传统 AI 工具的解决方案通常是:

    重新写 Prompt ,再生成一次。

    但我觉得这个交互方式其实很反人类。

    因为真实世界里,我们和设计师沟通也不会这样。

    你不会每次都重新写一份完整需求。

    你可能只是说:

    “这里简单一点。”

    “背景去掉。”

    “人物保留,线条再干净一些。”

    “这个地方不太对,再改一下。”

    所以我开始觉得:

    AI 图片产品真正应该做的,不是“一次生成”,而是“持续修改”。


    所以我现在更愿意把 formind 定义成「 Image Agent 」

    我的理想交互其实非常简单。

    比如你上传一张照片。

    先生成一张线稿。

    如果不满意,可以直接继续修改:

    线条简单一点。

    然后:

    去掉背景。

    然后:

    保留头发细节。

    然后:

    改成适合小朋友涂色的线稿。

    然后:

    还是太复杂,再简单一点。

    AI 应该知道:

    你是在修改刚才那张图片。

    而不是每一次都让你重新上传、重新描述、重新生成。

    这也是我觉得 Image Agent 和普通 AI Image Generator 最大的区别。

    普通生图工具更像:

    Prompt → Image

    我希望 formind 最终变成:

    Image → Edit → Edit → Edit → Final Result

    或者更准确一点:

    Idea → Agent → Result


    我越来越觉得,Prompt 可能只是 AI 产品的一个过渡阶段

    现在很多 AI 产品都在强调 Prompt 。

    甚至出现了 Prompt Engineering 。

    但站在普通用户的角度,我其实一直觉得这件事情有点奇怪。

    比如我使用 Photoshop 的时候,我不需要先学习:

    “如何正确描述我要删除背景。”

    我只需要点击 Remove Background 。

    AI 应该让软件变得更简单,而不是让用户学习一种新的“编程语言”。

    所以 formind 现在有一个比较明确的产品原则:

    能不让用户写 Prompt ,就尽量不让用户写 Prompt 。

    比如:

    照片 → 线稿

    照片 → 草图

    去背景

    删除人物

    删除物体

    增强画质

    扩图

    头像

    证件照

    这些需求,本身就是 Prompt 。

    用户点击「 Photo to Line Drawing 」的时候,其实已经告诉系统他想干什么了。

    剩下的 Prompt 、模型选择、参数、工作流,我觉得都应该交给产品完成。


    未来我想做的其实不是 100 个 AI 小工具

    现在市面上有很多 AI Tool 网站。

    首页可能放着:

    AI Image Generator Remove Background Image Enhancer Remove Object AI Avatar Photo to Anime Photo to Sketch ……

    一眼看过去有几十个工具。

    formind 现在也有一些类似能力。

    但我后来越来越觉得:

    如果只是把 100 个 AI 工具放在一起,它依然只是一个工具箱。

    我真正想做的是把这些能力连接起来。

    举个例子。

    你上传一张照片,说:

    我想把它做成一本儿童涂色书里面的插画。

    Agent 可以自动完成:

    照片识别 ↓ 删除复杂背景 ↓ 人物主体提取 ↓ 转换线稿 ↓ 降低线条复杂度 ↓ 增强轮廓 ↓ 输出适合打印的图片

    用户不需要知道这里用了几个模型。

    甚至不需要知道中间发生了什么。

    他只需要看到最后的结果。

    这才是我理解的一站式 Image Agent 。


    为什么我还是选择从「线稿」开始?

    因为我觉得做 AI 产品很容易掉进一个坑:

    什么都想做。

    AI 生图可以做。

    AI 编辑可以做。

    换脸可以做。

    头像可以做。

    商品图可以做。

    视频也可以做。

    如果一开始就做一个“万能 AI 图片平台”,其实用户很难理解:

    你到底解决什么问题?

    所以 formind 目前还是会把:

    Photo to Line Drawing / Sketch

    作为最核心的入口。

    先把一个非常具体的需求做好。

    包括:

    • 人像转线稿
    • 宠物转线稿
    • 建筑转线稿
    • 产品转线稿
    • 照片转铅笔画
    • 照片转 Coloring Page
    • 图片转漫画线稿

    但是在线稿生成完成之后,希望用户不要停在这里。

    而是可以继续和 Agent 沟通、修改、生成,直到最终得到自己真正想要的结果。


    做这个产品之后,我现在最大的思考

    以前我觉得 AI 图片产品竞争的是:

    谁的模型效果更好。

    现在越来越觉得不是。

    因为模型会快速迭代。

    今天某个模型领先,几个月之后可能又换一个。

    如果你的产品价值只是:

    “我接入了最新的 XX 模型。”

    这个优势其实非常短暂。

    我现在更关注的是另外几个问题:

    1. 用户能不能不用学习 Prompt ?

    2. 用户第一次生成不满意之后,能不能很自然地继续修改?

    3. AI 能不能理解当前图片和之前的修改历史?

    4. 产品能不能自动决定应该调用哪个模型、哪个工具?

    5. 用户最终关心的是“模型”,还是“结果”?

    我自己的答案越来越倾向于:

    用户根本不应该关心模型。

    模型最终应该像数据库、CDN 、云服务器一样,变成底层基础设施。

    用户只需要说:

    我想要这个。

    然后 Agent 帮他完成。


    目前 formind 还在比较早期的阶段。

    核心方向是:

    Photo to Line Drawing / Sketch + Image Agent

    网站: https://www.formind.app

    如果 V2EX 有做 AI 、独立开发、设计或者图片产品的朋友,欢迎试一下。

    我现在尤其想听听大家对一个问题的看法:

    你觉得未来 AI 图片产品的主要交互方式,会继续是 Prompt → Image ,还是会逐渐变成类似 Agent 一样,围绕一张图片不断沟通和修改?

    另外也非常欢迎直接吐槽产品。

    如果你打开网站之后 30 秒就关掉了,我其实更想知道:

    是什么让你决定关掉它?

    这个反馈可能比“支持一下”对我更有价值。

    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3125 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 29ms · UTC 12:27 · PVG 20:27 · LAX 05:27 · JFK 08:27
    ♥ Do have faith in what you're doing.