Skip to content
Elliot's Harness Lab
Go back

这几年我做过的那些扯淡的 AI 产品

AI Native Product

大模型这三年,我其实也做过一些挺扯淡的 AI 产品。

其中有一个项目,我到现在想起来都觉得挺搞笑的。

它大概是我最近几年职业生涯里最失败的项目之一,失败到我平时都不太愿意跟别人说这是我做的。

但今天我还是想把它写下来。

毕竟也是一份经历,不写下来就白白浪费了。


01|背景:智能座舱里的文生图

去年,我有幸跟了位很有远见的老板,今年很火的 AI播客,GenUI,VibeCoding,在sonnet3.5 之前,我们通通都立项了。

当时我负责的生成式 UI 的项目,有一个很小的功能:给车机换壁纸及主题。

其实那个项目很超前又很合理—— 用户坐在车里,说一句话,系统就能自动更换中控屏壁纸以及一系列的 icons,字体,界面等等。

比如用户说:

“来个变形金刚的主题。”

Ai Agent 就会立马给你生成一个变形金刚主题的壁纸,顺带换一套图标,字体,界面。

很未来,对吧?

但现实很快把人打醒了。

当时文生图模型能力真的不行,拉到什么程度呢?

第一,语义理解不行。 用户说“好看的”,模型完全不知道“好看”是什么。 你非得说得特别具体,比如“蓝天白云”“森林大海”,它才能勉强凑合。一旦抽象一点—— 比如“ins 风”“高级感”“有点设计感”,模型当场宕机。

第二,审美不行。 就算你描述得已经很具体了,生成出来的图也经常一言难尽: 颜色奇怪、构图混乱、乱手乱脚,看一眼就知道不可能上车。

第三,速度不行。 生成一张图要几十秒秒,在车里,这基本就是不可用。

老板看了我们第一个 demo 之后,直接开喷:

“这什么鬼?这么丑的图,能上车?”


02|产品方案:加一个“转译 agent”

其实我一直觉得是可以做到好看的,即使文生图模型还不太行

不好看,是因为输入不够。

用户说的“好看”,和模型理解的“好看”,根本不在一个频道。

用户脑子里想的,可能是: ins 风、极简、莫兰迪色、干净、有设计感。 但这些东西,大多数人自己都说不清楚,更别指望他们一次性说给模型听。

模型呢? 它见过很多图,但对“好看”这种抽象概念,本身就没有统一标准。

所以我当时的想法是: 要不在用户和文生图模型之间,加一层大模型?

这几年我做过的那些扯淡的 AI 产品 - image 1

这个大模型不负责画图,只负责一件事—— 把人话,翻译成模型听得懂的话。它会加入一些人类的 knowhow!

比如用户说:

“来点好看的。”

转译 agent 先帮他补全成一段具体描述:

“一张极简风格的风景壁纸,蓝天白云,远处是连绵的山脉,整体使用柔和的莫兰迪色系,氛围清新克制,适合作为汽车中控屏背景。”

然后再把这段话丢给文生图模型。

逻辑很简单: 不是让用户学会怎么写 prompt,而是让模型替用户补全想法。

我当时真觉得这个方案挺合理的。

但是我们算法的老大几次在评审会上都了我的方案。

理由也很简单:

“你不懂算法!你不懂大模型!做大模型怎么能没有 RAG!”

我当时还挺心虚,因为我整个方案的确从来没考虑过算法!


03|创业老兵的方案:人工标 30 万张图

我不敢跟算法老大硬刚,因为我们之间不管从级别还是经历来看,都差距悬殊。人家随便拿出一个 title,都能压死我。

然后算法老大给了他的方案。

大概是这样:

这几年我做过的那些扯淡的 AI 产品 - image 2

第一步,产品负责想场景,改写三十多万条 query。

第二步,找兄弟部门跑模型,生成三十多万张图。 第三步,发动整个部门,一百多号人,开始人工标注

标什么?

一是审美:好不好看。 二是缺陷:多手多脚、颜色诡异、构图崩坏。

我一开始以为,这些标注是拿去做重新训练的。

但不是。

标完之后,只是从三十万张图里,人工筛出一部分“看起来还行”的。

然后算法同学把这些图扔给当时的 GPT-4o(多模态), 以图推文,让模型反推出每张图的文本描述。

再然后,他们把这些描述做了向量化

用户输入一句话,就跟这些文本向量做相似度检索, 相似度最高的那张图,直接召回。

方案讲完,我脑子里只有一个念头:

原来 Rag 还有这种用法!

怪不得以前百度搜图总搜不准…

当然,它也有优势—— 快。 基本能做到 5 秒内出图。

但是问题也很明显

我每次说要给我生成变形金刚的时候,总是给我“生成”钢管或者螺帽。

原因其实很简单: 向量检索看的是文本相似度,不是真正的理解。

更可笑的是~,这个事情还被我写了个专利,不知道后来有没有下来。


04|其实大家都是新手

这事我后来想了很久。

一开始我是真的生气,觉得这方案太扯了,问题是为啥大家都不反对呢?

用偏搜索时代的解法,去解决一个生成问题,怎么看都不对。

但再往后想,我慢慢想通了。

他懂个鸟的大模型!

只不过是害怕方案里面没有算法的存在强行加戏

那位创业老兵是传统搜索出身。 向量检索、RAG,这些是他的舒适区。

所以他在面对一个全新的问题时, 下意识就会用自己最熟的工具。

这很正常。

说实话,换成我也一样。 如果我曾经用某种方法成功过,我大概率也会反复用它。

这就是经验主义。

在传统软件时代,经验主义是资产。 但在大模型时代,它很可能变成负担。

因为变化实在太快了。

去年还要堆工程的事,今年可能一句 prompt 就解决了。 上个月还需要 workaround 的问题,下个月模型直接原生支持。

你的经验,可能刚形成,就过期了。

而且更关键的是—— 这个时代,其实没有真正的专家。


05|大模型时代,没有专家

这三年我观察到一个很明显的现象:

很多传统软件时代的“专家”,到了 AI 时代,并不占优势。 反而是一些没什么历史包袱的人,上手更快。

原因也很简单。

大家站在的,其实是同一条起跑线。

大模型才出来三年, 没有人有十年的 AI 产品经验, 也没有人做过一百个成功的 AI 产品。

所有人都在试。

所以后来我再回看那些“扯淡”的项目,也不太觉得丢人了。

它们本来就是探索的一部分。

至少让我确认了几件事:

变形金刚和钢管搞混了? 没事,说明这条路不行,换一条。


06|真正的竞争力,是学习速度

后来我也做过一些相对还算成功的 AI 产品。

回头看,成功并不是因为我多聪明。 而是因为——我学得快。

模型一更新,我就去试。 新 prompt 技巧出来,我马上玩。 新工具发布,我第一时间上手。

持续好奇,快速验证,反复迭代。

这大概就是大模型时代最大的竞争力。

那些看起来很扯的项目, 不是浪费时间,而是学费。

它们让我彻底接受了一件事:

大模型时代,没有专家,只有学习者。

大家都是新手,谁也别装。

至于创业老兵、经验主义、权威专家—— 听听就好,别当真。

真想找答案, 不如去看看那些天天在实验的人。

比如 Twitter 上日更 demo 的人, 比如 Manus 这种一路试出来的产品。

反正大家都在摸索。

谁跑得快,谁就多看几眼风景。

原文

本文最初发布于微信公众号「白苏Elliot」:https://mp.weixin.qq.com/s/Nut_zG8ntT10kHJ6i5eQMQ


正在做 Agent 产品、企业 AI 落地或智能化转型?

我长期关注 设计 Agent 企业 Harness / FDE Agent 框架 AI Coding 。如果你也在这些问题里打转,欢迎探讨。

了解白苏 Elliot
Share this post:

上一篇
0投放、0营销,去年做的 AI 产品赚钱了
下一篇
多模态Agent还在用URL传图片?KeyMapping让成本降50%,速度快5倍