大模型这三年,我其实也做过一些挺扯淡的 AI 产品。
其中有一个项目,我到现在想起来都觉得挺搞笑的。
它大概是我最近几年职业生涯里最失败的项目之一,失败到我平时都不太愿意跟别人说这是我做的。
但今天我还是想把它写下来。
毕竟也是一份经历,不写下来就白白浪费了。
01|背景:智能座舱里的文生图
去年,我有幸跟了位很有远见的老板,今年很火的 AI播客,GenUI,VibeCoding,在sonnet3.5 之前,我们通通都立项了。
当时我负责的生成式 UI 的项目,有一个很小的功能:给车机换壁纸及主题。
其实那个项目很超前又很合理—— 用户坐在车里,说一句话,系统就能自动更换中控屏壁纸以及一系列的 icons,字体,界面等等。
比如用户说:
❝
“来个变形金刚的主题。”
Ai Agent 就会立马给你生成一个变形金刚主题的壁纸,顺带换一套图标,字体,界面。
很未来,对吧?
但现实很快把人打醒了。
当时文生图模型能力真的不行,拉到什么程度呢?
第一,语义理解不行。 用户说“好看的”,模型完全不知道“好看”是什么。 你非得说得特别具体,比如“蓝天白云”“森林大海”,它才能勉强凑合。一旦抽象一点—— 比如“ins 风”“高级感”“有点设计感”,模型当场宕机。
第二,审美不行。 就算你描述得已经很具体了,生成出来的图也经常一言难尽: 颜色奇怪、构图混乱、乱手乱脚,看一眼就知道不可能上车。
第三,速度不行。 生成一张图要几十秒秒,在车里,这基本就是不可用。
老板看了我们第一个 demo 之后,直接开喷:
❝
“这什么鬼?这么丑的图,能上车?”
02|产品方案:加一个“转译 agent”
其实我一直觉得是可以做到好看的,即使文生图模型还不太行
不好看,是因为输入不够。
用户说的“好看”,和模型理解的“好看”,根本不在一个频道。
用户脑子里想的,可能是: ins 风、极简、莫兰迪色、干净、有设计感。 但这些东西,大多数人自己都说不清楚,更别指望他们一次性说给模型听。
模型呢? 它见过很多图,但对“好看”这种抽象概念,本身就没有统一标准。
所以我当时的想法是: 要不在用户和文生图模型之间,加一层大模型?
这个大模型不负责画图,只负责一件事—— 把人话,翻译成模型听得懂的话。它会加入一些人类的 knowhow!
比如用户说:
❝
“来点好看的。”
转译 agent 先帮他补全成一段具体描述:
❝
“一张极简风格的风景壁纸,蓝天白云,远处是连绵的山脉,整体使用柔和的莫兰迪色系,氛围清新克制,适合作为汽车中控屏背景。”
然后再把这段话丢给文生图模型。
逻辑很简单: 不是让用户学会怎么写 prompt,而是让模型替用户补全想法。
我当时真觉得这个方案挺合理的。
但是我们算法的老大几次在评审会上都否了我的方案。
理由也很简单:
❝
“你不懂算法!你不懂大模型!做大模型怎么能没有 RAG!”
我当时还挺心虚,因为我整个方案的确从来没考虑过算法!
03|创业老兵的方案:人工标 30 万张图
我不敢跟算法老大硬刚,因为我们之间不管从级别还是经历来看,都差距悬殊。人家随便拿出一个 title,都能压死我。
然后算法老大给了他的方案。
大概是这样:
第一步,产品负责想场景,改写三十多万条 query。
第二步,找兄弟部门跑模型,生成三十多万张图。 第三步,发动整个部门,一百多号人,开始人工标注。
标什么?
一是审美:好不好看。 二是缺陷:多手多脚、颜色诡异、构图崩坏。
我一开始以为,这些标注是拿去做重新训练的。
但不是。
标完之后,只是从三十万张图里,人工筛出一部分“看起来还行”的。
然后算法同学把这些图扔给当时的 GPT-4o(多模态), 以图推文,让模型反推出每张图的文本描述。
再然后,他们把这些描述做了向量化。
用户输入一句话,就跟这些文本向量做相似度检索, 相似度最高的那张图,直接召回。
方案讲完,我脑子里只有一个念头:
原来 Rag 还有这种用法!
怪不得以前百度搜图总搜不准…
当然,它也有优势—— 快。 基本能做到 5 秒内出图。
但是问题也很明显
我每次说要给我生成变形金刚的时候,总是给我“生成”钢管或者螺帽。
原因其实很简单: 向量检索看的是文本相似度,不是真正的理解。
更可笑的是~,这个事情还被我写了个专利,不知道后来有没有下来。
04|其实大家都是新手
这事我后来想了很久。
一开始我是真的生气,觉得这方案太扯了,问题是为啥大家都不反对呢?
用偏搜索时代的解法,去解决一个生成问题,怎么看都不对。
但再往后想,我慢慢想通了。
他懂个鸟的大模型!
只不过是害怕方案里面没有算法的存在强行加戏
那位创业老兵是传统搜索出身。 向量检索、RAG,这些是他的舒适区。
所以他在面对一个全新的问题时, 下意识就会用自己最熟的工具。
这很正常。
说实话,换成我也一样。 如果我曾经用某种方法成功过,我大概率也会反复用它。
这就是经验主义。
在传统软件时代,经验主义是资产。 但在大模型时代,它很可能变成负担。
因为变化实在太快了。
去年还要堆工程的事,今年可能一句 prompt 就解决了。 上个月还需要 workaround 的问题,下个月模型直接原生支持。
你的经验,可能刚形成,就过期了。
而且更关键的是—— 这个时代,其实没有真正的专家。
05|大模型时代,没有专家
这三年我观察到一个很明显的现象:
很多传统软件时代的“专家”,到了 AI 时代,并不占优势。 反而是一些没什么历史包袱的人,上手更快。
原因也很简单。
大家站在的,其实是同一条起跑线。
大模型才出来三年, 没有人有十年的 AI 产品经验, 也没有人做过一百个成功的 AI 产品。
所有人都在试。
所以后来我再回看那些“扯淡”的项目,也不太觉得丢人了。
它们本来就是探索的一部分。
至少让我确认了几件事:
-
过去的成功经验,未必值得迷信
-
快速试错,比提前想清楚更重要
-
不要神话某个“专家”,团队一起验证才有意义
-
失败是常态,不失败才不正常
变形金刚和钢管搞混了? 没事,说明这条路不行,换一条。
06|真正的竞争力,是学习速度
后来我也做过一些相对还算成功的 AI 产品。
回头看,成功并不是因为我多聪明。 而是因为——我学得快。
模型一更新,我就去试。 新 prompt 技巧出来,我马上玩。 新工具发布,我第一时间上手。
持续好奇,快速验证,反复迭代。
这大概就是大模型时代最大的竞争力。
那些看起来很扯的项目, 不是浪费时间,而是学费。
它们让我彻底接受了一件事:
大模型时代,没有专家,只有学习者。
大家都是新手,谁也别装。
至于创业老兵、经验主义、权威专家—— 听听就好,别当真。
真想找答案, 不如去看看那些天天在实验的人。
比如 Twitter 上日更 demo 的人, 比如 Manus 这种一路试出来的产品。
反正大家都在摸索。
谁跑得快,谁就多看几眼风景。
原文
本文最初发布于微信公众号「白苏Elliot」:https://mp.weixin.qq.com/s/Nut_zG8ntT10kHJ6i5eQMQ