上礼拜有个下午,我坐在工位上对着幻简后台的生成记录发呆。前前后后点了十几次生成按钮,输入同一个需求,模型每次吐出来的话术都不一样,有的像刚实习的文案,有的像憋了半小时也不确定自己在说啥的老油条。我一边心里骂模型发挥不稳,一边又把其中一段摘出来,扔给旁边同事看。他看完问我:这段写得还行啊,你从哪儿抄的。

我当时就愣了一下。原来“还行”这个标准,在不同人眼里差别还挺大。那会儿我才认真开始想一个事,AI生成内容的质量,到底怎么定义,又到底能不能打。

被“垃圾感”骗了的那几年

早几年大家普遍觉得AI写的东西很“塑料”。措辞规整,排比很多,读起来没什么错,但也留不下什么印象。那时候我也这么觉着,还跟团队说过,宁可人工写,也别让AI糊弄用户。直到有一阵子我们做一个论文答辩场景的辅助功能,需要把一段很学术的话转成评委能听懂的白话。我随手让模型试了试,结果它把“本研究构建了一个xxxx框架”改成了“我们重新搭了个梯子,您可以踩着它往上走”。说不上多惊艳,但那一下我意识到:它至少知道自己在说人话。

后来我养成了一个习惯,每次看AI生成的段落,先不急着挑刺,而是问自己一句:如果这句话是个人写的,我会觉得他水平不行吗。这么调换视角以后,很多先前被我归为“垃圾”的内容,其实没那么垃圾,就是偶发平庸而已。平庸,跟劣质,是两件事。

质量不是标准答案,是语境问题

我个人的感觉是,AI内容的质量没法用一个固定标尺量。同一个模型,同一套参数,你让它写产品文案和让它写抒情散文,结果能是一个天上一个地下。它更像一个擅长应试但不稳定的临场选手:给足上下文,它还能发挥;你放养它,它就飘。

这一点我到现在也没完全想明白。有一回我们让模型模拟一个甲方客户给乙方提修改意见,它列了六条,条条语气都像真人在打字,还带口癖。我同事老周上周还在说,他自己写周报都没AI写得好。可同样这个模型,你让它说个冷笑话,它能把人讲冷。倒不是它不会说笑,而是它根本get不到什么场合讲什么话合适。

所以说,质量的判断标准,多半取决于你怎么用它。拿它当搜索引擎用,嫌它话多;拿它当陪聊,又嫌它没感情。这就像你问一把菜刀好不好用,得分切什么菜。

真正变的是做事方式的边界

我们在做幻简AI的日子里,越来越发现一个问题。用户嘴上说担心内容质量,其实关心的不是AI写得“好不好”,而是“能不能直接用”。大部分人不是专业写手,也不需要一篇满分作文,他们只需要一个不丢人的初稿,一个能把脑子里的疙瘩理顺的草稿。AI在这事上,是真能打。因为它最大的本事不是比谁写得好,而是把你从空白文档面前救下来。

有一次我自己写公众号,标题想了三版都不满意,随手让AI给了十个。前五个烂大街,第六个是有个动词组合有点怪的,我盯着看了两眼,竟然顺出了一个新方向。最后文章用的还是我想的标题,但那个“怪”的版本帮我跳出惯性了。

所以你要问AI生成内容质量能不能打,我现在的答案是:单看平均水平,还不够惊艳。但它最大的价值不在“质量”这两个字里,而在于它能打破你原本的节奏。就像你请了个不太稳定的搭子,他不一定每次都靠谱,但偶尔冒出一句话,你忍不住想回一句“等等,你再说一遍”。

我还在观望后头会走到哪,但至少现在,我已经不轻易管AI叫人工智障了。它有时候是有点笨,但笨得有点人味儿。这一点,挺难得的。