为什么提示词不是最好的交互模式?
最近面试了几家公司,发现面试官不约而同对于产品新兴的交互模式更感兴趣。字节的面试官提出了一个核心命题是:
如何超越提示词本身这种交互模式,提供用户更高效,更能表达用户自身意图的交互模式。
这确实是一个非常值得探究的问题。现有的交互模式多为提示词交互,那么提示词交互有什么弊端呢?
提示词本质是语言,在一个有限的输入框里,语言这个媒介本身能承载的信息有限,用户必须先想清楚才能表达清楚。回忆一下,我们在和ai对话的时候,是不是得先想清楚自己到底要表达什么,想要实现什么意图?
但是对于用户本身来说,用户很多时候根本不知道自己要什么,因为清晰的语言表达背后需要对这件事情有足够深度的思考,用户思考没到那一层,自然说不清楚。
另外语言本身是线性的,序列化的,但一张图片的美是多维度的,同时发生的,比如说光影,材质,构图,空间关系,当用户有了一个初步构想时,该如何描述这些纬度呢?
只能一个词一个词去描述。
但问题就在于,如果用户想要生成一个图片或视频,该如何描述这个物体在左边,那个物体的阴影角度,背景的色温?一旦要描述,文字将会变得极其冗长,且容易遗漏。文字天生就具备这个局限。
再者,提示词本质上是一次性提交,事后才能看到结果的模式,用户在构建提示词的过程中,根本拿不到任何中间反馈,没办法边预览边调整,这个等待的过程,太折磨人了。
提示词模式的限制这么多,那什么是更好的交互模式呢?
老实说这个问题我还要再想想,过几日再回答吧。
Hueyin