
有一个现象,最近在圈子里悄悄传开了:
不少文科生,用AI做出了比专业程序员更好用的应用。
他们不懂递归,分不清堆和栈,写出来的代码大概率连编译都过不了。但他们做的东西,用户喜欢,留存高,甚至有人心甘情愿掏钱。
一个工作了五年的后端工程师,看着这种情况,内心一定是崩溃的。
凭什么?
答案不复杂:文科生从来没有用"程序员的脑子"去想用户。
程序员有一套根深蒂固的思维顺序——先想架构,再想逻辑,再想数据流,最后才轮到用户。用户的感受在整个链条里排名靠后,有时候甚至是"留到上线后再说"。而文科生不一样,他们思考问题的第一个问题永远是:这个人会怎么用它?他在什么状态下打开它?他到底想要什么?
这两种思维方式做出来的产品,从基因上就不同。
今天我想聊的,就是这个"从用户出发"的设计思路里,最核心也最被忽视的一个概念——
驱动。
不是Windows驱动。是用户行为模式驱动。
现在的AI应用,大多数都在等你来"伺候它"
2024年到2025年,AI应用井喷。各个赛道跑出了代表产品,AI写作、AI视频、AI设计工具,多到你打开应用市场都不知道该下哪个。
但如果你真的用过一圈,就会发现一个让人憋屈的共同问题:
它们都在等你来用它。
你打开软件,面对一个输入框,或者一排功能按钮,然后你得自己想清楚要干什么,填进去,等结果,再看结果对不对,不对再改,循环往复。这个过程,本质上是你在服务这个工具,而不是工具在服务你。
这是工具逻辑,不是产品逻辑。
举个例子。你打开备忘录,随手记了几个字:"明天早上9点开会"。
一个好产品,会在你按下回车的瞬间问你:要不要帮你在明天8:30设一个提醒?
一个坏产品,是在你打开日历App,手动新建事件,选日期,选时间,填标题,确认保存之后,才姗姗来迟地说"你好,有什么可以帮您?"
区别不是功能,是驱动时机。好产品找到了驱动点,坏产品在等你去找它。
顺便说一句:独立开发者三件套,真的别做了
聊驱动之前,有句话不吐不快。
网上流传着一个梗:很多独立开发者一上来就做记账、日记、Todo,俗称"独立开发者三件套"。这个梗能传开,是因为它说中了一个真实的、反复发生的现象。
为什么独立开发者会扎堆做这三个?
原因很简单:需求清晰,边界明确,技术难度低,做起来心里有数。
记账App的逻辑是"输入-存储-展示"。日记App的逻辑是"写-保存-回顾"。Todo的逻辑是"添加-完成-删除"。每一个,一个开发者花两周就能做出来。做完了还有一种莫名其妙的成就感——你看,我做了一个App,它跑起来了,它有功能,它是一个产品。
但这种成就感是假的。
因为这三类产品的市场,早就被做烂了。App Store里,记账App有几百个,日记App有几百个,Todo App有几百个,而且其中很多是微软、苹果、notion这些体量的玩家在做。你做出来,凭什么让人下载你的?
更致命的是,这三类产品的驱动设计,已经被做到天花板了。记账的驱动点是"花了钱就记",日记的驱动点是"睡前回顾",Todo的驱动点是"想到任务就加"。这些驱动点已经被研究烂了,交互范式已经固化了,你在里面几乎找不到可以差异化的空间。
独立开发者做这三个,更多是在完成一次"我能做App"的自我证明,而不是在解决一个真实的用户问题。
这不是说三件套本身有什么错。是说,如果你用驱动设计的眼光去看世界,你会发现周围有大量还没有被捕获的驱动点——用户在某个很自然的时刻,有一个很真实的需求,但市面上没有一个产品在那个时刻出现。
找到这种断层,比做第481个记账App有价值得多。
我是怎么用字幕驱动整个AI视频应用的
说概念太虚,来一个真实案例。
B站上有个叫"大圆镜科普"的账号,做科普类AI视频,质量在我见过的同类里算是顶尖的。画面叙事感很强,分镜有自己的节奏,主要是特效和脑洞大开,不像大多数AI视频那种"PPT加配音"的廉价感。我研究了很久,试图复刻他的制作路径,最后发现根本复刻不了——他的脑洞从哪里来,我找不到源头。
市面上的AI短视频工具,套路基本一样:
让AI读小说 → 生成剧本 → 拆分镜 → 生成角色场景资产 → 发给Seedance之类的视频模型去生成。
听起来挺系统,但问题是:剧本的脑洞在哪里?AI自己编的剧本,创意在哪里?视频出来,像一条没有灵魂的流水线产品,你说不出哪里有问题,但就是看着没意思。
我最后找到的解法,是把驱动锚点换一个位置——
不从故事出发,从声音出发。
这是演示视频,感谢小师妹@Graceruansu 录制音频。
整个程序从构思到写好用了2小时左右。
生成一段视频的时间在20分钟左右。
效果没有达到我的预期,主要是seedacne1.5不支持一些暗黑的图片和提示风格。

流程是这样的:
- 先写口播稿(这件事是我自己来,因为创意这件事,目前还是我的)
- AI朗读,生成音频文件,转成字幕文件(SRT格式)
- 大模型读字幕,理解这是一个什么内容走向的科普视频
- AI根据理解,生成所需的人物、道具、场景资产图
- 按照Seedance支持的生成时长(4-15秒),切割字幕
- AI逐段读字幕,生成对应分镜描述,附上资产图,发给Seedance,用首尾帧连贯模式生成视频片段
- 拼接所有片段,和口播音频对齐(大概有1秒左右的误差,手动微调)
- 完成
这个流程的本质,是把字幕文件变成了驱动信号。
SRT字幕文件是一个"带时间轴的脚本",它包含了:内容说了什么、每句话说了多久、信息节奏怎么分布。大模型读懂了字幕,就读懂了创作意图,剩下的视觉化工作让AI补全。
但是,这里有一个关键点,我在第一版里漏掉了,现在补上——
导演风格。
整个工作流里,有一套预设的导演风格库。AI在读字幕的时候,不是瞎猜要用什么视觉语言,它会去匹配:这段内容,适合哪位导演的调度方式?
比如,字幕里描述一场大规模战争场面,AI会自动匹配史诗战争片的分镜逻辑。字幕里是两个人的日常对话,AI会切换到更生活化的镜头语言。
当然,你也可以直接告诉AI:
"我要昆汀·塔伦蒂诺的风格。"
AI秒懂——超长对话、突然暴力、跳切、非线性叙事、大量流行文化梗,全给你安排上。
"我要斯皮尔伯格的风格。"
AI也懂——大场面里的个人情感,背景里永远有一盏暖光,主角永远有一个从地面仰拍的镜头,配乐进场时机恰到好处。
但更有意思的情况是——用户不知道自己要什么风格。
词汇量不够,说不出导演名字。他只知道"我想要那种很厉害、很震撼、看了起鸡皮疙瘩的感觉"。
这时候就是AI对话出场了。AI会问他几个问题:你喜欢什么类型的电影?你希望这个视频让人感到紧张还是感动?画面是华丽的还是克制的?问着问着,AI自己拼出一套风格描述,然后把这套风格语言化,给用户看——"我理解你想要的是这种感觉:……"——用户点头,流程启动。
本质上,这是把"选风格"这件门槛很高的事,用对话给拆解掉了。词汇量不是问题,感受才是输入。
这就是字幕驱动的完整形态:字幕文件是骨架,导演风格是灵魂,两者叠加,AI才能生成有质感的视频,而不是一堆画面的堆砌。
驱动的完整分类手册
字幕驱动只是一个切面。当你真正把"驱动"当成设计方法论来用,你会发现这个世界到处都是驱动点。
1\. 文件驱动
核心逻辑:一个文件出现了、被修改了、被删除了,AI被激活。
- 新文件入库驱动:你把一份PDF丢进某个文件夹,AI自动读取、打标签、提取关键信息,归档进知识库。你什么都没做,只是"丢了一个文件"而已。
- 截图驱动:截图文件夹里出现了新截图,AI识别内容——是收据就记账,是名片就存联系人,是菜单就分析卡路里,是报错截图就直接开始debug。
- 录音文件驱动:录完一段会议语音,同步到云端,AI立刻转写、提炼待办、发到任务管理系统。你只是录了个音,后面的事它全包了。
- 代码保存驱动:文件一按Save,AI立刻检查风格、跑测试、输出潜在bug。程序员最怕的那种"稍后再改",被扼杀在摇篮里。
文件驱动的技术本质是文件系统的事件订阅,实现起来不复杂,但大多数产品没想到用。
2\. 地点驱动(位置驱动)
核心逻辑:你到了哪里,或者离开了哪里,AI知道该干什么。
- 到达公司驱动:手机进入地理围栏,AI打开今日日程摘要,过滤掉家庭模式的通知,切换成工作人格。
- 到家驱动:手机回到家庭网络,AI问你今天累不累,顺便提醒你有没有忘记晚上要做的事。
- 到达机场驱动:GPS判断你在机场,AI主动调出航班信息、候机楼、登机口,提醒你证件有没有带。
- 出行中驱动:检测到你在高铁或飞机上(GPS漂移特征加上网络断续),AI悄悄把你今天可能用到的内容下载到本地。
地点驱动的核心不是"你在哪里",而是"你在那个地方大概想干什么"。位置是信号,意图才是目标。
3\. 网络驱动(Wi-Fi / 蓝牙驱动)
核心逻辑:连上了什么网络或设备,AI切换对应的模式。
- 连接家庭Wi-Fi驱动:进入家庭网络,AI切换到家庭模式,降低工作通知权重,该放松的时间不骚扰你。
- 连接公司Wi-Fi驱动:进入工作网络,AI推送昨晚未处理的邮件摘要,今日日程一览。
- 连接车载蓝牙驱动:手机连上车机,AI立刻问要去哪,查路况,顺带提醒今天有没有外出行程。
- 断开固定网络驱动:检测到你离开了某个固定Wi-Fi,AI判断你出门了,触发购物清单、外出任务提醒。
4\. 时间驱动
核心逻辑:到了某个时间点,或某个时间段,AI自动动起来。
时间驱动是最基础的驱动方式,但基础不代表简单——大多数产品的时间驱动只是"定时推送",做到极致的时间驱动是能感知时间段和状态的叠加的。
- 晨间驱动:早上7:30,天气、日程、昨晚的未读重要信息,打包送到你面前,你喝咖啡的时间就搞定了。
- 工作结束驱动:傍晚6点,AI提醒今日待办完成情况,问你明天有没有需要提前准备的。
- 周报驱动:每周日晚,AI拉取本周数据,写一份只有你自己看的周报,不用你动手。
- 截止日驱动:任务距截止日剩48小时,AI主动出现,问你需不需要帮忙。
5\. 传感器驱动
核心逻辑:设备上的传感器数据发生变化,AI推断你的状态并响应。
- 心率驱动:智能手表检测到你心率持续偏高,AI判断你在压力状态,主动推一个3分钟呼吸练习,而不是继续给你发工作消息。
- 睡眠驱动:检测到你已经睡着,AI自动静音所有通知,顺带把智能家居的灯调暗。
- 运动驱动:计步器判断你开始跑步了,AI切换运动模式,歌单切过来,本次运动记录开始。
- 相机驱动:镜头对准药瓶,AI识别药品,提醒用量和禁忌。对准食物,自动估算卡路里。
6\. 行为序列驱动
核心逻辑:用户做完了一系列连续的动作,AI认出这个"完成动作"并激活。
这是最接近"读心术"的驱动方式,也是设计难度最高的一种。
- 关文档驱动:你关掉了会议纪要文档,AI识别这个结束信号,问你要不要提取待办并同步给相关人。
- 连续阅读驱动:你连续看了5篇同一话题的文章,AI判断这是研究意图,主动整合资料,生成一份综述。
- 停留超时驱动:你在同一段内容上停留超过3分钟,AI判断你可能卡住了,主动提供解释或背景资料。
7\. 语义驱动
核心逻辑:用户写了什么或说了什么,AI解析意图,触发对应的工作流。
- 情绪驱动:日记App里出现低落情绪的词句,AI切换成陪伴模式,而不是继续给你推送任务提醒。
- 意图驱动:输入框里出现"我想写一篇……",AI不等你选功能,直接进入创作辅助流。
- 关键词驱动:聊天里出现"发票"、"报销",AI悄悄把最近的消费记录调出来备用。
最被低估的驱动:用户心智模型驱动
前面说的那些驱动——文件、位置、时间、传感器——本质上都是外部信号。它们在说:当某件事情发生了,AI该做什么。
但还有一层驱动,更深,也更难,它来自用户脑子里对产品的预期。
这叫用户心智模型驱动。
心智模型是认知科学里的概念,用人话说就是:用户在打开你产品的那一刻,脑子里已经有了一张"它应该怎么工作"的地图。他不会读说明书,他只会按照脑子里的地图操作。如果你的产品的真实逻辑和他地图对不上,他就会感到困惑,然后放弃,然后去App Store给你打两星。
大多数AI应用失败,不是功能不好,是和用户的心智地图撞车了。
三个真实的心智模型冲突案例:
案例一:AI对话框被当成了搜索引擎
很多用户第一次打开AI产品,脑子里的参照物是搜索框——我输入关键词,它给我结果。所以他输入"Python教程",然后发现AI给了他一大段对话,他一脸困惑:这怎么用?不是应该给我一个链接吗?
这不是用户蠢,是产品没有帮用户完成心智模型的切换。
案例二:"记忆"的预期差
用户认为AI应该记住他说过的话,就像跟真人聊天一样。但实际上大多数AI产品每次对话都是全新的无状态开始。用户说"上次聊到的那个方案",AI一脸茫然,用户立刻崩溃,觉得被愚弄了。
这不是用户期望过高,是产品设计者没有对齐心智模型。
案例三:儿童产品里的玩具逻辑断层
这是最容易被忽视的。儿童没有"学一个App怎么用"的心智模型,他们用的是一套原始的、更诚实的逻辑——玩具逻辑。
玩具逻辑是什么?拿起来就能玩。不需要引导页。出了错有即时的、有趣的反馈。玩腻了可以换一种玩法,不需要退出重进。
但市面上大多数儿童教育产品的交互逻辑,是"缩小版的成人App"——有引导页、有菜单、有进度条、有账号体系。这套东西和儿童的玩具心智完全不兼容。结果:孩子玩两分钟就跑了,家长说孩子不专注,其实是产品设计者不知道孩子的脑子是怎么转的。
心智模型驱动的设计,分三步:
第一步,找到目标用户的参照物。 在设计任何交互之前,先问:这个用户的脑子里,对"好用的东西"的参照系是什么?是微信?是遥控汽车?是翻书?找到参照物,你的产品交互就要尽量贴着这个参照物走。
第二步,找到断层,用设计填平它。 用户期望AI记住他,那就做记忆功能,或者在对话开头自动摘要上次的关键内容,让用户感知到"它记得我"。用户期望"说话就能控制",那就把语音做成主入口,不要藏在设置里第三个子菜单的第二行。
第三步,让产品"自我解释"。 当用户做了一个"预期之外的操作",不要弹一个Tutorial,而是即时给出温和的纠偏提示。用户的困惑本身,就是一个驱动信号——AI应该捕捉这个困惑,然后主动解释,而不是等用户去翻文档(他不会的)。
驱动设计的三个原则
这些驱动类型讲完了,提炼三条原则,帮你在下一个AI应用里真正用好驱动设计。
原则一:找到用户的"最小启动动作"
用户愿意做的动作越小,你的产品越有价值。丢一个文件是最小动作,连上Wi-Fi是最小动作,说一句话是最小动作。驱动要紧盯这些最小动作,让AI帮用户把后续的所有事搞定。
真正好的产品,用户感知不到"我在使用AI",他只感觉"这个东西好用得有点不正常"。
原则二:驱动要和场景意图强绑定
连上车载蓝牙,不一定触发工作模式。连上家庭Wi-Fi,不一定推送新闻摘要。驱动本身没有价值,驱动和场景意图的精准匹配才有价值。
设计每一个驱动的时候,问自己:用户在这个时刻,最有可能想干什么?答案通常只有一个,只服务那一个,不要贪心把所有功能都塞进来。
原则三:让驱动对用户透明、可控
驱动越智能,用户越容易感到失控——"它为什么突然给我推这个?"好的驱动设计,要让用户随时能看到"现在是什么在驱动它",并且能轻松关掉或修改。不要做一个什么都替用户决定的产品,做一个用户愿意信任的产品。信任,是比功能更稀缺的东西。
未来的交互,会经历三次跃迁
我们正站在AI交互范式的转折点上,但大多数人还没意识到这个弯转得有多大。我把接下来几年的演变,分成三次跃迁来说。
第一跃迁:从"召唤AI"到"AI环绕"
今天我们使用AI,是主动召唤——打开App,输入问题,等结果,关掉App。AI在工具箱里,等你来取。
第一跃迁之后,AI会变成环境的一部分。它在你的耳机里、眼镜里、手表里、桌上的小设备里,持续感知你的状态,随时准备开口,但又知道什么时候不该开口。你不需要召唤它,它已经在场了,就像空气一样。
这个阶段,驱动的意义是:AI不再等你触发,AI在主动解读现实世界的信号,判断你什么时候需要它介入,什么时候最好消失。
第二跃迁:从"单一入口"到"无界面"
今天每个AI应用都有一个入口——一个App图标,一个网站,一个实体按钮。用户要在不同入口之间反复切换,这是认知负担,也是隐形的摩擦成本。
第二跃迁之后,入口消失了。你看着冰箱门说"牛奶快没了",AI记录下来,加进购物清单,查了今天的超市优惠,没有App,没有点击,没有等待。你只是说了一句话。
这件事听起来像科幻,但Apple Intelligence、Google Assistant们都在往这里追。现在还很笨、还很割裂,但方向是确定的。
这个阶段,驱动的信号来源从"你的操作行为"变成了"你的整个生活现场"——你说了什么,你看了什么,你在哪里,你的表情是什么,全是驱动源。
第三跃迁:从"响应式AI"到"预测式AI"
前两个跃迁,AI还是在"响应"——你给信号,它做反应。第三跃迁,AI开始"预测"。
它对你的了解足够深,深到可以在你产生念头之前,提前把事情准备好。
你每天早上9点去咖啡馆写作,有一天你坐下来,AI已经把今天需要的资料整理好了,因为它知道你今天下午有个会议,而你的习惯是会前一小时整理资料。你什么都没说,它就做了。
这是心智模型驱动的终极形态:AI不再是在读你的行为,AI在读你的意图,甚至读你自己还没意识到的意图。
个人数据飞轮(持续学习你的习惯)+ 多模态感知(声音、视觉、位置、生理状态)+ 推理模型(意图预测),三者组合,这件事的实现窗口在五年内。写程序写了十几年的老手,现在设计产品时脑子里如果还没有这张图,那之后会很难受。
从字幕驱动到最终的那个麦克风按钮
回到开头的字幕驱动视频工作流。说一下它未来的样子。
用户打开App,整个界面只有一个东西:一个麦克风按钮。
用户说:"我想做一个关于黑洞的科普视频,给小学生看,我想要那种,看完了会发呆的感觉,很震撼的那种。"
AI问他几个问题,理解他要的"震撼感"是什么质感——是宇宙尺度的渺小感,还是科学发现那一刻的戏剧感?他说是前者。AI说,明白了,我给你做一个诺兰《星际穿越》风格的科普片。
用户说好。AI生成三份口播稿,用户选一份,对着麦克风念一遍。AI克隆他的声音,生成字幕,分割,匹配导演风格,制作资产,生成分镜,调用Seedance,拼接,对齐音频。
十分钟后,视频完成。
用户从头到尾:说了几句话,选了一次,念了一遍稿子。
声音即触发,对话即流程,出片即结果。
这背后有一个更大的设计哲学:未来真正优秀的AI应用,不会让用户学怎么用,只会让用户自然地触发。
所以,与其问"我们该做什么功能",不如先问:用户在哪个最自然的时刻,最需要我们出现?那个时刻是什么?能不能把那个时刻做成驱动点?
找到那个时刻,产品就有了灵魂。功能是肉,驱动是骨架。没有骨架的产品,软的,立不起来。
最后说一件正在做的事
很多人学AI应用开发,把大量时间用来学API调用、学Agent框架、啃Prompt技巧。这些都对,都值得学,但都不是最重要的。
最重要的事,是在你敲下第一行代码之前,你要能回答一个问题:
用户在什么情况下,会需要这个东西突然出现在他面前?
那个"什么情况下",就是驱动。驱动想清楚了,应用的灵魂就有了。剩下的代码,让AI去写吧,它比你快,也比你不累。
说完理论,顺带聊一件正在做的事。
我在设计一款教育产品。
它有硬件,但不局限于硬件。用户可以下载App,支持全平台客户端、网页端,也有Skill接口。
产品还在打磨。不急。
如果你是这个方向的大佬,有兴趣聊聊——
文科生在AI时代跑得快,不是因为他们技术好,而是因为他们更懂人。技术是工具,人才是目的。这条路没有门槛,有没有勇气来走才是问题。
写在最后:
目前AI发展的这个阶段,我知道的很多所谓“文科生”的项目,如果最后的交付阶段,还是找了比较专业的人士完善他的项目。