本文作者:花叔(@AlchainHust)。版权归作者所有,未经授权禁止转载。
上周在X上刷到吴恩达开源了他做的OpenWorker。

再结合最近国内几家做AI产品的大厂的动作,能看出一个挺明确的趋势:做一个给白领工作者、或者给企业老板用的work类产品,好像正在成为显学。半年前Anthropic那边也出过一个名字里带work的东西,叫Claude Cowork。
这件事之所以是现在才成立,我觉得是两样东西凑到了一起。一是模型的coding和agent能力这一年进化得实在太快,二是大量「蒸馏」了知识工作者认知和工作流程的skill生态繁荣起来了。AI大概确实不该再只是跟你聊聊天、提提建议,它完全可以、而且已经成了很多人的工作伙伴。
昨天我看到纳米Work开了个发布会,发现这个产品和我现在对于办公类AI产品的预期还挺一致的。再加上一个有趣的机缘(纳米Work的专家广场里有三个以我命名的专家:花叔-设计大师、花叔-女娲蒸馏师、花叔-达尔文Skill优化官,都是我授权他们基于我开源的skill做的)。

于是我正好就去试了试,看看到底怎么样。这篇文章主要涉及两个真实任务:一个是让它给我的产品剪条宣传片,它跨了三家大模型把片子剪出来了,这个后面细说;另一个是四件套的定位改写,我先说这个,因为它交回来的第一件东西完全出乎我意料。
OPC的一些困境
大家都懂的,我平时做产品、做开源skill、还写内容/做视频,和很多OPC一样,实在是给自己身上扛了太多事。当然,现在在coding agent的帮助下,只要自己的需求明确了,开发产品很多时候成了最简单的事。
卡人的是写完之后那一堆活。FanBox是我开源的一个macOS桌面产品,MIT协议,定位写的是「Coding Agent的驾驶舱」,左边浏览本地文件,右边内嵌Claude Code或者Codex,agent每改一个文件对应的卡片就亮起来。

问题是它现在所有的对外物料都是开发者语言,terminal、agent、repo、zero dependencies,而我50万读者里大部分人不写代码。这个产品其实是为不写代码但要指挥AI干活的人做的,我的读者恰恰就是这种人,所以很多人看完我的这个项目仓库后,也会搞不懂这个产品是什么,究竟该怎么用
想清楚向谁传播、重写文案、做落地页、剪一条片子,这四件事我拖了挺久了。一人公司的瓶颈从来不在开发。
所以我就把这件真活丢给它了。
像给员工布置任务一样
为了考验纳米Work,我这一波给的任务还挺狠的,我基本上像领导给自己的下属布置任务一样,把我做这个事的背景、目标、资料、限制都交给他了,并且要求他给我产出四个交付物。

先把整个过程放上来。这是它执行过程的录屏,思考和执行是并排展开的,它每一步在想什么、下一步要动哪个文件、跑了什么命令,全都摊在界面上。
我觉得这个「全程可见」本身就是产品的一部分。 现在有很多产品会把过程藏起来,或者只给你展现部分执行和思考的过程一旦结果不对,你完全不知道它是从哪一步开始歪的,只能重来。过程摊开的好处是你能在中途就发现它理解偏了,不用等四件东西全做完才发现方向错了。
它读完README列了一串产品事实,然后自己拐进了仓库里的docs/13。那是我很早以前写的一份产品思考,叫「创作者的最后一公里」,README里没有链接过去,它是自己找过去的,理由写的是这份东西跟白领定位直接相关。后来它还回头读了docs/01那份用户研究,用来给定位判断找事实基础。

思考链里有一句我看了两遍:「My judgment: The honest answer is nuanced.」然后紧跟着一个「But wait」,它在句子中间把自己刚下的判断往回拧了一下。这个产品要求用户在终端里跑Claude Code或者Codex,这确实还是开发者工具的交互范式,但等一下,它的受众是不写代码但要指挥AI干活的人,而花叔本人就正是这种人。
判断做完它才列执行计划,五步。

第五步里有一句:
「Constraint: no real people/live action — AI illustrations are fine but real UI screenshots are safer for facts.」
我给视频的限制原文只有一条「不要用真人出镜和实拍素材」,「AI插画可以,但真实界面截图对事实更保险」这半句是它自己往前推的。这条约束是在动手之前写下的,不是出了问题之后的补救,这个先后顺序后面还会派上用场。
同一段里还有一句是关于配乐的:「Actually, let me not over-engineer; check the skill quickly.」它在自己拦自己。我见过太多AI在这种地方一路加码,做一堆没人要的东西。
它先把我的人群假设切开了
四件交付物都做完了,但排在最前面的是这么一段:

「白领方向成立,但不是『所有白领』,是白领里已经在指挥AI干活的那群人。按『让市场部普通同事也用』理解就不成立——翻箱的另一半是跑在你电脑上的AI助手,一个只在网页里聊AI的人,没有使用场景,文案不能骗他。」
然后它列了真会用的三类人:用AI生产的个体创作者、不写代码的vibe coder、AI重度知识工作者,按契合度排序,每一类都说明了理由。
接着是这一句:
「明确不适合:普通白领(文件在微信/云盘里、电脑上没有干活的AI)。传播时不要向这个人群承诺。」
先说清楚一下,它这段说的是我这个产品不适合谁,不是纳米Work不适合谁。
这是我这次最意外的东西。我给它的原始需求是「面向白领工作者」,它没有照单执行,反而把我的人群假设切开了一半,还专门写了一句让我别向那半人承诺。
后面还有个我没要求它给的东西,它标了「两个我替你做了主、需要你确认的点」:一是门槛,用FanBox的前提是Mac上装了Claude Code或者Codex这类agent,它在落地页FAQ里诚实写明了而不是藏掉,理由是藏了只会换来下载了不知道干嘛;二是视觉,它说默认那套荧光绿终端风的皮肤和我的宣传图都很开发者,所以落地页和视频它换用了另一套奶油纸配赤陶橙的皮肤,但建议我自己想想新用户默认该看到哪一套。
一个能标出这两处是我替你做的主的东西,和一个把80%内容重写完但假装什么都没改的东西,差别是很大的。

四件交付物
文案部分它给的一句话定位是「翻箱FanBox:AI替你干活,翻箱替你盯着」,三个价值点是找得回、看得清、说了算,全篇没出现terminal、repo、dependency这些词,这是我明确要求的。它还顺手把功能的呈现顺序重排了。改动幅度它自己给了个数:产品一行不用改,文案重写80%。
落地页是个单文件HTML,2.4MB,所有截图内联成base64,双击就能打开,任何环境图片都不裂。用的是仓库里的真实素材,没有占位图(这条也是我要求的,AI做落地页最爱塞占位图)。
有个细节能说明「白领听得懂」这条硬指标它是真的在执行:落地页最后那句大标题写的是「访达帮你管文件,翻箱帮你看清AI在你的电脑上做了什么」。访达是Finder的中文名,我自己写文案多半会直接写Finder。
视频1920×1080、30秒、含配乐。
这几件我都当场验收了,能用。落地页那个内联base64的处理我挺满意,因为我自己踩过这个坑,单文件HTML交付物里图片走网络请求,在本地双击打开的时候必然裂。
你可以选择最好的模型
模型下拉打开是这样:

Kimi的K3、GLM-5.2、豆包seed-2.1、MiniMax M3、DeepSeek-V4,国内这几家头部模型公司最新的基本都在里面了,我知道现在很多人在订阅大模型公司的token plan的时候还挺担心的,生怕下个月最好的模型厂商就换人了,自己是不是又得重新订阅别家的。在纳米Work里的话,基本上就没这层困扰了,反正国产模型里强的它都会上,就选择当下最佳的就好了。我这两次任务全程用的都是Kimi K3,1M上下文。所以即使执行的任务很长,也没发现对话需要压缩或者执行不下去的情况。
那个「花叔-设计大师」
上面那条30秒视频,其实已经是它第二次给我剪片子了。
更早的时候我只丢了一句话过去:「帮我给这个产品做一个面向白领工作者的宣传视频」,后面跟一个GitHub地址,别的什么都没说。用的是专家广场里那个「花叔-设计大师」,我授权他们基于我开源的skill做的其中一个。

它先去读了仓库,拿README的时候撞了个404,然后自己判断可能默认分支不是main,改去查默认分支,拿到了。这段我看的时候有点想笑,因为main和master这个坑我前几天刚在另一个平台上踩过一模一样的。

很有意思的是它做的一次分工判断。那条片子五段分镜,开头结尾两个白领办公室场景是AI生成的(右下角有「AI生成」水印,合规做了),中间三段用的是仓库里的真实素材:一段官方宣传图,两段真机截图,git log、README原地预览、右侧终端,都是真的。

这和我Huashu Design里要求的规矩「真实素材优先、不能编造」完全一致。
这条片子的制作说明里写着:开头结尾两个白领场景由Seedance 2.0文生视频生成,配音是MiniMax的TTS,运镜和合成用的ffmpeg,背景音乐用的是CC-BY授权的曲子,作者名它署上了。
效果是这样的👇
三家模型厂商加一条渲染管线,跑在同一个任务里,而我一个key都没配。
说实话,这个制作能力比我自己的Huashu Design强不少...因为为了skill的适用性,我开源的时候尽量让我自己的skill不需要依赖任何的API,尽量只采用代码的方式生成,这算是个无奈的妥协。
但纳米Work这个产品确实就没有这个负担了,我看他们发布会上似乎提到他们接了上百家的工具和模型API,这确实是只有大玩家能干,并且这套东西可以对用户隐形。
所以,如果你在这里用花叔-设计大师的话,大概率能获得比在自己的agent上安装huashu deisgn skill更好的效果。
另外这两次我用的都是单个专家,但广场里还有整团的编队,产品开发、市场营销、自媒体爆款、全球CEO智囊团这一类,点进去是一支配好角色的队伍。我这次的活一个设计方向就够了所以没用上,那种从赛道判断到产品上线的完整链条才该整团雇。

手机随时接管
哦对,还有个重要的需要提一下,纳米Work设置里有个连接器面板,飞书、钉钉、推推、QQ这些都能接。

还有手机端。我在电脑上布置完任务出了门,那两个待我拍板的点是在手机上回的:

对我这种经常在路上的人来说,这个比多一个功能实在。活在云上跑,我在哪台设备上都能接管。会比现在在不同coding agent上切换更方便一些。
最后
如果只让我用一句话说纳米Work和普通AI的区别:它能组织一支AI团队,把一整套活干完,中途该驳回你的时候驳回你,然后把成品交回来。

想试的话地址是:Work.n.cn
我的建议是第一次就把话说全,把自己想象成一个领导,把你需求的背景,你想实现的目标,你的产品项目相关上下文知识。因为模型越来越强了,很多时候不给太多的限制,给他一个更自由探索和发挥的机会,反而能给你deliver更好的结果。
“Context,not control.”这套管理学理念在人和agent的协作中越来越成立了。