花叔最近又干了一件非常符合他个人风格的事儿。
前几天闲着没事刷GitHub Trending的时候,无意间瞅见一个项目仅仅花了三天时间就冲上了两万八千颗星,名字叫做女娲,作者正是花叔,也就是之前弄出小猫补光灯的那位,曾经在AppStore付费榜上拿过头名的独立开发者。这人的项目有这么一个特点,起的名字往往都特别宏大,不过你仔细去琢磨他做的事情,还真的不是什么花架子。
女娲这个名字取自于咱们中国的神话传说,就是那个凭借泥土来造人的女神。而花叔所使用的泥土则是公开信息,造出来的并不是真正的人,他本人把这玩意儿叫做「镜子」。这话听着感觉多少有点玄乎,不过你接着往下看也就清楚他到底想干嘛了。
整件事情的起点其实是另一个项目,名字叫做同事.skill,同样也是近来在GitHub上爆火的项目,把离职同事给蒸馏成AI Skill,短短几天时间就突破了五千星。花叔看到这个项目之后提出了一个问题,我个人觉得这个问题提得相当到位,既然咱们现在已经具备了蒸馏人的能力,为什么仅仅只去蒸馏身边的同事呢?去把各个领域的头面人物给蒸馏一下难道不好吗。
像是芒格、费曼、马斯克、Naval还有乔布斯这些人物,他们留下了数量庞大的公开材料,无论是著作、演讲、访谈还是社交媒体上的发言,统统都是可以被提取出来的素材。同事 Skill 蒸馏的是人去干什么,而女娲蒸馏的则是人怎么去思考。
我先是亲自上手试用了一下,让它蒸馏一个Naval。系统跑了几分钟的时间,随后就生成了一个完整的Skill文件。我试着向它抛出了一个问题,说我同时想要开展自媒体写作、写书以及做独立开发的工作,感觉精力实在是不够用。
Naval的Skill回复我说,你列举了三个欲望,而每一个欲望其实都是你跟不快乐签订的一份合同,并不是精力不够,而是合同签得太多,问问你自己哪一个做起来你会进入忘我的状态,那个就是你的特定知识所在,不是三选一,而是先一再一再一,串行复利而不是并行内耗。
说句实话我当时确实愣了一下。这个回答的框架确确实实属于Naval,欲望即合同,特定知识,串行复利,这些全都是他在播客和推文里面反复提及的核心概念。它不单单是机械地复读语录,更是借助Naval的认知框架来对我的问题进行分析。
接着我又试了试马斯克。问它要是SaaS产品获客成本太高应该怎么处理。马斯克的Skill回复我说,先别去想怎么降,先去算一下物理极限,获客的极简必要动作到底是什么,用户从知道你到最终付费,信息传递的理论短路径是什么,现在你的实际路径又是理论路径的几倍,要是超过了3倍,那么中间一定存在可以砍掉的步骤,不是去优化漏斗,而是质疑漏斗本身究竟该不该存在。
渐近极限法,从原理一直拆解到物理边界,质疑系统本身而不是去优化系统内部。这套思维方式你去看马斯克的采访和传记,他每次遇到工程问题都是走的这个路径,从Tesla的电池成本再到SpaceX的火箭回收。女娲抓取的是他的思考骨架,而不是某一句特定的话。
让我觉得挺有意思的地方在于,把乔布斯蒸馏出来之后去问它OpenAI和Anthropic究竟谁的大方向更对头。乔布斯的Skill直接就说,你这问题本身就问错了,这压根就不是一场关于方向的比拼,而是一场关于品味的较量,OpenAI看起来就像是1985年的微软,什么领域都想做而且什么都想要赢下,选用这种策略确实能拿下市场份额但是根本不可能把每件事都做到insanely great,Anthropic则更像是早期的Apple,讲究的是聚焦,Focus means saying no to a hundred good ideas,不过这两家公司都犯了一个我绝对不会去犯的错误,那就是他们都不去控制硬件,到最后能赢的或许会是那些同时把芯片模型还有用户界面都控制在自己手里的人,你猜现在谁在同时做这三样事情呢,就是Apple。
聚焦也就是说不,端到端进行控制,拼的是品味而不是拼方向。你根本不用去翻资料也能明白这就是乔布斯的思维框架,从他1983年谈到的位置一路到1997年重返Apple大砍产品线然后再到2007年iPhone正式发布。女娲所提取出来的其实是乔布斯看待世界的那副镜片,而不是单纯在模仿他怎么讲话。
那么女娲到底蒸馏出来了些什么东西呢。它一共提取了五个层面,分别是怎么说话,怎么思考,怎么判断,什么不做,还有知道局限。在这五个层面里我觉得后面两层才是最核心的关键。什么不做,指的就是反模式和价值观的底线,好比乔布斯绝对不会说「我们先去做个市场调研看看用户到底需要什么」,马斯克也绝对不会说「这个方向成本实在太高了我们还是换一个吧」。知道局限,则是每个生成出来的Skill都会明确标注清楚自己究竟做不到哪些事,蒸馏不了直觉,框架能够提取灵感但是没法捕捉突变,这仅仅只是截止到调研时间点的一个快照;而且公开表达并不等于就是真实的想法,只能凭借公开信息来作为基础。
花叔在README里面写了一句话,我觉得这句话简直算是整个项目的灵魂所在了,一个不告诉你它的局限究竟在哪里的Skill,根本就不值得你去信任。
我来聊聊具体应该怎么去使用,毕竟这个东西在安装还有使用上的门槛确实非常低。
你只要打开目前正在用的AI agent,不管你选用的是Claude Code、Codex、Cursor还是其他的什么工具,直接告诉它帮我把这个skill安装上,把GitHub链接丢给它就行。或者借助命令行,npx skills add alchaincyf/nuwa-skill,就这一行命令,它就能自动识别你当前在用的工具然后把文件放到正确的目录里。装好之后你再说蒸馏一个保罗格雷厄姆,或者说造一个张小龙的视角Skill,它就自动开始跑了。
造完之后就能直接调用,用芒格的视角来帮我分析一下这个投资决策,费曼会怎么去解释量子计算,切换到Naval我正在纠结三件事。就是这么简单。
那么应用场景究竟在什么地方呢,我试着拆解一下。
头一个场景,就是你在个人做决策的时候把它拿来当做认知陪练。你要是纠结到底要不要跳槽,别去问ChatGPT让它给你列什么利弊,而是蒸馏一个张一鸣问问他怎么看待,然后再蒸馏一个Naval问问他又是怎么看待的,这两个人给你的框架大概率是不一样的,张一鸣可能会从组织还有平台杠杆的角度切入,Naval则可能会从财富杠杆以及特定知识的角度切入,你把这两个框架放在一起进行对照,自己的决策也就变得清晰了。一个人想问题往往容易钻牛角尖,两套不同的认知框架放在一起交叉验证,可比一个人闷头想靠谱多了。
第二个场景,开展内容创作的时候借助它来生成独特视角。要是写文章缺乏灵感,不晓得从哪个角度切入,那就蒸馏一个MrBeast问问他这个选题会怎么做内容,再蒸馏一个Paul Graham问问他怎么把这个话题写成一篇让人想转发的essay。这个用法的核心关键不在于让AI替你写完,而是让你借助别人的脑子换个角度,最终出来的东西依然是你自己的判断和表达。MrBeast的Skill被评了97分保真度,Paul Graham同样也是97分,框架提取的质量确实能够当作参考来用。
第三个场景,学习一个新领域的时候运用主题Skill来补充认知。女娲已经蒸馏了一个X导师主题Skill,专门针对X/Twitter运营的方法论。你不用去报课购买训练营,把一个领域的优秀实践蒸馏成Skill,对着它进行提问,比刷两百条短视频碎片信息密度高太多。当然这取决于你蒸馏的源材料质量,垃圾进垃圾出这个道理在AI时代依然是成立的。
第四个场景我觉得挺有意思,那就是团队管理。作为一个团队负责人,想要给团队建立一套决策框架却不晓得怎么系统化,那就蒸馏几个你佩服的管理者,看看他们的决策启发式是什么,把适合你团队的那几条挑出来,沉淀成你自己的管理Skill。这个东西不光是给自己使用的,更是可以当成团队认知资产传承下去的。
说个细节我比较认可。女娲的工作原理并非简单抓取,它分做四步来进行。头一步六路并行采集,著作播客访谈社交媒体批评者视角决策记录人生时间线这些维度,6个Agent同时跑各自存档。第二步三重验证提炼,一个观点要是被收录为心智模型,必须跨2个以上领域出现过,必须能推断对新问题的立场,必须不是所有聪明人都会这么想的,三条都过才收录。第三步构建Skill,3到7个心智模型加5到10条决策启发式加表达DNA加价值观与反模式加诚实边界。第四步质量验证,拿3个此人公开回答过的问题测试,方向一致才通过,再用1个他没讨论过的问题测试,Skill应该表现出适度不确定而非斩钉截铁。
到头来那个测试设计我觉得是真用心了。拿没讨论过的问题测,要是Skill回答得斩钉截铁说明它过拟合了在编,要是表现出适度不确定说明它真正学到了这个人的认知边界在哪。这跟蒸馏同事完全不同,同事Skill蒸馏的是工作流程和知识库,女娲蒸馏的则是认知操作系统。
目前已经蒸馏了14位人物加1个主题,Paul Graham、张一鸣、Karpathy、Ilya Sutskever、MrBeast、特朗普乔布斯马斯克芒格、费曼、Naval、塔勒布张雪峰孙宇晨,再加上X导师主题Skill。全员通过了独立双Agent盲测的保真度评分卡,低分马斯克89,高分97,没有一个低于85分。
这事的本质我觉得其实得这么看。以前咱们把AI当成工具来用,主要是让它帮忙干点咱们不想干的事。但女娲这个路子呢,是把AI当成容器来用,把别人的思维方式给装进去,然后让它替你进行思考。工具能帮你省下时间,而容器能帮你换个视角。
花叔手里还有另外一个项目叫达尔文.skill,能让所有的Skill持续不断地进化,借助自主实验循环来开展批量优化工作。女娲负责把Skill造出来,达尔文则让Skill进行进化,这俩完全是配套的。
MIT协议,大家随便用随便改随便造就行。项目地址我放在来源里了,要是感兴趣的话就可以自己去看看。
我个人的判断是这样,女娲这个项目的核心价值其实不在于它现在蒸馏了哪14个人,而在于它证明了一种可能性,那就是人的思维方式是能够被结构化提取出来的,并且提取出来的框架还具备实际的分析预测能力。这个方向比起让AI去模仿人的说话方式要深一层。说话方式只是表面,认知框架才是操作系统。
当然它也存在局限,README里面很诚实地标注了,没法蒸馏直觉,捕捉不了突变,而且公开表达也不等同于真实想法。这些局限反倒让我更加信任这个项目。一个把做不到什么清清楚楚写在脸上的工具,比起一个声称自己什么都能搞定的工具,要靠谱得多。
