AI领域的这个iPhone时刻,大概已经成了垃圾时刻

23年11月7日,OpenAI在其首届开发者大会上宣布推出GPTs,让用户通过自然语言对话即可快速创建专用版本的ChatGPT。发布会上,奥特曼同时宣布了GPT Store即将上线,也就是汇聚了大量第三方创建的GPTs的分发平台(当然也可以成为变现平台)。

在当时,被誉为AI的iPhone时刻。

我一直认为,iPhone时刻这个词是不大精准的,因为iPhone本身并没有什么特别出彩的地方,真正让iPhone成为移动互联网风口的关键是AppStore时刻:这是一个:1、任何一个第三方都能开发提交app;2、app通过它分发;3、app如果想收钱,得通过它变现(即著名的苹果税);4、从此手机成为万用设备。AppStore才让iPhone形成了越多用户越多开发者越多开发者越多用户的良性生态,且,封闭。

OpenAI的GPT store看上去是有GPT生态的影子的。在自身大模型的基础上,形成越多用户越多开发者越多开发者越多用户,且分发/变现两大核心能力掌握在OpenAI手中。从这个角度而言,说成iPhone时刻,似乎也成立。

GPTs问世时相当火爆,三个月后,当GPTs store上线,GPTs数量已经跨过了300万大门,看上去大家热情很高。OpenAI也很看重它的生态带动,表示将在2024年Q1启动一项名为“GPT开发者收入计划”的补贴,即根据用户对其GPT的参与度向美国开发者支付报酬。

但这个iPhone时刻其实并没有真正到来。

国内大厂迅速跟进,并称之为“智能体”。

但这个智能体并不是我们今天很多人提到的智能体(agent)的意思。如果要做区分的话,那么它们可以被称为“轻智能体”,而现在科技圈里喜欢说的agent,才是真·智能体。

虽然,这波轻智能体的原点是GPTs,但后续的演进略有不同。GPTs的定位是轻量AI应用开发平台,其本质是是封装好的提示词+简易 RAG。国产智能体则以角色扮演、情感陪伴、星座娱乐、本土化轻工具为主,传播性强、门槛极低:

正因为门槛极低,国产轻智能体的受众并不小。部分用户还因为早期接触了这类轻智能体,慢慢养成了使用习惯。

国内大厂基于LLM的bot服务(聊天机器人)用户动辄亿起,这类轻智能体同样需要消耗海量token,商业上却又很难产生令人满意的回报。豆包、千问的海量轻智能体,你稍微浏览一下就知道,说一句没有一个所谓智能体会让你产生掏钱的可能,不能算很夸张。

道理就在于,生成这样一种轻智能体,实在太简单了。

上周,豆包千问均宣布,将于7.15下架所有UGC轻智能体。具体做法略有不同,但在未来,各自的app里“智能体”这一入口,应该是看不到UGC的轻智能体了。可能再过一阵子,这个入口都很难找到。

一般都理解为是响应4月有关部门发布的《人工智能拟人化互动服务管理暂行办法》。因为明确提出将于7.15起正式实施该法规。

但这个法规显然只聚焦于拟人化互动,而不是覆盖所有。但大厂们的应对则是:UGC全部下架。

所以我一直解读为:借助新规实施,就坡下驴,体面撤退。

道理除了实在是找不到商业化可能却徒背巨大消耗外,还有一点很重要:bot正在把这类轻智能体全部“吃掉”:即覆盖了轻智能体的功能。

在bot中,你还有什么必要调用一个叫“拍照识物”的轻智能体呢?又有什么必要调动一个叫“小学数学作业批改”的轻智能体呢?

这些年AI的发展,基本形成了两个路数,bot(聊天机器人)和agent(真智能体)。bot的覆盖范围越来越广,这和其自身能力越来越强有关。比如ai搜索这个路径,我一度也是perplexity的付费用户,但确实也感觉,似乎没有什么必要专门搞一个ai搜索的app了。

有四个前赴后继的所谓“工程”概念:prompt engineering、context engineering、harness engineering和loop engineering。至少第一个提示词工程,第二个上下文工程,当下的热议度和当初刚冒出来时完全不能相提并论(当然我并不是说它们已经完全过气没有价值)。

我依稀记得,当初甚至有人提出过一个新工种:提示词工程师。这个职业主要就是想出更好的指令,以便于ai给予更好的反馈结果。但随着大模型的意图识别能力的加强,人类这一侧,指令变得越来越傻瓜化。恐怕,提示词工程师作为一个“职业”真的也就是过眼云烟了。

国内的第三方轻智能体已在被清退的路上,国外GPTs也在被OpenAI边缘化。

GPTs 刚推出时的核心卖点有三:预设提示词与人设、挂载私有知识库和调用专属工具。当下,这三项能力都已经被原生bot内化,几乎没有什么必要调用专门的GPTs。

而这三个核心卖点,其实在国内大厂的bot里,也已经完成了内化:

看看这些bot的发消息框的一堆配置就知道了。

最后稍微说一下这个拟人化的垂类AI。

在国外,最著名的就是Character.AI。这个全球最大的AI角色陪伴平台大概有2000万月活用户,目前已经放弃自研基础大模型(当然也就估值腰斩),转向为产品体验与安全合规。

24年年营收仅为3220 万美元,今年预计约6010万美元,未盈利。部署广告服务引发免费用户剧烈不满,因为情感陪伴需要沉浸感,广告入侵显然极度破坏用户体验。

这个最大的平台24年谷歌以27亿美元“人才收购 + 技术授权”模式接盘,极有可能最终无疾而终。

另外一个则是Replika,被视为长期记忆能力做得最好的服务之一,走“单一人设、深度情感联结”路线。注册用户过千万,但付费率远超character.ai,年入3000万美元左右,但由于其团队很小,算力成本被压得很低(有报道说单次30轮长对话的算力成本25年降低至0.0003美元),已持续盈利。跨会话长期记忆是它的核心优势 ,故而Replika可以持续积累用户的生活细节、偏好、过往经历,形成真正的 “长期关系感”。

规模而言,Replika并不大,这两年也未听说其高速增长,大概可以归为“小而美”的垂直产品。

Pi属于维护型产品。

韩国的Zeta是一匹黑马,AI小说式陪伴产品,走叙事型路数,今年在日本市场有爆发,月流水近200万美元,Q1的收入增速为全球第一。

总得看来,大平台character难以为继,小平台replika美但不大,Pi和死亡没什么区别,Zeta可能走不出东亚区域。

中国嘛,本赛道大概是over。

—— 首发 扯氮集 ——

AI 时代 我们该怎么读书 顺便介绍一个小工具

总体而言,本篇不涉及文学作品。比如小说这种东西,另有读法。

读前提示,本文略长,公号后台统计说,四千余字。

所谓开卷有益,大体是正确的。读书当然有好处。

但书本身只是一种载体,承载着他人智慧的载体。要是把这个载体等同于智慧,那就是佛家所谓的“着了相”,是人类制造的一大幻觉。

禅宗有个著名的“指月之喻”:手指头指着月亮指出月亮在哪里,但手指头本身,绝不是月亮。

所以,对书籍这种载体别太迷恋,以至于到了还非说纸质书比电子书“高级”的地步。

事实上,书籍并不在知识界内处于顶端的位置。我当初刚读研时,还很好奇为啥老师上课时提到的某些大牌教授出书不多(但绝不是零),想找点其人著作就没多少。老师告知曰:还在活跃的大牌教授以写论文为主。当你看到一个教授一本接一本的书出的时候,这个教授大约就是快退休了。老师还反复教育我:有时间多看论文为宜。

今天这个时代,著作等身没什么了不得的。出书的门槛,比发顶刊论文,低多了。

所以,我先建立一个大前提:在当下,别把书籍这种载体,太当回事,它一点不神圣,也没啥特别的意义在。

要害是:把关。

面向公众发表内容这件事门槛越低,总体质量就越需要小心。顶刊的论文把关很严,相对来说靠谱性最高(当然我不是说百分百)。书籍在把关审核序列里是排名靠前的,所以书籍总体来说,比一般媒体文章靠谱。网文的序列最低,所以越需要小心——比如我这篇文章就约等于零把关。

同样的,不同出版机构厂牌也代表着不同的把关度,不同的媒体厂牌也代表着不同的把关度。在这个意义上讲,把关二字,即专业。

这个理念说穿了一点也不神奇,但在具体应用上,有着肉眼可见的好处。此文后面我会介绍一个小工具,基本出发点就是利用了这个理念。

但不得不承认这样的事:买书如山倒,看书如抽丝。这种状态极其常见,以至于有些人会秉持买了就算看过了的自我安慰心理。归根到底,因为书是一个人脑算力与计算标的有着巨大矛盾的东西:1)计算标的是《量子物理学教程》,我一个文科生脑袋算力处理不了,这个叫超纲(芯片不行);2)计算标的是《鲁迅全集》,18卷700万字,信息太多,算力处理起来极累,这个叫超量(存储不够)。超纲超量的结果都是一个:放下。

面对前一种情况,要明白人类世界总有些东西是你无法理解的,这并不值得多么沮丧。而且非要去理解也不是不行,一步一步来,直接从一楼到二楼跨不上去,搭个梯子一个台阶一个台阶上总可以。但通常的问题是第二种。

这就是我一直说的,书作为一种内容,颗粒度太大。你需要降颗粒度,也就是必须把它碎片化。

别惊讶,很多人说碎片时代碎片信息碎片注意力,一提到碎片,似乎就是坏词。对碎片不加区分地攻击,纯属装逼性质的扯淡。系统理解系统掌握也是一个碎片一个碎片这么积累起来,想想你小时候读书是不是这么过来的。

哪里只有千里没有硅步的混账道理。

划线其实就是一种“碎片化处理”。划线大多数是出于“这句是金句”、“那句是重点”的意图,当然也夹杂着“划过就是记住了”这类类似买了就是看了的心理状态。

可能是从小这么教育出来的缘故,很多人成年后读书依然喜欢划线,以至于微信读书把它做成了一种社交功能:你能看到别人划的线。这个功能甚至产生了某种现实幽默:有人发现波伏娃的《第二性》起手章节划线很多,越到后来划线越少。这本大名鼎鼎的煌煌巨作,看来开了卷能看到底的人,还是少数——算力不足以承担计算标的。

微信读书还做了批注的社交功能。也许真有人喜欢在读书的时候“社交”,这玩意儿就像视频的弹幕功能,不仅将颗粒度极大的视频内容降颗粒度——我表示这几帧画面很好笑但我并不是表示整个视频很好笑——还能引发共鸣。我个人对读书社交化有着强烈的不适。不过也不奇怪,我连视频弹幕都很少看。我并没有孤独到要用这种方式来找共鸣的地步。

微信读书有个skill最近挺热门,据说还被顶上了热搜。这个skill看介绍说是能帮助你提取各种阅读过的划线和批注。然后加以整理,重新组织这些阅读痕迹。

我因为没有划线批注的习惯,所以没有试用过。但重组阅读痕迹,确实是一种重组小颗粒度碎片的做法。

我们来看一下一类书籍:教材。

一本标准的教材撰写风格就四个字:述而不作。教材编写者是没有立场的,也是没有观点的。ta要做的事,就是在既定领域里,把张三李四王五赵六的看法综合起来。这些看法全部来自于各自的学术专著或论文。教材就是一种提取碎片然后加以整合的工作。

而好的教材则是在这个基础上,将可能晦涩难懂的学术观点加以不失原味地浅显化表达出来,或者不一定浅显,但有一定的阅读体验。好的教材还是要讲点文字表达能力的。

但有一点确实要承认,教材在这两个步骤里,会丢失部分信息。比如张三的看法,有着庞杂的推导过程,这一部分可能会被教材略去。教材也有可能用一些案例、比方来说明张三的看法,可能未必能百分百对应。所以,如果一个读者真得想全盘了解张三的看法,教材只是一个勾子。但如果只是想略微掌握一下并没有深入的意思,其实教材确实是够了。

这就是碎片和系统的关系。

教材用一个界面(教材这本书)在整合展示既定领域里海量书籍的信息(这里还有一定的把关成分,有些观点完全不值得介绍,有些观点需要浓墨重彩一下)。它帮助读者降低了计算标的,让读者的算力足以能去处理。明白了这件事,你就能明白接下来我要介绍这个工具的意义。

这个工具其实是一个知识库性质的。。。软件(其实它是一个agent,功能很垂,就是文档分析)。市面上不是没有成型的知识库,比如腾讯出品的IMA。但我觉得友人风端介绍我并强力推荐的这个agent更好,唯一的缺点是需要支付点散碎银子,但真得是散碎银子,不值一提的那种。

首先,下载安装claude desk。去a社官网获取。

其次,下载安装cc switch。去github获取。

最后,获取deepseek的api,略微充点钱(比如我充了200块)。

经过一番简单配置,你就获得了一个agent,风端命名为“脚手架”,他甚至还给这个脚手架做了一个skill来完成向量化运算。但考虑到他的这个skill对显卡要求很高,我的m4跑过一次,机器从来没那么烫过,就没怎么用过。

早期的claude desk可以很方便地在其中调用第三方大模型(比如deepseek)的,但现在的版本基本关掉了这个通道。所以需要一个cc switch来开一个后门。之所以要调用ds,道理很简单:性价比最高。ds的token价格只有a社的八十分之一,而且这点也很重要:你在使用这个脚手架的时候,完全不需要什么额外的上网工具。

脚手架的核心原理就是它不使用web search。在这件事上其实我迷糊了很久,后来自己想出了一个炒菜的比喻:使用bot就是菜得ai自己找,然后它炒菜。使用这个agent,原料变成我自己找的,然后它炒菜。

当你提出某个需求时,bot会去互联网上找各种信息(找菜)拼凑一个答案给你(炒完装盘),但其实web search有很大的问题,ai缺少鉴定好坏的手段——它只知道概率。但使用agent,往一个指定的workspace扔一点书,让ai就这些书里的信息进行回答,会靠谱很多。因为书籍本身就已经有把关过程了。菜是我找的,我依赖的,只是ai的炒菜能力——归纳、推理诸如此类的能力。而这些能力,人脑是完全不能比的。

我对硅谷那边诸位ai大佬之间的恩怨情仇有很强的八卦需求,我特别想吃这类瓜。

但如果你直接问一个bot——比如gemini好了,告诉我一下奥特曼、哈萨比斯、马斯克之间的瓜,一来可能料还是不够多,二来bot经过一番web search,未必可信。

大量的传记书会记载这些事。由于有着层层把关的程序,基本上可以相信这些事确实发生过。但由于传记有着各自不同的立场,所以叙述方式会不同,侧重点也不同。阅读大量的传记确实是一个好法子,但极有可能,人脑的存储无法承担,也就是看过就忘,或者模模糊糊记得。

有了这个脚手架,这个需求就会被非常容易地实现。我在授权文件夹workspace里放入了一些ai传记书籍,然后我和agent有如下对话:

agent其实洋洋洒洒写了六大点,后面还进行了四个层级的分析,太长了,就不展示了。

类似这样的需求,是可以让谷歌家的notebookLLM实现的,但我试过,路径通,但效果一般。也许和工程能力有关。风端的看法是,claude desk拆解你指令转化为若干任务的能力极佳,最好当然是用它家模型,但价格差异如此之大是不得不考虑的。deepseek v4 pro的能力可能是性价比最优的。

可以把这个吃瓜需求进行推演,比如说,你想了解某公司十年以来的财务表现。问bot可能真会出现幻觉,但你用这个agent,在文件夹里放入十年半年报、年报的pdf文档,这是一个非常好的利器,因为它不会web search。

这是一个知识库工具,但我不认为它可以替代读书。

它能做到的事是,让你读书变得更为快速。我自己一向有“不求甚解”的心态,看到比较烧脑的内容,我会跳过——我一向认为反复纠缠于个别烧脑内容,是会摧毁你的读书习惯的——可能会动用书签夹一下,提示自己有空有心情的时候再来好好用用算力。

重要的是先了解个大概,然后愿意的话,细细琢磨。这套脚手架给我这个习惯提供了很大的助力。以前的书签都白夹了,我很少真会有那个好好用用算力的时刻。但现在,这些锚其实是有用武之地的。

更重要的是,它能做到破壁。若干本书中的信息点被打碎,然后重新组合。这是电脑远超人脑的地方。但前提是,你得先了解个大概,否则你大概只会提一个问题了:这本书讲了什么,给我归纳一下。

文学作品,不是这么读的。体验文学作品,ai几乎是没用的。

我举个例子。

有个叫“小雨的名著时光”的up主,最近分享了他对水浒传中一句话(够碎片了吧)的看法。这句话出现在林教头风雪山神庙这一节中,原话是这么写的:“把尖刀插了,将三个人头发结做一处,提入庙里来,都摆在山神面前供桌上”。

这个up主有同名公号,我简单搜了搜,他撰写的和风雪山神庙分析的文章里,没有提到这个细节。他的同名视频号也没有这个内容。我就这里简单归纳一下:

up主说,为什么要写三个人头发结做一处呢?直接写“把三人首级摆在山神面前供桌上”不就完了吗?因为首先要说明林冲打算就跑一次,而不是先拿两个头进去,再拿一个头进去,而是打算一次性带进去完事,表明林冲内心其实是有些担心被附近人撞见深怕逗留太久的。而人的头颅其实重量不低,三个加一起得有大几十斤重,且鲜血横流容易脱手,加之雪夜极冷,需要一点额外的法子,才能一次性带上三个头进庙里。把头发结在一处,单手就能提上,另外一只手还可以继续拿着武器以防不测——再次提醒读者林冲心中的戒备。讲者表示,施耐庵绝对是有具体经验的,没这种经验根本写不出“三个人头发结做一处”这种细节。

我知道水浒传那种写实主义风格的残忍,武松飞云浦之后的各种表现,你读得稍微慢一点就可以品出来。但像这位up主这么分析这一句话,确实没做到。回头再去体验体验,细品细品。

雪夜山神庙入选了当下统编版语文课本,供高一年级下学期学生学习。不晓得今天的语文老师敢不敢在课堂上这么给一堆未成年人做如是分析。

文学作品是这么读的,所以ai帮不上,但依然还是那句话:碎片不是罪恶。

—— 首发 扯氮集 ——