HeadlinesBriefing favicon HeadlinesBriefing.com

小模型:AI新前沿

Hacker News •
×

过去几周,我一直在玩gpt-5.6-luna。它能力惊人,速度快,又聪明。我经常看到它每秒处理约100个token,并快速浏览我的代码库、电子邮件和知识库。当然,luna最大的特点是成本。我尝试运行一些相当复杂的研究线程,但很难产生高额账单。即使让它搜索数千封电子邮件,API成本也只有几美分。有了GLM 5.3,我们甚至在帕累托前沿有了一个新选项。

在做编码工作时,我几乎总是选择最昂贵、功能最强的模型(Fable 5、5.6 Sol)。所以很容易忽视小型快速模型取得的进步。我交谈过的几位投资者提到:“奇怪的是,我们没有看到更多的消费级AI公司。这是为什么?”答案很简单:token成本。

在AI出现之前,大型消费应用的剧本是这样的:创建一个有吸引力且运行成本相当低的网站,吸引大量用户(通常通过某种病毒式传播),筹集资金,扩展到更多用户,创建广告市场。这大致描述了大数大型消费公司(Google、Facebook、Snapchat等)。但如果你想为产品添加AI呢?现在,每个请求都有实际的推理成本!突然之间,所需资本量急剧增加。

我的一个宠物评估是建立一个每日新闻网站,为我个性化:在互联网上研究@calvinfo,找出他们可能喜欢的新闻,建立一个微型网站,展示今日头条,为他们个性化,搜索hn、reddit、twitter等。使用上一代模型(Sonnet类),你大约要花1美元才能得到结果。对于消费应用来说,每月收费30美元是不可行的。这里有很多可以优化的地方,但如果你收取WSJ或经济学人那样的费用,你最好提供类似的价值。但看看luna,结果相当不错,平均成本约为0.10美元。现在我们有话可说了!

我认为这在商业领域更有趣。我和我的Segment联合创始人Peter最近在一次徒步中比较了笔记。在他的各种初创公司中,Peter看到了两种工作:“智商180”的工作(某个疯狂科学家天才类型提出你从未想过的疯狂解决方案)和“token喷吐者”的工作(超级响应,在几十个不同战线上推进)。Peter经营多家公司。除了Segment,他为Charm Industrial筹集了超过1亿美元,最近刚刚为Revoy完成了A轮融资。他非常有条理,时间利用效率极高。然而,Peter提到他约95%的工作属于第二类。就是接电话、催促别人、防守和进攻。需要说明的是,Peter说如果没有一个智商180的技术头脑解决深层问题,他的公司今天就会陷入困境。只是他的大部分工作属于第二类。

我认为对“前沿级”模型的需求将继续增长,特别是对于需要新颖突破或发现的领域(工程、硬科学、模型训练)。但我也认为对“快速/便宜/足够好”模型的需求即将起飞。想想你每天互动的人:同事、供应商和客户。十有八九,你想要一个超级响应并为你处理事情的人。如今公司中大多数“人类token”都花在这方面——招聘严重偏向快速/便宜/足够好的原型。要让快速/便宜/足够好的模型成为商业现实,还有很多工作要做:新的工具、提示注入安全、角色和权限。但我相信我们会解决的。如果你也在尝试让小型模型变得有用,请给我留言。Amazon和Netflix是明显的例外。Peter在这里也很谦虚;他非常敏锐。