AI客服一开口就露馅,这家公司想用小模型让你分不清人机

打客服电话,对面接起来的是个AI,大部分人三秒钟就能听出来。露馅的地方往往不是音色——现在的合成语音已经足够干净了——而是节奏。你说完一句,它要顿一下才回;你想插一句,它照着自己的稿子往下念。那种”轮到你了、现在轮到我了”的机械感,一下就把幻觉戳破。

Smallest.ai 联合创始人团队
Smallest.ai 创始团队,左一为创始人兼CEO Sudarshan Kamath|图片来源:TechCrunch

一家叫 Smallest.ai 的公司,正是冲着这半秒钟的尴尬去的。它2024年底才成立,刚刚拿到1300万美元A轮,由 Seligman Ventures 领投,Sierra Ventures 和 3one4 Capital 跟投,累计融资超过2100万美元。

它赌的不是大模型跑得更快,而是换一条路

行业里解决语音延迟的主流思路,是想办法把大语言模型的推理压得更短。Smallest.ai 的判断反过来:下一跳不会来自把大模型加速,而是来自专门为人类对话造的小模型。

创始人兼CEO Sudarshan Kamath 解释他们的模型是怎么设计的时,用了一个特别日常的比方。

我跟你说话的时候,你其实已经在想了,如果我讲太久,你甚至会打断我。

听、想、说这三件事,人是同时干的。而大模型不是。Kamath 说,大模型的工作方式是你把一整段提示词交给它,它才开始思考。这点延迟放在文字聊天里没人在意,放到语音对话里,哪怕一小段静默都显得不自然——”你想想我们现在怎么讲话的,我不会把一大段音频剪好丢给你,你再开始想。”

小模型顶前台,大模型在后面待命

Smallest.ai 的产品结构是这样的:小语音模型充当实时智能层,负责在特定话题范围内跟客户自然对话,响应几乎没有延迟。一旦碰到超出它知识边界的问题,就把这个问题移交给大型基础模型,同时礼貌地请客户稍等,说自己去”查一下”——跟真人客服的处理方式一模一样。

Kamath 相信这会变成所有语音智能体的标准架构:一个负责实时交互的小语音模型,加一个按需唤起、解决复杂问题的”离线”大模型。

因为只做语音,它优化的东西也跟通用大模型不一样,全是些细碎但要命的场景:

  • 各种口音都能听懂,不挑发音标准的用户;
  • 支持几十种语言;
  • 在有背景噪音的环境里照样工作。

客户名单里已经有 RingCentral 和 Truecaller

目前 Smallest.ai 的客户主要是语音领域的公司,包括 RingCentral 和 Truecaller。Kamath 认为,任何做客服的公司都是潜在客户,包括 Sierra、Decagon 这类新兴的AI客服创业公司。

有人会问:这些公司自己融了那么多钱,为什么不顺手把语音模型也做了?Kamath 的回答挺实在——对客服创业公司来说,把语音这一件事做到极致,是对主业的分心。

它要面对的对手也不轻松。语音AI这条赛道上,ElevenLabs 是公认的头部,另外还有 Cartesia,以及像 Sarvam 这样专注本地语言的区域玩家。不同之处在于,一些对手把语音AI用在配音、播客这类内容生产场景上,而 Smallest.ai 只盯着面向企业的实时对话智能体,别的一概不碰。

我们想让模型打破图灵测试。你跟它说话,应该分不出对面是人还是AI。这是公司唯一的目标。

这条路走不走得通

把话说回来,语音交互的瓶颈从来就不是知识储备。一个客服机器人需要懂的东西其实很有限,它输就输在反应的时间差和对话的节奏感上。行业主流还在往参数上加码,而 Smallest.ai 挑的是另一个维度——谁能先把那零点几秒的空白抹平,谁就先摸到这块市场的门。

风险当然也在这里。小模型意味着能力边界明确,一旦频繁触发”请稍等我查一下”,那种真人感照样会碎掉。移交给大模型的那个瞬间处理得够不够顺滑,可能才是这家公司真正的技术门槛。

📎 原文来源:Smallest.ai raises $13M to build ultra-fast voice AI that sounds genuinely human — TechCrunch

评论

2 条对“AI客服一开口就露馅,这家公司想用小模型让你分不清人机”的回复

  1. MWTAH51627 的头像
    MWTAH51627

    做过一年呼叫中心的外包,最烦的不是AI答不上来,是它非要等我说完整句才反应。人跟人讲话本来就是抢着来的,谁会规规矩矩等对方句号。这家把小模型当前台、大模型当后台的拆法,方向上比一味压大模型延迟靠谱。

  2. PRFKY42165 的头像
    PRFKY42165

    疑问点在移交那一下。真人说“稍等我查一下”,中间还会有键盘声、嗯啊两句,节奏是连着的;AI一旦切换到大模型,往往就是一段死寂再突然开口,反差比原来更明显。这个衔接做不好,前面省下的半秒全白搭。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注