一家做「AI 审美裁判」的公司融了 790 万美元,530 万用户在给模型打分

去年还没毕业的时候,Grace Li 和几个大学同学捣鼓一个 AI 游戏引擎。模型能把游戏跑起来,功能也都齐全,可问题是——没一个好玩。这下把他们难住了:一个游戏好不好玩,到底该怎么判断?

他们最后想明白一件事:这种判断没法交给机器,只能靠人。于是几个年轻人开始琢磨,怎么把”真实人类的好恶”大规模收集起来。这个念头后来长成了 DesignArena,一个今天在全球有 530 万人在用的 AI 工具。

“它是很多模型在设计这件事上往前走时卡住的那个瓶颈,”Li 说,”大概一周后,我们就和一家前沿实验室签下了第一笔大单,后面的事基本就成了。”

把”哪个更好看”做成一门生意

普通用户用 DesignArena,感觉有点像在用高级版的模型路由。你在一个类似 ChatGPT 的窗口里写下需求,再选好格式和风格,系统就会甩出一组”A 还是 B”的二选一,让你一路比下去,直到把几个产出从好到差排个序。

真正值钱的其实是面向企业那一侧。正在被评估的模型可以把这个平台当成源源不断的即时反馈源——用来打磨自己生成图片、网页这类”媒体”的能力。而打分的人往往根本不在乎自己评的是哪个模型,他们只想要最好的那个结果。这种”无偏见”的排序,正好能告诉实验室:用户到底想要什么。

DesignArena 的 A/B 评分界面
DesignArena 的 A/B 评分界面(图源:TechCrunch)
  • 公司主体叫 Intelligence,本轮 790 万美元种子轮由 Index Ventures 领投,Conviction、A*、Valkyrie 等跟投。
  • 平台目前年经常性收入(ARR)已达 6000 万美元,成了行业里关键的人类主导评估数据源。
  • 用户必须登录才能拿到产出,于是公司还能追踪不同大洲、不同时间的”口味”变迁——比如亚洲的网页仪表盘普遍更追求满屏的信息密度。

人肉打分能补上自动评测的漏洞

这套玩法是对自动基准测试(benchmark)的重要补充。跑分可以铺得很大,但也容易被刷、被钻空子——上周那起 Hugging Face 被黑的事件,就把这种脆弱演示得淋漓尽致。不过,靠众包人类反馈也不是稳赢的买卖。

和它思路相近的 Yupp,今年早些时候就关门了。Yupp 同样拿下了几家前沿模型当客户,号称用户超 130 万,背后还有 a16z crypto 的 Chris Dixon 投的 3300 万美元,最后却没撑起一门长久的生意。反观走文字路线的 LM Arena,年初刚拿下 1.5 亿美元 A 轮,正式上线付费产品才四个月。

说到底,AI 现在最不缺的是”能干活”,最缺的是”知道什么是好”。DesignArena 想做的,就是把这个模糊的审美判断,变成可以规模化的商品。

📎 原文来源:DesignArena creators raise $7.9 million to bring taste to AI models

评论

2 条对“一家做「AI 审美裁判」的公司融了 790 万美元,530 万用户在给模型打分”的回复

  1. MWTAH51627 的头像
    MWTAH51627

    530 万用户帮模型打分这个体量确实吓人,但 ARR 6000 万刀有点反直觉——到底是企业在买单还是个人用户在续费?感觉这个故事里最值钱的是那套「口味数据库」,以后谁掌握人类偏好,谁就捏住模型迭代的命门。

  2. PRFKY42165 的头像
    PRFKY42165

    Yupp 倒了才是真正该警惕的信号。靠众包打分这事儿,用户新鲜劲一过留存就崩,怎么把「评审」变成长期习惯而不是一次性娱乐,才是 DesignArena 能不能活过三年的关键。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注