去年还没毕业的时候,Grace Li 和几个大学同学捣鼓一个 AI 游戏引擎。模型能把游戏跑起来,功能也都齐全,可问题是——没一个好玩。这下把他们难住了:一个游戏好不好玩,到底该怎么判断?
他们最后想明白一件事:这种判断没法交给机器,只能靠人。于是几个年轻人开始琢磨,怎么把”真实人类的好恶”大规模收集起来。这个念头后来长成了 DesignArena,一个今天在全球有 530 万人在用的 AI 工具。
“它是很多模型在设计这件事上往前走时卡住的那个瓶颈,”Li 说,”大概一周后,我们就和一家前沿实验室签下了第一笔大单,后面的事基本就成了。”
把”哪个更好看”做成一门生意
普通用户用 DesignArena,感觉有点像在用高级版的模型路由。你在一个类似 ChatGPT 的窗口里写下需求,再选好格式和风格,系统就会甩出一组”A 还是 B”的二选一,让你一路比下去,直到把几个产出从好到差排个序。
真正值钱的其实是面向企业那一侧。正在被评估的模型可以把这个平台当成源源不断的即时反馈源——用来打磨自己生成图片、网页这类”媒体”的能力。而打分的人往往根本不在乎自己评的是哪个模型,他们只想要最好的那个结果。这种”无偏见”的排序,正好能告诉实验室:用户到底想要什么。

- 公司主体叫 Intelligence,本轮 790 万美元种子轮由 Index Ventures 领投,Conviction、A*、Valkyrie 等跟投。
- 平台目前年经常性收入(ARR)已达 6000 万美元,成了行业里关键的人类主导评估数据源。
- 用户必须登录才能拿到产出,于是公司还能追踪不同大洲、不同时间的”口味”变迁——比如亚洲的网页仪表盘普遍更追求满屏的信息密度。
人肉打分能补上自动评测的漏洞
这套玩法是对自动基准测试(benchmark)的重要补充。跑分可以铺得很大,但也容易被刷、被钻空子——上周那起 Hugging Face 被黑的事件,就把这种脆弱演示得淋漓尽致。不过,靠众包人类反馈也不是稳赢的买卖。
和它思路相近的 Yupp,今年早些时候就关门了。Yupp 同样拿下了几家前沿模型当客户,号称用户超 130 万,背后还有 a16z crypto 的 Chris Dixon 投的 3300 万美元,最后却没撑起一门长久的生意。反观走文字路线的 LM Arena,年初刚拿下 1.5 亿美元 A 轮,正式上线付费产品才四个月。
说到底,AI 现在最不缺的是”能干活”,最缺的是”知道什么是好”。DesignArena 想做的,就是把这个模糊的审美判断,变成可以规模化的商品。
发表回复