标签: AI缺陷

  • 福特重新雇回”灰胡子”老工程师,AI质检这次没顶住

    福特最近做了一个挺打脸的决定——他们重新雇了350名老工程师。这些人里有曾经离职的前员工,也有在供应商那边干过的老手。原因说起来有点尴尬:原本指望AI和自动化质检系统能把质量搞定,结果不尽如人意。

    “我们误以为把AI和设计需求喂进去,就能出高质量产品”

    福特首席运营官Kumar Galhotra向记者承认,公司这几年越来越依赖自动化质检系统,但结果让人失望。所以他们会把技术专家请回来,让这些人在零件上线之前就先把失败点找出来。

    车辆硬件工程副总裁Charles Poon说得更直接:”我们误以为,只要引入AI、把我们的设计需求灌进去,就能产出高质量产品。”这句话基本把过去几年汽车行业对AI的盲目乐观总结到位了。

    福特工程师与AI质检系统
    福特重新雇回经验丰富的老工程师来弥补AI质检的不足(配图由AI生成)

    这些被返聘的工程师有个很接地气的称呼——”gray beard”(灰胡子),指的是那些在行业里干了几十年的老炮儿。他们的活儿不是取代AI,而是训练年轻员工、重新调整AI工具的参数,让这套系统真正能用。

    Ford CEO Jim Farley的说法是,这批人的回归已经开始产生回报——保修和召回成本在下降,”给福特带来了数亿美元的降本红利”。

    JD Power质量榜单第一,打脸还是证明?

    有意思的是,就在福特公布这个人事动作的同时,JD Power发布了2026年初期的初始质量调查(Initial Quality Survey),福特在主流品牌里排到了第一。公司层面当然愿意把这个成绩和”重新雇回老工程师”联系起来讲成一个完整故事。

    但这里有个问题值得想清楚:JD Power的评分是基于新车车主在购车后90天内报告的问题数量。福特这次排第一,到底是因为老工程师回来了,还是因为之前几年的AI质检虽然不完美但至少把基线拉高了?这个问题的答案可能要等一两年才能看清。


    汽车行业对AI的幻灭,才刚刚开始

    福特这个案例不是一个孤立事件。过去两年,汽车厂商都在讲AI赋能制造的故事——自动化质检、预测性维护、AI辅助设计,听起来都很美好。但实际落地的时候,问题一个接一个来了。

    • AI质检系统对”质量”的理解是统计学意义上的,而老工程师的判断来自几十年积累的手感和经验,这两件事目前还接不上轨。
    • 自动化系统的误报率和漏报率在工业场景下仍然是大问题,尤其是那些”看起来差不多但其实差一点”的瑕疵。
    • AI模型的训练数据往往来自历史案例,但新车型的缺陷往往是新的,模型不一定认识。

    福特的做法是把人和AI放在一起用,而不是二选一。这个思路其实比纯粹”AI优先”或者”人回归”都要务实。但问题在于,这种混合模式的人力成本显然比纯AI方案高,福特能不能长期维持这个配置,还要看那”数亿美元降本红利”能不能持续。

    对其他行业来说,福特的这个教训值得记一下:AI能帮你提速,但有些判断还是得靠人。尤其是当”质量”这个词的含义超越了数据能描述的范围时,老师的傅的价值就不是AI能替代的了。

  • 福特重新雇佣”灰胡子”工程师,AI质量控制没那么靠谱

    福特最近做了一个看似倒退的决定——重新雇佣350名资深工程师,其中有不少是已经退休的”灰胡子”(gray beard),还有一些是从供应商那边挖回来的老将。原因很简单:AI和质量自动化系统没能交出预期的答卷。

    AI质检,翻车了

    福特首席运营官Kumar Galhotra向记者承认,公司此前”越来越依赖自动化质量系统”,但结果令人失望。所以他们”把技术专家请了回来”,让这些老将在零部件进入工厂生产线之前就找出可能的故障点。

    福特AI质量控制
    AI质检系统未能达到预期,福特转而重新雇佣资深工程师

    福特车辆硬件工程副总裁Charles Poon说得更直白:”我们错误地以为,只要引入人工智能、把设计需求喂进去,就能自动产出高质量产品。”这句话基本上把过去几年业界对AI质检的过度乐观一棍子打醒了。

    “Mistakenly we thought that by just introducing artificial intelligence and ingesting the design requirements that we had, that that would produce a high-quality product.” —— Charles Poon,福特车辆硬件工程副总裁

    不是放弃AI,而是让人教AI做事

    需要说明的是,福特并没有把AI一脚踢开。那些被请回来的”灰胡子”工程师,现在的任务是培训年轻员工,同时重新编程AI工具。换句话说,AI还是要用,但得有人在旁边盯着,告诉它什么是对的、什么是错的。

    这个做法其实挺符合现实——AI在制造业落地的最大问题,从来不是算法不够先进,而是它缺乏对物理世界的”常识”。一个干了30年的老工程师,摸到零件就能感觉到不对劲,AI目前还做不到这种程度的直觉判断。

    钱说了算:召回成本降了

    这套”老将回归”的组合拳,看起来正在产生实际效果。福特CEO Jim Farley表示,保修和召回成本的下降,” literally hundreds and hundreds of millions of dollars of a tailwind for Ford on cost”(为福特带来了数亿美元的 cost 顺风)。

    更有说服力的证据是,在本周发布的JD Power新车初始质量调查(Initial Quality Survey)中,福特在主流品牌里拿了第一。这个调查衡量的是车主购车后90天内遇到的质量问题数量,能拿第一说明”灰胡子”们确实在起作用。


    制造业的AI幻觉

    福特的这个案例,其实是整个制造业过去几年狂热押注AI之后的一次现实检验。疫情之后,美国制造业普遍面临熟练工人短缺的问题,大家都指望AI和自动化来填补这个缺口。但福特的经历说明,至少在目前这个阶段,AI还不能完全替代经验丰富的老工程师。

    这件事对其他行业也是个提醒:AI可以让流程更快,但”更快”不等于”更好”。尤其是在质量控制在制造业这种容错率极低的场景里,人的判断仍然不可替代。

  • 谷歌AI连”Google”都拼不对,大语言模型的底层缺陷藏不住了

    谷歌AI连”Google”都拼不对,大语言模型的底层缺陷藏不住了

    2026年5月27日 | 来源:TechCrunch

    谷歌AI拼写错误示意图
    谷歌AI Overview将”Google”拼成了两个P | 图源:TechCrunch

    单词”Google”里面有几个P?谷歌自己的AI给出的答案是:两个。

    这不是段子,是真实发生在谷歌搜索”AI Overview(AI概览)”功能里的场面。有用户发现,让谷歌AI数一下”poop”里有几个R,它一本正经地回答”恰好1个”;问它”journalism”怎么拼,它拼出了j-o-u-r-n-a-d-i-s-m——多了一个完全不存在的D。

    至于美国总统的姓氏,谷歌AI表示里面有1个P——但拼出来的是t-r-p-u-m。

    这已经不是第一次了

    早在谷歌大张旗鼓给搜索结果页加入AI概览功能的时候,就有不少人预感会出事。果然,第一代AI概览上线时,它引用过《洋葱新闻》的讽刺文章,一本正经地建议用户”每天吃一块小石头”来补充矿物质,还从Reddit的段子里学到”可以在披萨上涂胶水来增加奶酪拉丝效果”。

    那一轮翻车之后,谷歌表面上修了不少问题。但这一轮以生成式AI为核心的搜索改版,把AI概览摆到了搜索结果的最顶端——也就是用户第一眼看到的位置。拼写错误这种低级失误,就这样被放大给了数亿用户。

    谷歌AI拼写错误示例
    用户实测:让各AI数”strawberry”里的R,纷纷翻车 | 图源:TechCrunch

    为什么AI就是不会拼写?

    这背后其实有一个相当硬核的技术原因,只是大多数用户并不知道。

    驱动聊天机器人和文本生成工具的大语言模型(LLM),从设计逻辑上就不是为了”阅读”而生的。当你输入一段提示词,模型会先把它转换成一串数字编码(也就是token),然后根据上下文关联来预测下一个最可能出现的token。

    问题就出在这里:模型眼里没有”字母”这个概念。它看到的”the”是一个整体编码,知道这个词的意思是”这个”,但它根本不知道T、H、E分别是什么字符。

    “LLM基于Transformer架构,这个架构本质上就不是真的在’阅读’文本。你输入提示词之后,它会被转换成编码。当模型看到单词’the’的时候,它只有’the’对应的编码,知道这个词的意思是’这个’,但它根本不知道’T”H”E’分别是什么。”——阿尔伯塔大学AI研究员Matthew Guzdial助理教授

    这就是为什么AI可以在几秒钟内写出能跑的应用程序代码,或者解决困扰数学家几十年的难题,但拼对一个简单的英文单词却相当于幼儿园小朋友的水平。

    研究人员也不乐观

    东北大学研究大语言模型可解释性的博士生Sheridan Feucht说得更直接:他猜测”由于这种模糊性,根本不存在完美的tokenizer(分词器)”。

    对于AI研究人员来说,拼写能力本来就不是LLM的核心评判指标。能写代码、能推理、能翻译,才是大家关心的。但问题是,当这些模型被直接推到数亿用户的搜索框里,每一个低级错误都会被无限放大。

    谷歌通过邮件向TechCrunch回应称:”单词计数是LLM的已知难题,我们正在努力修复这个特定问题。”措辞相当谨慎——”已知难题”四个字,基本等于承认这是底层架构的问题,不是修几个bug就能彻底解决的。

    给我们提了个醒

    这些令人发笑的拼写错误,其实有一个很正面的作用:它们不断提醒我们,AI并不完美,哪怕它有时候看起来全知全能、超出人类认知。

    我们不能盲目相信AI的输出,哪怕它说得再自信,也要二次核对准确性。这个道理大家都听过,但只有当AI把”Google”拼成两个P的时候,它才真正地被大多数人理解。

    谷歌这一轮搜索改版,把生成式AI摆到了有史以来最显眼的位置。它得到的赞美会更多,但挨的骂也会更多。拼写错误可能只是开始。


  • 谷歌AI把Google拼错了,大语言模型的拼写死穴到底能不能修好

    上周有个网友在X上发帖吐槽,说用谷歌搜索”Google”的时候,AI概览(AI Overview)给出的结果里,Google这个单词里有两个P。等等,Google里明明只有一个P啊。

    这不是孤例。有人问AI”poop”里有几个R,它说有1个(实际是2个)。问”journalism”怎么拼,它给出的答案是j-o-u-r-n-a-d-i-s-m——多了一个完全不存在的D。”disregard”更离谱,AI概览直接输出了”我明白了,如果你有新的提示或问题请告诉我”,活像是把训练语料里的客服话术当成了单词释义。

    谷歌通过邮件向TechCrunch回应称:”统计单词内字母数量一直是大语言模型的已知难题,我们正在努力修复这个问题。”说实话这个回应挺诚实的——他们没狡辩,也没说这是特性不是bug。

    为什么AI不会拼单词

    这事的根源得从Transformer架构说起。大语言模型处理文本的时候,不是逐字母读取的,它会把文本切分成一个个”token”——一个token可能是一个完整单词,也可能是一个音节,甚至单个字母。模型内部存的是这些token的数字编码,根本不知道T-H-E分别是哪几个字母。

    阿尔伯塔大学的AI研究员Matthew Guzdial给TechCrunch举了个例子:当你输入单词”the”的时候,模型拿到的是”the”这个整体对应的编码,它完全不知道这个单词是由T、H、E这三个字母构成的。这就好比你认识一个人,但说不出他长什么样——你知道这个token”长什么样”,但拆不开它。

    Google AI Overview spelling error screenshot
    谷歌AI概览将”Google”错误拼写为两个P的截图(TechCrunch修改标注)

    东北大学研究大语言模型可解释性的博士生Sheridan Feucht说得更直白:对于语言模型来说,”单词”到底是什么其实是很难界定的问题。哪怕我们让人类专家达成一个完美的token词表共识,模型可能还是觉得需要把内容拆分得更细。他猜测,由于这种模糊性,根本不存在完美的分词器。


    这不是第一次,也不会是最后一次

    谷歌上一次在AI搜索上翻车,还是AI概览刚上线的时候。当时它引用讽刺网站The Onion和Reddit的帖子,给出了”每天吃一块小石头””在披萨上涂胶水”这类荒谬建议,闹得沸沸扬扬。这次谷歌把整个搜索体验都改成了生成式AI驱动,是搜索产品25年来最大的一次重构,拼写错误只是暴露出来的冰山一角。

    有意思的是,拼写测试已经成了AI圈的一个梗。每当有公司发布新模型,大家都会问它”strawberry里有几个R”——这个简单问题曾经难倒了所有主流模型。现在情况好多了,但Google这件事说明,哪怕模型能在几秒内写出一整个应用,或者解决困扰数学家几十年的难题,拼写能力还是和幼儿园小朋友差不多。

    研究人员并不乐观认为这个问题能被彻底解决。但换个角度想,大语言模型的价值本来也不在拼写能力上。这些明显的低级错误反而是个好事——它提醒我们,AI并不完美,哪怕它有时候看起来全知全能。用AI输出结果之前,二次核对准确性这件事,永远不能省。