半夜十二点半,一个刚到家准备睡觉的人被连打了五个电话。第五个才接起,人很愤怒:安全了,别打了。

平台复盘后发现电话不是打错的。这位乘客当晚从酒吧出来,系统看到送他的司机在小区门口停留了一会儿,然后点了收车、退出 App。

《三五环》No.228 请到滴滴网约车平台安全部负责人曲晓楠,主播刘飞是他早年在滴滴的老同事。五十二分钟里两人没聊一句"科技向善",聊的是召回率和准确率哪个优先、三千多万单怎么过两道 AI、哪些风险平台压根看不见。

那通深夜电话不是系统笨。它是一条写明了的规则在生效,而这条规则一旦摊开,平台卖的东西就跟大多数人以为的不一样了:**它卖的不是安全,是把风险概率往下压的工程。**而这门工程真正稀缺的东西不是模型,是有限的人力该盯谁。

准确率低是设计目标,不是技术短板

主播问了个很技术的问题:安全场景是不是召回率比准确率更重要,虚惊一场顶多让人不满,漏判才麻烦。曲晓楠的回答是:

"对于我们来说,这个召回率的重要度远大于准确率。而且不得不说我们现在的这个准确率其实是比较低的,绝大多数的订单都是虚惊一场。以及从我们内心,虚惊一场反而是我们最希望的,宁可所有的订单都是虚惊一场,那代表所有的订单都是安全的。"

一家公司主动说自己某项指标"比较低",通常是在认错。这次不是。准确率低是这套系统的设计目标,不是技术短板。

任何风险识别系统都要在两种错误之间选边:把好人当坏人(误报),或把坏人当好人(漏报)。能力给定的情况下,压低一个必然抬高另一个。滴滴选的是把误报的成本吃进自己碗里,来换漏报的减少

误报的成本是什么?就是开头那五个电话:用户的睡眠、用户的愤怒、发到小红书上的吐槽,以及为这些电话付工资的一整个团队。**这些成本一项都没落在漏报那侧的受害者身上,全部落在平台和被误扰的普通用户身上。**这是一次明确的成本分配选择,不是技术演进的自然结果。

有个案例把这个选择推到了近乎荒诞的边界。系统识别到车内有未成年人,录音里听见"亲一下",风险判定立刻拉满,人工打电话给司机。结果是妈妈带孩子坐车,那句话是妈妈说的。曲晓楠的结论是"仍然确实是要值得介入的,因为我们还是要保召回"。

一对母子的日常对话被识别成风险信号,然后走完了核实流程。体感上不舒服,逻辑上完全自洽:真把漏报当成不可接受的错误,就得接受这种程度的误报。两者是同一枚硬币,只谈一面的讨论都不诚实。

三千多万单怎么收敛成几千次干预

这套取舍落地成一条漏斗,曲晓楠给的数字很具体:一天三千多万单,先过第一层 AI 扫描筛出十万单;AI 再扫一遍,收敛到三万单交给人工;人工研判之后,大约几千单真正进入干预

从三千多万到几千,砍掉四个数量级。而最后那一步是人做的。

做这件事的人不在客服体系里。滴滴在天津、珠海、成都设了安全预警中心,岗位职责分两段:研判"更像一个侦探",根据蛛丝马迹判断这单有没有风险;干预"有点像警察",把已识别的风险摘掉。客服解决投诉,他们做的是实时拦截。

前面那两层 AI 的作用于是清楚了:**它不是在替人做判断,是把三千多万的规模压缩到人力能触碰的量级。**决策权没下放给模型,模型交出去的是一份排好序的名单。

大模型的贡献确实是真的。有个例子是从长段对话里抓出一句"你的手好冰",据此判断发生了肢体触碰,高亮推给人工复核。这种从语义褶皱里捞信号的能力,规则引擎做不到,人力逐条听也做不到。听得懂,但听不完三千多万单。

而这条漏斗暴露了整套体系的真实约束:**决定安全水平的是底下那几千次人工干预的产能,不是顶上那层模型有多聪明。**模型再强,筛出五万单待处置而中心只能处理几千单,多出来的就是一份没人看的名单。这是产能问题。

这跟徐新那期讲的是同一个骨架。《五万月薪的人加agent,不大于agent|徐新:AI组织没有中层》讲的是 agent 削掉了"可转述"的那部分工作。这里也一样:模型接走了筛选这道可转述的工序,人留下来做交不出去的那件:判断这通电话该怎么打,以及打完之后还要盯多久。专家打完确认电话、乘客说了已安全下车,研判也不会立刻结束,还要再看这个司机有没有去接下一单。

那 20% 里,混着两种完全不同的东西

曲晓楠说得很直接:召回率大概百分之八十多,"也有将近百分之二十是无法召回的"。他把这 20% 拆成几类:线下私单——司机拿到联系方式、脱离平台成交,"我们所有的安全都失效了";醉酒静默——车里没有任何异常,人睡着了,"人去听也没有任何的异常";订单结束之后——"一段时间录音也失效了,这个时候再发生一起案件,我们也难以召回"。

节目里这 20% 是作为"能力短板"讲出来的,语气坦诚。而收尾时它变成了另一个东西:"现在平台能做到百分之八十,但剩下的百分之二十难度极大,非常依靠司机和乘客的努力。"

这两句话的落点不一样:前一句说"我们做不到",后一句说"剩下的靠你"。而这 20% 里混着两种性质完全不同的缺口。

**一种是结构性的。**一个睡着的醉酒乘客不产生任何信号,无论录音多清晰、模型多强,无信号就是无信号。检测不到没有信号的东西,这不是投入不足,是物理事实。蓄意预谋同理。专门研究平台规则来规避的人,你能收紧规则,但没法保证跑在他前面。

另一种不是。录音由乘客自主开关,能被扫描的只是选择开启的那部分;车载录像设备只有部分运营车辆装了。这两条都不是数学边界,是覆盖率。而覆盖率可以靠钱、靠强制标准、靠改默认选项来抬。节目里也说了,异常停留的那单能救回一个突发疾病的司机,正是因为那辆车有录像可调。

把这两种缺口打包成"剩下的百分之二十难度极大,非常依靠司机和乘客的努力",就把一部分本该由平台承担的投入决策,翻译成了用户的配合义务。"概率有边界"是一句真话;但真话也可以被放在一个让人不再追问下一句的位置上。

那个下一句是:这 20% 里,多少是数学上够不到的,多少是还没舍得花钱补的?不做这个切分,坦诚就成了一张更好用的免责单。

还有一个比"数据没人审"更根本的问题。召回率是"抓到的"除以"抓到的加漏掉的"。而按曲晓楠自己的描述,漏掉的那部分正是无信号、订单结束后、脱离平台的私单——**这些恰恰是平台按定义就不知道有多少的部分。**分母里有一项是未知数,"八成多"就不是能被外部核对的测量值,更接近一个内部估计。

上面这些数字,召回率、漏斗、每年数十亿投入、逐年降幅,全部出自平台一方,没有第三方审计,召回率还多一层不可自证。方向上大概不假。但精确到百分位地拿它们论证成效,那是把公关材料当审计报告用。

平台的能力边界,和它自己划的责任边界

还有一个反方观点,比"平台不够努力"这种批评有力得多。

平台讲的是能力边界:线下私单看不见,订单结束后录音失效。都对。但能力边界和责任边界不是一回事

曲晓楠自己做了个对照:直播行业做安全比他们方便,一是"所见即所得",风险天然暴露在平台眼皮底下;二是干预手段够硬,"终止直播,安全风险直接归为零了"。网约车两头都不占。风险在线下,散在全国各地,感知本来就弱;就算发现了,怎么干预也是难题,再往前一步就得报警。

这个对照很诚实,但它同时说明:**网约车的风险,一部分是这门生意的形态自带的。**一个陌生人、一辆封闭的车、一段外人看不见的路程——这是产品形态的固有属性。谁设计它、谁从中获利,就很难只用"这段路我看不见"来结清责任。

这个逻辑不是我们发明的。在更广泛的平台责任讨论里,产品责任法的思路已经被用到互联网平台身上:如果风险是被产品设计制造或放大的,"我已经尽力筛查了"不构成免责。国内目前还没有把这套思路用到网约车安全上的判例,它是一个正在被讨论的方向,不是既成的法律现实。

节目给出的边界是一个真实的能力描述,但它不能自动等于责任的分界线。平台当然可以说"我看不见"。可决定录音默认开还是关、多少车辆装录像、预警中心配多少人的,也是同一个主体。"看不见"里有多少是选择的结果,该单独拿出来算。

不过也得给平台记上一笔。2018 年那两起事件之后,集团有两年没给网约车设业务目标,曲晓楠的说法是"当时的网约车的 CEO 或者是班子成员呢,只背安全目标"。这个动作公关做不出来。连续两年不给核心业务下营收指标,意味着要么牺牲一轮增长,要么让一整层管理者的年终考核跟一个不能带来收入的指标绑在一起。这条同样是单方陈述,但它至少说明当时的排序真的变过。

「绝对安全」为什么让他们更害怕

节目里有一段自我剖析。它传播力很强,也特别需要小心处理。

主播问,外界对平台安全工作的误解是什么。曲晓楠说有两类。第一类是觉得滴滴还是不安全、没有努力做事,他认为这是很大的误解。第二类:

"有一些用户觉得滴滴极其安全,百分百不可能有问题,这个我觉得比第一类误解更加令我们担忧。安全的工作一定是需要司机、乘客和平台共建,平台不是无所不能的。"

这句话是本期的题眼,同时是个陷阱。

先说它成立的那一面,而且是硬的。一个相信"平台已经兜底"的人会做出不一样的选择:不看车牌,醉到无法判断时还是一个人打车回家。而这些恰恰是那 20% 里的典型场景。**"绝对安全"真正的危险在于它会让人卸掉那部分只有本人才能提供的防护。**一个记得自己不安全的人,是这套系统里成本极低、又相当有效的传感器。

这跟《商场不靠卖货赚钱了|奥莱在卖一件叫"确定性"的商品》是一个道理:奥莱赢在顾客出发前就完成了购买决策。用户的警惕也一样,它发生在服务开始之前。

但这句话有个结构性问题。"我们更怕你太信任我们"在事实层面无法被证伪。任何一家公司都可以说它,说完没有任何可检验的推论。这跟《投票器还是免责单?市场"审美真实"的两幅面孔|石磊谈AI商业判断》里那个问题是同一类:一个能解释一切、又无法被外部检验的框架,要警惕它在充当自我保护机制。

所以它该被当成一个待检验的承诺,不是结论。检验方法很直接:一家真的怕用户过度信任的平台,会不会在宣传里同样用力地讲自己做不到什么?

这期节目算是往那个方向走了一步。线下私单、醉酒静默、订单结束后的风险,这些短板都讲了,准确率低也讲了。**一个平台的安全叙事可不可信,看的不是它承诺了多少功能,是它有没有公开承认盲区、承认得够不够具体。**至于那些盲区里哪些其实是钱的问题,它没讲。

那五个电话,最后落在哪

回到开头那位被连打五个电话的人。

现在这通电话的来历清楚了:他从酒吧出来,司机在小区门口停留过,然后收车下线。三个信号叠在一起,系统判断这单不能就这么结束。他被叫醒,很愤怒,把这事发到了小红书上。而按平台自己给的数字,绝大多数这样的电话最后都是虚惊一场,包括他这通。

所以那通电话既不是骚扰,也不是"你真的有危险"。它是一套宁可错扰一千也不敢漏掉一个的机制,运行到你身上时的样子。你的睡眠就是它的运行成本,而这笔成本记在你头上,不记在漏判那侧的受害者头上。

这期节目没有一句宏大叙事,只有一串数字:三千多万单、两层 AI、三万单交人工、几千次干预、八成多的召回率、两成看不见的缺口。它们合起来说明的事,比任何"科技向善"的表态都硬。安全不是一种状态,是每天都在做的一次分配。

而分配这件事永远可以问下一句:**这 20% 里,哪些是它真做不到,哪些是它还没打算做。**这句话不只对滴滴成立。任何一家把"剩下的靠用户配合"说得很自然的公司,都该被这么问一遍。

想听完整这期,点击阅读原文。