![]()
一、每句话都对,合起来没有用
做汽车这行二十多年,大部分时间在听人说话。
车展、论坛、发布会、内部会。听多了会有一种很具体的疲惫:每一句都对,合起来没有用。
有人说竞争激烈,对的。有人说要智能化,对的。有人说出海是必然,也对。你把这些话摆一桌,它们既不矛盾,也不指向任何东西。你从这堆正确的话里,推不出下一步该干什么。
有一阵子我以为是自己没听懂。后来我觉得不是。
问题不在他们说了什么,在他们说话的时候默认了什么不必说。
举个例子。一家车企在车展上报:"英欧一季度卖了七万七千辆,增幅超过百分之二百四十。"
这句话本身只是个数字。但你把它拿到车展上报,就意味着你默认了另一件事:
出海是必经之路,不是选项之一。
如果出海只是众多选择中的一个,这个数字根本没有报的必要。
那句话他没说。但他所有的判断都压在它上面。
我想知道的是:一个行业,在某一年里,共同默认了什么?
![]()
二、我最初的做法是错的
一开始我用的是老办法:拿一篇文档、一次访谈,把里面的假设一条条提出来。
这个办法能用,但提出来的是那一篇文档的假设,不是这个行业的假设。
后来我想明白为什么。
在一篇文档里,主张和前提长得一模一样。
说话的人正在论证的东西,和他默认不必论证的东西,从字面上分不开。他说"智能化是核心竞争力"——这是他在论证的观点,还是他和听众共享的前提?单看这一句,你永远判不了。
转念是在一次很笨的尝试里出来的。我把一年的材料摊开,不再一篇一篇看,而是横着看。
一个人说"哪吒S续航长,充电快,非常值得期待"——看不出什么。 另一个人说"综合续航突破1200公里"——还是看不出什么。 第三个人说"北方八省补能设施覆盖不到百分之四"——
三句话放一起,那个没说出口的东西才显出来:他们共同默认,补能焦虑是买主的首要顾虑。
没有人论证过这一点。三个人都当它是不必解释的背景。
预设不在一句话里,它在很多句话的交叉处。
三、判据只有一句
摊开之后还有一个问题:怎么确定某个东西是预设,而不是我脑补的?
我最后用的判据只有一句话,简单到有点可疑:
把那句话否掉,原话还说不说得出口。说不出口,它就是预设。
试三个。
一家车企报海外销量,"英欧一季度7.7万辆,增幅超240%"。候选:出海是中国车企的必经之路。 否掉它——如果出海只是选项之一,这个数字就没有在车展上报的必要。说不出口了。所以它是预设。
一位车主抱怨胎噪,说"把音乐放高点盖过这种声音。耳不见心不烦吧,也只能这样了"。候选:小毛病是修不好的,得自己适应。 否掉它——如果修得好,他不会选择"盖过去"。说不出口了。
一份监管文件写着"未经审批,不得通过在线等软件升级方式新增或更新汽车自动驾驶功能"。候选:车企会用远程升级绕开准入审批。 否掉它——如果没人这么干,不必单独立这条规矩。说不出口了。
这一句判据的好处是,它不需要你揣摩说话人在想什么。你只要看:拿掉这个前提,原话还成不成立。这是可以跟人对账的。
四、按谁说的分,不按说的什么分
这是整件事里最关键的一步,而我最初做错了。
我一开始是按话题分的:所有关于价格的放一起,所有关于智能化的放一起。做出来是一堆整齐的表格,然后我发现——它什么也说明不了。
后来改成按说话的人分。改完当天就看见了原来看不见的东西。
2021 年,同一个动作,三方默认了三件不同的事。
那个动作是远程升级——OTA,厂家在你不去店里的情况下给车升级软件。
![]()
三方都在认真说话。三方都没察觉对方说的是另一件事。
这种东西,按话题分永远看不见——它们会被归进同一格,叫"OTA 相关"。只有按人分,才知道同一个词在不同人嘴里是三件事。
五、大模型在这里面干了什么
这一节要单独讲,因为它最容易被误解。
很多人以为这种活是"把材料丢给 AI,让 AI 分析出结论"。恰恰相反。整个过程里,模型说的话一个字都没有进最终的档案。
它只干了一件事:当目录。
问题是:你根本不知道该去哪儿找
你想看 2019 年中国车市默认了什么。可是 2019 年发生过什么?有哪些政策?哪些车上市了?谁在什么场合说过话?
互联网没有一份按年份组织的索引。你没法遍历。搜索引擎是按"后来有多重要"排序的,你搜"2019 年中国车市",首屏几乎全是后来写的复盘。
但有一样东西读过大量这些材料,而且大致记得它们在哪儿——大模型。
所以第一步不是搜索,是先问它"有哪些坐标"
每一年,问四遍:
这一年有哪些公开发言的场合?
这一年哪些公司被反复提及?主要发言人是谁?
这一年从业者每天在处理什么问题?
这一年有哪些事当时很重要、今天很少再被提起?
答案只接受三列:什么事 | 大约什么时候 | 涉及谁。
不接受任何描述、评价、因果解释、重要性判断。多写一个字算违规。
这条规矩是硬的,理由很简单:
模型给的那句描述,一旦进入工作流,就会给后面所有判断定调。
我要的是它的索引,不是它的观点。
第二步才是去找原文,一切以原文为准
拿着这份坐标清单去搜、去扒、去抓原文。清单上有、但搜不到当年材料的,单独记成一行"提示过但没找到"。
这一行本身就是发现——它意味着这件事当年可能很重要,但今天可检索的语料里已经没有了。
为什么问四遍,而不是一遍
因为这份清单有已知的偏差,而且方向是清楚的:
它是按报道量加权的,不是按重要性加权的。偏向后来变重要的、戏剧性强的,系统性漏掉当年重要、今天无人再提的、以及平淡但结构性的。
四个问法激活的是四套不同的分布。第四问——"当时重要今天没人提的"——是专门用来对冲这个偏差的,不能省。
还有一件必须承认的事
用模型当目录,意味着我的采样范围有一部分就是模型的知识边界。它不知道的,我也找不到。
所以留了两三成的配额给不经过目录的来源:政策部门的发文列表、论坛的帖子编号区间。否则你永远发现不了连它也不知道的东西。
一句话总结模型的角色
它读过的东西我读不完,但它记得大概在哪儿。
我借的是它的记忆位置,不是它的判断。
六、到底收了什么
六方是车企、车主、政策方、媒体与协会、经销商和供应链。
![]()
第六方是最后补的,也是最难收的。供应商很少开发布会讲自己。后来找到的办法是去扒上市公司的业绩说明会记录——强制披露、有准确日期、有逐字问答,而且讲的正好是账期、产能、客户这些别处听不到的东西。
逐年逐方,一共 440 句原话
![]()
每一条都有链接和发表日期,可以逐条回去核。
从这 440 句话里,一共提出384 条预设:
![]()
一半的预设有两个以上互相独立的来源。后面所有跨年的判断,只建立在这一半上。
车主那一层,靠的是帖子编号
政策那一方好办——文件有文号有施行日期。车企发言也还行——车展有固定日期。
难的是车主。车主的话散在论坛里,没有任何索引,模型也记不住具体哪个帖子。
后来发现一件事:论坛的帖子编号是随时间单调递增的。
汽车之家的帖子编号,2017 年初大约在五千九百多万,2018 年初到六千九百多万。中间那一段,就是 2017 年。不用搜任何关键词,直接在这个区间里等距抽样——抽到的必然是那一年发的帖子,因为后来写的东西不可能拿到更小的编号。
这个办法把最贵最脏的一层变成了最干净的一层。
但有个坑,我们踩过:每一年都得重新标定,不能按速率外推。
![]()
五年掉了六成。拿旧速率去推,整年都会错位。
七、翻了三次车
这一节本来我不想写。写出来才发现它可能是全文最有用的部分——因为三次都不是执行出了问题,是我设计错了。
第一次:两个数字打架。
我给每条预设标了可信程度:三个以上的人各自说过,标最高;两个人,标中等;只有一个人,标最低。
同时我又给收料定了上限:每方每年收四到六条。
这两个数字放在一起是荒谬的——四条材料里凑出三个不同的人说同一件事,概率极低。
结果:媒体那一方跑完,三十七条预设里三十六条是单人主张。
可信度全是最低档,后果不是"结论偏弱",是这一层不产生任何信息——你分不出哪条是全场共识,哪条是某人随口一说。
第二次:判据的方向被弄反了。
有一条车主的原话是这样的:车主问售后"有拉缸的吗",售后反问他"你怎么知道!"
提取出来的预设写成了:「售后应向车主如实告知已知的车型故障」。
这句话读着很顺,也很正确。但它是我的主张,不是那句对话里的预设。
那句对话真正踩着的是:售后知道这个车型有通病,但默认不主动说。
一个是"本该怎样",一个是"已经是怎样"。预设是后者。一旦写成"应该",记录下来的就是分析者的立场,不再是那一年的空气。
后来我把"应该""应当""需要"这几个词直接禁掉了。
第三次:一句话没写清楚。
我在给执行的指令里写"每年抓取不超过十二页,到顶就停"。
"到顶就停"——哪个顶?
它读成了全局停止。跑完 2017 年,额度用完,整轮停了。剩下九年只剩一个空壳。
三次,没有一次是别人执行得不好。都是我把规则写坏了,而规则写坏了,后面所有工作都白做。
![]()
八、这套东西自己踩着什么
写到这儿该轮到我自己了。
这套方法成立,靠的是一个没说出口的前提:人说的话,能反映他默认的东西。
可是公开发言是表演。车展上那些话是说给媒体听的,业绩说明会上那些话是说给投资人听的。我抓到的,可能不是"他默认什么",而是**"那一年在那个场合可以说什么"**。
这一点我认,而且写进了方法里:研究对象的完整名字是——某一年,公开可发表的文本中,共同不必解释的背景。不是"行业真实的想法"。
还有一条更扎人的,我想了很久:
我用"三个人说过"来判断哪条预设更可信。可是三个人说同一句话,可以是因为他们真的都这么想,也可以是因为那一年只有这句话可以说。
信度越高,越可能是后者。
也就是说,我这套打分,分不清"共识"和"口径统一"。分数最高的那几条,恰恰最可能是当年最不需要动脑子就能说出口的话。
这个问题我没解决。
所以这十年的材料我只敢这么用:它记录的是每一年可以被说出口的东西的形状,不是每一年真实的想法。形状本身有信息——尤其是当某个形状十年一动不动的时候。
九、一个你现在就能用的问题
不讲方法论。就一句话,个人认为很有用:
你正在说的这句话,如果把某个前提否掉,你还说得出口吗?
说不出口——那个前提,就是你没打算证明、但所有判断都压在上面的东西。
拿它试一下你手上那份战略文档、那份汇报材料、那句你说了很多遍的话。
大部分时候,你会发现最要命的那个前提,从来没有被写进任何一页。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.