节点 NEXUS · 认知

第 02 课 · 点点的字典

AI 不识字 · AI 识数字 · 你跟它之间永远隔着一本词典
时长 ≈ 13:00 口播字数 ≈ 2200 字 点点 i2v 镜头 22 个 真人点哥 3 段 版本 v1 · 灵魂层立项
全 片 灵 魂 金 句 三 连
「AI 不识字 · AI 识数字。」第一锤
「你跟 AI 之间 · 永远隔着一本词典。」第二锤
「足够好的压缩 · 就是智能本身。」第三锤 · Ilya Sutskever

📌 观众看完带走的 5 层认知收获

  1. 心智模型升级:AI 看到的不是字 · 是一串数字 · 中间隔了一本词典
  2. 解释力:8 个为啥(为啥数 r 错 / 为啥中文贵 / 为啥同句话不同模型反差大 / 为啥偶尔崩溃 ...)
  3. 行动改变:30 秒判断法 · 字符级任务别用 LLM · 避方言生僻字 · 选适配语言的模型
  4. 谈资:SolidGoldMagikarp 诅咒事件 / Ilya 压缩论 / Karpathy 金句 / BPE 30 年 / 国产分词器主权战
  5. 态度转变:从「嘲笑 AI 笨」→「理解局限来自设计选择 · 聪明地用」
栏目护城河 · 全 i2v 点点具象化
i2v 点点视频 · 把抽象概念演给观众看(栏目铁律 3)
真人 点哥出镜 · 舞台 黑屏 / 字幕 / 转场 · 图卡 CSS 视觉锚
💡 认知点埋点 = 这一段对应"5 层认知收获"里的哪一层
0:00 - 0:30 钩子 · 反共识揭穿(全黑底字幕 · 无人) 舞台
全黑底字幕 · 节点 NEXUS 角标常驻 · 配音独白 · 节奏紧
点哥旁白 你今天发给 AI的所有信息——
每一条消息、每一个 prompt——

你以为它读到了你打的字。

真相是——
一个字都没看见

它看到的,
一串数字

这一节 12 分钟——
我带你看清楚——
你跟 AI 之间,到底隔着什么。
💡 埋点 · 第 1 层(心智模型):第一秒就建立"你以为/真相是"的认知断层 · 跟 ep01「你以为它在思考 · 它在预测」同等节奏。
0:30 - 0:45 黑屏转场 · 课程标识 舞台
全黑 · 节点 NEXUS 品牌 whoosh 音效(栏目辨识度三件套之一) 第 二 课 点点的字典 · AI 不识字,AI 识数字
0:45 - 1:15 点哥入镜 + 回顾上集 + 引入 真人
点哥 大家好,我是你们的点哥
欢迎回到节点 NEXUS · 认知栏目第二课。

上集啊——我们讲了一件事——
AI 不是会思考,是会预测。
他在做接龙,猜下一个字最可能是啥。

那今天我们继续问——
预测的"东西",到底是个啥?
吗?是吗?
D01 点点登场摇头 · 4s i2v
具象化:点点从画面右下蹦出 · 听到"字吗?词吗?"开始疯狂摇头 · 摇到头晕扶墙 · 萌系反差
点点不是!不是!
我看到的——是数字啊点哥!
💡 埋点 · 第 1 层:抢话点出本集核心命题 · 用点点之口讲"我看到的是数字" → 让观众直接进入颠覆认知状态。
第 一 幕

压 缩 即 智 能

情绪 · 敬畏 + 颠覆世界观 · 5 分钟
论证目标:把"AI 怎么读"这个问题 → 引到"智能本质 = 压缩"(Ilya 信息论锚定)
1:15 - 1:45 Step 1 · 引入 · AI 不读字
点哥 点点说得对——
真的不识字

你打"床前明月光"——
他眼睛里没有"床"没有"前"没有"明"没有"月"没有"光"

他看到的就是几个数字
比如33448911027...
D02 点点翻字典 · 字典里全是数字 · 6s i2v
招牌镜头 · 本集核心 i2v:点点举着一本厚字典 · 翻开 · 镜头推进 · 每一页全是数字(3344 / 891 / 1027 ...)· 字典扉页烫金「点点的字典」· 点点表情困惑指着数字"这是啥呀" · 暖金灯光
💡 埋点 · 第 1 层:用招牌镜头一锤把"字 → 数字"的心智转换打进观众脑子。这一镜是全片记忆点。
1:45 - 2:45 ⭐ Step 2 · 杀手类比 #1 · 微信语音转文字
点哥 给你打个比方——

每天都在用微信发语音吧?
长按、说完、松手——
旁边小图标点一下,"语音转文字"。

可有时候你说「耙耙柑」——
它给你打成「把把柑」
你说「伢儿」——
它给你打成「牙儿」

为啥?
因为它的字典里——
没有"耙耙柑",
没有"伢儿"。

AI 跟你之间——
隔着这么一本词典
看不到字
它只能对照词典,找最接近的一串数字。
D03 点点举耙耙柑卡片 · 5s i2v
具象化:点点举写有"耙耙柑"的纸牌 · 字一个一个褪色变成"???" · 点点惊讶捂嘴 · 卡片掉地 · 暗暖光
💡 埋点 · 第 1 层 + 第 5 层(态度):把"AI 看不懂方言"从"AI 笨"扭转成"它的词典没收录"——这一步就开始植入态度转变。
2:45 - 3:45 Step 3 · BPE 切片机 · 30 年时空跨度
点哥 那这本"词典"——
到底咋来的?

有名字,叫 BPE——
"字节对编码"。

重点来了——
BPE 这玩意儿——
1994 年就发明了。
30 年前的事

当时它是干嘛用的?
一句话——
压数据
省磁盘。
那时候硬盘贵啊,几兆都得算着用。

谁能想到——
30 年后——
一个压数据的算法——
成了整个 AI 革命的底座。
D04 1994 年复古场景 · 6s i2v
具象化:1994 年怀旧风 · 老式 CRT 显示器 + 软盘 + 老式打字机 · 屏幕跳出"BPE 压缩算法 v1.0" · 镜头快速 zoom out · 跳到 2026 · 点点站现代数据中心前指着同一个 BPE 标识 · 字幕浮"30 年"
💡 埋点 · 第 4 层(谈资):BPE 30 年时空跨度是"圈内梗"——观众下次跟人聊 AI 能掏出来"那个压缩算法 1994 年发明的你知道吗"。
3:45 - 4:45 ⭐ Step 4 · Ilya 金句锚 · 压缩即智能(世界观锤)
点哥 那问题就来了——
一个压缩算法——
凭啥能产生智能

这事啊——
OpenAI 前首席科学家 Ilya——
反复讲过一句话——
R1 Ilya 真人访谈截图 · 4s 真图
真实素材:Ilya Sutskever 访谈截图 / Lex Fridman / Dwarkesh Patel 视频帧 · 配字幕英文金句 "Compression is intelligence"
点哥 他说——
「足够好的压缩,就是智能本身。」

啥意思?
我用点点给你演——
你要把一本《红楼梦》——
压成一句话——
必须真的看懂了
要不然你压不下去,
要不然你压出来就是胡说

压得越小、还能展开——
说明你越懂

AI 也一样。
他把整个互联网——
几万亿字的人类语言——
进了他的词典参数里。
他能压成这样——
说明他真的,懂
D05 点点压《红楼梦》· 6s i2v
核心具象化:点点抱厚重《红楼梦》· 双手用力压 · 书越压越小 · 最后变成一个发光小立方体 · 点点举起小立方体露惊叹表情 · 神圣金光
💡 埋点 · 第 1 + 4 + 5 层:本集世界观锚 · Ilya 信息论原理 · 这一镜决定 ep02 是"科普 token"还是"理解智能本质"。
4:45 - 5:30 Step 5 · 量级冲击 · 词表对比 + 训练量
点哥 给你几个数字感受一下——

人类日常常用——
5000 个汉字。

GPT 的词典——
5 万条。
Claude 的词典——
20 万条。
国产 DeepSeek 的词典——
15 万条。

然后呢——
GPT-4 训练用了多少数据?
13 万亿条

13 万亿啊朋友们——
一个压缩算法——
13 万亿条语言——
压进了一本20 万条的词典里。

这就是为啥AI 能
D06 词表三大墙对比 + 13 万亿海洋 · 8s i2v
具象化:左中右三道大墙(5 万/20 万/15 万分别贴 GPT/Claude/DeepSeek 标签)· 点点站墙前小小一个 · 镜头切到 13 万亿 token 数据海洋 · 点点跳进去游泳 · 巨大对比反差
💡 埋点 · 第 2 层(解释力):观众看完这段就能解释 context window 中英文吃量不同 · API 计费按 token 的根因。
第 二 幕

诅 咒 与 瞎 点

情绪 · 神秘 + 揭秘感 · 4 分钟
论证目标:既然 AI 看到的是数字 → 反推它的"瞎点"在哪 · LLM 所有怪 bug 都是 tokenizer 的锅
5:30 - 6:15 Step 6 · 桥接 · strawberry 数 r 真相
点哥 那既然 AI 看到的是数字——
他对"字"的体验,到底是啥样?

我举个最经典的例子——
"strawberry"(草莓)——
英文几个 r ?
你数得清——
3 个

问 GPT。
GPT 给你说——
2 个

(笑)你说他笨吗?
不是。
他看不见 r
D07 strawberry 在 AI 眼里 · 5s i2v
具象化:屏幕显示"strawberry" · 镜头从人类视角切到 AI 视角 · 字母 s-t-r-a-w-b-e-r-r-y 全部消失 · 取而代之是一个发光的整数 token "[27015]" 一团 · 点点看着这个数字皱眉数手指
点哥 在他眼里——
"strawberry" 就是一团——
一个编号——
从没见过 s, t, r, a, w, b, e, r, r, y 这些字母

你让他数 r ——
就像让蒙眼的人没见过的东西
💡 埋点 · 第 2 层 + 第 5 层:把"AI 数 r 错"这个被嘲笑了三年的事 · 给出原理级解释 · 完成"嘲笑 → 理解"态度转变。
6:15 - 7:00 ⭐ Step 7 · 一锅端 · Karpathy 金句锚
点哥 其实啊——
AI 数 r 数不清——
只是冰山一角

你让他反转字符串——他做不好。
你让他做简单算术——他翻车。
你让他判断两个字符的差别——他装看不见。

所有这些——
都是同一个根

Karpathy——
OpenAI 创始团队、特斯拉前 AI 总监——
专门录过一个两小时的视频讲这件事。
他说——
R2 Karpathy 视频截图 · 4s 真图
真实素材:Karpathy "Let's build the GPT Tokenizer" YouTube 视频帧 · 配英文字幕原话 "Tokenization is at the root of much weirdness of LLMs"
点哥 「Tokenization 是 LLM 一切怪 bug 的根。」

一句话——
把锅——
全甩给了切片机
💡 埋点 · 第 2 + 4 层:8 个"为啥"在这里 1 句话扫平 · 谈资双锚(Ilya + Karpathy)双大神金句构成本集"硬通货"。
7:00 - 8:30 ⭐ Step 8 · 真新闻揭秘 · SolidGoldMagikarp 诅咒事件
点哥 讲到这——
我必须告诉你一件真事——
一件 AI 圈到现在都津津乐道的真事

2023 年——
几个研究者在玩 GPT 的词典——
他们发现里头有一批奇怪的词——
比如——
"SolidGoldMagikarp"

这词啥意思?
它没意思
它就是个玩家昵称
某游戏论坛里某个老哥用了 5 年的 ID。
R3 LessWrong 原文截图 + Reddit 截图 · 6s 真新闻
真实素材:LessWrong "SolidGoldMagikarp" 原帖截图 + Reddit r/MachineLearning 讨论截图 · 标题高亮 "anomalous tokens" / "诅咒 token"
点哥 关键的来了——
研究者把这个词丢给 GPT——
问他:这个词什么意思?

GPT 直接疯了

他要么装死不回答——
要么胡言乱语——
要么张口骂人——
要么自称外星人——
要么直接说——
"我是 distribute"——
(根本不是个词)。

研究者一——
发现这个词进了 GPT 的词典——
但训练数据里几乎没有它
GPT 从没真正"读过"这个词。
所以遇到它——他瞎了
D08 点点翻字典翻到诅咒页 · 7s i2v
核心揭秘镜头:点点翻字典 · 翻到中间某一页 · 字典着火(金色火苗 不暴力)· 点点瞳孔变 ??? · 嘴里冒泡泡说外星语 · 字典自动翻页过去 · 镜头神秘暗光
点哥 后来人们管这种词叫——
"诅咒 token"

每个大模型——
词典里都藏着几个这样的角落——
研究者还在挖

(顿)你以为 AI 读完了整个互联网
其实——
他的词典里——
有些角落他从没去过
💡 埋点 · 第 4 层(谈资)核心 · 第 5 层(态度)核心:SolidGoldMagikarp 是本集"社交货币"——圈内人都知道、圈外人没听过、观众拿走就能装。同时把"AI 强大"的崇拜感拉回"AI 也有盲区"的清醒感。
8:30 - 9:30 ⭐ Step 9 · 杀手类比 #2 · 永远隔着一本词典(金句锤)
点哥 其实啊——
不光是诅咒词——
中文方言——
生僻字——
古文——
AI 都视若无睹

你跟他说"耙耙柑"——他装作懂——
其实他的词典里没这个
你跟他说"魑魅魍魉"——
他能切成6 段——根本不是个词。

所以这里——
我要给你第二句锤子——
金句 你跟 AI 之间——
永远隔着一本词典
D09 点点 vs 点哥隔着透明大字典 · 6s i2v
核心金句具象化:点哥真人 + 点点分别站画面两边 · 中间悬浮一本巨大透明字典 · 两人想握手 · 手伸不过字典 · 字典里数字流动 · 神圣感 · 字幕浮金句
💡 埋点 · 第 1 层 + 灵魂金句第二锤:这是本集情绪最高峰 · 把所有铺垫一句话收口 · 观众离开后能记住这一句就够本集。
第 三 幕

重 新 看 A I

情绪 · 清醒 + 拥抱 · 2.5 分钟
论证目标:把前两幕的认知 → 落到行动 · 观众离开有具体能用的东西
9:30 - 10:00 Step 10 · 桥接 · 重新提问
点哥 那好——
既然 AI 看到的不是字——
词典里的编号——

那我要怎么写 prompt——
才能让他看清楚我要说的事?

我给你30 秒——
教你三个判断——
下次用 AI 前过一遍
10:00 - 10:45 ⭐ Step 11 · 30 秒判断法(截屏神位 · 工具卡)
点哥 第一问——
这是字符级任务吗?
数字母?反转?拼写?
——别用 AI。用 Python 三行搞定。

第二问——
里头有方言生僻字古文吗?
——换说法
"耙耙柑"换成"杂柑"。
"伢儿"换成"小孩"。

第三问——
中英文混杂,大段哪边?
大段中文——优先国产模型
大段英文——优先海外模型
(不是品牌问题,是词典适配问题。)
C-11 30 秒判断法工具图卡 · 全段 CSS 图卡
截屏神位:cards-skin.css 三栏卡片 · 暖金底 · 三个问题大字 + 简洁动作建议 · 全 ASR 字级 stagger 入场 · 跟 ep01 卡 08「30 秒 3 问」同款套路 · 用户截屏发朋友圈/同事群
💡 埋点 · 第 3 层(行动改变)核心:观众看完这一段获得"截屏带走"的工具卡 · 是节目的复用价值锚。
10:45 - 11:30 Step 12 · 国产 AI 词典主权战(认知反转)
点哥 再给你一个反转——

很多人以为——
中文用 AI 吃亏——
一个汉字按 2-3 个 token 算钱——
比英文贵两倍。

但这两年——
DeepSeek、Qwen、Kimi——
这些国产模型专门重训了中文分词器。

意思就是——
他们把中文重新切了一遍——
给中文优化了一本新词典

现在你拿中文问 DeepSeek——
反而比英文还便宜

所以你别看 AI 模型卷得凶——
其实最底层的战争——
是在词典这一层打的。

AI 的词典——
也是国家的词典
D10 点点抱新词典 + 国产 logo 墙 · 5s i2v
具象化:点点举一本红色「中文优化版」词典 · 翻开 · 里面汉字配整齐数字 · 后景出现 DeepSeek/Qwen/Kimi 三个真彩 logo 墙(用 lobe-icons 真图)· 不拉踩 · 正面叙事
R4 DeepSeek tokenizer 优化新闻截图 · 3s 真新闻
真实素材:DeepSeek 官博 / 技术报告 PDF 截图 "中文 tokenizer 重训" · 配字幕中文小字
💡 埋点 · 第 2 + 4 层:观众离开能解释"为啥国产 AI 中文体感好" · 同时获得"分词器主权战"这个产业级谈资。
11:30 - 12:00 ⭐ Step 13 · 灵魂金句三连击(招牌段)
点哥 所以——
这节课最后——
我用三句话——
给你封顶。
第一锤 AI 不识字——
AI 识数字
第二锤 你跟 AI 之间——
永远隔着一本词典
杀手锏 足够好的压缩——
就是智能本身
—— Ilya Sutskever · OpenAI 前首席科学家
C-13 三连金句图卡 · 6s CSS 图卡
招牌图卡:cards-skin.css `.tbh` + `.gate` 黑底暖金 · 三句金句逐句弹出 · 第三句 Ilya 落款 + 配 ep01 同款 `.mrv` 杂志收尾感
💡 全片认知收获在此封顶:金句三连按"现象层 → 关系层 → 本质层"递升 · 第一锤打懂 / 第二锤打透 / 第三锤打深。
12:00 - 12:30 落版 · 系列地图 + 互动征集(栏目三件套之三) 真人 舞台
点哥 最后三件事——

第一——
评论区告诉我你说过哪些 AI 装听懂其实没听懂的怪词——
我们做一期——
「点点失明事件大赏」

第二——
下集——
「点点的大脑」——
我们讲138 亿个参数——
AI 凭啥"知道"那么多事——
一次给你讲透 MoE。

第三——
这是节点 NEXUS 认知第一季——
点点诞生记——
12 课——
我们一节一节—— 把 AI 拆给你看。
D11 + C-14 系列地图 + 点哥点点并肩落版 · 8s i2v 图卡
栏目辨识度收尾:12 集进度条 · 第 02 课 ✅ 点亮 · 暖金光晕 · 点哥真人 + 点点并肩看远方 · 杂志收尾感 · 杂志边框 + "节点 NEXUS · 认知课" + "第 02 课 · 完" + "下一课 → 第 03 课《点点的大脑》"

📊 全片统计

总时长≈ 12:30 净讲(13:00 含转场)
口播总字数≈ 2200 字
三幕分配第一幕 5:00 · 第二幕 4:00 · 第三幕 2:30 · 钩子+落版 1:00
点点 i2v 镜头D01-D11 共 11 个 · 复用 ep01 角色 ref + Wan/Seedance 双通道
真实素材锚R1 Ilya 访谈 · R2 Karpathy 视频 · R3 SolidGoldMagikarp 真新闻 · R4 DeepSeek 官博
CSS 图卡C-11 30 秒判断法 · C-13 灵魂金句三连 · C-14 系列地图(复用 ep01 cards-skin.css 套路)
真人点哥3 段(开场介绍 + 中间衔接 + 收尾落版)
灵魂金句三连不识字识数字 / 隔着一本词典 / 压缩=智能
大神金句锚Ilya(压缩=智能)+ Karpathy(tokenization 是根)
真新闻事件锚SolidGoldMagikarp 诅咒 token(圈内梗 · 圈外没听过)
工具卡30 秒判断法 · 字符 / 方言 / 中英混杂 三问
互动征集「点点失明事件大赏」· 评论怪词收集
📝 给老婆审稿用
• 看蓝色框(点哥/点点口播)——这是要录的话,看顺不顺、好不好讲、有没有"AI 味"
• 看绿色框(D 号 i2v)——这是点点演的镜头,看脑补出来萌不萌、有没有比 ep01 招牌镜头
• 看暖红/冷蓝/清绿三幕分隔条——节奏感对不对、情绪推升够不够
• 看暖橘色 💡 埋点——每一段在埋哪一层观众认知收获、对照看是不是空话
• 看顶上金色金句三连——三句话是不是真的够灵魂、有没有 ep01 「不是会思考 是会预测」那种世界观级别
• 看顶上 5 层认知收获清单——观众离开后真能带走这些吗
🔴 立项 v1 的不确定点(等你拍板)
• 灵魂金句三连:当前「不识字识数字 / 隔词典 / 压缩=智能」三锤递升 · 要不要砍掉 Ilya 那句(最抽象 · 但最有世界观感)
• SolidGoldMagikarp 段:90s 揭秘戏码 · 算"圈内梗" · 大众观众接受度未知 · 要不要砍到 60s
• 国产 AI 反转段:碰边"评比模型" · 走"中性叙事" · 是否要更弱化品牌名
• 集长 12:30 比 ep01 14:50 略短 · 是不是再加深一段(如多举 2-3 个 AI 切错的具体例子 / 加 BPE 算法可视化)
• 互动征集 topic「点点失明事件大赏」——名字够不够抓人 · 还是直接「评论你说过 AI 听不懂的怪词」