节点 NEXUS · 认知
第 02 课 · 点点的字典
AI 不识字 · AI 识数字 · 你跟它之间永远隔着一本词典
时长 ≈ 13:00
口播字数 ≈ 2200 字
点点 i2v 镜头 22 个
真人点哥 3 段
版本 v1 · 灵魂层立项
全 片 灵 魂 金 句 三 连
「AI 不识字 · AI 识数字。」第一锤
「你跟 AI 之间 · 永远隔着一本词典。」第二锤
「足够好的压缩 · 就是智能本身。」第三锤 · Ilya Sutskever
📌 观众看完带走的 5 层认知收获
- 心智模型升级:AI 看到的不是字 · 是一串数字 · 中间隔了一本词典
- 解释力:8 个为啥(为啥数 r 错 / 为啥中文贵 / 为啥同句话不同模型反差大 / 为啥偶尔崩溃 ...)
- 行动改变:30 秒判断法 · 字符级任务别用 LLM · 避方言生僻字 · 选适配语言的模型
- 谈资:SolidGoldMagikarp 诅咒事件 / Ilya 压缩论 / Karpathy 金句 / BPE 30 年 / 国产分词器主权战
- 态度转变:从「嘲笑 AI 笨」→「理解局限来自设计选择 · 聪明地用」
栏目护城河 · 全 i2v 点点具象化
i2v 点点视频 · 把抽象概念演给观众看(栏目铁律 3)
真人 点哥出镜 ·
舞台 黑屏 / 字幕 / 转场 ·
图卡 CSS 视觉锚
💡 认知点埋点 = 这一段对应"5 层认知收获"里的哪一层
全黑底字幕 · 节点 NEXUS 角标常驻 · 配音独白 · 节奏紧
点哥旁白
你今天发给 AI的所有信息——
每一条消息、每一个 prompt——
你以为它读到了你打的字。
真相是——
它一个字都没看见。
它看到的,
是一串数字。
这一节 12 分钟——
我带你看清楚——
你跟 AI 之间,到底隔着什么。
💡 埋点 · 第 1 层(心智模型):第一秒就建立"你以为/真相是"的认知断层 · 跟 ep01「你以为它在思考 · 它在预测」同等节奏。
全黑 · 节点 NEXUS 品牌 whoosh 音效(栏目辨识度三件套之一)
第 二 课
点点的字典 · AI 不识字,AI 识数字
点哥
大家好,我是你们的点哥。
欢迎回到节点 NEXUS · 认知栏目第二课。
上集啊——我们讲了一件事——
AI 不是会思考,是会预测。
他在做接龙,猜下一个字最可能是啥。
那今天我们继续问——
他预测的"东西",到底是个啥?
是字吗?是词吗?
D01 点点登场摇头 · 4s i2v
具象化:点点从画面右下蹦出 · 听到"字吗?词吗?"开始疯狂摇头 · 摇到头晕扶墙 · 萌系反差
点点
都不是!都不是!
我看到的——是数字啊点哥!
💡 埋点 · 第 1 层:抢话点出本集核心命题 · 用点点之口讲"我看到的是数字" → 让观众直接进入颠覆认知状态。
第 一 幕
压 缩 即 智 能
情绪 · 敬畏 + 颠覆世界观 · 5 分钟
论证目标:把"AI 怎么读"这个问题 → 引到"智能本质 = 压缩"(Ilya 信息论锚定)
点哥
点点说得对——
他真的不识字。
你打"床前明月光"——
他眼睛里没有"床"、没有"前"、没有"明"、没有"月"、没有"光"。
他看到的就是几个数字。
比如3344、891、1027...
D02 点点翻字典 · 字典里全是数字 · 6s i2v
招牌镜头 · 本集核心 i2v:点点举着一本厚字典 · 翻开 · 镜头推进 · 每一页全是数字(3344 / 891 / 1027 ...)· 字典扉页烫金「点点的字典」· 点点表情困惑指着数字"这是啥呀" · 暖金灯光
💡 埋点 · 第 1 层:用招牌镜头一锤把"字 → 数字"的心智转换打进观众脑子。这一镜是全片记忆点。
点哥
给你打个比方——
你每天都在用微信发语音吧?
长按、说完、松手——
旁边小图标点一下,"语音转文字"。
可有时候你说「耙耙柑」——
它给你打成「把把柑」。
你说「伢儿」——
它给你打成「牙儿」。
为啥?
因为它的字典里——
没有"耙耙柑",
没有"伢儿"。
AI 跟你之间——
就隔着这么一本词典。
它看不到字。
它只能对照词典,找最接近的一串数字。
D03 点点举耙耙柑卡片 · 5s i2v
具象化:点点举写有"耙耙柑"的纸牌 · 字一个一个褪色变成"???" · 点点惊讶捂嘴 · 卡片掉地 · 暗暖光
💡 埋点 · 第 1 层 + 第 5 层(态度):把"AI 看不懂方言"从"AI 笨"扭转成"它的词典没收录"——这一步就开始植入态度转变。
点哥
那这本"词典"——
到底咋来的?
它有名字,叫 BPE——
"字节对编码"。
重点来了——
BPE 这玩意儿——
1994 年就发明了。
30 年前的事。
当时它是干嘛用的?
一句话——
压数据。
省磁盘。
那时候硬盘贵啊,几兆都得算着用。
谁能想到——
30 年后——
一个压数据的算法——
成了整个 AI 革命的底座。
D04 1994 年复古场景 · 6s i2v
具象化:1994 年怀旧风 · 老式 CRT 显示器 + 软盘 + 老式打字机 · 屏幕跳出"BPE 压缩算法 v1.0" · 镜头快速 zoom out · 跳到 2026 · 点点站现代数据中心前指着同一个 BPE 标识 · 字幕浮"30 年"
💡 埋点 · 第 4 层(谈资):BPE 30 年时空跨度是"圈内梗"——观众下次跟人聊 AI 能掏出来"那个压缩算法 1994 年发明的你知道吗"。
点哥
那问题就来了——
一个压缩算法——
凭啥能产生智能?
这事啊——
OpenAI 前首席科学家 Ilya——
他反复讲过一句话——
R1 Ilya 真人访谈截图 · 4s 真图
真实素材:Ilya Sutskever 访谈截图 / Lex Fridman / Dwarkesh Patel 视频帧 · 配字幕英文金句 "Compression is intelligence"
点哥
他说——
「足够好的压缩,就是智能本身。」
啥意思?
我用点点给你演——
你要把一本《红楼梦》——
压成一句话——
你必须真的看懂了。
要不然你压不下去,
要不然你压出来就是胡说。
压得越小、还能展开——
说明你越懂。
AI 也一样。
他把整个互联网——
几万亿字的人类语言——
压进了他的词典和参数里。
他能压成这样——
说明他真的,懂。
D05 点点压《红楼梦》· 6s i2v
核心具象化:点点抱厚重《红楼梦》· 双手用力压 · 书越压越小 · 最后变成一个发光小立方体 · 点点举起小立方体露惊叹表情 · 神圣金光
💡 埋点 · 第 1 + 4 + 5 层:本集世界观锚 · Ilya 信息论原理 · 这一镜决定 ep02 是"科普 token"还是"理解智能本质"。
点哥
给你几个数字感受一下——
人类日常常用——
5000 个汉字。
GPT 的词典——
5 万条。
Claude 的词典——
20 万条。
国产 DeepSeek 的词典——
15 万条。
然后呢——
GPT-4 训练用了多少数据?
13 万亿条。
13 万亿啊朋友们——
一个压缩算法——
把13 万亿条语言——
压进了一本20 万条的词典里。
这就是为啥AI 能。
D06 词表三大墙对比 + 13 万亿海洋 · 8s i2v
具象化:左中右三道大墙(5 万/20 万/15 万分别贴 GPT/Claude/DeepSeek 标签)· 点点站墙前小小一个 · 镜头切到 13 万亿 token 数据海洋 · 点点跳进去游泳 · 巨大对比反差
💡 埋点 · 第 2 层(解释力):观众看完这段就能解释 context window 中英文吃量不同 · API 计费按 token 的根因。
第 二 幕
诅 咒 与 瞎 点
情绪 · 神秘 + 揭秘感 · 4 分钟
论证目标:既然 AI 看到的是数字 → 反推它的"瞎点"在哪 · LLM 所有怪 bug 都是 tokenizer 的锅
点哥
那既然 AI 看到的是数字——
他对"字"的体验,到底是啥样?
我举个最经典的例子——
"strawberry"(草莓)——
英文几个 r ?
你数得清——
3 个。
问 GPT。
GPT 给你说——
2 个。
(笑)你说他笨吗?
不是。
是他看不见 r。
D07 strawberry 在 AI 眼里 · 5s i2v
具象化:屏幕显示"strawberry" · 镜头从人类视角切到 AI 视角 · 字母 s-t-r-a-w-b-e-r-r-y 全部消失 · 取而代之是一个发光的整数 token "[27015]" 一团 · 点点看着这个数字皱眉数手指
点哥
在他眼里——
"strawberry" 就是一团——
一个编号——
他从没见过 s, t, r, a, w, b, e, r, r, y 这些字母。
你让他数 r ——
就像让蒙眼的人数没见过的东西。
💡 埋点 · 第 2 层 + 第 5 层:把"AI 数 r 错"这个被嘲笑了三年的事 · 给出原理级解释 · 完成"嘲笑 → 理解"态度转变。
点哥
其实啊——
AI 数 r 数不清——
只是冰山一角。
你让他反转字符串——他做不好。
你让他做简单算术——他翻车。
你让他判断两个字符的差别——他装看不见。
所有这些——
都是同一个根。
Karpathy——
OpenAI 创始团队、特斯拉前 AI 总监——
他专门录过一个两小时的视频讲这件事。
他说——
R2 Karpathy 视频截图 · 4s 真图
真实素材:Karpathy "Let's build the GPT Tokenizer" YouTube 视频帧 · 配英文字幕原话 "Tokenization is at the root of much weirdness of LLMs"
点哥
「Tokenization 是 LLM 一切怪 bug 的根。」
一句话——
把锅——
全甩给了切片机。
💡 埋点 · 第 2 + 4 层:8 个"为啥"在这里 1 句话扫平 · 谈资双锚(Ilya + Karpathy)双大神金句构成本集"硬通货"。
点哥
讲到这——
我必须告诉你一件真事——
一件 AI 圈到现在都津津乐道的真事。
2023 年——
几个研究者在玩 GPT 的词典——
他们发现里头有一批奇怪的词——
比如——
"SolidGoldMagikarp"。
这词啥意思?
它没意思。
它就是个玩家昵称。
某游戏论坛里某个老哥用了 5 年的 ID。
R3 LessWrong 原文截图 + Reddit 截图 · 6s 真新闻
真实素材:LessWrong "SolidGoldMagikarp" 原帖截图 + Reddit r/MachineLearning 讨论截图 · 标题高亮 "anomalous tokens" / "诅咒 token"
点哥
关键的来了——
研究者把这个词丢给 GPT——
问他:这个词什么意思?
GPT 直接疯了。
他要么装死不回答——
要么胡言乱语——
要么张口骂人——
要么自称外星人——
要么直接说——
"我是 distribute"——
(根本不是个词)。
研究者一查——
发现这个词进了 GPT 的词典——
但训练数据里几乎没有它。
GPT 从没真正"读过"这个词。
所以遇到它——他瞎了。
D08 点点翻字典翻到诅咒页 · 7s i2v
核心揭秘镜头:点点翻字典 · 翻到中间某一页 · 字典着火(金色火苗 不暴力)· 点点瞳孔变 ??? · 嘴里冒泡泡说外星语 · 字典自动翻页过去 · 镜头神秘暗光
点哥
后来人们管这种词叫——
"诅咒 token"。
每个大模型——
词典里都藏着几个这样的角落——
研究者还在挖。
(顿)你以为 AI 读完了整个互联网?
其实——
他的词典里——
有些角落他从没去过。
💡 埋点 · 第 4 层(谈资)核心 · 第 5 层(态度)核心:SolidGoldMagikarp 是本集"社交货币"——圈内人都知道、圈外人没听过、观众拿走就能装。同时把"AI 强大"的崇拜感拉回"AI 也有盲区"的清醒感。
点哥
其实啊——
不光是诅咒词——
中文方言——
生僻字——
古文——
AI 都视若无睹。
你跟他说"耙耙柑"——他装作懂——
其实他的词典里没这个。
你跟他说"魑魅魍魉"——
他能切成6 段——根本不是个词。
所以这里——
我要给你第二句锤子——
金句
你跟 AI 之间——
永远隔着一本词典。
D09 点点 vs 点哥隔着透明大字典 · 6s i2v
核心金句具象化:点哥真人 + 点点分别站画面两边 · 中间悬浮一本巨大透明字典 · 两人想握手 · 手伸不过字典 · 字典里数字流动 · 神圣感 · 字幕浮金句
💡 埋点 · 第 1 层 + 灵魂金句第二锤:这是本集情绪最高峰 · 把所有铺垫一句话收口 · 观众离开后能记住这一句就够本集。
第 三 幕
重 新 看 A I
情绪 · 清醒 + 拥抱 · 2.5 分钟
论证目标:把前两幕的认知 → 落到行动 · 观众离开有具体能用的东西
点哥
那好——
既然 AI 看到的不是字——
是词典里的编号——
那我要怎么写 prompt——
才能让他看清楚我要说的事?
我给你30 秒——
教你三个判断——
下次用 AI 前过一遍。
点哥
第一问——
这是字符级任务吗?
数字母?反转?拼写?
是——别用 AI。用 Python 三行搞定。
第二问——
里头有方言、生僻字、古文吗?
有——换说法。
"耙耙柑"换成"杂柑"。
"伢儿"换成"小孩"。
第三问——
中英文混杂,大段哪边?
大段中文——优先国产模型。
大段英文——优先海外模型。
(不是品牌问题,是词典适配问题。)
C-11 30 秒判断法工具图卡 · 全段 CSS 图卡
截屏神位:cards-skin.css 三栏卡片 · 暖金底 · 三个问题大字 + 简洁动作建议 · 全 ASR 字级 stagger 入场 · 跟 ep01 卡 08「30 秒 3 问」同款套路 · 用户截屏发朋友圈/同事群
💡 埋点 · 第 3 层(行动改变)核心:观众看完这一段获得"截屏带走"的工具卡 · 是节目的复用价值锚。
点哥
再给你一个反转——
很多人以为——
中文用 AI 吃亏——
一个汉字按 2-3 个 token 算钱——
比英文贵两倍。
但这两年——
DeepSeek、Qwen、Kimi——
这些国产模型专门重训了中文分词器。
意思就是——
他们把中文重新切了一遍——
给中文优化了一本新词典。
现在你拿中文问 DeepSeek——
反而比英文还便宜。
所以你别看 AI 模型卷得凶——
其实最底层的战争——
是在词典这一层打的。
AI 的词典——
也是国家的词典。
D10 点点抱新词典 + 国产 logo 墙 · 5s i2v
具象化:点点举一本红色「中文优化版」词典 · 翻开 · 里面汉字配整齐数字 · 后景出现 DeepSeek/Qwen/Kimi 三个真彩 logo 墙(用 lobe-icons 真图)· 不拉踩 · 正面叙事
R4 DeepSeek tokenizer 优化新闻截图 · 3s 真新闻
真实素材:DeepSeek 官博 / 技术报告 PDF 截图 "中文 tokenizer 重训" · 配字幕中文小字
💡 埋点 · 第 2 + 4 层:观众离开能解释"为啥国产 AI 中文体感好" · 同时获得"分词器主权战"这个产业级谈资。
点哥
所以——
这节课最后——
我用三句话——
给你封顶。
第一锤
AI 不识字——
AI 识数字。
第二锤
你跟 AI 之间——
永远隔着一本词典。
杀手锏
足够好的压缩——
就是智能本身。
—— Ilya Sutskever · OpenAI 前首席科学家
C-13 三连金句图卡 · 6s CSS 图卡
招牌图卡:cards-skin.css `.tbh` + `.gate` 黑底暖金 · 三句金句逐句弹出 · 第三句 Ilya 落款 + 配 ep01 同款 `.mrv` 杂志收尾感
💡 全片认知收获在此封顶:金句三连按"现象层 → 关系层 → 本质层"递升 · 第一锤打懂 / 第二锤打透 / 第三锤打深。
点哥
最后三件事——
第一——
评论区告诉我你说过哪些 AI 装听懂其实没听懂的怪词——
我们做一期——
「点点失明事件大赏」。
第二——
下集——
「点点的大脑」——
我们讲138 亿个参数——
AI 凭啥"知道"那么多事——
一次给你讲透 MoE。
第三——
这是节点 NEXUS 认知第一季——
点点诞生记——
12 课——
我们一节一节—— 把 AI 拆给你看。
D11 + C-14 系列地图 + 点哥点点并肩落版 · 8s i2v 图卡
栏目辨识度收尾:12 集进度条 · 第 02 课 ✅ 点亮 · 暖金光晕 · 点哥真人 + 点点并肩看远方 · 杂志收尾感 · 杂志边框 + "节点 NEXUS · 认知课" + "第 02 课 · 完" + "下一课 → 第 03 课《点点的大脑》"
📊 全片统计
| 总时长 | ≈ 12:30 净讲(13:00 含转场) |
| 口播总字数 | ≈ 2200 字 |
| 三幕分配 | 第一幕 5:00 · 第二幕 4:00 · 第三幕 2:30 · 钩子+落版 1:00 |
| 点点 i2v 镜头 | D01-D11 共 11 个 · 复用 ep01 角色 ref + Wan/Seedance 双通道 |
| 真实素材锚 | R1 Ilya 访谈 · R2 Karpathy 视频 · R3 SolidGoldMagikarp 真新闻 · R4 DeepSeek 官博 |
| CSS 图卡 | C-11 30 秒判断法 · C-13 灵魂金句三连 · C-14 系列地图(复用 ep01 cards-skin.css 套路) |
| 真人点哥 | 3 段(开场介绍 + 中间衔接 + 收尾落版) |
| 灵魂金句三连 | 不识字识数字 / 隔着一本词典 / 压缩=智能 |
| 大神金句锚 | Ilya(压缩=智能)+ Karpathy(tokenization 是根) |
| 真新闻事件锚 | SolidGoldMagikarp 诅咒 token(圈内梗 · 圈外没听过) |
| 工具卡 | 30 秒判断法 · 字符 / 方言 / 中英混杂 三问 |
| 互动征集 | 「点点失明事件大赏」· 评论怪词收集 |
📝 给老婆审稿用:
• 看蓝色框(点哥/点点口播)——这是要录的话,看顺不顺、好不好讲、有没有"AI 味"
• 看绿色框(D 号 i2v)——这是点点演的镜头,看脑补出来萌不萌、有没有比 ep01 招牌镜头
• 看暖红/冷蓝/清绿三幕分隔条——节奏感对不对、情绪推升够不够
• 看暖橘色 💡 埋点——每一段在埋哪一层观众认知收获、对照看是不是空话
• 看顶上金色金句三连——三句话是不是真的够灵魂、有没有 ep01 「不是会思考 是会预测」那种世界观级别
• 看顶上 5 层认知收获清单——观众离开后真能带走这些吗
🔴 立项 v1 的不确定点(等你拍板):
• 灵魂金句三连:当前「不识字识数字 / 隔词典 / 压缩=智能」三锤递升 · 要不要砍掉 Ilya 那句(最抽象 · 但最有世界观感)
• SolidGoldMagikarp 段:90s 揭秘戏码 · 算"圈内梗" · 大众观众接受度未知 · 要不要砍到 60s
• 国产 AI 反转段:碰边"评比模型" · 走"中性叙事" · 是否要更弱化品牌名
• 集长 12:30 比 ep01 14:50 略短 · 是不是再加深一段(如多举 2-3 个 AI 切错的具体例子 / 加 BPE 算法可视化)
• 互动征集 topic「点点失明事件大赏」——名字够不够抓人 · 还是直接「评论你说过 AI 听不懂的怪词」