知乎上刷到一个问题《为什么 LLM 仅预测下一词,就能「涌现」出高级能力?》,看了几篇高赞回答,像一颗石子,落进心里那片静水。
“压缩即智能”——为了预测准确,模型被逼得没办法,只能去理解整个世界的运作规律。它不是想理解,是为了降低误差,被迫演化出了理解。读到这里,我忽然想起另一句盘桓在心里很久的话:“广度是深度的副产品。”
这两句话,一句讲机器的智能,一句讲人的学问,看似无关,放在一起却绞成了一条绳。
大模型为了在浩如烟海的数据里精准预测下一个词,必须放弃死记硬背,转去提取规律,压缩信息。人要想拥有真正的广度,何尝不是如此?必须先在某一条线上深深扎下去,提炼出那种被压缩过的抽象规律与联结。所谓“压缩”,就是抓到本质,抓住那条可以牵动万物的主线。 继续阅读“下一个词,与命运的流形”