最近有点魔怔,因为思路完全卡住了。现在的claude code、codex、hermes就是LLM的wrapper而已,而且LLM为了在RL里刷分,幻觉会提高不少。它见过的东西确实写得很不错,它没见过的真的是胡扯。
顺着deepseek招聘的新闻也顺便看了下它的招人JD,和我想得差不多,底层需要infra团队gpu+storage想办法计算调度拉满+RDMA把网络带宽拉满,模型核心之外,除了比较新的harness团队,还有一个绝对绕不过去的坎就是搜索引擎(所以百度和google其实是有天生超大优势去作agent的),再下一步它应该就要招垂直领域去在商业合作上下功夫开疆拓土了,想走toC赚广告的互联网模式现阶段还是难了点。
从商业模式拉回来,我们继续想agent的设计。上一话我们提到了构建代码驱动的推理,那么如何构建一个function搜索引擎,如何逐步更新这些function,什么时候该重构,什么时候合并。我一周写一个领域然后用户多了开始各种流程path都走通了,这些raw data怎么能成为知识。从deepseek的使用上,它的thinking也已经在逐步进步比如肉眼可见拆解用户intent,但是1M上下文毕竟还是有限的,在大工程里根本微乎其微,harness其实就是外置知识的探索,从bm25、word2vec到any2vec,只能说我们完成了知识的压缩,本来很大一团离散知识,现在变成可计算的vector了而已,知识表示和更复杂的关系网处理还需要修炼。
更深入的是------魔怔的重点------我开始思考到底"什么是知识?"这个完全把我难住了。对于tri-tuple来说object predicate subject这个是没法表述复杂经验或者复杂知识的。因为想用function拆解从user input到generated output的时候,我们会发现中间的推理可能会用到"知识图谱",但是解析和生成或者说处理unstructure数据的时候,就有天然的屏障,这部分知识到底该如何表示,这也是通常因为有了LLM而被完全忽视的知识表示。我还得花点时间,多手动写写这样的伪代码,然后一层一层把function拨开写下去,并且需要找到一种基于状态机的知识表示法,这样我才能完全去映射常量、变量、函数、文件、模块、系统。
思路卡住的时候,我也会和LLM讨论,比如如果专家系统的rules达到million甚至trillion级别,可不可能和现在的LLM一样表现出色------结论是原来没人能达到过这个级别------这个是一个可以探索的方向,它和原来研究到seq2seq和BERT以后因为一直参数偏小遇到瓶颈,GPT把数量级做上去真的就给它做成了...这和当时CNN对图像识别也是,deep越来越深最后darknet到19层发现似乎视觉空间被击穿,而语言是在transformer以后随着层数增加然后被击穿。
人类其实思考的时候有一个奇怪的步骤就是提前假设某个东西成立然后代入并得到一个内部轮廓估算,通过内部轮廓和外部轮廓的挤压最后形成思维路径。这个外部轮廓和内部轮廓其实以前的文章里说过:大模型LLM就是一个外部轮廓拟合器,你气球足够大,把东西装进去然后放气直到拟合这个东西的外部轮廓,但是大模型对内部轮廓捉襟见肘,这个必须要logic离散逻辑去控制,不然它就会被反向传播拉得死去活来。比如我们看见燕子会飞,然后我们知道燕子是鸟,我们会假设所有鸟都会飞,然后碰到大部分都对了我们会记录一个轮廓或者margin,并且我们还会使用例外列表,比如鸵鸟、企鹅不会飞。内部轮廓很像图查询,比如给出"汽车"和"苹果",思维需要找到一个通路,比如开汽车去买苹果。
汽车到苹果只是简单的一个链路,而现实复杂得多是一个hypergraph。当初在思考怎么搞meta learning的时候,就是我如何让知识表示知识,让旧知识拆解新知识,然后再包装起来,当时只是脑洞到一个常数 e,就是 limit ((n+1)/n)^n n+1片知识+1是新知识,被原先的n片知识分解,再用n片知识包装,n趋于无穷大就是e,大概知识的维度是2.71... 扯远了,看来在abstract上还是得研究得更透彻一些才行。所以问题还是"什么是知识"。
最近产出低下,只能先表述下脑海中的大概影像。在一步一步往前走吧。