受 B 站邀请,来上海参加 Bilibili builder club 的颁奖活动了。
冠军作品 AI 猫娘获得了 100 万奖金,太牛了。
现场数据墙有张参赛者选出的常用大模型榜单,我看 DeepSeek、Kimi 都上榜了,DeepSeek 甚至压过了 Claude。
这一年我评测不少模型,也把 AI 接进自己的产品。
我的判断是:头部模型仍有差距,但都已跨过"够用"的临界点。
选模型正在变成选基础设施。成本、稳定性、中文理解和生态适配,会直接影响用户选择。
这份榜单更像一张真实调用清单:国产模型已从"被讨论"走到"被调用"。
嘉宾卡比大佬谈到 Harness,说了句暴论:
Skill 将死,方法论永生。
Skill 里的技巧会被模型吸收;第一性原理、消融实验、对抗式审查这些方法论,一个词就能激活整套思路。
我认同。Harness 的价值,是把人的方法论变成 Agent 能执行的规则:什么该做,什么算完成,什么错误必须拦。
每次纠正、确认、重写、否定,都是高质量数据。跑得够久,它会记住那些"只有你我知道"的东西。
Skill 会旧,模型会换。你的判断和共同上下文更难复制。
听到这里,我发现 B 站也在把 Harness 从个人工作流,变成公开协作。
过程视频沉淀方法,Toy 承接体验,评论区产生需求、纠正和判断。按卡比的说法,这些都是高质量对齐数据。
模型给普通人能力,B 站给他们公共上下文和第一批用户。64% 没有开发背景、80% 以上单人组队,也能把产品做出来;近 60% 还会根据反馈继续改。
内容和产品在这里合流。
冠军作品 AI 猫娘,我很早就关注了,还接进了 WeSight。现在 18 位 UP 主一起在做猫娘插件。
获奖作品「世界之门」。UP 主潜水 14 年,第一次投稿,视频近 500 万播放,直接爆火。
把这两个作品放回整个 BIP 第一季看,会更有感觉:1.34 万人交出了 3 万多份投稿,88% 还是万粉以下的 UP 主。这场创造已经走出了少数技术高手的圈子。
AI 让普通人拥有做出第一版的能力,BIP 再让创意被看见、被试玩、被用户接住。每个人都可以 Harness 大模型,最后拼的,还是谁更懂问题、谁愿意先动手。
我越来越确定:Demo 会越来越容易,真正稀缺的是问题意识、个人判断,以及第一批愿意陪你改的人。
以前学 AI,我会去 B 站找教程。现在还能边做边讲,让想法长成产品、被更多人看见。
我看 BIP 第二季开了。兄弟们,我要不要也冲一冲?