国产大模型竟然干过了 Claude!!

受 B 站邀请,来上海参加 Bilibili builder club 的颁奖活动了。

冠军作品 AI 猫娘获得了 100 万奖金,太牛了。

现场数据墙有张参赛者选出的常用大模型榜单,我看 DeepSeek、Kimi 都上榜了,DeepSeek 甚至压过了 Claude。

这一年我评测不少模型,也把 AI 接进自己的产品。

我的判断是:头部模型仍有差距,但都已跨过"够用"的临界点。

选模型正在变成选基础设施。成本、稳定性、中文理解和生态适配,会直接影响用户选择。

这份榜单更像一张真实调用清单:国产模型已从"被讨论"走到"被调用"。

嘉宾卡比大佬谈到 Harness,说了句暴论:

Skill 将死,方法论永生。

Skill 里的技巧会被模型吸收;第一性原理、消融实验、对抗式审查这些方法论,一个词就能激活整套思路。

我认同。Harness 的价值,是把人的方法论变成 Agent 能执行的规则:什么该做,什么算完成,什么错误必须拦。

每次纠正、确认、重写、否定,都是高质量数据。跑得够久,它会记住那些"只有你我知道"的东西。

Skill 会旧,模型会换。你的判断和共同上下文更难复制。

听到这里,我发现 B 站也在把 Harness 从个人工作流,变成公开协作。

过程视频沉淀方法,Toy 承接体验,评论区产生需求、纠正和判断。按卡比的说法,这些都是高质量对齐数据。

模型给普通人能力,B 站给他们公共上下文和第一批用户。64% 没有开发背景、80% 以上单人组队,也能把产品做出来;近 60% 还会根据反馈继续改。

内容和产品在这里合流。

冠军作品 AI 猫娘,我很早就关注了,还接进了 WeSight。现在 18 位 UP 主一起在做猫娘插件。

获奖作品「世界之门」。UP 主潜水 14 年,第一次投稿,视频近 500 万播放,直接爆火。

把这两个作品放回整个 BIP 第一季看,会更有感觉:1.34 万人交出了 3 万多份投稿,88% 还是万粉以下的 UP 主。这场创造已经走出了少数技术高手的圈子。

AI 让普通人拥有做出第一版的能力,BIP 再让创意被看见、被试玩、被用户接住。每个人都可以 Harness 大模型,最后拼的,还是谁更懂问题、谁愿意先动手。

我越来越确定:Demo 会越来越容易,真正稀缺的是问题意识、个人判断,以及第一批愿意陪你改的人。

以前学 AI,我会去 B 站找教程。现在还能边做边讲,让想法长成产品、被更多人看见。

我看 BIP 第二季开了。兄弟们,我要不要也冲一冲?

相关推荐
ZealSinger18 小时前
Go slog生产落地LevelVar与共存
开发语言·后端·golang·go
w***488218 小时前
SpringBoot整合easy-es
spring boot·后端·elasticsearch
dpharness19 小时前
踩完 dsh-ads 的四个坑,我说说虚构排名该怎么看
后端
预知同行19 小时前
深入解析 AI 应用可观测性:OpenTelemetry GenAI 规范下的调用链追踪与 Token 成本治理
后端·架构
张宏宇19 小时前
我把微软开源的 tgrep 做成了本地版 GitHub Code Search:45,629 个文件里搜一次 10ms
前端·后端
打工仔折腾 AI19 小时前
把模型切换交给平台:用蓝耘智能路由搭建商品评论分析工具
java·服务器·前端·后端·python·性能优化·ai agent 实战
后端LV19 小时前
Caffeine 源码详解:为什么它是最快的 Java 本地缓存——一次压测引发的源码考古
java·后端
dd聊技术19 小时前
RAG 召回不准,先别急着换模型:用 RRF 把 BM25 和向量召回接起来
后端
dadaobusi19 小时前
Trace-driven 建模(基于轨迹/踪迹的建模)
java·后端·spring
1360967572319 小时前
服务器回显里的四个假故障
后端