
凌晨2点,一个B站直播里还有两百多人,同时在看一个人反复让DeepSeek跑任务。
屏幕上没什么特别的。
一个终端,一个Agent,一段不断往下刷的思维链。
弹幕却一直没停。
有人让他换一个Prompt,有人说重新开Session,有人怀疑刚才的请求被路由到了另一个版本,还有人已经在自己的电脑上复现刚才的结果。
这天是DeepSeek V4 Pro正式版和Harness发布的日子。
模型能力、不同版本、Harness效果,讨论还很混乱。
很多事情没有官方答案,连大家测到的是不是同一个东西,都说不清楚。
两百多人就在直播间里陪着他,一遍一遍地跑。
这个场景让我对B站有了一点新的认识。
在此之前,我基本没把它当成一个AI技术社区。
评论区居然开始研究模型指纹
我平时也看B站,只是看的东西跟AI没有太大关系。
鬼畜、军事,有时候首页推来一个几十分钟的视频,也会莫名其妙看完。
如果真要追一个刚发布的模型,我过去的习惯很固定:先看X,再去GitHub、Hugging Face,然后翻国内几个开发者社区和群。
B站通常排不到前面。
我对它的理解更接近一个内容(鬼畜)平台。
事情已经发生有一段时间后,有人研究明白了,再做成视频讲一遍。
最近一直在追DeepSeek V4,我才发现这个理解已经有点过时了。
我回头看了一下自己看到的DeepSeek有关内容。
V4 Pro不同版本的性能差异,社区后来讨论的几个不同模式,包括灰测的版本线索,再到Harness发布以后模型表现发生的变化。
我惊讶的发现,其中不少最早的线索,我居然都是在B站看到的。
不是有人把X上的帖子翻译搬运回来,是真的有人在测。
V4 Pro刚出来时,有一段时间社区非常混乱。
同样是DeepSeek V4 Pro,不同人拿到的结果差异很大。
有人觉得它已经强得很离谱,也有人觉得和之前相比没什么变化。
慢慢地,社区开始怀疑后端是不是存在多个版本,或者不同请求被路由到了不同模式。
我后来写过一次「三个模式」的讨论。
其中不少线索来自隔山水樵的视频和评论区。
评论区有人质疑他的测试环境:是不是Max模式?Key是什么时候开的?有没有可能碰到灰度测试或者不同路由?
他的回应不是简单说「我确定没有」。
他把Key创建时间、测试模式和自己的判断依据都放了出来。

讨论到后面有人开始观察模型的思维链。
发现这个版本经常说 users want me,另一个版本更常出现 let me。
一些人开始把这些细微的语言习惯当成模型指纹,再拿自己的Key去交叉测试。
有人提出猜测,有人立刻反驳;有人贴截图,有人重新跑。
很多结论后来未必都成立。
但这件事本身很有意思。一个视频网站的评论区,正在进行一种很民间的模型逆向研究。没有标准实验设计,没有论文,也没有人提前知道正确答案。
大家只是发现「这个东西好像不对」,然后开始往下挖。

DeepSeek Harness发布以后,我又看到了类似的事情。
小明XBright注意到,Harness的Minimal模式有一个反直觉的地方:工具明显更少,实际任务表现却可能比Standard更好。如果只是做模型测评,到这里已经足够了。
放两张跑分,再得出「少即是多」的结论,一条内容就完成了。
但他继续往下拆。
他在Windows环境中,用标准工具尝试还原Minimal模式的工作方式,想弄清楚真正影响模型表现的到底是什么。
工具数量、System Prompt、Context组织方式,还是Harness本身改变了模型解决问题的路径?
到了这里,它已经不太像一个传统意义上的「AI视频」。更像一份公开的实验记录。
新模型发布后,先开一场直播
后来我发现,这种内容在B站并不少。尤其是在新模型发布的头几天。
这是B站和X、GitHub很不一样的地方。X擅长快速传播一个结论。一个模型发布,Benchmark截图、体验判断、成功Case会在几个小时内铺开。GitHub则更适合代码最终沉淀下来。B站保留的是另一种东西:过程。
新模型上线几个小时,就有人开直播。主播先准备几个Case,观众在弹幕里继续出题。一个任务跑得特别好,大家会研究它为什么成功;跑崩了,就开始往前翻,看问题到底出在第几步。有人怀疑Prompt,就换Prompt。有人怀疑Context,就开一个新Session。有人觉得模型被路由了,就换Key再跑。
直播间里甚至没有明确的「主播」和「观众」分工。很多时候,观众也在自己的电脑上跑。一个人在直播间里发现异常,几十个人同时开始复现。几个小时以后,其中一个人把结果整理成视频;第二天,评论区又多了一轮讨论。再过一天,可能已经有人把解决方案写成了代码。

这是一种很奇怪的技术社区形态。十几年前,这些事情可能发生在论坛里。一个人发帖说自己发现了一个Bug,下面几十层回复一起排查。现在帖子变成了视频,回复变成了弹幕。连实验本身也变成实时的了。
模型刚发布,研究已经开始。
从测模型,到自己做东西
B站自己披露的数据,其实也能解释这种变化为什么会发生。
它早就不只是少数程序员偶尔发技术视频的地方。
AI已经成为平台增长很快的一类内容,观看模型测评、编程、Agent和各种AI应用的人越来越多。
过去内容创作者和开发者往往是两个角色。
一个人做项目,另一个人负责把它讲出来。现在越来越多时候,这两件事是同一个人在做。
最近DeepSeek Harness的插件生态里,就出现了两个挺典型的例子。
8月13日晚的DSH插件热榜快照中,colleague-skill排在第1。
它的作者@只是路过的titanwings,是一名B站UP主。

这个项目解决的问题很具体:怎么把同事脑子里的工作经验变成Agent能够直接调用的Skill。
公司里真正有价值的知识,很多时候并没有被写进知识库。
它可能只是一个销售做了几年以后知道,面对某类客户应该先问哪几个问题;也可能是一个运营看到一组异常数据时,下意识知道第一步应该检查哪里。
这些经验很难被传统知识库捕捉。
colleague-skill尝试把它们结构化,让Agent能够复用人的工作经验,并完成了DeepSeek Harness的适配。
同一晚的热榜快照里,第3名OpenBiliClaw的作者littlewish,同样是一名B站UP主。它做的事情甚至和B站本身有关:让Agent连接和使用B站内容。

我们通常说让Agent连接互联网,想到的是Google、网页搜索和浏览器。但中文互联网有大量有价值的信息并不以一篇结构清晰的网页存在。
它可能是一段视频,也可能在评论区,或者分散在一个创作者过去几个月的内容里。OpenBiliClaw尝试让Agent进入这些内容场景。
项目随后也在GitHub开源,开发者可以继续通过Star、Fork和Issue参与。
它们提供了一个有意思的切面。
B站上的AI内容,正在形成一条以前不太常见的链路:先有人讨论一个问题。
有人开始测试。围观的人参与复现。开发者发现真实需求。
最后做成Skill、插件或者产品,再开源到GitHub。
内容、社区和开发之间的边界变得越来越模糊。
B站在这条链路里承担的,也不只是「传播」的角色。
它开始成为一些开发者找到第一批用户、获得反馈,甚至寻找合作者的地方。
AI需要的,可能刚好就是这种社区
这也是我最近对B站改观最大的地方。
过去我们很容易想象,真正前沿的AI工作应该发生在几个固定的地方。
研究在实验室、代码在GitHub、消息在微信里。
国内开发者再建立几个自己的论坛和群。
但AI,尤其是大模型,改变了一部分技术社区的组织方式。
模型的门槛和传统软件不太一样。
一个刚发布的模型,任何人都可以立刻开始测试。
它的很多能力也没办法只靠一张Benchmark表格理解。
同一道题跑两次,结果可能不同;
Prompt改一点,结果可能不同;
Context、工具甚至Harness换掉,模型都会表现得像另一个东西。
于是「一起玩」本身开始变得有价值。

而视频、直播、弹幕,刚好很适合这件事。
它没有GitHub那么严谨,也没有论文那么可靠。
错误很多,猜测更多。
有人今天信誓旦旦发现了新版本,明天可能发现只是自己的测试条件出了问题。
但技术社区真正活跃的时候,本来就不是所有人都在等待最终答案。
总得有人先试。有人先猜错。
有人说「你这个不对」,然后另一群人再跑一次。
X把结论传出去,GitHub把代码留下来。
B站把实验留在了还没结束的那几个小时里。
对大模型这种高度路径依赖、又很难一次测准的东西,这几个小时可能比结论更重要。
所以现在DeepSeek再更新,我依然会打开X,翻GitHub,也会看几个熟悉的技术社区。只是多了一个以前不会有的动作:去B站搜一下。
我的首页还是很混乱。上一条可能是鬼畜。
下一条是军事。划两下,有人在直播拆DeepSeek Harness。
但现在我不觉得这几件事情放在一起很奇怪了。
B站没有在哪一天突然宣布自己要成为一个AI技术社区。
它甚至可能从来没有认真设计过这件事。
只是在这一轮AI浪潮里,一群本来就喜欢折腾东西的人,开始在这里测试模型、讨论问题、写代码,也找到和自己一样的人。
等我追DeepSeek V4的时候注意到他们,这个社区已经在那里了。
而且比我想象中热闹得多。
感谢您的观看🥹
我是Max,一个在AI方向持续探索的小学生。
我会持续更新一些AI方向最新最快的产品,技术,思考
文章来自于微信公众号 “01Founder”,作者 “01Founder”