
起底 K3 背后核心极客天团,人均扛起 7 亿估值!
7 月 27 日,月之暗面拿出全部诚意,直接把满血版 2.8T 模型 Kimi K3 全部开源了。在技术报告的最后,他们首次公布了Kimi K3背后的实际贡献者名单,我们细数了一下,有401位成员,可以说,这是月之暗面人才团队的一次全面亮相。


从当初那个估值仅几亿美金的初创团队,到如今名副其实的“国产大模型之光”,月之暗面已然成为全球牌桌上,少数能与 Claude Fable 5 和 GPT-5.6 Sol 这样顶尖模型“掰手腕”的极客团队。
伴随 K3 的发布,月之暗面最新估值飙升至 315 亿美元,约为 2100 亿元人民币,而撑起这 2100 亿估值的,是一个极度年轻的团队。
据公开信息显示,月之暗面大概有 300 多人,平均年龄不到30岁,其中,80% 是 I 人。如果换算一下,基本人均扛起7亿人民币的估值。
月之暗面的组织形式十分扁平。月之暗面一共有五个创始人,平均每人直接对接 40-50 人。内部以“无职级、无KPI、无部门墙”著称,员工随时可以挑战老板。有一个细节是,在2025年初反思会,有员工提激进建议,杨植麟听完后做得比建议更激进,直接放弃 K1 转做 K2。
这种不拘一格同样体现在公司的“灵魂”里。作为摇滚爱好者的杨植麟,将会议室冠以 Rolling Stones、Nirvana、Radiohead 等传奇乐队之名,甚至连 Kimi 的会员套餐都以 Adagio(柔板)、Allegro(快板)等音乐术语来命名。
月之暗面坚信,在算力和数据日益同质化的今天,“品味”才是建立差异化壁垒的核心驱动力。这种品味不仅体现在模型打磨上,更深刻地映射在他们对人才的挑剔与渴望上。
月之暗面喜欢雇佣 CEO 们,非常青睐有“创业者光环”或“赌徒基因”的人。据公开资料显示,公司内部至少有 50 人创办或加入过创业公司。而在过去一年,月之暗面招聘的新人中有超过 100 个是通过内部推荐进来的。
今天,我们按照名单,全面深挖,将 K3贡献者有关的一切公开可信信息汇总于此。这支顶尖极客军团的核心背景与硬核实力,尽数展现。
01
Kimi 技术体系顶层基石
▎周昕宇:

周昕宇是月之暗面的核心联合创始人之一,同时他也是算法团队负责人。
周昕宇与杨植麟早就相识,很有趣的一个细节是,周昕宇曾是清华大学 Splay 乐队吉他手,而鼓手正是杨植麟。
在加入月之暗面之前,周昕宇曾在旷视从事算法量产及移动端模型研究。他与当时旷视的基础科研负责人、现任阶跃星辰的首席科学家张祥雨紧密合作,作为核心作者亲手写出了轻量化网络大作 ShuffleNet。
周昕宇的主攻方向是大模型算法量产化,擅长将最前沿的实验室算法,高效率、低成本地转化为大规模生产线系统。他还擅长混合架构优化,在 Reddit 社区的技术交流(AMA)中,率先拆解了 Kimi K3 KDA 混合架构结合 NoPE MLA 的对比优势,证实该架构在预训练和强化学习中更省算力、速度更快。
▎吴育昕:

吴育昕是月之暗面的联合创始人之一。同时,他还是人工智能领域的顶尖专家与明星架构师,在深度学习、计算机视觉(CV)以及大语言模型(LLM)的底层工程架构与基础设施上拥有极深造诣 。
吴育昕与杨植麟拥有相同的教育背景,本科毕业于清华大学计算机系,随后赴美国卡内基梅隆大学(CMU)深造 。他曾在 Meta AI 研究实验室(FAIR)担任研究工程师,期间主导并贡献了多项计算机视觉里程碑级技术。
在与杨植麟创立月之暗面之前,吴育昕就已经在深度学习和计算机视觉领域留下了两个行业标准级的重磅成果:
一个是作为 Detectron2 的主要创建者和开发者之一,这个项目直接重塑了全球计算机视觉的研究生态,成为全球成千上万视觉大模型和目标检测项目的“通用底座” 。
更具开创性的是,他在 2018 年与顶尖学者何恺明共同发表了关于 Group Normalization 的大作,获得 ECCV 2018 最佳论文荣誉提名(Best Paper Honorable Mention)。
这篇经典直接打破了传统 Batch Normalization 在小样本训练下的致命瓶颈。这种用一两行底层创新就“重写全球 AI 训练规则”的能力,让吴育昕在开源世界拥有极高的技术号召力。
在月之暗面,他是那个打地基的人。他深度参与大模型架构与训练效率的优化工作,更曾亲临全球 PyTorch 开发者大会,向全世界硬核拆解 Kimi 对全球开源基建的底层贡献 。
吴育昕的专攻方向,完美补齐了 Kimi 冲击下一代多模态长文本极限的最后一块拼图。他擅长高性能深度学习系统优化,解决的是如何让大模型在万亿参数下跑得更稳、算得更快、内存吃得更少,这正是 Kimi 在长文本和高并发下保持丝滑体验的技术铁壁 。
作为深度学习里程碑之作 MoCo v1 的核心作者之一 ,他让 Kimi 不仅拥有行业最强的大脑(自然语言理解),更正在长出能够深度理解现实物理世界的眼睛(多模态视觉)。
▎张宇韬:

张宇韬是月之暗面的联合创始人之一,同时也是月之暗面的 CTO。他与杨植麟为清华同门师兄弟,智谱创始人唐杰是他的老师。
2016 年,张宇韬与杨植麟共同创立“循环智能”,随后,他与杨植麟共同创立“月之暗面”。如果说杨植麟是月之暗面的“领航员”,那么张宇韬就是那个负责把“智能”这艘巨轮动力系统调校到极致的首席工程师。 Kimi 能够在长文本、复杂推理和 Agent 任务执行上实现跨越式进化,张宇韬功不可没。
在加入月之暗面之前,他已经在知识图谱与异构数据融合领域留下了数个“行业级”的重磅成果。
他最广为人知的技术标签之一,是作为技术负责人主导了科技大数据分析平台 AMiner 的研发。这个如今服务于全球千万级学者的平台,其背后核心的异构数据融合技术就包含张宇韬在清华攻读博士期间参与构建的底层能力。这种对 “海量知识如何被机器吸收、理解并检索” 的深度洞察,直接构成了 Kimi 超长文本处理能力的技术底座。
在学术贡献上,他在 KDD、CIKM 等计算机顶尖会议发表过多篇高引论文。他不仅擅长通过知识图谱让 AI 具备“逻辑感”,更是在循环智能时期就主导开发了“千循零样本 AI 平台”,实现了行业大模型在企业服务场景的规模化落地。
张宇韬的专攻方向,精准预判了 AI 从“能对话”向“能干活”转变的每一个节点。 他专注于推动长上下文窗口技术和动态扩展网络架构,解决的是如何让 AI 在海量信息中保持“清醒”。
在 2026 年 7 月的最新技术峰会上,他一针见血地梳理了行业工程化的三段技术脉络:2023 年是研究‘怎么问’的 Prompt 时代,2024 年演进到‘给足信息’的 Context 时代,而到了 2026 年,大模型正式步入 Harness 工程新阶段 。 如今,他正带领团队攻克“怎么构建运行环境、让 AI 出了问题能自己闭环修改”的 Agent 终极战局。
▎许欣然:

图注:右一是许欣然
许欣然是月之暗面(Moonshot AI)工程副总裁兼 AI 基础设施负责人。
他具备全栈底层开发经验,此前在旷视曾负责 MegEngine(天元)深度学习框架与亿级向量检索系统的研发。目前,他主要负责月之暗面大模型训练、推理与基础设施的整体架构设计。
在大模型推理端,针对 Kimi 的长文本业务场景,他与团队联合设计了以 KV Cache 为中心的分离式推理架构 Mooncake。该成果因彻底分离了预填充(Prefill)与解码(Decode)阶段、缓解了百万级超长上下文的显存和 I/O 压力,获得了存储顶级会议 FAST 2025 最佳论文奖。
同时,作为 MoBA(混合块注意力)机制的核心作者之一,他通过块级别注意力切分,在训练和推理两端为 Kimi 实现了大幅的降本增效。
在模型训练端,他参与了开源项目 Moonlight 及其底层优化器 Muon 的研发,利用矩阵正交化处理替代传统 AdamW,降低了万亿参数模型在分布式训练中的算力成本。
凭借这一系列在大规模长文本流量下的分布式存储与推理实践,他曾受邀在 GOSIM China 全球开源盛会上发表演讲。他的专攻方向始终聚焦于全栈大模型架构,致力于用更少的 FLOPs 损耗和 KV Cache 占用,支撑高智能的长文本推理。
▎何蔚然:

作为月之暗面推理系统负责人,他是存储顶会 FAST 2025 最佳论文的核心作者,是 Kimi 长文本推理架构工程落地的核心技术骨干。从 Kimi k1.5、Kimi-VL、K2 到 Kimi Linear、Kimi-Audio,再到 MoBA、Muon、AttnRes 等核心架构论文,其署名贯穿六代技术成果,所有工作始终围绕同一个核心:用系统设计换效率,让大模型真正用得起。
加入月之暗面之前,何蔚然已经在高效计算领域深耕多年。他毕业于清华大学计算机系,早年深耕芯片布线与底层性能优化;旷视时期他主力攻坚自研 AI 芯片与低位宽神经网络,与后来的月之暗面联合创始人周昕宇同期共事 —— 周昕宇正是经典 OCR 文字检测方案 EAST 的第一发明人。
2023年加入月之暗面后,他把多年的系统工程经验,全部落地到了万亿参数大模型的推理服务上。
他最具代表性的成果,是 KVCache 分离式推理架构 Mooncake。这套系统打破了传统推理服务的架构定式,把大模型最耗显存的记忆缓存拆解出来集中调度,通过全局缓存复用和精细化路由,在算力规模不变的前提下,让 Kimi 的请求承载量提升超 75%。他在 2024 年 QCon 大会上披露,依托这套架构和持续的工程优化,Kimi 推理集群的单位成本一年下降超 20 倍。
2025年2月,Mooncake 相关论文拿下 FAST 大会埃里克·里德尔最佳论文奖——这是存储系统领域的最高荣誉之一。更能体现其工程价值的是,早在论文正式获奖前,这套架构已经在 Kimi 生产环境数千个节点上稳定运行,每天处理上千亿 token 的用户请求。
尽管 K3 技术报告未披露具体个人分工,但多项核心突破都延续着他团队的技术脉络:针对 KDA+MLA 混合架构下传统前缀缓存失效的难题,团队向 vLLM 社区贡献了官方适配实现;
面向百万 token 长请求,集群采用缓存感知的路由调度策略,最大化缓存复用效率。最终 K3 交出的成绩是推理成本仅为 Claude Fable 5 的 38%,而 KVCache 优化、前缀缓存、成本控制,恰恰都是 Mooncake 体系的核心命题。
从芯片布线到万亿大模型推理,何蔚然的技术路径始终清晰:死磕系统效率,用工程设计换更低的计算成本。如果说顶尖算法研究员为 Kimi 拉高了能力上限,他和团队做的,就是把这份旗舰级的能力落到实处,让更多普通用户能用得起、用得稳。
02
中坚攻坚·落地级骨干
▎杜羽伦:

杜羽伦在月之暗面负责预训练(Pretraining)与规模化(Scaling)方向。
他毕业于美国伊利伊诺大学香槟分校和卡内基梅隆大学人工智能专业。随后加入循环智能,历任研究员、AI Lab 负责人,是月之暗面的核心技术元老。
作为模型基座预训练与规模化方向的核心负责人,他的技术贡献完整贯穿了Kimi历代核心旗舰基座,以及VL、Audio等多模态全系列的架构设计。
在底层技术突破中,他是《Attention Residuals》、《MoBA(混合块注意力)》以及预训练优化器论文《Muon is Scalable for LLM Training》的共同作者。其工作核心在于:通过块级别注意力切分与训练流重构,缓解超深网络中的信号衰减问题,显著提升万亿大模型的分布式训练效率。
在工程开源层面,他是 MoonshotAI 官方开源项目的活跃核心贡献者。从代码协作记录来看,杜羽伦与算法专家苏剑林、推理系统负责人何蔚然之间有着高频的协同开发与代码审查配合,三者共同构成了 Kimi 支撑百万级长文本和全模态高效流转的底层技术闭环。
▎张宇:
张宇是月之暗面的核心架构师,主攻大语言模型的高效、可扩展和硬件友好型架构设计。作为非 Transformer与线性注意力路线开拓者,他致力于攻克长文本“越长越慢、极度烧钱”的工程魔咒。
在学术与工程实践上,张宇成果颇丰。他不仅是残差连接《Attention Residuals》论文共同第一作者,更是月之暗面高效模型架构的核心研发一作。
由他主导开源的 Kimi Linear 模型,首次将线性注意力机制成功应用于超长上下文任务,实现了颠覆性的效率跃升。不仅如此,他在知乎等技术社区分享的 “Kimi Linear 研发心路”,至今仍被无数大模型数据工程师奉为必读指南。
从实现 7B 模型的底层破局,到一战助力万亿参数大模型冲入全球第一阵营,张宇游刃有余地穿梭于学术界与工业界,在顶级学术会议和开源社区中留下了众多硬核代码。
这一系列突破源于他在核心技术上的深耕:在高效模型架构设计上,他专注于模型深度扩展过程中的通信与内存瓶颈优化;在训练动态与效率提升方面,他通过重构底层残差流,从根本上解决了大模型中 PreNorm 导致的梯度稀释与隐状态爆炸问题。
▎