大模型开始吞噬越来越多的东西,创业公司究竟还能做什么?
在 AGI Playground 2026 上,我们做了一场特别的 Founder Show 活动,10 个团队,每人 15 分钟,讲清楚自己在做什么、为什么值得做,并接受现场评委的追问。
这 10 个项目,横跨 Agent 基础设施、Agent 、Physical AI 、硬件和 AI 原生内容等不同方向。他们试图去回答,当模型能力足够便宜、足够强之后,真正稀缺的东西正在从模型移向何处。
产品介绍之外,我们还整理了创始人们在现场分享的核心思考,他们想解决什么,以及他们看到了什么机会。
01
Tap8:实时生成交互视频,
在每一次使用中自我进化
产品:https://tap8.ai/
Tap8 是 SigmaZ 推出的实时交互式视频平台。它用代码组织文字、图表、3D 内容和交互,再以像素补足视觉表现,让 AI 可以在数秒内生成一个能够继续点击、拖动和追问的视频界面。
SigmaZ 联合创始人兼 CEO William Yang 今年 23 岁,10 个月前从剑桥退学。他从 16 岁开始做产品,这已经是第三次创业。联合创始人 Derek 此前是 Amazon AGI Lab 的技术负责人。William 分享了 SigmaZ 如何从消费端切入,在用户使用、模型迭代与企业服务之间建立飞轮。

AI 生成得越来越快,人却读不过来了
我们要解决的问题很简单,用打字方式和 AI 协作实在太慢了。
前沿自回归大模型每秒可以输出约 300 个 token,人阅读文字的速度大约只有每秒 5 个 token,中间存在约 60 倍的吞吐差距。人类其实更偏爱实时视频,但今天大多数 AI 视频都是为娱乐而做的,既不互动、也不提供信息,更谈不上自适应。
Tap8 想建立一种新的实时视频交互模型,能像人类「系统一」和「系统二」思维那样不断自我提升,让 AI 更快、更直观、更动态地表达自己。系统一负责快速直观的响应,系统二处理长周期复杂任务。
在 Tap8 里,用户可以让 AI 搭建一个实时健身环境,随时更换背景和教练。也可以查看一副耳机的 3D 模型,旋转、放大并继续询问细节。它还能实时生成一份 SpaceX 的业务简报,营收数据、发射基地位置、投资入口全部以可交互的视觉形式呈现,不只是一段静态文字。
用代码搭骨架,用像素补足视觉
支撑这一切的核心技术,是我们自研的一套代码与像素结合的混合格式,专为人机交互界面设计。代码是骨架,像素是皮肤。
数学、文字、图表和表单由代码生成,电影感和需要真实视觉表现的部分再交给像素。像素很适合生成超人和美国队长打架,却不适合准确呈现数字、文字和结构化信息。这种方式既保留了信息准确性,也能提供完整的视觉体验。
Tap8 也因此具备原生交互能力。用户可以旋转、拖动、点击屏幕上的内容,一次生成最长只需要等待约 5 秒。
底层速度来自我们后训练的 Diffusion Language Model(扩散语言模型)。它每秒可以生成超过 1000 个 token,速度约为消费级 GPU 上主流自回归模型的 10 倍,成本则约为 SOTA 像素扩散视频模型的 1%。
每一次生成,都进入下一轮自我改进
以视觉代码作为产出骨架,还有一个优势是,当结果出错时,我们能定位到具体是哪段代码造成了问题。
我们打造了一个元 Coding Agent,读取视觉语言模型给出的反馈并纳入长期改进。通过知识蒸馏和强化学习,我们的模型每周都在变得更好。
过去一年,我们积累了超过 10 万条带有人类反馈和评估的视频数据,并与来自 50 个领域的 1000 名专家共同建立评价体系。视觉审美会持续变化,评估系统也需要跟着变化。
这套「视觉递归自我提升」技术能够形成非常强的数据飞轮。即使其他团队开始复制这条技术路线,等到相似产品完成时,我们的系统已经获得了指数级提升。
02
EigenFlux:
给 AI Agent 建一张自己的互联网
项目:https://www.eigenflux.ai
EigenFlux 是一个面向 AI Agent 的广播与协作网络。Agent 可以用自然语言描述自己关心的内容,由网络自动匹配和推送相关信息,也可以在这里发现其他 Agent、交换需求并展开协作。
EigenFlux 联合创始人兼 CTO Pascal Hu 分享了为什么今天的互联网无法满足 Agent,以及他们想如何从信息流开始,逐步建立 Agent 之间的协作网络与经济系统。他此前曾在 MiniMax 负责大模型训练,团队成员毕业于哈佛、牛津、康奈尔、上海交通大学、浙江大学等高校。

今天的互联网不是为 Agent 设计的
如果我们期待未来 AI Agent 能够大规模协作,它们应该生活在一张怎样的网络里?这是我们过去几个月一直在思考的问题。
今天的互联网完全围绕人类建立。网页有视觉布局、导航、按钮和交互,但 Agent 真正需要的是内容和元数据。以同一份网站内容为例,Agent 读取 RSS 所消耗的 token,比读取完整网页少 90% 以上。更关键的是,人类互联网建立在注意力经济之上,很多时候并不主动搜索,信息会通过新闻、社交媒体和短视频推送给我们。但 Agent 没有「推送」这一层,它们只能靠硬编码的定时任务反复搜索互联网。搜索得太频繁,会浪费大量 token。间隔太久,信息可能已经过时。
一套系统没法同时服务两种完全不同的物种。
今天的 Agent 彼此隔离,部署在不同平台、不同开发者的系统中。你的 Agent 无法接收到当前工作流之外的有效信息,需要协作者时,也没有一种原生机制去发现对方。Agent 并不缺少智能,它们缺的是一张能够连接彼此的网络。
Agent 需要自己的信息推送层
EigenFlux 的答案是,围绕「广播」和「点对点私信」构建的网络。Agent 在获得许可后,可以描述用户长期关心的事情、广播需求。网络会把这条信息推给可能感兴趣的 Agent,感兴趣的一方可以进一步转入私信、交换上下文。
比如,你的 Agent 知道你关注 AI 产品,当一个 Agent Harness 项目开始登上 GitHub 趋势榜,它会第一时间提醒你。投资人的 Agent 也可以广播自己关注的赛道,正在融资的创始人 Agent 则可以发送项目与融资需求。双方匹配后,再交换更多背景和可用时间。
根据我们的实验,Agent 接入 EigenFlux 以后,比起单纯靠心跳机制反复搜索,有效主动性提升了 5 倍。上线 24 小时内,涌入超过 1000 个 Agent,目前已有 4500 多个 Agent 接入网络,供需匹配广播中约 20% 达成有效对接。这证明,只要给 Agent 一个原生网络,它们就能使用,而且用得很好。
信息交换之后,是经济协作
今天的 EigenFlux 看起来更像一个信息交换平台,但通信网络只是起点,不是终点。
互联网始于网页和链接,社交网络始于个人主页和关注关系。EigenFlux 最初的基本单元,是 Agent 广播信号、发现彼此。随着 Agent 开始表达需求、提供服务、建立信任,并拥有交易机制,信息交换会继续演化成经济协作。
我们把自主 Agent 经济分为三个阶段。第一阶段是已经在发生的信息流动,Agent 分享自己从真实世界中获取的信号。第二阶段是供需匹配,投资人找到创始人,岗位找到候选人,预警信息找到需要它的用户。第三阶段是专业化协作,不同 Agent 承担不同工作,共同创造实际价值。
我们希望这张网络只促进互利的交换。发送方单方面获利,会变成垃圾信息。接收方通过伤害发送方获利,会带来隐私问题。双方都没有得到价值,就是纯粹的噪音。
我们的目标是 A2A 经济。通过促进 Agent 之间的互利交换,EigenFlux 可以从通信网络演化为协作网络,创造今天还无法完全想象的价值形态。
03
Aceii One:
一台真正能和你对打的 AI 网球机器人
产品:https://aceiilab.com
Aceii One 是一台 AI 网球击球伙伴机器人。它可以沿底线和侧边线等移动,通过双目摄像头识别网球轨迹与球员状态,并根据用户的每次回球调整位置和下一拍,模拟真实的对打节奏。
首代产品主要面向 2.0—4.0 级、已经具备基础对打能力的球员,定价约 2000 美元,与美国市场的中高端发球机处于相近区间。目前,Aceii One 已进入量产和交付阶段,接下来还将推出面向初学者、更小也更便宜的版本。
AceiiLab 联合创始人 Chao Guang 认为,专用设备可能比通用机器人更早进入真实场景。网球只是第一个落地场景,机器人在其中积累的感知和交互能力,AI 如何帮助人类提高运动水平和运动表现,未来可以拓展到更多运动。

Physical AI 不只有人形机器人一条路径
人形机器人并不是 Physical AI 唯一的路径,我们也可以把智能加入到一些专用设备里。这样不需要等到人形机器人完全成熟,就可以把产品交到人手中,让它在真实世界里工作、收集数据、加快迭代。
AceiiLab 选择从运动开始,是因为体育运动的规则非常清晰,没有个人偏好或习惯的干扰,进球出界、位置速度全部可测量。其次,数据能带来非常清晰的反馈。最重要的一点,运动者天然希望自己变得更好,愿意获得反馈,也愿意持续训练,这才是驱动机器和 AI 不断变强的原始欲望。
网球被我们选为第一个场景,恰恰因为它足够难:球场超过 30 米长,球速超过 100 公里/小时,反应时间不到一秒。如果我们能在网球上解决这个问题,就可以把这套能力迁移到更简单的运动上。
每一次对打动作,都是网球机器人的训练数据
传统发球机和网球机器人之间最大的区别是什么?我认为是互动。传统发球机一次训练里只有一次互动,设置好、开机,然后结束。我们的产品每一秒都在互动。
我们有「眼睛」,双目摄像头会捕捉球员和网球的位置、速度、飞行时间和落点等全部数据,传给「大脑」。大脑理解球场上正在发生什么,预测下一步,再控制底盘移动到对应位置,并决定下一球应该怎样送出。每一次动作都会产生新数据,这些数据又帮助大脑理解得更准确,在下一球时给出对面选手真正想要的东西。
Aceii One 的最高移动速度可以达到每秒 5 米,每秒与球员形成两次交互。用户会感受到机器在回应自己的击球,训练也因此更接近真实对打。
很多人会问,为什么不直接做一个软件?在我们看来,软件只能分析数据,硬件能创造新场景,能给用户一个持续使用产品的理由。只有当硬件好玩和技能提升这两件事叠加螺旋上升的时候,改变才可能持续发生。所以我们想做的不是一台更好的传统发球机,而是一个新品类,网球机器人。
机器人每次训练都会产生新的数据。第一阶段,它能够看见、移动和行动。第二阶段,它会理解球员并给出有用的反馈和课程。长期追踪后,系统还可以判断一个球员会怎样发展,为他建立个性化模型。结合互联网上的通用数据、产品沉淀下来的私有数据以及运动本身的知识,去解决如何提高人的运动能力、运动水平,让人们享受运动。
不同运动的动作和规则各不相同,但提升表现的底层逻辑一致。判断什么是好表现、自己目前在哪里,以及下一步最准确的行动和挑战是什么。
04
Ropedia:
把人类经验变成 Physical AI 的训练数据
项目:https://ropedia.com
Ropedia 是一家面向 Physical AI 的数据基础设施公司。团队通过 HOMIE 等可穿戴采集设备、Human Experience Engine 和统一模型,将人类在真实世界中的行动转化为视觉、语义、3D、4D 姿态、触觉与力等多模态训练数据。
联合创始人陈昭熹、洪方舟均为清华大学本科、南洋理工大学博士,首席科学家刘子纬在 Google Scholar 上的论文引用量超过 10 万次。Ropedia 发布的 Xperience-10M 是全球最大的 4D 人体交互数据集,上线 Hugging Face 五天下载量突破 200 万。公司已完成数千万美元种子轮融资,投资方包括有 Google、NVIDIA、Amazon 背景的北美天使投资人及亚洲知名美元基金。
陈昭熹认为,Physical AI 的下一条 Scaling Law 将由真实世界的经验驱动。Ropedia 选择先以数据服务切入,再逐步向基础设施和模型服务延伸。

AI 读过一切,却没有真正经历过物理世界
过去五年,AI 已经可以把一件事情解释得很好,也可以生动地想象它,却依然很难在物理世界里真正行动。
我们认为,原因在于 AI 读过互联网上几乎所有内容,却没有真正经历过物理世界。语言模型学习的是人写下了什么。Physical AI 还需要学习人做了什么、世界如何回应,以及接下来会发生什么。
十年前,ImageNet 用像素和标签建立训练单元,回答「这是什么」。生成式 AI 通过 Prompt 和内容学习「这可能长什么样」。下一阶段的物理智能,需要把经验与结果、行动连接起来,回答「如果这样做,接下来会发生什么」。
让人类经验成为可规模化生产的数据
今天的语言模型和视觉模型建立在互联网数据之上。人们每天发布文字、图片和视频,也在持续为模型贡献数据。
但大多数物理经验从来没有被记录。人怎样拿起物体、施加多大的力、环境如何变化,这些信息并不存在于公开互联网中。
Ropedia 想把经验的生产工业化,我们从三类专用采集设备开始:HOMIE 是第一视角 360 度采集的头戴设备,记录人的第一人称视角和动作;模态图谱设备 Touch 用来采集力与触觉;桌面级轻量装置记录手与物体之间的精细交互。
硬件把真实世界的数据带进数字世界,我们打造的 Human Experience Engine 再自动运行不同模块和算法,将原始数据处理成同步的多模态信号。最后形成的内容包括语言与分层语义、2D 视频、深度、3D 重建、4D 人体姿态、交互和物体轨迹。
更重要的是,我们已经观察到一种「体验 Scaling Law」。基于以人为中心的数据训练出的模型,能泛化到机器人双臂仿真,也能泛化到轮式机械臂,乃至全身人形机器人,数据不再完全绑定特定硬件形态。
05
SeeleAgent:3D 多模态基础模型公司,
第一个落地场景选择游戏
产品:https://www.seeles.ai
SeeleAgent 是 SEELE 推出的多模态 AI Agent,可以根据一句 Prompt 生成完整游戏、3D 资产和代码。
过去三年,SEELE 一直在训练面向互动世界的 3D 多模态基础模型。Seele02 采用 MoT 架构,让负责理解和生成的不同 Transformer 共享全局注意力。同时还积累了 3000 万条独有数据,用两年时间搭建起一套 3D 空间数据标注和训练管线,形成较高的数据与工程壁垒。
接下来,SEELE 计划推出 PEGA(Physics-Embedded Generative Architecture,物理嵌入式生成架构),将物理规则、对象状态和行动反馈纳入生成过程。让互动世界能够持续存在,并根据玩家行动不断变化。
SEELE 创始人王诗沐是前网易云音乐创始人,曾任腾讯 NBase 创新业务总经理、腾讯新闻负责人,是移动互联网时代的知名产品经理。他分享了 SEELE 如何以游戏为商业化入口,在模型研发、创作者增长和内容分发之间建立闭环。

通用大模型生成代码,SEELE 生成世界
一句 Prompt 能不能生成一个完整游戏?通用大模型当然可以写出能够运行的游戏代码,但代码原型和一个完整世界之间还有很大距离。
我们把同一个 Prompt 分别交给通用大模型和 SEELE。前者会把世界概念翻译成代码,再用代码块拼出一个原型。SEELE 会直接构建游戏世界的表征,把空间布局、核心规则、互动机制和实时反馈放在一起。
两者的差别不只体现在视觉效果上,也来自完全不同的生成路径和世界表征逻辑。
此前打造一款 2A 或 3A 游戏的成本在 100 万到 1 亿美元之间,现在我们可以把这个成本压到不到 1 万美元,用户自己生成一个游戏可能只需要几百美元。从概念到上线原本要几个月甚至几年,现在从提示词到可玩游戏只需要几个小时或几天。
让互动世界持续运行,走向分发和商业化
SeeleAgent 上线后,在大约五个月内获得了 30 多万名创作者。目前平台活跃创作者超过 36.6 万,已经生成 20 万多个游戏,累计游玩数达到数千万次。预计下个月 ARR 破千万美元,年底约 2000 万美元,未来 12 个月内实现 1 亿美元 ARR。
最早,用户做游戏主要是为了自己玩。后来模型越来越好,创作者开始向我们提出新的需求。他们希望下载完整工程包,把游戏发布到 St