谷歌Gemma4-12B怎么用最好?16G显存轻薄本也能跑起本地多模态SubAgent
过去一年,开源模型的发布节奏已经快到让人麻木。每次发布,伴随的永远是一组跑分、一张能力雷达图,以及几个“超越某某”的结论。
AI交互新基准!蚂蚁提出MiniAppBench并入选ICML 2026 Spotlight
想象一下,你问 AI 要一个饮食记录工具,它不再是回你一段文字建议,而是直接给你一个可以点击添加、统计热量的完整应用。人和 AI 的交互,正在从「读文字」走向「用应用」。
实测小米最快1T大模型:吞吐量每秒1000+ Tokens,Vibe Coding七秒交付
全球大模型的军备竞赛,正在“智商”之外开辟新的战场—— 推理速度。
我让 Claude Fable 5 画了张 CAD,让工程师老爹愣住了
今天凌晨,大家等了很久的 Claude Fable 5 终于上线了。
SwarmFlow来了!openJiuwen开创蜂群可控协同新范式
AI Agent 正在从 "单兵作战" 走向 "团队协作"—— 让多个 Agent 分工配合,去完成单个 Agent 难以独立扛下来的复杂任务,也是近期最受关注的方向之一。
Claude 最强模型 Fable 5 全解析:Mythos 级别的怪物
今天凌晨,Anthropic 发布新模型 Fable 5,毫无疑问的,也是当下的最强模型
扩散模型里的噪声,原来还有这样的作用:DRDD重新定义统一图像翻译
在图像到图像翻译(Image-to-Image Translation, I2I)这个任务上,扩散模型过去几年几乎形成了一套默认逻辑:先把输入图像和噪声混合,再一步步去噪,把目标图像 “还原” 出来。
BEV杀入具身智能:跨维智能把机器人数据带上Scaling快车道
具身智能现在面临的问题,和自动驾驶几年前的困境非常相似。
OneReason:当推荐系统学会思考
推荐系统的过去十年,本质是把 "用户 - 物料" 的统计共现挖到极致 —— 从协同过滤、深度模型,到生成式 OneRec 系列,每一代都在让 "记忆" 更精细、参数更大、序列更长,也让 Scaling 这件事在工业级推荐系统上跑通,持续释放算力红利。
当线性注意力学会「写入前思考」:并行化的多步记忆写入
Transformer 依托强大的建模能力和 Scaling 效率在推荐领域被广泛应用于超长序列建模和生成式推荐等方向,
RSS2026 | 强泛化强迁移VLA,上海创智学院×上海交大提出MINT:让VLA从模仿轨迹走向理解意图
机器人视觉语言动作(Vision-Language-Action, VLA)模型越来越多地开始展示叠衣服、倒茶、做咖啡等复杂操作。但是,今天的大多数 VLA 更像 “展台机器人”。
实测Claude史上最强模型Fable 5,普通人慎用
对普通人最坏的消息要来了。
HTML版剪映来了!Open Design 团队最新开源力作,3天时间,写了3万行代码!
视频制作行业正在经历一场革命。
Claude Code爆火背后的Agent Harness底层逻辑,UIUC、Meta、斯坦福深度解读
过去两年,大模型写代码已经不再新鲜。从代码补全到 GitHub issue 修复,从竞赛编程到仓库级软件工程,人们习惯用一个简单标准评估 coding agent:代码能不能写对?测试能不能通过?
新架构模型HRM-Text创新纪录!1B参数、1000美元,图灵奖得主都亲自下场了
一个约 1B 参数的模型,在 MATH 上拿到 56.2,在 GSM8K 上拿到 84.5,在 ARC-Challenge 上拿到 81.9。训练成本约 1500 美元,16 块 H100 跑了不到两天。
Anthropic最新博客:生物学Agent的瓶颈不在模型,而在数据基础设施
当前,Coding Agents 在软件工程领域一路高歌猛进,科学家们看到此场景,也不禁寄予厚望:AI 智能体何时能以同样的速度,帮人类攻克药物设计、病毒监控与生物学建模的重重难关?
实测CodeX 3大更新,OpenAI"准超级应用”"杀死比赛?
在ChatGPT拥有10亿用户后,AI问答这一定位,显然已经难以撑起其下一阶段的增长。另一方面,Codex每周活跃用户已超500万。很多人囿于名字,以为这是Coding产品。。。。限制了其在编程圈外的增长。
扣子3.0实测:手机就能远程遥控你电脑里的Agent
扣子,来了个大版本的升级——3.0正式发布!
实测阶跃 Step 3.7 Flash:更稳、更快、更省的 Agent 大脑
很难想象,企业使用 AI 的成本已经远远超过了雇佣员工的成本。
MiniMax 低调发布 M3 和 MiniMax Code,我们测完后有几点感受
前沿的 Coding 能力、1M 的上下文窗口,还有原生的多模态