最近的流量焦虑,被这两个开源Skill解决了。
大家好,我是袋鼠帝 前两天一个朋友问我,怎么边工作,边把自媒体持续做下去,还能做得好。
实测 OiiOii 2.0:让AI视频创作者少折腾一点
Agent + 无限画布带来的想象力。
Anthropic 5.2万人调查大曝光!美国人对AI已达成共识
在一个什么都能吵翻天的国家,71%的美国人难得达成共识:AI必须有人管——但管它的,绝不能是造它的人。
视觉latent reasoning为什么不稳?这篇论文从特征空间找到了关键缺口
导读:视觉 latent reasoning 希望让多模态模型在内部生成连续 latent token,用这些中间表示补充多模态理解和推理任务中缺失的视觉证据。但问题在于,模型生成出来的 latent token 可能并不落在它原本熟悉的视觉输入空间里;如果模型无法稳定读取这些 token,它们就很难成为有效的中间视觉证据。
AI Scientists的下一站是社会科学:清华团队推出「硅基社会实验室」AgentSociety²
在《三体》式的科幻想象中,文明可以被遥远地观察,社会可以被冷静地记录,人类行为仿佛成为一个可被推演的复杂系统。
腾讯Robotics X开源HyVLA-0.5:基于亚毫米级指套UMI与真机强化,摆脱繁重遥操
6 月 15 日,腾讯 Robotics X、福田实验室与混元团队联合发布面向真实世界机器人操作任务的端到端具身智能模型 Hy-Embodied-0.5-VLA(简称 HyVLA-0.5)。
给音视频生成打草稿!复旦&腾讯提出Baton:首创语义蓝图指引,实现音画逻辑精准同步
当用户给出一句简单提示词时,当前的音视频生成模型往往已经能够生成具有不错质量的视听内容。然而,一旦提示词变得复杂,问题便开始暴露出来。
用国产GPU训练AI给自己写内核,摩尔线程刷榜硬核基准
国产算力生态的难题,从此有了 AI 解。
1080条提示词、7款模型大比拼:视频生成离「好看、好用又准确」还差多少?
当视频生成模型走出娱乐创作的舒适区,进入科学、医疗、教育等知识密集场景,它们是否还能生成事实准确、清晰可用的视频?
ICLR 2026|美图提出位置编码场 PE-Field ,让 DiT 感知和控制 3D 空间
PE-Field将传统的2D位置编码扩展为结构化的3D场,使DiT能够更加直接地在3D空间中处理几何信息。
低成本复刻Fable 5的路子找到了:OrcaRouter多模型组队,性能反超
AI网关OrcaRouter最近上线了一套可编程路由策略Routing DSL,多个模型同时答题,自动仲裁出最优解。几个你现在就能调用的“常规模型”,给它来个组合编排,跑出来的综合胜率,直接掀翻了Fable 5的单体基准线。Opus 4.8打不过Fable 5,GPT-5.5也单挑不过,但这两个拼一组,结果就反超了。
一夜反转!「杀进第一梯队」的巴西LLM竟「套壳缝合」了国产模型
昨天,AI 圈大都被这一新闻「刷屏」:巴西里约热内卢市政府旗下的一家 IT 公司,平地一声雷地推出一款名为「Rio 3.5」397B 的开源模型,甚至还一路逆袭杀进了全球第一梯队,超越 Qwen 3.7 Plus 等开源模型,在多项基准测试中斩获 SOTA 性能。
Agent终于长出了身体:Jiuwen Symbiosis背后的思考与实践
如果你在三年前问AI圈:未来最强的AI长什么样?
代码定位太慢?蚂蚁ACL2026新作:FuseSearch-4B让模型自己学会「该搜多少」
新智元报道 【新智元导读】FuseSearch:学习型自适应并行执行 —— 一个40亿参数的模型,凭什么在代码定位上干过了商用闭源大模型?答案只有四个字:搜得更聪明。 在AI编程狂飙突进的今天,一个尴
把真实GitHub仓库转化为可执行终端轨迹!TerminalTraj入选ICML 2026
被ICML 2026接收为Spotlight!
HuggingFace CEO力荐,Bengio团队也押注:这个1500美元训出的HRM模型,凭什么火了?
好家伙,这次不是模型圈自嗨。
啥?Fable 5一出,Skill和Prompt都白学了?
Workflow、Skill、SOP,可能真的要过时了。
登Nature子刊!清华团队提出全球气候模态统一预测模型UniCM
全球气候异常事件正在深刻影响农业生产、水资源调度、能源管理和防灾减灾。
不到 5 分钟复刻《我的世界》,Kimi K2.7 Code 到底有多能打?
朋友们,Kimi 又更新了。
视频生成作为多模态推理新范式 | CVPR 2026
被CVPR 2026收录!