豆包1.8实测——字节的基座模型走到哪一步了?
最近这段时间,谷歌DeepMind的官方纪录片《The Thinking Game》在AI圈传播挺广。
MiniMax M2.1 首发评测:专治祖传屎山,这种爽感谁用谁懂
要说这两天AI圈最火的一条消息,莫过于MiniMax正式通过港交所聆讯,即将冲刺IPO。
小杯Gemini战胜GPT5.2,1分钟模拟Windows操作系统
谷歌丢出Gemini 3 Flash,给AI圈示范了啥叫:小孩子才做选择题,成年人当然是全都要(doge)。一个公式来形容这款新模型:Gemini 3 Flash=Pro级智能+Flash级速度+更低价格。
一手实测 Aha 2.0:真的是达人营销的最优解吗?
尽管最近 AI Agent 很火,真正落地到垂直行业里的例子依旧不太多。尤其是我们今天要讨论的行业:非标、分散、高度依赖沟通:达人营销。对于科技公司来说,达人营销非常重要。但是直到今天,很多团队依然在依赖 Excel 表格管理达人,靠人工手动发送成百上千封「碰碰运气」的邮件。
实测 GPT-5.2 :价格暴涨能力微涨,凭什么反击 Gemini
要吊打 Gemini 的 GPT 5.2 在今天凌晨正式发布了,向所有用户推出。 上个月刚刚退订掉 ChatGPT Plus,转到 Gemini,这次需要因为 GPT-5.2 再回去吗? 看完下面这些网友真实的体验分享,还有 APPSO 的上手实测,或许能有个答案。
Refly.AI 一手评测!花了 50 万积分,想象出了将 Agent 做到 2 亿量级的样子!
我在想,有没有这样一个工具:我不用理解节点和变量,直接说我想要什么,AI 就帮我把工作流搭出来?我尝试了很多,直到遇到 Refly.AI 这个 Vibe Workflow 平台—— AI 自动搭建工作流。它给出了一个让我眼前一亮的答案:通过 Vibe Workflow,把想法变成自动化工作流,让我真正进入口喷工作流时代。
一手实测 | 智谱AutoGLM重磅开源: AI手机的「安卓时刻」正式到来
具体来说,Open-AutoGLM 由一个手机端智能助手框架 Phone Agent 和一个 9B 大小的模型 AutoGLM-Phone-9B 共同组成。这次开源对行业的影响力,核心来自这次智谱开源的不是一个普通的 GUI agent 模型,而可能是行业最好的模型。
自费购买,把豆包AI手机当主力机3天,我的真实体验有些不同
上周,“豆包手机助手”一跃成为AI圈与手机圈的年度热点,热度与争议齐飞。我们抢在首批样机售罄前,自费3499元入手了一台搭载豆包手机助手的努比亚M153工程机,进行了3天的沉浸式体验,对这其中的争议和真实使用体验有了更深的感受。
实测豆包手机助手:比价点外卖、自动回微信,AI 操作手机的时代来了?
字节正和多家手机厂商谈合作。
第一时间评测:字节的小云雀2.0,AI 真的能复刻爆款吗?
AI 创作 Agent 正在接管过去最耗时的部分。
LangChain 最新agent框架deepagents测评:长任务友好,高可控
任务规划+文件系统访问+子agent委托
通宵测完NanoBanana Pro,我只想说,太牛逼了。。【附超多邪修玩法+Prompt】
预告了很久,Google终于把他们蓄势已久的NanoBanana2给放出来了。
年度最强AI实锤!谷歌Gemini 3全网首测震撼,一句话编码封王
谷歌的Gemini 3,才是奥特曼做梦都想要的「GPT-5」?
实测完“灵光”,我意识到人类对 AI 助手的开发不足1%
今天的朋友圈,被一款叫「灵光」的APP刷屏了。了解了一下,这是一款来自蚂蚁集团的AI 应用,定位是面向普通人的零门槛全模态 AI 助手,还可以自然语言30秒生成可互动的小应用。这让我想到了还在预热,这周即将发布的Gemini3.0,一句话生成操作系统,这都给了我们一个无限想象力的画面。未来,AI生成的边界是什么?
测完千问APP,我在小红书扒出 5 个 AI 新场景
千问 APP 上线还是超乎意料。毕竟在 2025 年底,可能也只有阿里有底气尝试,重推一款 AI 应用类产品。界面简洁、克制的不像阿里出品。刚好这两天,我做了件有意思的事:泡在小红书,专门看普通用户在用 AI 做些什么,却发现不少人把 AI 用在各种“不正经”上:
实测专盯Agent上工的OS:长得有点像AI浏览器,双系统通用
这不,Flowith最近也搞了个新东西:FlowithOS,全球首款专为AI Agent打造的操作系统,重点是Windows用户也能用,终于不是Mac专属了:它的最大特点是:虽然长得像浏览器,但干的却是执行的事儿,能让Agent自己动鼠标、跑流程、干活。
大模型比拼:MiniMax M2 vs GLM 4.6 vs Claude Sonnet 4.5
正好上周(10月27日),MiniMax 公司发布了[2] M2 模型,代表了国产大模型的最新水平。我就想,可以测测它的实战效果,跟智谱公司的 GLM 4.6 和 Anthropic 公司的 Claude Sonnet 4.5 对比一下。毕竟它们都属于目前最先进的编程大模型,跟我们开发者切身相关。
刚刚月之暗面发布Kimi K2 Thinking模型,藏师傅首测教你用 Kimi 编程全家桶
四个月前 Kimi 发布了 K2 模型,凭借优秀的质量以及先进的架构优化,一举打破了持续了几个月关于月之暗面的质疑。 我当时也写了两篇测评《Kimi K2 详测|超强代码和Agent 能力!内附Cla
英国首例AI训练判决!Stability AI大战Getty Images,双方均宣称胜诉
2025年11月4日,一家总部位于英国伦敦的人工智能公司Stability AI,赢得了一项具有里程碑意义的高等法院案件,该案审查了人工智能模型在未经许可的情况下使用大量受版权保护数据的合法性。而本案的原告,Getty Images 在针对人工智能公司 Stability AI 图像生成产品的英国诉讼中基本败诉。
开发者生产力“平替”?MiniMax M2全面测评:代码、速度与迁移成本
生成式AI技术的成熟,让智能编程逐渐成为众多开发者的日常,然而一个大模型API选型的“不可能三角”又随之而来:追求顶级、高速的智能(如GPT-4o/Claude 3.5),就必须接受高昂的调用成本;追求低成本,又往往要在性能和稳定性上做出妥协。开发者“既要又要”的正义,谁能给?