阿里开源 Qwen3.8-2.4T-A95B:首次开放 Qwen-Max 级别模型,原生 256K 上下文
AI HOT/IT之家(RSS) · 今天 00:10
这是 Qwen 首次开源 Max 级模型,总参数 2.4T、激活 95B,直接对标闭源前沿。与 DeepSeek V4 Pro 同日发布对照,国内开源双雄正把'开源逼近闭源'从口号变成现实。这条线下半年会反复出现。
每日摘要 · Daily Brief · No.039
今日 AI 圈主线是模型发布潮:DeepSeek V4 Pro、Grok 4.6、Qwen3.8-2.4T 同日登场,加上 Meta 的 Muse Glimmer 开源,头部实验室竞争从参数转向体验与智能体能力。值得注意的暗线是开源模型集体逼近闭源(Qwen 首次开源 Max 级、Muse Glimmer 主打本地智能体),而定价战(Grok 4.6 低价、DeepSeek V4 Flash 便宜)正迫使微软等闭源厂商承压。接下来需关注:Grok 4.6 的智能体编程基准……
AI HOT/IT之家(RSS) · 今天 00:10
这是 Qwen 首次开源 Max 级模型,总参数 2.4T、激活 95B,直接对标闭源前沿。与 DeepSeek V4 Pro 同日发布对照,国内开源双雄正把'开源逼近闭源'从口号变成现实。这条线下半年会反复出现。
AI HOT/Cursor Blog · 昨天 08:00
Grok 4.6 与 DeepSeek V4 Pro 同日发布,且与 Cursor 绑定,明显冲着 Agent 编程场景去。在 Artificial Analysis 上追平 Fable 5,但真实体感待验证。与 xAI 官方口径双源交叉,可信。
AI HOT/X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman) · 今天 00:00
微软终于在自研推理模型上亮牌,但 显示 MAI Code 1.1 Flash 被 DeepSeek 在性价比上碾压,微软 AI 自研能否撕开缺口存疑。与 DeepMind 人才流失线索对照,大厂自研压力普遍增大。
AI HOT/X:OpenRouter (@OpenRouter) · 昨天 20:00
Meta AI 超级智能实验室首个开放权重模型,Apache 2.0,专注本地智能体。MCP Atlas 得分亮眼,与 第13条(Mac 上提速 3.3x)同频,本地智能体生态可能被点燃。值得纳入你的代理框架观察。
AI HOT/公众号:数字生命卡兹克 · 今天 06:22
卡兹克双源(公众号+HN 第11条),DeepSeek 在开源模型体验上逼近闭源标杆。与 Qwen 开源 Max 级同日,国内开源阵营集体秀肌肉,对闭源厂商形成定价压力。你批注里 DeepSeek 的三重身份,这条是'读别人'的又一佐证。
The Decoder · 今天 02:33
Decode 报道 Grok 4.6 在性能追平 OpenAI 最佳,价格更低,延续 xAI 一贯性价比打法。与 DeepSeek 的定价战同频,'性能追平+低价'正在成为新模型发布的标准姿势,闭源商业模型压力陡增。
TechCrunch AI · 今天 02:19
Devin 的开发公司在 Agent 编程热中估值飙升至 400 亿,与 Blacksmith估值一年涨 10 倍同频,AI 编程赛道资本热度可见一斑。与你的 AI 编程 Agent 线索参照,'自主写代码'正从工具变成资本故事。
TechCrunch AI · 今天 00:04
Lovable 作为 AI 应用生成平台,估值三个月内从几十亿跳到 133 亿,显示资本对'AI 造应用'路线的重注。与 Cognition 高估值同频,AI 编程/开发工具赛道正在经历资本狂欢,需警惕泡沫。
TechCrunch AI · 今天 06:26
水印技术引发隐私担忧,用户在职场用 Claude 可能被识别。这是治理与便利的经典冲突,与 OpenAI 安全事件同频,AI 安全监管正在从政府要求变成产品争议。
AI HOT/GitHub Blog · 今天 02:00
AutoGPT 维护者的工程实践:把指令放 AGENTS.md,用 PR 模板、CI 门槛、CLA 门控把智能体提交从不可用变成可合并。这是 Agent 工程落地的好样本,与你的 Loop-Engineering 批注互证,'给目标+验……
Hacker News · 今天 00:04
HN 热帖讨论 DeepSeek V4 Pro 发布,与 第5条 同源交叉。社区关注点集中在性能逼近闭源和定价,说明 DeepSeek 在开发者心智中已是开源标杆。这条线索会持续演进,建议跟踪社区反馈中的实操问题。
AI HOT/OpenRouter:Announcements(RSS) · 昨天 08:00
OpenRouter 的实时评测数据很有价值:搜索预算从 1 轮到 25 轮 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型比引擎平均分差 15。这给 Agent 检索配置提供了量化依据,与你的 Agent 通信基础设施批注可对照。
Reddit r/LocalLLaMA · 今天 03:29
本地智能体性能优化案例,Muse Glimmer 在 Mac 上的加速意味着本地运行更可行。与 第4条 开源对照,本地智能体生态正在补上性能短板,本报此前提示里的本地 Agent 栈可重点关注。
Reddit r/LocalLLaMA · 今天 00:54
社区热帖调侃 Qwen3.8、Grok 4.6、DeepSeek V4 Pro 同日发布,'模型日'成为社区梗。这本身是情绪指标,反映发布密度之高。真正值得盯的是这些模型在本地跑起来的实测对比(如 )。
AI HOT/Google Research:Blog(网页) · 今天 01:57
这个框架把事实错误分为编码失败、回忆失败等五类,发现前沿模型的问题多在'丢钥匙'而非'空货架'。对理解 LLM 能力边界有参考价值,也暗示 RAG 或记忆层(你的 Cognee 批注)可能比换更大模型更划算。
AI HOT/Nathan Lambert:Interconnects(RSS) · 昨天 21:01
Nathan Lambert 写 RLHF 教科书后的观察:LLM 改错字、做编辑行,但组织整章结构仍混乱。这与 Agent 能写代码形成对比,提示'结构化创作'仍是 AI 短板,对内容从业者是利好信号。
The Decoder · 今天 01:32
提示词逆向工程接近完美,这对闭源模型的商业保密是威胁,对安全研究是工具。与 Anthropic 水印第9条同频,'模型输出可溯源'正在成为监管和维权的新战场。
Latent Space · 昨天 15:11
Latent Space 讨论从输出反推推理痕迹,与 第17条 同主题但角度偏安全攻防。推理痕迹一旦可被提取,思维链的商业价值和安全风险都会被放大,这条线值得持续跟踪。