DeepSeek 同日发布 V4-Pro 正式版与 Harness 智能体框架,开源且上调 API 价格
The Decoder · 今天 00:27
V4-Pro 的 Agent 能力(HLE 42.7)加上 Harness 开源,明摆着抢 Cursor/Claude 的开发者心智。涨价但性能跃升,是把「性价比」从廉价重定义为「单位成本智能」。与 Gemini 3.7 Flash 降……
每日摘要 · Daily Brief · No.040
今日 AI 圈的主线是「能力上探、成本下探」的同步加速:DeepSeek 用 V4-Pro 的 Agent 能力跃升与 Harness 开源双线出击,Gemini 3.7 Flash 三周迭代且价格腰斩,二者在编程与智能体赛道正面交锋,性价比叙事从模型层延伸到框架层。暗线是 Anthropic 的多智能体内斗研究与 Twitter 上的实践案例,揭示「协调成本」正成为规模化部署的新瓶颈,这与成本下降形成对冲。接下来盯三处:DeepSeek Harness 的生态扩散速度、……
The Decoder · 今天 00:27
V4-Pro 的 Agent 能力(HLE 42.7)加上 Harness 开源,明摆着抢 Cursor/Claude 的开发者心智。涨价但性能跃升,是把「性价比」从廉价重定义为「单位成本智能」。与 Gemini 3.7 Flash 降……
AI HOT/Google DeepMind:Blog(RSS) · 今天 01:04
三周迭代一次且价格砍半,Flash 系成了 Google 打价格战的排头兵。编程与智能体是当前最肥的变现场景,降价抢量意图明显。与 DeepSeek V4-Pro 同日发布形成针尖对麦芒,观察谁先跑通「低价+强 Agent」的盈利模型。
AI HOT/DeepSeek:API 更新日志 · 昨天 19:16
从 3.5 到 4.0 Pro,DeepSeek 把重心从聊天转向终端执行(HLE 42.7),这是要跟 OpenAI/Anthropic 抢企业自动化市场。与 Harness 框架同日发,自研模型+自研框架的组合拳,生态野心暴露无遗。
AI HOT/X:硅基流动 SiliconFlow (@SiliconFlowAI) · 昨天 22:04
Qwen 继续堆参数但只激活 95B,MoE 路线把推理成本压到 $2/M,直接在性价比上对标 DeepSeek。硅基流动 Day-0 支持,国产开源系在智能体赛道的军备竞赛进入白热化。
AI HOT/公众号:小红书技术(dots.llm) · 昨天 17:59
中文 TTS 赛道来了个能打的,全连续自回归架构是差异化路线。开源权重对中小团队是利好,但商业化路径不明。与 MiniMax Music 3.0 同日,音频生成的开源权重日。
TechCrunch AI · 今天 03:22
速度提升 14 倍如果能保持质量,等于把推理成本打下来一个量级。这比模型本身迭代更影响落地——很多 Agent 场景不是不会做,是等不起。与 DeepSeek 的涨价形成对比,定价策略分化明显。
TechCrunch AI · 今天 04:14
Databricks 主动压低融资额,说明不缺钱、也不想要高估值绑架。190B 估值在 AI 基建里属于「理性定价」,与 CoreWeave 的暴涨形成对照。数据平台层的资本热度仍在但趋于务实。
TechCrunch AI · 昨天 23:08
5000 亿押注算力扩张,重点在盘活老 GPU(折旧摊薄后成本优势)。这是对「AI 资本开支见顶论」的反击,但债务杠杆风险仍在。与 Kyber 延迟至 2028 的线索同频,Nvidia 在帮客户找过渡方案。
TechCrunch AI · 今天 03:19
IBM 把 GPT-5.6 嵌进咨询平台,是「模型即服务」的渠道战。与 Cognition 传闻 400 亿估值形成对照:巨头靠渠道,创企靠模型能力。企业 AI 市场的卡位战从模型层打到交付层。
TechCrunch AI · 昨天 23:30
微软在给 Copilot 生态做减法,承认前期铺得太散。收缩是好事,集中在核心入口。但这也说明巨头在 AI 应用层还没找到杀手锏,跟 Writer 的 harness 控成本、IBM 走渠道形成三种路径。
AI HOT/X:Boris Cherny (@bcherny) · 今天 05:27
这是「AI 运维员」的真实案例,不是 Demo。388 个 PR 说明 Claude 已经能处理日常维护的脏活累活,与「Agent 只能写玩具」的刻板印象直接对撞。工程团队的组织方式值得被重新设计。
TechCrunch AI · 今天 02:28
多智能体协作的最大风险不是能力不够,而是互相踩脚。实验里 45 个智能体跑出 266 个漏洞,印证「协调成本」是新瓶颈。与 Claude 接管 PR 的个案对照:单点强 vs 多点乱。
Reddit r/LocalLLaMA · 今天 02:52
本地跑 95B 激活是硬核玩家的炫技,0.8 tok/s 基本不可用,但验证了 MoE 在消费级硬件的可行性。与云端 $2/M 的价格互补,本地+云端的混合部署会是下半年的常态。
Reddit r/LocalLLaMA · 今天 03:39
小模型解决具体痛点的又一例证。tar 命令这种高频低难度的场景,正是端侧小模型的甜区。与追求大而全的 Qwen 2.4T 形成两个极端,生态开始分层。
Reddit r/LocalLLaMA · 今天 04:22
开源社区的价值就在这种细枝末节的修复上。大模型发布越来越快,模板这类配套工具的滞后是常态。社区补位速度决定生态健康度,也是观察 Qwen 生态活跃度的窗口。
AI HOT/Anthropic:Research(发表成果 · 网页) · 昨天 09:20
45 个智能体在 2700 万 token 里发现 266 个漏洞,说明并发不是免费的。这篇给「多智能体=更强大」的叙事泼了冷水——不加约束的并行反而制造混乱。与 Zawinski's Law of MultiAgents 同频,协调层……
Interconnects · 08-12 21:01
Nathan Lambert 的自我设问,其实在给「AI 能否替代深度写作」划线。他发现 LLM 改错字行、组织整章乱,与 Agent 能写代码形成有趣对照:显式规则 vs 隐式结构。这条线对理解 LLM 能力边界很有参考。
The Decoder · 昨天 18:42
「AI 做研究」的里程碑兑现速度比保守派预测的更快,但「坠落」也说明虚实参半。与其争论强 AGI 何时来,不如跟踪具体任务(如代码、论文)的自动化率曲线。这条线下半年会反复被引用。
Latent Space · 08-12 15:11
推理轨迹是模型思考的「黑盒日志」,能偷走它等于拿到模型的思维链。多智能体协作越深,这类侧信道攻击越危险。与 Anthropic 智能体内斗研究互补:一个管效率,一个管安全。