Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
这跟你有什么关系
原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。
二〇二六年九月十六日 星期三
Daily · 实时更新
全网最新热点替你翻成了中文。点标题或「阅读原文」直接跳到原出处,每半小时自动更新一次。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
这跟你有什么关系
原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。
生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。
这跟你有什么关系
官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。
阶跃星辰发布 StepAudio 3 系列,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,已在阶跃星辰开放平台上线。
这跟你有什么关系
官方完整介绍了五款模型的能力与榜单成绩,可帮助读者了解语音模型在实时交互、理解和创作上的进展。
硅基流动(SiliconFlow)宣布开源模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042。
这跟你有什么关系
原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
小红书 AllSpark 团队发布并开源 Search Agent 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布。
这跟你有什么关系
原文给出了数据构造、SFT-RL 训练和统一评测的完整思路,读者可以据此理解 Search Agent 的训练难点与可迁移方法。
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。
这跟你有什么关系
官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型已在 Baseten Model APIs 上线。规格为 552B 总参数、prefill 激活 8B、decode 激活 16B、1M token 上下文、支持文本加图像输入。
WorkBuddy 宣布 DeepSeek V4.1-Flash 已在其平台上线,免费试用两周。引用的 DeepSeek 公告称 V4.1-Flash 已登陆 DeepSeek API 并支持原生多模态。
OpenAI 为 ChatGPT Ads 推出多项 AI 驱动的新体验。Sponsored Agents 允许用户在点击广告后与明确标识的商业赞助智能体对话,目前在美国部分广告主中测试。
这跟你有什么关系
官方宣布 ChatGPT Ads 多项更新,涵盖 Sponsored Agents 测试和 HubSpot、Shopify 集成,可了解 AI 广告平台的具体落地方式。
Anthropic 为 Claude for Small Business 新增 43 个工作流和 27 个集成,覆盖 Shopify、Salesforce、Stripe、Gusto 等,该产品自 5 月上线以来安装量超过 90 万次。工作流默认处于审批模式,所有发送、发布或付款需用户确认;今秋将在 10 个美国城市举办免费工作坊,14 个集成伙伴从 9 月底到 11 月各举办一场免费网络研讨会。
这跟你有什么关系
原文给出 Claude for Small Business 的 43 个工作流、27 个新集成和具体客户数字,读者可以据此评估它在小店运营场景的可用性。
Google 宣布其语言技术已支持超过 300 种语言、覆盖全球 86% 人口,并发布 TranslateGemma 轻量开源翻译模型(基于 Gemini 训练、支持 55 种语言、可离线运行)。
这跟你有什么关系
原文来自 Google 对其语言技术的系统性梳理,读者可以借此了解其多语言 AI 的技术路线和数据合作方式。
Apple 发布新一代 Apple Intelligence,推出全面重构的 Siri AI,支持个人语境理解、屏幕感知、系统级应用操作和跨设备对话,今日起以英文测试版随 2027 系统更新推出,下月扩展至法语、日语、韩语、葡萄牙语和西班牙语。
这跟你有什么关系
官方公告完整列出 Siri AI 的能力清单、设备与语言范围,以及欧盟和中国市场暂不可用等限制,读者可据此评估适用性。
Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。
Together AI 扩展 Together Fine-Tuning 服务,新增对 GLM-5.3、Kimi K2.7、Qwen 3.5 系列等最新开源权重模型的支持,并上线实时实验跟踪、数据集预览验证等能力。
Google 发布图像生成工具 Google Pics,基于 Nano Banana 构建,现已上线 pics.new。支持局部对象编辑、图内文字修改与翻译、多人协作创作和单提示词生成多个选项。
OpenAI 在 ChatGPT Work 中推出新的 Data agent,用户用自然语言即可连接公司数据、分析变化并生成可分享的交互式仪表盘。
Perplexity CEO Aravind Srinivas 宣布自研键值数据库 CobbleDB,替代 AWS DynamoDB 用于快速网页内容抓取,迁移后每年最多可节省一亿美元。该项目由两名工程师和数百个持续运行的 Computer 智能体在两个月内完成核心基础设施,官方研究称热存储批次读取延迟较 DynamoDB 全分布下降约 5 倍(P50 从 31.4ms 降至 5.60ms)。
这跟你有什么关系
原文给出成本节省数字和构建方式,图片补充了批次读取延迟的具体对比数据。
Anthropic 告知投资者将实现连续第二个季度盈利,但该说法基于剔除股权激励等成本的调整后指标;据 Financial Times,毛利率超过 80%,尚未计入对 Amazon 等伙伴的分成和模型训练成本。
这跟你有什么关系
报道梳理了 Anthropic 盈利口径与 Nasdaq 上市计划的细节,并指出调整后指标与分成成本的口径差异,有助于读者评估 IPO 叙事。
Anthropic 9 月威胁报告披露,据评估极可能关联胡塞组织的也门小组使用 Claude Code 开发制导火箭、射程超 2,000 公里弹道导弹及名为 R2000 的高超声速滑翔载具概念的相关软件。
这跟你有什么关系
原文梳理了 Anthropic 威胁报告中也门组织用 Claude Code 并行推进导弹研发的完整链条,可帮助读者理解 AI 滥用如何绕过安全防护。
Minitap 团队发文指认 Google 的移动设备自动化项目 Artemis 大量复用了其开源项目 mobile-use 的代码,包括完全一致的 Hopper agent 提示词和示例,却未在 README 中署名;更早的包文件曾列出三位作者,8 月一次 force push 将其替换为另一作者。
这跟你有什么关系
Minitap 团队以代码比对和提交历史为据,指认 Google Artemis 移除了其 mobile-use 的作者署名,还给出 Apache 2.0 条款和排行榜争议细节。
据路透社报道,英伟达正与 Anthropic 洽谈以基石投资者身份参与其 IPO,考虑投资至多 100 亿美元。Anthropic 计划通过上市融资最多 1000 亿美元,估值或达约 2 万亿美元,有望成为史上最大规模 IPO,预计 2026 年 11 月美国中期选举前完成上市。
这跟你有什么关系
报道汇总了 IPO 融资规模、估值和双方既有合作安排等数字,读者可以据此了解这宗超大规模上市的关键背景。
Anthropic 发布报告,指控多家中国 AI 公司对 Claude 持续发起蒸馏攻击,累计发现近 2 亿次相关交互,涉及五个活动。
Shopify 宣布将全部移动应用从 React Native 迁回 Swift 和 Kotlin,判断是 LLM 智能体大幅降低了跨平台重复开发成本这一核心假设被改变。
Arena 更新 Image-to-WebDev 排行榜,纳入四个新评测模型。GPT-6 Astra (Max) 以 1733 分居第一,领先 GPT-5.6 Sol (xHigh) 129 分;Claude Fable 5.1 (Max) 以 1710 分排第二,Muse Spark 1.3 (Max) 1645 分第四,GLM-5.3-Flash 1588 分第十。
这跟你有什么关系
榜单给出四款新模型在图像生成网站任务上的排名和每百万 token 价格,可据此比较性能与成本差异。
Gergely Orosz 实地探访 OpenAI 总部并访谈七位工程师与工程负责人,发现自约一月起 Codex 和 ChatGPT Work 已成为公司几乎所有工作的基础。
这跟你有什么关系
作者亲访 OpenAI 并访谈七位工程负责人,给出 Codex 全面接管内部研发的第一手流程细节和工程实践变化。
404 Media 披露 OpenAI 内部代号为莉莉计划(Project Lily)的项目,由时薪超 50 美元的提示词审核员查看匿名化后的真实用户聊天记录,评判回复是否切题、是否存在 AI 式话术和谄媚口吻。
这跟你有什么关系
报道披露了人工审核流程的运作细节和隐私边界,读者可以据此了解模型优化背后的人力环节与数据风险。
Trail of Bits 发文批评 1Password 8月6日发布的 FLAWED 报告,称其 26% 的 AI 干净修复率受四项实验设计选择影响而失真,包括刻意指示智能体应用错误修复的提示词占 22% 数据、36% 的试验禁止编译测试,以及不同推理档位设置。
这跟你有什么关系
原文针对1Password基准的26%头条数字给出逐项方法学批评,并补充自身人类修复失败率与开源合并数据作对照。
Anthropic CEO Dario Amodei 呼吁行业与政府协调放缓前沿 AI 开发,并寻求反垄断豁免,Sam Altman 与 Elon Musk 表示同意。
这跟你有什么关系
文章汇总了各方对头部 AI 实验室提议放缓前沿模型开发的批评与政治反应,呈现了安全叙事之外的竞争与监管分歧。
Artificial Analysis 发布 Speech to Speech Index,OpenAI 的 GPT-Live-1 以 81.5 分(Astra 后端,medium 推理强度)排名第一,超过 Grok Voice Think Fast 2.0 High 的 81.3;Sol 后端配置得 80.1 排第三。
这跟你有什么关系
原文给出语音到语音模型的完整分数、速度和成本对比,读者可据此在不同后端配置间做选型判断。
Vercel COO Jeanne DeWitt Grosser 在 The Information 访谈中表示,公司 inbound 销售开发已实现 90% 自动化,团队从 10 人压缩至 1.25 人。
这跟你有什么关系
Vercel COO 给出自家 inbound 销售自动化的人员压缩、年度基础设施成本和 32x ROI 数字,是可直接参考的一手落地案例。
Sam Altman、Dario Amodei、Demis Hassabis 和 Elon Musk 周末粗略同意放慢 AI 开发,提出引入第三方审计、监管国内实验室并达成全球放缓协议,批评者则称其为压制竞争者和开源运动的"卡特尔"。
这跟你有什么关系
文章汇集安全研究者、监管团体与前官员的多方观点,既讨论放慢协议的价值,也剖析安全洗白与监管真空的可能走向。
Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。
这跟你有什么关系
原文用公开基准和可复现脚本对比两档模型在代码评审上的召回、精度与成本,并给出按仓库和 bug 类别分层的可迁移测法。
作者分析被指与 OpenAI 机器人相关的 GemStuffer 恶意 gem 代码,发现其利用 .yardopts 的 --load 加载脚本,在安装或 RubyDoc.info 处理 YARD 文档时执行任意代码,且 Docker 容器有网络访问权限可执行爬取。
这跟你有什么关系
作者逐段读了自己的恶意 gem 代码,讲清 YARD 执行和缓存密钥两个攻击面,读者能直接理解漏洞原理。
Tomer Tunguz 分析 Dario Amodei 提出的放缓前沿 AI 发展号召,梳理出可解释性、劳工、经济、地缘政治和监管俘获五派立场,并指出没有任何一派给出具体速度。
这跟你有什么关系
作者用前沿领先期缩短和算力门槛的历史数据,检验放缓前沿的提议在操作层面意味着什么。
Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。
这跟你有什么关系
作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。
Tessl 发文提出智能体转型的真正难点是上下文等要素的归属问题,而非 Agent 本身。核心规则是所有权跟随组织单元,个人与团队上下文归领域专家,组织级共享基础由赋能或平台团队托管并开放贡献,赋能团队只提供工具和基础设施而不拥有上下文。
这跟你有什么关系
文章把智能体转型的难点从模型转向上下文归属,给出按组织单元分层确权和赋能团队只供工具不拥有上下文的可迁移框架。
文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。
这跟你有什么关系
文章把解决长任务中上下文溢出与目标丢失的机制拆成四类,并对照多款主流 Agent 产品的具体实现和阈值,便于读者迁移到自己的系统。
Dario Amodei 发布新文章 We Must Pace the Frontier,主张 AI 行业应放慢速度,并提出三部分计划。Anthropic 单方面承诺第一步,为第三方评估者提供永久的员工级系统访问权限,以核实安全措施执行、报告事故并评估训练期间模型的 alignment。
这跟你有什么关系
Anthropic 首席经济学家转发 Dario 新文,原文给出了行业减速的三步计划及 Anthropic 已承诺的第一步。
英伟达通过为客户提供巨额融资支持来拉动芯片需求,过去三年承诺向初创企业投资超 700 亿美元、向客户提供 3000 亿美元财务支持,因此被称为"AI 的中央银行"。今年 8 月它同意为俄亥俄州一座大型数据中心提供最高 1050 亿美元的兜底,并与六家华尔街机构合作撬动超 5000 亿美元 AI 基础设施投资。批评者将其类比 1990 年代末思科和朗讯向电信客户放贷的互联网泡沫风险。
这跟你有什么关系
原文系统梳理了英伟达通过担保、入股和收益兜底深度介入客户融资的规模与风险,有助于理解其增长背后的金融结构。
Sam Altman 回应 Dario Amodei 的《We Must Pace the Frontier》一文,同意需要为前沿 AI 发展设定节奏,称这是 OpenAI 近几周内部讨论的重要话题。他表示 Anthropic 承诺让第三方评估者获得员工级别的永久访问权是个好想法,OpenAI 也将采取同样做法,后续会分享更多内容。
这跟你有什么关系
OpenAI 对 Anthropic 放缓前沿计划的公开回应,读者可以据此了解两大实验室在独立评估上的立场变化。
Dario Amodei 发布新文章《We Must Pace the Frontier》,主张 AI 行业应放慢速度并给出三点计划。Anthropic 单方面承诺落实第一步,为第三方评估者提供永久、员工级系统访问权限,使其可验证安全措施执行情况、报告事故并在训练期间评估模型对齐。全文见 https://darioamodei.com/post/we-must-pace-the-frontier
这跟你有什么关系
作者本人阐述放缓前沿 AI 的三点计划,并给出 Anthropic 率先落实的第三方评估开放措施,可了解其具体主张。
GitHub 日韩地区营销负责人 Tomoko Tanaka 分享如何不写代码,把活动运营交给 GitHub Copilot 自动化。
这跟你有什么关系
作者以自身营销工作为例,展示了用 Issue、Actions 和 SKILL.md 复用开发者治理流程落地自动化的完整路径。
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。
这跟你有什么关系
三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。
OpenAI 发文(系列上篇)讲述其在线存储平台 Habitat 的演进:现每秒处理超 7000 万请求、服务每周超 10 亿用户、管理超 500PB 数据,覆盖近 40 个地区。
这跟你有什么关系
原文披露了 Habitat 从 Python 库到 Rust 服务的完整演进细节,含 asyncio 调优、连接池等可迁移经验。
作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。
这跟你有什么关系
作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。
Elon Musk 转发 Grok Bot 对 SpaceX CFO Bret Johnsen 在 Goldman Sachs Communacopia 演讲的摘要。
LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。
Augment Code 发布长文,复盘其九个月建设的软件工厂:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台在需求、工单、PR、生产四个环节部署 PR Author。
热点数据来自 AI HOT,每条「阅读原文」直达原始出处,版权归原作者;中文标题与摘要由其生成。