2026-09-28 至 2026-10-04 AI 行业动态整理
AI 行业周报 · 2026 年 10 月第 1 周(9/28 - 10/04)
覆盖 2026-09-28 至 2026-10-04(截至北京时间 20:00),共收录 27 条事件。仅纳入本周有明确发布、提交或报道日期的进展,优先引用官方公告、论文页面与可靠媒体;同一事件不跨栏目重复计数,厂商评测与预测不视为独立验证结果。
1. 头部大厂
国内
- 阿里千问 AI 平台升级,增加 Agent Studio 与智能体服务(9 月 28 日报道)
云栖大会相关报道介绍了平台从模型调用向任务托管、企业知识库接入和行业方案扩展,并推出 API 优速模式及 Agent Studio。重点是把模型服务、运行保障与业务交付整合起来;文中效率数据为平台方口径。i黑马/网易。
国外
OpenAI 推出常驻智能体 dots(9 月 29 日)
官方将 dots 定位为拥有云端电脑、可持续执行任务并从反馈中学习的智能体,支持通过 ChatGPT、Slack 和 Teams 交互,并连接插件生态。首批向符合条件的 Pro 与 Business Premium 用户开放,企业版本需管理员启用;不是所有用户立即获得完整能力。OpenAI。Anthropic 与 Barclays 扩大 Claude 合作(10 月 1 日)
Barclays 将 Claude 用于软件开发、遗留系统现代化和员工知识辅助,计划到 2026 年底让 Claude Code 覆盖半数开发者,2027 年扩展至多数工程师。该比例是部署目标,不是已经完成的采用率。Anthropic。Google 公布 Gemini 与 Workspace 的 skills 及 Gems 迁移安排(9 月 30 日)
Skills 提供可复用自定义指令,支持在对话中组合多个技能,并将逐步替代部分 Gems 使用场景。现阶段 Gemini 应用与 Workspace 间不自动同步技能,团队迁移时仍需分别配置。Google Workspace。Gemini Live 在 Android 上推出 Guided Vision(10 月 1 日)
新功能面向盲人、低视力用户及需要视觉辅助的人群,通过摄像头提供实时口述、环境解释和取景提示。Google 称其与 Aira 及无障碍社区合作开发;能力属于视觉辅助,不应替代安全关键场景中的专业判断。Google。
2. 创业公司
国内
- MiniMax M3.1-Flash-Preview 开启公测(9 月 28 日报道)
凤凰网报道 MiniMax 上线预览模型,官方宣称支持原生多模态、百万上下文,以及 Bug 修复、完整功能开发和测试验证。预览体验不等于正式 API 全面可用;与匿名 Space Bunny 模型的关联仍是开发者猜测,本报不据此确认身份。凤凰网。
海外
Halluminate 完成 3,000 万美元 A 轮融资(10 月 1 日)
公司宣布由 Oak HC/FT 领投,累计融资达到 3,850 万美元。其业务聚焦知识工作所需的评测与强化学习环境,先从金融服务扩展至相邻行业;客户与收入增长数据为公司披露。Halluminate、Fortune。Photon 获 450 万美元种子融资,押注消息应用中的 Agent(10 月 1 日报道)
TechCrunch 报道 Photon 为开发者提供在 iMessage、WhatsApp 等现有消息入口中构建智能体的工具。其路径是减少用户安装新应用的摩擦,而非证明移动应用已经被替代。TechCrunch。
3. 基础模型
OpenAI 发布 GPT-6.1 Sol,强调能力与成本平衡(9 月 29 日)
官方将新模型定位于编码、电脑操作和专业工作,标准 API 输入/输出价格分别为每百万 token 2 美元/10 美元,缓存输入为 0.10 美元。其“接近 Astra”表现来自官方评测,不能直接等同于所有任务上的同等能力。OpenAI。Google 发布 Gemini 4 Argon,采用分阶段访问(9 月 30 日)
Argon 面向长期软件工程、企业知识工作和网络安全防御,先通过 Fairwind Program 向可信防御者开放。官方计划逐步扩展访问,并公布每百万 token 输入 2 美元、输出 10 美元的介绍价格;当前不能按普遍可用的消费级发布理解。Google。Microsoft 发布流式转写及新一代语音模型(10 月 1 日)
MAI-Transcribe-2-Streaming 支持 60 种语言和连续语言识别,配合 MAI-Voice-2.1 与 Flash 版本构成实时语音 Agent 的听说链路。官方称流式部分结果可在约百毫秒后出现;延迟与榜单表现需要结合实际音频、网络和工作负载评估。Microsoft AI。Decagon 推出 Voice 3 与 Chord 语音模型(10 月 1 日)
Voice 3 采用并行的低延迟对话层与复杂推理/工具调用层,减少等待期间的沉默并支持自然插话。Chord 专注客服场景中的语音节奏与表达;公司说明训练使用授权数据及同意参与的配音人才,而非客户自有数据。Decagon。Suno 推出 Speech 测试版,联合生成讲话与配乐(10 月 1 日)
Speech 可一次生成语音内容及其背景音乐,覆盖故事、演讲等创作场景,并在移动端与网页端提供。该版本仍在测试阶段,本周公告没有给出可与其他模型直接对照的统一评测。Suno。
4. 论文与研究进展
Meta 公布 Muse Spark 与数学家合作的六篇研究论文(10 月 2 日)
官方介绍六项合作,其中五项针对此前开放的研究问题。研究由数学家引导并进行人工核查,明确区分人类和 AI 起草部分,也承认部分问题存在独立同期成果;不应简化为模型独立解决全部问题。Meta AI Research。VISTA:通过视觉记忆与检索增强交互推理(10 月 1 日提交)
论文提出保存原始视觉观察并允许主动检索、重组上下文的 visual harness。作者报告其提升了同一基础模型在交互游戏与谜题任务上的表现;本周事件是技术报告提交,早期博客已在 8 月发布,且公开游戏结果不能外推至完整未知测试集。arXiv。OmniSeek:让音视频模型主动选择证据窗口(10 月 1 日提交)
框架让模型决定何时看、何时听及检索哪个时间段,将稀疏关键证据加入多轮推理。训练结合 OmniTraj-170K 轨迹与强化学习,并通过 Audio-Visual Necessity 目标减少只依赖单一模态的捷径;效果为论文实验报告。arXiv。PoS:以显式信念状态管理长周期 Agent(10 月 1 日提交)
论文《Beyond Memory》将当前世界状态估计与未解决任务要求组成决策上下文,持续检查一致性与进展,识别停滞后执行针对性恢复。其主张是上下文管理不仅要保留历史,还要维护可行动的当前理解。arXiv。ThinkingGuard 与 TriggerBench 聚焦多模态组合风险(9 月 29 日提交)
研究针对单独看似无害、组合后产生危险含义的图文输入,构建 5,600 条实例的 TriggerBench,并提出分步骤监督的防护模型。论文报告标准与隐式安全基准上的改进,但部署可靠性仍需独立测试。arXiv。
5. 开源项目与社区讨论
Raven 发布 v0.2.4,增加配置审批与工作区检查点能力(10 月 3 日)
GitHub release 记录新增对话内配置工具、写入确认和每轮工作区检查点,并说明无人值守定时回合不能修改配置。这里以可核验的本周版本发布作为开源进展,不把搜索聚合页的“Trending”标签当作官方榜单排名。GitHub Releases。HN 讨论 System76/COSMIC 的 AI 代码限制与维护成本(10 月 3 日)
相关帖子围绕 AI 生成代码的可维护性、审查责任,以及小步变更和清晰 API 边界展开讨论。抓取时已有百余条评论,代表社区争议而非行业共识;帖子标题的禁令范围不能泛化成所有开源项目的政策。Hacker News。
6. 其他趋势
OpenAI 披露并处置针对受保护推理的蒸馏攻击(9 月 30 日)
本周公开报告描述了从 7 月开始的协调攻击及后续缓解措施,重点涉及交互操纵、推理回放和输出保护。官方强调这不是数据库入侵或加密被破解;本周计入的是披露,而不是把历史攻击时间移到本周。OpenAI。AWS MCP Server 扩展至六个新增区域(10 月 2 日)
新增新加坡、悉尼、东京、爱尔兰、伦敦和俄勒冈区域,使开发者可选择更近的托管 MCP 端点并满足数据驻留需求。服务提供对 AWS API 的统一访问界面,区域扩展不意味着智能体自动获得基础设施变更授权。AWS。Cloudflare 在 AI Gateway 中推出 Web Search API(10 月 2 日)
Cloudflare 与 Ceramic.ai、Exa、Linkup 合作,为智能体提供检索入口,减少靠猜 URL 获取事实的低效流程。该层主要解决实时信息接入与上下文供给,搜索结果仍需来源核验。Cloudflare。Modal VM Sandboxes 正式可用,为 Agent 提供完整 Linux VM(10 月 1 日)
开发者可通过runtime="vm"选择完整虚拟机运行时,并沿用 Sandbox API 和镜像构建方式。产品面向需要真实机器语义的编码与评测任务;云端执行隔离仍需配合权限、网络与生命周期管理。Modal。Modal Clusters 正式可用,简化多节点训练与推理(10 月 1 日)
@modal.clustered将多节点 GPU 与 RDMA 能力接入既有函数、数据卷和队列工作流。其意义是降低分布式计算的编排门槛,而非取消训练代码对拓扑、通信和失败恢复的要求。Modal。Prime Intellect 发布 Prime Inference(10 月 2 日)
服务覆盖 serverless 端点与预留容量,目标是把开放模型训练、生产推理和后续学习连接起来。GLM-5.3 的首个公开部署发生在 9 月 22 日,不重复计为本周模型发布;本周事件是推理平台正式公告。Prime Intellect。加州签署 AI 工作场所保护等系列法案(9 月 30 日)
州长办公室公告涵盖 No Robo Bosses 等劳动保护,限制仅凭自动化系统作出解雇或纪律处分等决定,并涉及监督、通知及其他 AI 使用规则。具体义务需按各法案文本与生效日期判断,不能把整套规则描述成即时统一生效。加州州长办公室。