← 全部日报

AIGC 信息日报

2026 年 10 月 10 日 周六

行业与平台

Industry

HeyGen Voice 登顶 TTS 榜并开放 API

HeyGen 发布新语音模型 HeyGen Voice,称在 Artificial Analysis TTS 排行榜盲测中击败所有主要模型登顶,现已在 HeyGen 平台和 API 上线。API 用户 10 月 31 日前享 50% 折扣,每百万字符 15 美元(原价 30 美元),自动生效。适用于配音、虚拟角色对话、短剧对白等语音生成场景。

HeyGen 新语音模型在 Artificial Analysis TTS 盲测榜登顶,API 已上线且 10 月 31 日前每百万字符 15 美元(原价 30)。做 AI 配音、短剧对白、虚拟角色口播的可以接 API 跑一周,比一比废音率和情绪自然度。

点击打开原平台查看,能否访问取决于网络环境

通义千问开源 Qwen-Image-2.1-Turbo,8 步出图

通义千问发布 Qwen-Image-2.1-Turbo,基于同一 7B 视觉生成架构的加速版本,只需 8 个去噪步骤即可完成图像生成和编辑,权重已开放。对做图像批量生产和本地部署的视觉团队来说,步数压缩意味着单张出图耗时大幅下降,适合接进自己的出图流程里实测速度与画质的平衡点。

8 步去噪就能出图和改图,还开放权重,做批量出图和本地部署的视觉团队可以拉下来跑一遍,看速度和质量能不能顶住日常产能。

点击打开原文,能否访问取决于网络环境

Pine 发布面向 AI Agent 的云端计算机

Pine 发布为 AI Agent 构建的云端计算机 Pine Computer,开发者通过 SDK 创建实例,用自然语言下达任务,由 Agent 在网站、文件和应用间自行规划并执行。运行 GPT-5.6 Luna 时,官方称在 SaaS-Bench v1.1 上模型 token 成本约为 GPT-5.6 Sol + Codex 的 1/20,checkpoint 得分 78.3% 为公开对比中最高,约为 Opus 5 + Claude Code 的 1/26,部分内部初步测试中快 2-5 倍。

给 Agent 单独造一台云端电脑,开发者用 SDK 开实例、说人话派活,它自己跨网站和文件干活。跑 GPT-5.6 Luna 时 token 成本只有 Sol+Codex 的约 1/20,做自动化流程的可以接 SDK 试一周。

点击打开原平台查看,能否访问取决于网络环境

HiDream 新视频模型首秀图生视频音频榜第 6

HiDream 发布 HiDream-O1-Video-1.0,定位原生全模态视频模型,主打物理一致性,可生成 1080p、5 到 20 秒带原生同步音频的视频,时长由场景决定而非预先固定。在 Artificial Analysis Video Arena 图生视频(含音频)榜首秀排第 6,紧随 Dreamina Seedance 2.0 720p,与 MiniMax H3、Vidu Q4 Preview、Gemini Omni Flash 同梯队,领先 Wan 3.0。定价每分钟 1080p 带音频视频 5.80 美元(约每秒 0.10 美元),已通过 HiHarness API 和 vivago R1 Studio 提供。

国产新模型首秀就挤进图生视频带音频榜第 6,紧跟 Seedance 2.0,1080p 带原生同步音频、时长按场景自动定,做短剧和配音的可以拿它跟手上模型对比着跑几条。

点击打开原平台查看,能否访问取决于网络环境

fal 推出 Claude Motion 与 Claude Connector

fal 官方发布 Claude Motion 与 fal Claude Connector 两款新产品,并附上 YouTube 完整视频链接。推文正文仅给出产品名称和视频地址,未说明具体功能、参数或接入方式。对做自动化出片流程的团队来说,值得点开视频确认这两个工具能否接进现有的生成工作流。

fal 把 Claude 接进了自己的生成平台,Motion 和 Connector 两个新东西具体能干什么还得看视频,做自动化出片流程的可以先点开看看。

点击打开原平台查看,能否访问取决于网络环境

Busabase 开源智能体数据库与工作空间

Busabase 团队推出开源(MIT)的智能体数据库与工作空间,解决智能体产出困在孤立聊天记录、无法积累的问题。智能体不再把工作丢在临时对话里,而是直接写入结构化工作空间,把输出转成可复用的数据、文档和技能,供整个团队访问。详情见 busabase.com。

智能体产出不再散落在聊天记录里,而是写进结构化工作空间变成可复用数据、文档和技能,MIT 开源。自己搭 Agent 流程的可以拉下来跑一遍,看能不能接进现有的素材和脚本管理。

视频版 ChatGPT 酝酿超 9 年终问世

Synthesia 的 Steffen Tjerrild 发推宣布 Syren 上线,称其为「视频版 ChatGPT」,并附上 synthesia.io/syren 产品页链接,表示期待看到用户的创作。推文本身只有一句话加链接,未展开具体能力、参数或价格。做数字人播报、口播视频批量生产的团队可以点开产品页确认实际功能。

Synthesia 官方人员放出的 Syren 产品页,自称「视频版 ChatGPT」,做数字人播报和批量口播视频的可以点进去看它到底能做什么。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

Higgsfield 推出 Katana,可在 Claude 内使用

Higgsfield AI 推出 Higgsfield Katana,一款由 Claude Motion 驱动的 AI 视频编辑工具,现可在 Claude 内通过 Higgsfield MCP 调用,支持上传参考素材生成可编辑的动态图形、产品发布视频等。官方演示视频未使用任何视频 AI 模型,不含 Blender、After Effects、Seedance,全部由 Three.js 代码生成,含渲染约 12 小时完成。

演示片全程没碰视频模型,纯 Three.js 代码生成,12 小时含渲染做完。做动态图形和产品发布视频的可以进 Claude 接 MCP 试一遍,看代码出片这条路走不走得通。

点击打开原平台查看,能否访问取决于网络环境

Claude Managed Agents 推出动态工作流

Claude Managed Agents 新增 Dynamic Workflows 功能,在 agent 配置里设置 multiagent type: multiagent_20261001 后,让 Claude 运行工作流,Claude 会自己撰写计划并调度单次最多 1,000 个智能体。官方示例用 claude-opus-5-5 模型和 agent_toolset_20260401 工具集,演示对 300 份合同批量查找控制权变更条款。

单次跑最多 1000 个智能体、Claude 自己写计划做调度,官方示例是 300 份合同批量查条款。做批量素材处理、批量脚本拆解的团队可以接 API 试一周,看能不能替掉人工分发的活。

点击打开原文,能否访问取决于网络环境

Luma AI 推出 Product Shots 产品图换场景功能

Luma AI 在官方 X 账号发布 Product Shots 功能,定位是让创意团队把已有的产品图放进新场景,不必每次从头重做。官方描述的场景是「你已经有产品图了,现在需要把它放到别的地方」。适用于电商产品图、广告物料的多场景复用。

同一张产品图直接换场景,不用每次重拍重搭,做电商视觉和广告物料的可以拿手头素材跑一遍看一致性。

点击打开原平台查看,能否访问取决于网络环境

Suno Studio 2.0 上线自定义效果器机架

Suno 官方介绍 Studio 2.0 支持自定义效果器:在任意音频或 MIDI 轨道上点击 Add Effect 即可搭建效果器机架,也可通过聊天栏制作自己的插件。对做 AI 配乐、配音和声音后期的创作者来说,这意味着 AI 生成的音轨可以在同一工具内完成效果处理,不必再导出到外部 DAW 做二次加工。

Suno Studio 2.0 给每条音频/MIDI 轨道加了效果器机架,还能在聊天栏里直接做插件,做 AI 配乐和声音后期的可以上手搭一套自己的音色链。该产品的发布我们已在 2026-08-14 报过,这条是官方对已有能力的介绍,不是新上线。

点击打开原平台查看,能否访问取决于网络环境

Fish Audio Drama 3 可为角色声音添加更多情绪

Fish Audio 官方宣布 Drama 3 新增两项能力:一是给角色声音加入更多情绪控制,二是可以只重录一句台词甚至单个词,不用重新生成整段音频。对做 AI 短剧、动画配音和有声内容的后期来说,改词不再牵动全段,情绪调整也能落到单句粒度,配音返工成本明显下降。

配音环节最烦的就是改一个字要重跑整段,Drama 3 这次能只重录单句甚至单个词,情绪也能单独调。做短剧和动画配音的可以拿一段旧台词试改,看接缝自不自然。

点击打开原平台查看,能否访问取决于网络环境

豆包工作新增画布功能,上线豆包 2.1 Lite 与图片模型 Seedream 5.0 Flash

豆包工作宣布任务模式新增画布功能,支持无限画布查看整理素材与创作成果,并可逐步编辑文字、配色与布局。同时上线豆包 2.1 Lite 模型,主打更省额度、更快交付,覆盖文档撰写、表格处理、PPT 制作等场景;另新增图片模型 Seedream 5.0 Flash,为生图创作提供更多风格选择。

豆包工作加了无限画布,素材和成片能摊开整理、逐层改文字配色布局;同时上了更省额度的 2.1 Lite 和生图模型 Seedream 5.0 Flash,做视觉和分镜的可以拿它试生图风格。

ElevenLabs 推出合成语音检测,通话开头几秒辨真人

ElevenLabs 宣布推出合成语音检测功能,在通话开始几秒内分析来电者语音,判断是真人还是 AI 生成,并据此进行路由。官方称这样真人能获得为真人打造的体验,智能体可以进行直接、有边界的交互,恶意行为者可以被拦截。对做 AI 配音、语音智能体和电话外呼的团队来说,这是语音流程里新增的一道身份识别环节。

做 AI 配音、虚拟角色电话客服的可以留意:通话开头几秒就能判断对面是真人还是 AI 并分流,合规和反诈场景用得上。

点击打开原文,能否访问取决于网络环境

PixVerse 活动含 OpenAI 演示 ChatGPT 出片流程

PixVerse 官方公布系列直播活动安排,每场包含 PixVerse 平台讲解、OpenAI 现场演示 ChatGPT 连接日常工具并通过 PixVerse Plugin 生成创意简报和成片、社区创作者分享两款工具的使用方式,以及现场问答环节。对做 AI 短剧和广告的团队来说,这是观察「对话式工具直接产出成片」这条流程实际跑法的窗口,可关注直播看创意简报到成片的衔接细节。

ChatGPT 接上 PixVerse Plugin,从创意简报直接出成片,做短剧和广告的可以蹲直播看这条流程怎么串起来。

Grok Bot 新增专属邮箱功能

Grok Bot 新增专属邮箱功能(该产品 8 月 12 日已发布)。Bot 可以用它注册第三方服务、代替用户联系商家、或与对方安排时间。这是 Grok Bot 在自主执行能力上的一次功能扩展,把「注册账号」「发邮件沟通」这类原本需要人工操作的环节交给 Bot 完成。对做自动化工作流的团队来说,这类带独立身份的执行能力可以接进需要账号注册、对外联络的流程里。

Grok Bot 现在能自己注册服务、替你联系商家、约时间,做自动化流程的可以看看能不能接进自己的发布/对接环节。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

Artificial Analysis 实测四款图像模型 30 步连续编辑一致性

Artificial Analysis 用同一张照片对 GPT Image 2.5 Sunburst、Ideogram 4.5、FLUX 3、Nano Banana 2.1 做了 30 步连续房地产布景编辑(点火、加沙发、刷墙、白天换黄昏等),每步基于模型自己的上一步输出。结论:Ideogram 4.5 和 FLUX 3 走局部编辑,小改动时 95% 以上画面不动;GPT Image 2.5 每次重绘整图,仅约五分之一画面不变,色彩细节偏差逐步累积;Nano Banana 2.1 居中,编辑局部但整体画面轻微偏移并逐渐变暗。

同一张图连改 30 次,Ideogram 4.5 基本保住原图,GPT Image 2.5 每步重绘整张导致漂移累积。做分镜迭代和场景反复改稿的视觉师值得看这份对比。

点击打开原平台查看,能否访问取决于网络环境

Higgsfield 用 Claude Motion 纯代码一次生成产品广告

Higgsfield 官方发布一条产品广告,称由 Claude Motion 与 Higgsfield Katana 组合、全程用代码一次性生成,未经过多轮返工。官方给出的判断是 AI 动态设计开始接近可交付水准。对做产品广告、动态设计和电商物料的团队来说,这是一条纯代码路径的成片样本,可用来判断画面质感和交付完成度。

纯代码路径一次跑出产品广告成片,做电商广告和动态设计的可以点开看画面质感,判断这条路线能不能替掉部分实拍和后期。

点击打开原平台查看,能否访问取决于网络环境

Lovart 实测 Nano Banana 2.1 人像质感对比 GPT Image 2.5

Lovart 放出 Nano Banana 2.1 与 GPT Image 2.5 的人像生成左右对比图,左侧为 Nano Banana 2.1,右侧为 GPT Image 2.5,称前者在人像打光和皮肤质感上有明显提升(该产品 10 月 6 日已发布)。对比图由 Lovart 制作。做角色定妆、人像海报和写实人物素材的视觉创作者,可据此判断两个模型在皮肤细节和光线处理上的差异。

Lovart 放出 Nano Banana 2.1 与 GPT Image 2.5 的人像左右对比,主打打光和皮肤质感。做角色定妆、海报人像的视觉师可以拉图看细节差异,再决定用哪个出图。

点击打开原文,能否访问取决于网络环境

Codex 操作电脑串起 Tripo3D 与 Blender 一晚做出 3D 游戏

作者用 GPT-6 Astra + Tripo3D + Blender + Claude Opus 5.5 组合,让 Codex 操作电脑自动完成从生成图片、Tripo 生成 3D 模型、绑骨骼拆分、Blender 减面组装搭场景,到 Opus 5.5 完善玩法逻辑的全流程,一晚做出可玩的荒岛狩猎游戏 Demo,角色可移动、切换手枪猎枪和刀、开镜射击、猎物会主动攻击。作者特别提到 Tripo 新上的 P2.0 模型能生成干净可用的拓扑面,高精度模型可直接进入游戏开发和动画制作流程,省去大量细调时间。

一条把 Codex、Tripo3D P2.0、Blender、Opus 5.5 串成自动流程的实测记录,从出图到 3D 资产到场景组装全程 AI 操作电脑完成。做 3D 资产和自动化工作流的可以拆它的分工方式。

点击打开原平台查看,能否访问取决于网络环境

Recraft 教程:一张主图生成角色三视图与表情表

Recraft 官方博客发布教程,讲如何在 Recraft Studio 里把一张角色主图转成转身图(turnaround)、表情表(expression sheet)和姿势表(pose sheet)三套参考素材,目的是让角色在后续每一张新图里保持同一形象。教程面向需要跨图维持角色一致性的创作场景,属于工具使用说明类内容。

角色一致性是 AI 短剧和动画最头疼的一环,这篇官方教程把一张主图拆成转身图、表情表、姿势表三套参考,做角色 IP 和系列片的视觉师可以照着跑一遍。

lemo-opuscar 更新 公开 98 个奥斯卡最佳影片场景复刻提示词

开源项目 lemo-opuscar 更新,把短片《Opuscar 98》里 98 个奥斯卡最佳影片场景复刻的风格、提示词和导演执导思路全部公开,网站支持一键复制提示词复刻对应风格。项目 GitHub 已获 1.5K star,不用 Claude 的用户可以把仓库丢给 Grok bot 本地跑 skill。

98 部奥斯卡最佳影片的场景复刻风格、提示词、导演执导思路全公开,网站可一键复制,做视觉开发和风格参考的可以扒下来当素材库。

点击打开原文,能否访问取决于网络环境

Claude 托管 Agent 自动化搭建指南发布

Anthropic 开发者账号发布 Claude Managed Agents 自动化搭建指南:可部署一个按计划定时读取 Slack/GitHub 的 Agent,支持凭证与记忆,并自动发布更新;通过一条 Claude Code 命令即可完成设置,Max 和 Team 套餐包含新的 API 额度。对做创作流程自动化的技术整合者来说,这套定时抓取+自动发布的模式可迁移到素材收集、进度同步等环节。

官方教程:用一条 Claude Code 命令部署定时读 Slack/GitHub 的 Agent,带凭证和记忆,Max 和 Team 套餐含新 API 额度。做自动化流程的技术整合者可以照着跑一遍。

创作者用 Claude 搭 Shorts 工厂,一台 Mac Mini 全天跑

创作者 Alex Patrascu 分享自己的 Claude Shorts 工厂:因用量消耗过快,改用一台 Mac Mini 24 小时常驻运行;同时新增 3 个 skill 对应 3 个内容品类,每个 skill 产出一整套制作包,含可编辑工程、上传物料(缩略图、标题、描述等)、脚本、清单、分镜、旁白、封面和提示词。目前进入上传与频道管理阶段。

个人创作者把 Claude 做成短视频批量生产线,一个 skill 直接吐出脚本、分镜、旁白、封面、标题描述全套物料,做短剧和账号矩阵的可以看看这套拆法。

点击打开原平台查看,能否访问取决于网络环境

Claude 写代码做 2D 动画,再转 Blender 3D 版

Kevin Ngo 分享:先让 Claude 用 JavaScript 逐帧绘制 2D 动画并编写钢琴乐谱,再把这部 2D 成片作为参考交给另一个 Claude,因为整部影片都是代码,Claude 得以复用完全相同的调度,在 Blender 中生成 3D 版本。核心在于用代码作为中间层,让同一套动作调度在 2D 与 3D 之间直接迁移。

整部片子是代码,Claude 先写钢琴谱、逐帧画 2D,再把同一套调度搬进 Blender 出 3D。做程序化动画和想用 Agent 串制作流程的可以拆一下这个思路。

点击打开原平台查看,能否访问取决于网络环境

ElevenLabs 语音智能体接入 Banner 医疗预约系统

ElevenLabs 与医疗机构 Banner Health 合作,用 ElevenAgents 语音智能体接听患者来电,从初级保健预约切入。患者可全天候拨打,智能体直接在 Banner 的电子病历系统中完成预约、改期、取消;需要人工时通话转接给 Banner 团队成员并附带上下文信息。这是语音智能体在医疗场景的一次业务落地案例。

语音智能体直接写进医院电子病历系统、能预约改期取消、转人工还带上下文——做 AI 客服和语音交互产品的可以看这套落地样本。

点击打开原文,能否访问取决于网络环境

Ethan Mollick 谈 Google 后 Gemini 4 时代挑战

宾大教授 Ethan Mollick 发推评论 Google 在 Gemini 4 之后的挑战:他认为关键不在模型本身,而在如何用好一个优秀模型。他指出 Anthropic 和 OpenAI 正走向用调度型智能体、以单一界面处理多种任务的方向,而 Gemini 3 时代的产品线分散在众多市场,这种碎片化打法对下一步行不通。属个人观点,无具体产品信息。

当天有 4 家独立信源在报同一件事,属于行业动向本身。对具体创作流程没有直接用处,但这个量级的消息值得知道。

作品与案例

Works

Higgsfield 用代码生成整支汽车广告

Higgsfield 官方发布一支汽车广告,称整支片子完全用代码生成,工具组合为 Higgsfield Katana 加 Claude Motion。成片为汽车广告类型,主打代码驱动的生成方式而非传统提示词流程。

Higgsfield 官方放出的汽车广告成片,主打 Katana + Claude Motion 的代码化生成路径,做广告片和视觉的可以拉片看镜头调度和质感。

点击打开原平台查看,能否访问取决于网络环境

B站AI短剧《别碰那生蚝》上线

B站「AI全民制作人」标签下的AI短剧《不烧心系列丨别碰那生蚝,吃了真会烧心啊》,剧情围绕沈砚川丢失的一袋生蚝展开:他通过业主群、物业广播、上门提醒寻找,赵桂兰却坚称生蚝是自己买的,双方从上门争执升级到索要赔偿、利用舆论施压,沈砚川逐步拿出聊天记录、监控和现场证据,牵出谎言、贪念与家庭矛盾。题材是市井邻里纠纷,走多集连续剧结构。

B站「AI全民制作人」标签下的AI短剧,讲一袋生蚝引发的邻里纠纷,从业主群吵到上门索赔再到舆论施压,做短剧的可以拉片看它怎么把日常小事铺成多集冲突。

点击打开原平台查看

B站AI短剧:女巫打得过吸血鬼却怕东北小伙

B站「AI全民制作人」标签下的 AI 短剧系列,题材是都市奇幻:吸血鬼、狼人、女巫与东北小伙的混搭设定,单集篇幅在 1 到之间,已更新多集并带预告。系列靠固定角色(女巫、夜寒、美汐等)串起连续剧情,属于个人创作者用 AI 做连续短剧的样本。

B站「AI全民制作人」标签下的连续短剧,吸血鬼、狼人、女巫、东北小伙混搭的都市奇幻题材,单集 1-。做 AI 短剧的可以拉片看它怎么用固定角色撑起连续剧集。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索