← 全部日报

AIGC 信息日报

2026 年 8 月 5 日 周三

行业与平台

Industry

FLUX 3 视频模型发布:原生音频、多帧图生视频

Black Forest Labs 发布 FLUX 3 视频模型,支持原生音频、文本转视频、多帧图像转视频、视频续接、多语言对话,最长 20 秒 1080p 原生分辨率,提供低成本的 Draft 模式用于快速探索创意,已开放 API 并接入常用工具,2K、4K 及开源权重即将推出。

FLUX 3 视频正式上线,原生音频、多帧图生视频、视频续接、多语言对话,最长 20 秒 1080p,还带便宜的 Draft 模式。做短剧和视觉的可以直接接 API 或常用工具实测,2K/4K 和开源权重也在路上。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 开放 API 与多端应用

MiniMax 官方宣布 H3 模型正式开放 API 调用,并提供 WebApp、桌面端等多端应用入口,覆盖全球及中国区。创作者可通过 API 或 App 直接使用 H3 进行视频生成,适用于短剧制作、视觉开发等场景。

MiniMax H3 正式开放 API 和 App 端,做 AI 短剧和视觉的可以直接接 API 或下载应用实测,看视频生成质量和角色一致性表现。

点击打开原文,能否访问取决于网络环境

Topaz 发布 Wonder 3.5 与 Bloom 2 两款图像模型

Topaz Labs 发布两款新图像模型:Wonder 3.5 面向照片和图像处理,Bloom 2 面向 AI 生成图像的增强。两款模型已同步接入 Topaz Image Web,并支持在 ComfyUI、fal、Oxen、Krea、Pixelcut 等平台的工作流中使用。

Topaz 一口气放出 Wonder 3.5 和 Bloom 2 两款图像模型,分别针对照片和 AI 生成图,已接入 ComfyUI、fal、Krea 等主流工作流。做视觉和后期的一周内接进管线实测,看修复和增强效果值不值得换。

点击打开原文,能否访问取决于网络环境

Bland 发布 Speech v3 语音引擎,称超越 ElevenLabs

Bland 推出 Speech v3,定位为世界首个人类语音引擎,在 DesignArena 的 Audio Realism 基准测试中排名第一,超越 ElevenLabs、Grok、Cartesia 和 OpenAI。模型基于超 1 亿段真实人类对话训练,面向企业、开发者和创作者开放免费试用。官方演示用 5 秒旧影像素材,帮助一位 49 岁中风父亲恢复声音。

语音合成新玩家,官方称在 Audio Realism 基准上超过 ElevenLabs、Grok、Cartesia 和 OpenAI,用 5 秒旧素材帮中风患者找回声音。做配音、虚拟角色对话的后期和短剧团队可以免费试一周,看真实度和情感表现力够不够用。

点击打开原平台查看,能否访问取决于网络环境

Qwen 模型上线 OpenRouter,权重即将开源

阿里 Qwen 官方账号宣布模型已上线 OpenRouter 平台,可直接调用,并预告开源权重即将放出。对 AIGC 技术整合者来说,这意味着多了一个可接入的模型源,且后续可本地部署,适合接入自动化创作流水线。

Qwen 官方确认模型已上线 OpenRouter 且权重即将开源,做工具链整合的可以直接接 API 测,等权重放出还能本地部署跑工作流。

点击打开原文,能否访问取决于网络环境

腾讯混元发布 Hy ASR 3.0 预览版,主打方言与语义理解

腾讯混元发布 Hy ASR 3.0 预览版,基于 Hy3 语言大脑,主打高精度语音识别与深度语义理解,在通用识别、上下文感知、多场景鲁棒性、方言覆盖四项上宣称领先,面向嘈杂真实音频场景。

腾讯混元把 ASR 3.0 预览版端出来了,主打方言覆盖和上下文理解,做 AI 配音、字幕、短剧后期转写的可以直接接 API 试一周,看脏音频和方言场景的识别稳不稳。

点击打开原文,能否访问取决于网络环境

商汤开源 SenseNova U1:统一推理与图像生成

商汤开源 SenseNova U1,一个统一推理与图像生成的 AI 模型。支持信息图模式(一条 prompt 生成带图标、章节、版式的结构化幻灯片)和交错模式(逐步构建文本+图像,可用于教学演示)。开源模型,可接入创作流水线。

商汤开源了能边推理边出图的统一模型,信息图模式一条 prompt 直接生成结构化幻灯片,做视觉方案和分镜草稿的可以接 API 试跑,看能不能省掉中间排版环节。

点击打开原文,能否访问取决于网络环境

Pika 推出 API Club 会员,直连头部生成模型

Pika 官方推出 API Club 会员服务,以会员制接入头部生成式媒体模型,主打低于聚合平台的直连价格。官方称不少 API 聚合平台存在约 3 倍加价,Pika 自建渠道并谈判更优价格。面向批量调用生成模型的创作者和工具链整合方,可降低 API 调用成本。

Pika 官方下场做 API 聚合,主打砍掉中间商 3 倍加价,做批量出片和工具链整合的团队可以算算成本账,接 API 跑一周看性价比。

点击打开原文,能否访问取决于网络环境

Luma 发布 2026 创意团队 AI 采用率统计

Luma AI 官方博客发布 2026 年创意团队生成式 AI 采用率统计报告,汇总 24 项关键数据,覆盖团队渗透率、工具使用分布、成本效率等维度。面向影视、广告、内容制作团队的决策参考。

Luma 官方整理的 24 项创意团队 AI 采用数据,制片人和团队负责人可以拿来做预算和工具选型的参考依据。

点击打开原文

小红书 AI 工作台 v0.1.0 开源

Mengke Wang 开源公司内部使用的小红书 AI 工作台 v0.1.0,包含针对小红书平台定制的 AI skills,已发布在 GitHub 仓库 nihe0909/xiaohongshu-ai-workbench。面向小红书内容生产场景,提供可复用的自动化工作流。

做小红书内容矩阵的团队可以拉下来看看,内部用的 AI skills 直接开源,省得自己从零搭工作台。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

阿里 Wan 推出实时相机转图像功能

阿里 Wan 官方发布 Camera-to-Image 功能,属于新的 Real-time 功能套件。用户打开摄像头即可将现实环境实时转换为动漫风格画面,官方附有演示视频。该功能面向实时视觉风格化场景,适合动漫风格化视觉探索和实时场景转换应用。

阿里 Wan 官方发布实时相机转图像能力,打开摄像头就能把现实场景实时转成动漫风格画面,做视觉风格探索和 AI 短剧场景转换的可以直接上手试。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter 上线图像模型 Playground 支持生成编辑合成

OpenRouter 官方推出图像模型 Playground,支持快速生成、编辑、合成图像,已开放试用链接。视觉师和做分镜的可以直接在网页上试多模型对比效果,不用本地部署。

OpenRouter 官方推出图像模型 Playground,支持快速生成、编辑、合成图像,视觉师和做分镜的可以直接在网页上试多模型对比效果,不用本地部署。

点击打开原平台查看,能否访问取决于网络环境

Vidu 一键 MV 升级:四大创作链路覆盖对口型与舞蹈

生数科技 Vidu 一键 MV 全面升级,推出对口型唱、演唱穿插、舞蹈演绎、剧情演绎四大创作链路,覆盖音乐 MV 主流形态。用户上传图片和音乐即可生成口型、动作、表情、镜头与剧情,支持 720P 生成。对口型唱、演唱穿插、舞蹈演绎模式每秒 0.75 元,剧情演绎每秒 0.65 元。

Vidu 把 MV 生成拆成对口型唱、演唱穿插、舞蹈、剧情四条链路,上传图+音乐就能出带口型动作表情的成片,做音乐视频和短剧的可以上手试一轮,720P 出片,价格按秒算。

Maestro v1.5.5发布 社区48小时适配H3

MiniMax 官方宣布 Maestro v1.5.5 接入 MiniMax H3 模型。社区在 48 小时内将 H3 跑通在官方未测试的硬件上,包括游戏显卡和完全离线的 MacBook,并构建了官方未规划的工具。官方对开源结果表示认可。

MiniMax 官方确认 H3 开源后社区 48 小时就在游戏显卡和 MacBook 上跑通离线,做本地化 AI 视频工作流的技术整合者可以跟进这套工具链。

点击打开原文,能否访问取决于网络环境

OpenRouter 推出异步工具,后台运行不阻塞对话

OpenRouter 宣布推出异步工具(async tools)能力,工具可在后台或跨进程运行,对话可继续推进,模型、代码与外部系统可同时与运行中的任务交互而不阻塞当前轮次。适用于需要长耗时后台任务的自动化创作管线,如批量渲染、转写、素材处理等场景。

OpenRouter 给 API 加了异步工具能力,后台任务不阻塞对话轮次,做自动化剪辑、批量转写这类长耗时管线的技术整合者可以接 API 试跑。

Google Cloud API Gateway 新增统一模型路由

Google Cloud API Gateway 推出模型路由功能(Public Preview),支持在 OpenAPI 3.x 规范中配置虚拟模型名到后端目标的映射,无需硬编码端点或管理开源代理。网关作为无服务器入口层,接受标准 OpenAI 兼容请求,自动将负载转码为目标模型的原生格式并动态路由流量。对 AIGC 技术整合者来说,这意味着可以在一个网关下统一管理多个模型供应商的调用,简化工具链的 API 接入和切换流程。

做工具链整合的可以关注,网关层统一路由 Gemini、Claude、OSS-GPT,省掉自己维护代理的活,接 API 时少一层麻烦。

点击打开原文

Gemini Notebook 增强版全面开放给 Pro 用户

Google 官方账号确认,更强大的 Notebook 体验已 100% 全面推出给所有 Pro 用户,免费用户也可使用。官方给出学习、商务、个人三类场景的示例查询,包括从讲义生成带测验的 PDF 学习指南、分析营收趋势、整理装修收据并生成成本追踪表格等。

Google 官方确认 Notebook 增强体验已 100% 覆盖所有 Pro 用户,免费用户也能用。做 AI 短剧和内容策划的可以拿它整理剧本素材、拆解竞品,当个资料管理工具用。

点击打开原平台查看,能否访问取决于网络环境

Replit Ambient Intelligence 每帧旁生成设计建议卡片

Replit 推出 Ambient Intelligence 功能,在编程界面的每一帧旁边弹出建议卡片,每张卡片代表一个不同的设计方向,点击即可生成新帧,旨在解决「下一步做什么」的决策问题。该功能面向 Replit 的 AI 编程环境,属于 IDE 交互层面的更新,不直接产出图像或视频媒体。

Replit 的 AI 编程环境新增 Ambient Intelligence,在每一帧旁边弹出设计方向建议卡片,点一下就能生成新帧。对做 AI 短剧工具链的整合者有点参考价值,但本质是编程 IDE 的界面功能,跟创作流水线关系不大。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

Higgsfield 开源《Hellgrind》全部提示词与素材

Higgsfield 将 95 分钟 AI 剧情长片《Hellgrind》的全部提示词、关键帧和素材开源,用于 Higgsfield 全球电影节。该片制作成本 50 万美元,曾在戛纳市场放映,获华尔街日报、Variety、BBC 报道。PJ Ace 将顶级技巧提炼为 10 步指南线程。对 AI 长片和短剧创作者来说,这是罕见的完整工业化制作资产包,可直接拆解预算分配、角色一致性和长叙事工作流。

95 分钟 AI 长片《Hellgrind》的提示词、关键帧和素材全部开源,还配了 10 步指南。做 AI 长片和短剧的可以直接拉下来拆解,看 50 万美元预算怎么花在角色一致性和镜头语言上。

点击打开原平台查看,能否访问取决于网络环境

BytePlus 拆解 Seedance 2.5 从创意到成片流程

BytePlus 官方发布 Seedance 2.5 幕后案例,展示如何将创意简报转化为连贯视觉序列,强调在保持原始创意愿景的同时,实现角色一致性、动态动作和定向精修。

官方幕后拆解 Seedance 2.5 如何把创意简报转成连贯镜头序列,重点看角色一致性和动态动作的定向精修,做短剧和视觉开发的值得拉片参考。

点击打开原平台查看,能否访问取决于网络环境

Luma Layers 教程:四种方式只改画面单一元素

LumaLabs 官方转发 DreamLabLA 的教程,演示 Luma Layers 图层合成功能:通过改变单一元素、保留画面其余部分,掌握 4 种图层控制方式。由 Blake J 制作,面向视觉创作者展示局部重绘与画面微调的具体操作路径。

Luma 官方转发的 Layers 图层合成玩法,讲怎么只改一个元素、保留其余画面,做视觉和后期的一看就懂,适合当局部重绘的参考模板。

点击打开原平台查看,能否访问取决于网络环境

@yachimat_manga实测MiniMax H3在Colab上15秒成本约€0.23

日本创作者 @yachimat_manga 实测在 Google Colab L4 上本地运行 MiniMax H3 模型,生成约 15 秒 720p 视频成本约 €0.23,对比官方 API 768p 约 €1.20(约 4.5 倍)、Seedance 2.5 官方 API 720p 约 ¥14.91(约 8.6 倍)。作者指出本地跑有速度和限制,但可通过预处理批量生成,且无需高性能本地机器,社区也在持续优化相关节点。

实测数据:H3 在 Google Colab L4 上跑 15 秒 720p 视频成本约 €0.23,比官方 API 便宜约 4.5 倍,比 Seedance 2.5 便宜约 8.6 倍。做短剧和批量出片的制片人可以算算账,本地跑通能省一大截成本。

点击打开原平台查看,能否访问取决于网络环境

WorkBuddy+ChatCut 实测:AI 自动找素材做剪辑

创作者实测用 WorkBuddy 连接本地文件夹,再接入 ChatCut MCP,让 AI 自动从文件夹找素材、完成剪辑并添加动效。口播多遍录制导致气口重复,但整体处理优于新手。2 分钟视频耗时 2 小时,先用混元免费模型,后切 K3 消耗 1167 积分,作者称 Codex 会更快。

实测 WorkBuddy 连本地文件夹 + ChatCut MCP 自动完成剪辑和动效,2 分钟视频跑 2 小时、耗 1167 积分,后期和短剧团队可以当自动化剪辑链路参考。

点击打开原平台查看,能否访问取决于网络环境

PixVerse 角色一致性演示:一个指令生成完美男主

PixVerse 官方发布角色一致性演示,以「创建完美男主,删除所有不完美版本」为指令,生成美人鱼国王、机车骑士、冷眼继承人等多个风格化角色形象,展示单指令多角色输出的能力。完整工作流需转发评论后私信获取。

PixVerse 官方演示角色一致性玩法,一个指令生成多个风格化男主形象,做角色 IP 和短剧的可以拉片看形象统一度处理。

点击打开原平台查看,能否访问取决于网络环境

Luma 官方发布 AI 图像后期编辑完整指南

Luma AI 官方博客发布《How to Edit AI-Generated Images: The Complete 2026 Guide》,系统讲解 AI 生成图像的后期编辑方法,覆盖从基础修正到进阶风格化的工作流,面向视觉师和后期人员提供官方视角的编辑流程参考。

官方出的 2026 版 AI 图像后期编辑指南,视觉师和后期可以当工具手册翻,看官方推荐的编辑流程和工具链怎么搭。

点击打开原文

PixVerse 官方演示:三视图参考保持角色一致性

PixVerse 官方演示《FELINE FALL》制作流程:先用三视图(正面、侧面、背面)角色参考图锁定角色一致性,再在 PixVerse Canvas 中按场景(屋顶、云层、街道)分支生成动态画面。

官方演示三视图参考+Canvas 分场景生成的工作流,做角色 IP 和短剧的可以照着跑一遍,看角色一致性怎么稳住。

点击打开原平台查看,能否访问取决于网络环境

PixVerse Canvas 演示:屋顶到办公室场景物理模拟

PixVerse 官方发布 Canvas 功能演示,展示「屋顶到办公室」场景构建,强调物理模拟真实感:手提袋自然摆动、布料随行走正确运动。官方称转发+回复可私信获取工作流拆解。

PixVerse 官方演示 Canvas 场景构建能力,重点在物理模拟——手提袋自然摆动、布料随行走正确运动。做视觉和场景搭建的可以看这个工作流拆解,关注物理真实感怎么调。

点击打开原平台查看,能否访问取决于网络环境

Codex 实测:AI 代理全程代办个人发票开票流程

个人创作者分享 Codex 代理实操:在真实税务系统里完成自然人代开发票全流程,包括判断开票类型、自动退回错误入口、修正税号位数、选择项目分类、处理购方信息不一致提示。作者强调 Agent 价值在于处理真实系统里的低频但必须做对的流程。

个人体验分享:Codex 在真实税务系统里带用户走完开票全流程,自动判断入口、修正税号、选项目分类。做 AI Agent 工作流整合的可以看看它处理低频脏活的实际表现。

点击打开原文,能否访问取决于网络环境

作品与案例

Works

Magnific 发布 MiniMax H3 全帧生成短片《Kat and Cat》

Magnific 官方发布 AI 短片《Kat and Cat》,讲述女孩、珍珠奶茶与一只 40 磅重猫的故事,全片每一帧均由 MiniMax H3 在 Magnific 平台生成。

官方用 MiniMax H3 全帧生成的短片,视觉师和编导可以拉片看角色一致性和叙事节奏,做短剧的也能参考全帧生成链路。

点击打开原平台查看,能否访问取决于网络环境

Magnific 原创系列《The Chronicles of Bone》第四集上线

Magnific 官方账号转发《The Chronicles of Bone》第一季第四章,该原创系列完全由 AI 工具创作,属于长线叙事剧集作品。

Magnific 官方转发的原创 AI 系列剧集新一集,纯 AI 工具链制作,做 AI 短剧的可以拉片看长线叙事和视觉风格统一怎么处理。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索