← 全部日报

AIGC 信息日报

2026 年 8 月 20 日 周四

行业与平台

Industry

ElevenLabs 发布 v3 Conversational 实时语音模型

ElevenLabs 宣布 v3 Conversational 实时语音模型全面可用,主打真实情感响应,支持 70+ 种语言,并内置音频标签实现精细控制,面向构建语音体验的开发者开放。

做 AI 配音、虚拟角色对话和实时语音交互的后期团队可以直接接 API 试一周,音频标签的精细控制对情绪表达是实打实的提升。

点击打开原平台查看,能否访问取决于网络环境

微软 MAI-Image-2.5-Pro 登顶图像编辑榜

微软 MAI-Image-2.5-Pro 在 Artificial Analysis 图像编辑排行榜登顶第一,超越 Reve 2.1、GPT Image 2 及自家 MAI-Image-2.5,文生图位列第七。该模型 7 月 23 日已在 Microsoft Foundry 预览,定价为每 1M 文本输入 token $5、图像输入 $8、图像输出 $106,约合每千张 1024x1024 图像 $108.5。

微软图像模型在编辑榜登顶,做视觉和美术的可以关注下编辑能力,做短剧的可以看批量出图的成本账。

点击打开原平台查看,能否访问取决于网络环境

Grok Voice Think Fast 2.0 基准超越 GPT Realtime

xAI 的 Grok Voice Think Fast 2.0 在 VulcanBench 基准上同时超越 GPT Realtime 的文本与语音表现。在 200 道保留问题上,Grok 文本准确率达 99%,从打字输入转为语音提问时几乎保持同等性能,响应速度显著更快。

实时语音模型又添一个能打的,文本准确率 99% 且语音提问不掉性能,做 AI 配音和虚拟角色对话的可以关注下 API 接入情况。

点击打开原文,能否访问取决于网络环境

Meta AI 视频模型 Muse 首批输出曝光,原生音频支持语音音乐

Meta AI 视频模型 Muse 首批输出曝光,目前处于封闭测试阶段。该模型对受版权保护内容限制严格,原生音频支持语音和音乐,开箱即用。若最终免费开放到 Meta 各产品,将是一记重拳。

Meta 的 Muse 视频模型首批输出曝光,封闭测试中,原生音频支持语音和音乐。做视频和短剧的可以蹲一下,看它跟现有模型比出片质感如何。

点击打开原文,能否访问取决于网络环境

FastMetal 让 Mac 本地 30 秒生成视频

Sky Computing Lab 发布 FastMetal,将 FastWan-QAD 系列带到 Apple Silicon,DiT、DMD 采样器和解码器均通过 MLX 在 Metal 上运行,默认 INT8。一段 5 秒 480P 视频完全在 Mac 上生成耗时 30 秒,仅占用 3.9 GiB 内存。提供 1.3B(480P)、5B(720P)、14B(追求画质)三个模型,代码和模型均已开源。

Mac 用户本地跑视频生成,30 秒出 5 秒 480P 片段,不依赖云端和 CUDA,做短剧和视觉的可以装起来试,省掉排队和成本。

点击打开原平台查看,能否访问取决于网络环境

Krea AI 推出 Seedance Studio 创作工具

Krea AI 推出 Seedance Studio 创作工具,将使用 Seedance 2.5 创作所需功能集于一处,包括提示词预设、镜头路径和 3D 场景控制。

做 AI 短剧和视觉的可以上手试,提示词预设、镜头路径、3D 场景控制都集到一个界面里,省得来回切工具。

点击打开原平台查看,能否访问取决于网络环境

Mirage 推出 Clips:长视频一键拆成 30+ 爆款剪辑

Mirage 发布新功能 Clips,可将任意长视频瞬间转化为 30+ 个病毒式传播的剪辑,自动编辑以优化表现。核心能力包括:查找并排序最具传播潜力的时刻、移除不需要的现有编辑、为社交平台重新取景和重剪每个片段。该功能由与 AI Edit 相同的编辑智能驱动,现已上线 iOS 和 Web 端。

做短剧和短视频分发的后期可以试试,自动找高光时刻、重剪成社交平台尺寸,省掉人工拉片和二次剪辑的功夫。

点击打开原平台查看,能否访问取决于网络环境

ImagineArt 推出 Imagine Computer:自然语言直出成品

ImagineArt 发布 Imagine Computer,主打用自然语言描述需求直接交付完成品,而非需要二次组装的草稿;系统能记住用户风格,避免重复解释,且每个项目基于前一个项目延续。面向视觉素材批量生产场景。

做视觉和短剧的可以关注,用大白话描述需求直接拿成品,还记住你的风格不用反复解释,适合批量出图出素材的团队试一周。

点击打开原文,能否访问取决于网络环境

OpenAI 重申前沿模型零数据留存并预览隐私安全处理

OpenAI 重申对符合条件的 API 客户提供零数据留存,并预览 Private Safety Processing 功能,旨在不牺牲数据隐私的前提下实现高级 AI 安全。

面向企业级 API 客户的数据合规政策,对创作工作流本身影响小,工具党路过。

MiniMax 为 H3 征集流式视频 LoRA 适配器并办黑客松

MiniMax 官方发文,为 H3 模型征集流式视频 LoRA 适配器方案,并预告举办线上黑客松。官方指出实时生成仍需加速推理。目前处于创意征集阶段,具体活动细节和参与方式待公布。

官方在征集 H3 的流式视频 LoRA 适配器方案,还打算办线上黑客松,做工具链和模型微调的可以关注下参与机会。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

Google Vids 接入 Gemini Omni,文本提示即可剪辑任意素材

Google Workspace 宣布 Google Vids 集成 Gemini Omni,用户可用简单文本提示编辑任意素材(手机视频、AI 片段),实现粗剪专业化和免重拍场景调整。该功能属于 Workspace Drop 更新的一部分,面向视频编辑场景,降低剪辑门槛。

Google 把 Gemini Omni 塞进 Vids,手机视频到 AI 片段都能用文本提示直接剪,粗剪变专业级、改场景不用重拍。做后期和短剧的可以上手试一周,看提示词剪辑的稳定度。

点击打开原文,能否访问取决于网络环境

OpenAI 推出私有安全处理,兼顾隐私与安全

OpenAI 推出 Private Safety Processing(私有安全处理),用于提升跨交互安全风险识别,同时不让 OpenAI 人员访问底层内容。该功能已研发一段时间,并承诺前沿模型继续提供零数据保留(Zero Data Retention)选项,兼顾企业客户隐私与安全增强。

OpenAI 给企业客户加了一层安全识别,同时承诺零数据保留。对创作者影响不大,做企业级 AI 应用集成的可以留意,普通创作工作流基本用不上。

点击打开原文,能否访问取决于网络环境

Suno 移动端与网页播放列表重大升级

Suno 官方宣布移动端与网页端的播放列表功能迎来重大升级,官方号发布,具体更新细节以官方线程为准。对 AI 音乐创作者和短剧后期来说,播放列表管理优化有助于批量整理和复用配乐素材。

做 AI 音乐和短剧配乐的后期可以看看,播放列表管理升级对批量整理素材和成片配乐有帮助,官方号发的,信息可靠。

点击打开原文,能否访问取决于网络环境

阿里云 Token Plan 新增 DeepSeek-V4-Pro 等模型

阿里云 Token Plan 新增 DeepSeek-V4-Pro-0813,与 Qwen3.8-Max、GLM-5.2 等模型共享同一额度池。个人版计划上线、团队版定价下调,访问高级模型的成本降低。对 AIGC 创作者来说,统一额度池意味着多模型切换不用分别计费,批量生成和实验成本更可控,适合短剧团队和工具整合者评估接入。

阿里云把 DeepSeek-V4-Pro 等模型塞进统一额度池,个人版上线、团队版降价,做 AI 短剧批量出片的可以算算成本账,接 API 跑一周看性价比。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

Magnific 演示单图生成五场景

Magnific 官方演示:一张图像输入,输出五个连续场景。工作流为 Seedream 5 Pro 构建第一帧,Seedance 2.5 生成后续所有内容,提示词由官方提供,基于 BytePlus 技术,已在 Magnific 平台可用。

官方演示单图生成五连场景的工作流,Seedream 5 Pro 定首帧、Seedance 2.5 续后续,做短剧和视觉开发的可以照着跑一遍看连贯性。

点击打开原平台查看,能否访问取决于网络环境

Pika 官方拆解 Soundtrack 模型:视频音频对齐领先

Pika 官方发布 Soundtrack 模型技术拆解,主打视频到音频的对齐能力。在 67 段基准测试中,该模型在语义对齐和音画同步两项指标上排名第一,ImageBind 得分 0.2457。对 AI 后期和短剧团队来说,这是评估配乐贴合度的重要参考。

做 AI 后期和短剧配乐的可以看看官方技术拆解,重点在视频与音频的语义对齐和声画同步,跑一遍就知道配乐贴合度稳不稳。

点击打开原文,能否访问取决于网络环境

创作者拆解《英雄联盟:奥术》风格 AI 广告制作全流程

创作者 @beechinour 发布完整拆解,讲解如何为 @GTE_XYZ 制作《英雄联盟:奥术》风格 AI 广告,包含精确 prompt、所用模型、剪辑流程及整体方法论。

作者公开了完整拆解:精确 prompt、所用模型、剪辑流程和整体方法论,做风格化广告和视觉开发的可以直接抄作业。

点击打开原平台查看,能否访问取决于网络环境

MiniMax Design 代理按导演指令生成 H3 详细提示词

创作者 Pierrick Chevallier 演示:给 MiniMax Design AI 代理一张图片和指令「扮演专业 FPV 导演,做成病毒式内容」,代理自动分析想法、构建摄像机逻辑、运动与节奏,为 MiniMax H3 生成极其详细的提示词并出片。作者在帖子中分享了完整提示词与工作流。

给 MiniMax Design 代理一张图加一句导演指令,它自动拆解镜头逻辑、运动和节奏,生成 H3 的详细提示词。做 AI 短剧和视觉的可以顺着帖子里的工作流跑一遍,看自动提示能不能省下写分镜的功夫。

点击打开原平台查看,能否访问取决于网络环境

创作者分享AI视频制作流程:先做分镜和角色表再写提示词

韩国创作者 paperwiz 分享改进后的 AI 视频制作流程:先确定 30 秒完整故事(Hook→放大→反转/Payoff 结构),再制作角色表、道具表、车辆表、场景参考和空间调度图,检查一致性后最后才写 Dola 或 Seedance 提示词。30 秒视频拆成 10 秒×3 块,通过前后块动作衔接保证连贯。

把AI视频当实拍来准备:先定故事和分镜,再做角色、道具、车辆、场景参考图,最后才写提示词。做短剧和长片的可以直接套这套流程,解决角色和场景不连贯的老问题。

点击打开原文,能否访问取决于网络环境

Vidu S1 支撑《甄嬛传》数字人实时对话 H5

生数科技与 360 合作,以自研 Vidu S1 实时交互视频生成模型为底层,落地「甄嬛 360 传粉丝见面会」线上 H5 活动,支持用户与甄嬛、华妃等十位剧中角色实时对话。模型支持 1 分钟至 2 小时持续无损渲染、秒级响应及百余种语言与方言,并提供 SaaS、MaaS 两种轻量化接入方案。

生数科技与 360 合作,用 Vidu S1 落地《甄嬛传》粉丝见面会 H5,支持与十位角色实时对话。做 IP 互动和短剧数字人玩法的可以看这套 SaaS/MaaS 接入方案怎么落地。

开源视频+播客逐字稿提取 Skill,支持多平台

AI 产品黄叔开源一个视频+播客逐字稿提取 Skill,支持视频号/B站/抖音/小红书/Youtube/小宇宙。10 分钟音视频约 3 分钟转出,大部分用本地 FunASR 转写,Token 消耗低,逐字稿做了精修+分段方便阅读,欢迎 PR 和 issue。

做后期和短剧的可以接上这套转写工作流,10 分钟音视频 3 分钟内出稿,本地 FunASR 转写省 Token,精修分段直接能当剪辑脚本用。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 图像修复演示引热议

MiniMax 官方账号转发 @8bit_e 的演示:使用 MiniMax H3 进行图像修复,并附上 GitHub 项目 MaskVidExperiments 链接。演示展示了 H3 在图像修复场景下的能力,属于官方对第三方实验的认可与推广。

MiniMax 官方转发的 H3 图像修复演示,配了 GitHub 实验项目链接。做视觉和后期修复的可以点开看效果,顺手把仓库存下来当参考。

点击打开原文,能否访问取决于网络环境

Google Flow 邀三位广告传奇为本地小企业做 AI 广告

Google Flow 官方发布《The Small Brief》系列,邀请三位广告传奇人物 Susan Credle、Jayanta Jenkins 和 Tiffany Rolfe 无限使用 Google Flow,为本地小企业制作广告。首期展示 Susan Credle 为 Stonewood Farm 打造的以「Just Farming」为主题的广告,聚焦再生农业与社区关怀。

Google Flow 官方客户案例,看资深创意人怎么用 AI 工具做品牌广告,做商业片和广告的可以当参考样本。

点击打开原平台查看,能否访问取决于网络环境

Magnific 演示 GPT-2 一键拆解穿搭单品

Magnific 官方演示:用一条 prompt 将日常镜子自拍转换为杂志编辑风格的完整穿搭拆解图,自动识别并标注画面中人物实际穿着的每件单品及品牌标签。官方在推文下方附了 prompt 原文。

一条 prompt 把随手拍的镜子照变成带品牌标签的完整穿搭拆解,做时尚类视觉和电商素材的可以抄这个 prompt 跑一遍。

点击打开原文,能否访问取决于网络环境

唐杰谈缩放定律:GLM-5.3 后训练实验

唐杰(@jietang)发文反思缩放定律,指出参数规模需与数据、算力、推理成本协同考量,Chinchilla 最优比例并非终点。他宣布 GLM-5.3 作为受控实验:与 GLM-5.2 同架构、同参数,仅通过一个月长程环境与 RL 后训练带来显著提升,证明缩放不止参数一个旋钮。

模型训练圈的技术讨论,讲参数规模不是唯一旋钮,后训练也能带来显著提升。对创作工作流影响小,工具党路过。

作品与案例

Works

AI 粉丝自制《GTA 罪恶都市》系列第一集

B 站作者 SoraVerse 的 AI 生成《侠盗猎车手:罪恶都市》系列第一集《交易失败》,粉丝致敬作品,基于 Rockstar 游戏世界观改编,角色均为虚构。

游戏 IP 同人 AI 短剧,做短剧的可以拉片看游戏世界观转叙事和角色一致性处理。

点击打开原平台查看

楚人美游记1-25合集纯享版上线

B站作者「安奇米苏」的AI短剧《楚人美游记》1-25集合集纯享版,系列化短剧定位,主打角色一致性与连续叙事。

B站AI短剧合集,25集连播,做短剧的可以拉片看长系列的角色一致性和叙事连贯性怎么处理。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索