← 全部日报

AIGC 信息日报

2026 年 8 月 12 日 周三

行业与平台

Industry

阿里开源 Wan-Animate-2:多角色动画+实时生成

阿里开源角色动画模型 Wan-Animate-2 发布,核心升级点:高保真角色动画、多角色同框动画、文本控制镜头视角、实时流式生成。作为开源模型,可直接本地部署接入现有工作流,对角色动画和短剧批量生产场景价值高。

开源角色动画模型大升级,多角色同框、文本控制镜头、实时流式生成都来了。做短剧和角色动画的可以直接拉下来跑,看角色一致性和多角色交互的成片质量。

点击打开原平台查看,能否访问取决于网络环境

LTX-2.5 开源世界模型发布,本地 RTX 跑视频生成

LTX 发布 LTX-2.5,开源权重世界模型,面向视频生成、实时应用和物理 AI,针对 NVIDIA RTX GPU 和 DGX Spark 本地推理优化,降低 VRAM 需求。原生多镜头生成将整个序列作为连贯整体渲染,保持角色外观跨镜头一致,修复了早期开源模型在广告制作中的闪烁问题。采用更锐利的 Gemma 4 语言骨干和新解码器,减少高动态镜头伪影,输出接近后期可用。可在消费级 RTX GPU 上通过 ComfyUI 直接运行,支持 LoRA 微调锁定品牌角色或风格。

开源权重世界模型,原生多镜头生成能锁角色一致性,一张消费级 RTX 显卡在 ComfyUI 里就能跑,做短剧和广告的可以本地实测出片稳定性。

Luma 发布 Scenes 场景功能

Luma AI 官方博客发布新功能 Luma Scenes,具体能力细节未在摘要中展开,需查看原文了解其场景构建、镜头控制等具体能力。

Luma 官方发布新功能 Scenes,做 AI 视觉和短剧的可以点开看具体能力,判断是否值得接入工作流。

点击打开原文

腾讯混元发布 Hy3D WorldClaw:文本生成可探索 3D 开放世界

腾讯混元发布 Hy3D WorldClaw,一个 agentic 工作流,从文本提示词直接生成大规模 3D 开放世界。官方强调不是视频、不是高斯泼溅,每个场景可自由探索,且完全由可编辑、游戏就绪的 3D 资产构建。对 AIGC 技术整合者来说,这意味着从文本到可交互 3D 场景的自动化管线,可接入虚拟制片、游戏场景预演等创作流程。

腾讯混元官方发布,文本直接生成可自由探索、可编辑的游戏级 3D 开放世界,不是视频也不是高斯泼溅。做 3D 场景、虚拟制片和 AIGC 技术整合的可以点开看工作流细节。

点击打开原平台查看,能否访问取决于网络环境

Higgsfield 推出 Layers 图像编辑器:图层分解+原生 4K

Higgsfield 发布图像编辑器 Layers,支持图层分解、无瑕文本渲染和原生 4K。用户可上传或生成任意图像,拆分为图层后单独编辑,重生成任意文字或物体而不影响整张图。

图像编辑器新增图层分解和原生 4K,做视觉和海报的可以上手试试单独改图层、重生成文字而不动整张图。

点击打开原平台查看,能否访问取决于网络环境

Suno Studio 2.0 即将上线

Suno 官方账号发布预告,Suno Studio 2.0 即将上线,目前仅放出悬念文案与链接,未透露具体功能细节。作为 AI 音乐生成头部工具,Studio 版本通常面向更精细的编曲、混音与分段控制,对 AI 配乐和短剧 BGM 制作链路有直接影响。

Suno 官方预告 Studio 2.0,做 AI 配乐、音效和短剧 BGM 的后期可以蹲一波,看新版在编曲和混音上能放开多少控制。

点击打开原平台查看,能否访问取决于网络环境

Soniox TTS v2 发布:低价高质语音合成

Soniox 发布 TTS v2 文本转语音模型,以每小时 0.70 美元的价格提供高端音质,支持 60 多种语言、自然语言混合、低延迟流式传输和高保真语音克隆。该模型专为实时 AI 智能体设计,支持字符级时间戳和音频标签控制,便于打断与恢复。

做 AI 配音和短剧后期的可以关注,0.7 美元/小时的高端音质,支持 60+ 语言、语音克隆和实时打断,接 API 试一周看配音效率提升多少。

点击打开原平台查看,能否访问取决于网络环境

xAI 发布 Grok Bot:常驻云端自主完成跨应用工作

xAI 今日发布 Grok Bot,定位为常驻云端、7x24 自主工作的 AI 同事。Bot 拥有独立云端电脑,可登录用户现有工具跨应用、收件箱工作,端到端完成任务,仅在需要审批时返回。支持记忆对话与学习用户偏好。Beta 版已对 SuperGrok Heavy、Cursor Ultra 及 Cursor Teams Premium 订阅用户在桌面端和 iOS 开放,企业用户可加入候补名单。内部已在销售外呼、营销活动、办公运营、Bug 修复等场景使用。

xAI 把 Grok Bot 做成常驻云端、能跨应用干活的 AI 同事,Beta 已对 SuperGrok Heavy 和 Cursor 订阅用户开放。做自动化工作流整合的可以关注它怎么处理无 API 平台的跨应用操作。

点击打开原文

NVIDIA 发布 Nemotron 3.5 Lightning 开源模型

NVIDIA CEO 黄仁勋在 X 上宣布发布 Nemotron 3.5 Lightning 开源模型,定位为面向持续运行的长时智能体场景,强调智能、快速、高效且开源。

NVIDIA 官方发布开源模型,主打长时智能体场景,做 AI 工具链整合的可以关注后续 API 和本地部署能力。

点击打开原文,能否访问取决于网络环境

面壁智能开源 VoxCPM-0.5B 语音克隆项目

面壁智能发布 baby-mynah 项目,基于 VoxCPM-0.5B 小模型实现可控语音生成,通过 LoRA 专家模块支持 9 种英语口音的无缝融合与独特音色创造,已开放 demo 与模型权重。对配音和后期创作者来说,低成本微调即可定制音色,适合批量生成多口音角色配音。

0.5B 小模型就能做可控语音克隆,还支持 9 种英语口音融合,做配音和短剧后期可以接 API 或本地部署试一周,看音色定制和口音切换的稳定性。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

阿里 Wan 推出 CLI,Agent 可直接调用生成图视频

阿里 Wan 官方发布 CLI 工具,开发者可在 Agent 中直接调用 Wan 生成图像和视频,实现程序化批量生成。CLI 消耗的积分与 wan video 账号完全同步,无需单独计费。对 AIGC 技术整合者来说,这意味着可以把 Wan 直接嵌入自动化创作流水线,批量出图出视频的链路更顺了。

做工具链整合的可以直接接 API 跑自动化出片流程,短剧团队批量生成素材能省不少人工。

点击打开原平台查看,能否访问取决于网络环境

阿里云万相3.0发布动画生成功能

阿里云官方宣布万相3.0发布动画生成功能,主打「无尽世界、无尽想象」的动画世界创作,已开放演示并支持立即开始创作,入口在阿里云百炼和通义千问云平台。

万相3.0新增动画生成,官方演示已放出,做AI短剧和动画的可以点开看下效果,顺手在百炼上试跑一遍。

点击打开原平台查看,能否访问取决于网络环境

Luma 推出 AI 去文字功能,保留背景细节

Luma AI 官方博客发布新功能:用 AI 从图片中移除文字,同时尽量不破坏文字背后的背景细节。面向视觉美术和后期修复场景,可处理画面中的水印、字幕、招牌等文字元素。

做视觉和后期的可以直接上手试,去水印、清字幕、修画面里的杂字,比手动修补快得多,背景还原度是看点。

点击打开原文

Ideogram 上线 Ad Resizer:一键生成多平台广告尺寸

Ideogram 推出 Ad Resizer 功能,上传一张设计稿,选择需要的投放位,即可导出适配 Instagram、Facebook、YouTube、connected TV、display、print 等渠道的整套广告素材,支持极端宽高比。现已上线 Ideogram App 和 API。

做广告投放和视觉物料的团队可以直接用,一张主视觉自动切出 Instagram、YouTube、CTV 等全渠道尺寸,省掉手动重排版的功夫,接 API 还能批量跑。

点击打开原文,能否访问取决于网络环境

Figma Weave 工具接入 MCP,可在聊天中调用

Figma Weave 官方宣布其工具现通过 MCP(模型上下文协议)开放,可将 ChatGPT、Claude、Cursor 等任意 AI Agent 连接到 Figma MCP 服务器,在聊天中直接调用 Weave 工具并下达指令,无需离开对话界面即可获得创意产出。对 AIGC 技术整合者来说,这意味着 Weave 的创意能力可嵌入现有 AI 工作流,实现从对话到视觉产出的自动化链路。

Figma 把 Weave 工具接进 MCP,ChatGPT、Claude、Cursor 里直接对话就能跑创意工具,做视觉和 AI 工作流整合的可以接上试试。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

Magnific 演示 Seedance 2.5 一镜到底场景控制

Magnific 官方账号发布演示,展示 Seedance 2.5 的一镜到底场景控制能力:派对、披萨、狗追等元素及转场均在一个连续镜头内完成,由 BytePlusGlobal 提供算力支持。

官方演示 Seedance 2.5 的一镜到底能力,派对、披萨、狗追全在一个连续镜头里完成,转场都不切。做短剧和编导的可以拉片看场景调度和镜头连贯性怎么处理。

点击打开原平台查看,能否访问取决于网络环境

仙侠比舞短片:完整分镜 prompt 公开

创作者 @Soranlan 发布古风仙侠 AI 短片《好好好,要和我比舞是吧》,并完整公开分镜 prompt。设定为电影级写实质感、默片式视觉喜剧,两位仙门女子因过度讲礼数把让路演成武侠对决。prompt 含角色设定(剑仙师姐与小师妹)、0-5s 全景建立与 5-10s 中景镜像调度、动作与音效同步要求、16:9 横屏原生普通话对白、Negative 提示词等完整执行细节。

做 AI 短剧的可以直接抄这套分镜 prompt,角色一致性、镜像调度、默片喜剧节奏都写得很细,跑一遍就知道出片稳不稳。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 复古电影质感实测:1947 战争序列

创作者 Ruzaina 用 MiniMax H3 生成 15 秒 1947 年美国战争序列,目标还原 1940 年代胶片摄影机的真实历史镜头质感。公开了完整提示词:包含环境设定(乡村小镇、木屋、砖楼、老式汽车、雾霾烟尘)、角色设定(美军士兵与平民的 40 年代服装细节)、以及 0-3 秒、3-6 秒的分镜脚本(手持广角建立镜头、街道紧张氛围推进)。

创作者用 MiniMax H3 实测 1947 复古战争序列,完整公开了分镜提示词,做历史题材和复古质感的视觉师可以直接抄 prompt 跑一遍。

点击打开原平台查看,能否访问取决于网络环境

Mac 本地部署 MiniMax H3 项目:需 M3/M5 Max 64G

开发者 Lonely 分享 Mac 本地部署 MiniMax H3 的项目,需 M3 Max 或 M5 Max 至少 64G 内存。实现不依赖 PyTorch,在贴近硬件层面完成 BF16、Metal TensorOps、量化矩阵乘法、权重映射、流式加载、算子融合和 VAE 分块处理。对技术整合者来说,这套方案为本地化视频生成提供了可复用的高性能推理路径。

技术整合者福音:不依赖 PyTorch、贴近硬件的 H3 本地实现,跑通后本地批量出片成本大降。做工具链的可以研究这套 Metal TensorOps 和量化方案。

点击打开原文,能否访问取决于网络环境

PixVerse 官方介绍 Seedance 2.5 实景巨人短片工作流

PixVerse 官方介绍 30 秒 Seedance 2.5 生成短片(该产品 8 月 1 日已发布):赤脚粉裙巨人在真实城市行走,低机位 IMAX 压迫感,强调非塑料玩偶质感、真人尺度、英文对白锁定口型。附完整工作流链接。

官方号放出的 Seedance 2.5 实景合成 demo,低机位 IMAX 压迫感和真人尺度是看点,做视觉和短剧的可以点开链接看完整工作流怎么搭。

点击打开原平台查看,能否访问取决于网络环境

PixVerse 用 Canvas 和深度视频重制创意项目

PixVerse 官方演示:使用 Canvas 和深度视频功能重制整个创意项目,思路来自 @sorrysugar.official,核心方法是拆解所有镜头并重置角色。展示了从原项目到重制版的完整工作流,重点在角色一致性和镜头语言的重建。

官方演示用 Canvas 和深度视频重制整个创意项目,拆解所有镜头并重置角色。做视觉和短剧的可以拉片看角色一致性和镜头重制的工作流。

点击打开原文,能否访问取决于网络环境

创作者用 Agent Two 做出 2 分钟连贯动漫序列

创作者 @CharaspowerAI 用 Agent Two 构建 2 分钟以上动漫序列,具备真实连续性、对话、动作、世界观构建和一致角色。作者强调未将 Agent Two 当作一键工具,而是作为协作工具深度参与创作流程。

用 Agent Two 做出 2 分钟以上带对话、动作、世界观和一致角色的动漫序列,做 AI 短剧的可以点开看作者怎么把 Agent 当协作工具而不是一键生成来用。

点击打开原平台查看,能否访问取决于网络环境

开发者用 Kimi K3 一次成型构建 3D 历史帝国探索器

开发者 @thebuggeddev 用 Kimi K3 构建 Empire Atlas,一个基于 three.js 的 8 个历史帝国 3D 交互探索器,可查看居民生活、房屋、地图、日常与室内。K3 一次成型生成 11 步工程计划,将 500MB 3D 素材优化至 17.8MB(网格简化、Draco 压缩、1024px WebP 纹理),并用图像插件批量生成 56 张历史图像压缩至约 10MB。3D 资产由 TripoAI 生成,设计由 GPT Image 2.0 完成。

个人开发者用 Kimi K3 一次成型 vibe coding 出 3D 历史帝国探索器,500MB 素材压到 17.8MB,还批量生成 56 张历史图像。做 AI 交互叙事和 3D 场景的可以拆解这套工程流程。

点击打开原平台查看,能否访问取决于网络环境

Seedance 2.5 粘土动画风格演示:纯提示词生成

Magnific 官方账号发布 Seedance 2.5 粘土动画风格演示,强调无需真实粘土或微缩模型,仅通过提示词即可生成包含指纹和帧抖动细节的定格动画效果。

用 Seedance 2.5 做粘土定格动画风格的演示,强调指纹和帧抖动细节,视觉师可点开看提示词怎么写出这种质感。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

Higgsfield 开源 K-pop 新集,Seedance 2.5 提示词公开

Higgsfield 为百万美元全球电影节开源其 K-pop 动作系列新集《Zephyr: Special》,所有提示词和素材公开,使用 Seedance 2.5 生成。创作者可研究其动作戏和角色一致性处理,并基于公开资产构建自己的世界。

做 AI 短剧和动作戏的可以拉片看 Seedance 2.5 在 K-pop 动作场景下的表现,提示词和素材全公开,直接当模板拆解。

点击打开原平台查看,能否访问取决于网络环境

Magnific 发布 AI 粘土动画喜剧短片第一集

Magnific 官方发布 AI 粘土动画喜剧短片《Episode 1: the BBQ》第一集,8 个风格化 3D 粘土渲染角色全程同框,配阳光冲浪摇滚配乐和自然音效对话,多镜头喜剧 sketch 形式。

官方账号发的完整 AI 短片第一集,8 个粘土角色多镜头喜剧,做 AI 动画和短剧的可以拉片看角色一致性和多角色同框处理。

点击打开原平台查看,能否访问取决于网络环境

咒术回战IF二创:高羽史彦与未来英雄救场

B站UP主发布的《咒术回战IF》AI辅助二创短片,高羽史彦一句玩笑撕开连接未来的裂缝,68年后的虎杖悠仁从未来走来。非官方二创,角色与剧情均为假想创作,含AI生成内容,为虎杖悠仁B萌应援视频。

B站高播放AI二创短片,咒术回战IF线题材,做AI短剧和同人二创的可以拉片看角色一致性和情感叙事处理。

点击打开原平台查看

AI 末日连载短剧《归墟》第十二集更新

B 站个人创作者「萌新」的 AI 末日题材原创连载短剧《归墟》第十二集「归巢」,单集约,已更新至第十二集。故事从失踪案展开,讲述巨蚁出现后城市失守、秩序崩塌的废土与新物种时代,画面由 AI 生成。

个人创作者业余时间连载的 AI 末日题材短剧,已更到第十二集,做 AI 短剧的可以拉片看长线连载的叙事节奏和角色一致性处理。

点击打开原平台查看

PixVerse 发布 Seedance 2.5 制作 30 秒冬季对峙短片

PixVerse 官方发布用 Seedance 2.5 制作的 30 秒冬季对峙短片《The Batu Khan》,场景为拔都骑兵对阵罗斯盾墙,雪景与呼吸感是视觉重点。转发并回复“BATU”可私信获取完整工作流。

30 秒冬季骑兵对峙短片,Seedance 2.5 在 PixVerse 上的出片效果,做历史题材短剧的可以拉片看雪景和动作场面处理。

点击打开原平台查看,能否访问取决于网络环境

PixVerse 展示中国风 AI 短片视觉语言

PixVerse 官方发布一支 AI 短片,主打中国风视觉语言:古建筑与无尽云海、白玉桥与宏大尺度、柔和金色日光与氛围景深,镜头从大远景建立到古琴特写收尾,整体构建为统一的天界世界。

做国风题材的视觉师和编导可以拉片看这套视觉语言:古建+云海+白玉桥+金色日光的组合,以及从大远景到古琴特写的节奏设计。

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索