← 全部日报

AIGC 信息日报

2026 年 8 月 7 日 周五

行业与平台

Industry

阿里云发布万相3.0公测版,支持原生30秒视频生成

阿里云发布万相3.0(Wan3.0)公开测试版,主打“简单输入、智能创作”,支持原生30秒视频生成与真实感渲染。Omni-Reference能力扩展至文档、表格、幻灯片、网页等多模态输入。API价格按分辨率计费:480p $0.05/秒、720p $0.10/秒、1080p $0.20/秒,完整API访问即将推出。

阿里云万相3.0公测,原生30秒视频生成,API按分辨率计费,做短剧和批量出片的可以直接接API测一周,看长镜头稳定性和成本。

点击打开原文,能否访问取决于网络环境

通义千问图像3.0发布,支持4.5K提示词

阿里云发布 Qwen-Image-3.0 图像生成模型,支持 4.5K token 长提示词,可一次性生成学术页面(含 LaTeX)、分镜脚本、UI 线框图、游戏美术、建筑渲染和电影预演,起价 $0.03/张。对 AI 编导和视觉师来说,长提示词直接生成分镜脚本和电影预演是核心卖点,可接 API 测试其在复杂叙事指令下的出图质量与一致性。

阿里云官方发布 Qwen-Image-3.0,4.5K 长提示词一次生成分镜脚本、UI 线框和电影预演,起价 $0.03/张。做视觉开发和分镜的可以接 API 实测长提示词下的出图稳定性。

点击打开原平台查看,能否访问取决于网络环境

OpenAI 发布 GPT-5.6 Sol,付费用户全场景统一体验

OpenAI 发布 GPT-5.6 Sol,为所有付费用户(含 Instant 模式)提供统一对话体验。官方在金融、医学、法律高难度事实性评测中称,其事实性错误较 GPT-5.5 Instant 减少 68%。对 AI 创作者来说,这意味着底层对话与生成能力整体升级,涉及配音、虚拟角色对话、自动化内容生产等场景的团队可关注 API 接入后的实际表现。

OpenAI 把新模型 Sol 铺给所有付费用户,含 Instant 模式,事实性错误比 5.5 少 68%。做 AI 配音、虚拟角色对话、自动化内容管线的可以接 API 实测一轮,看稳定性和成本变化。

点击打开原文,能否访问取决于网络环境

Adobe 插件上线 ChatGPT,70+ 工具一站式调用

Adobe 官方宣布推出 ChatGPT 插件,集成 Photoshop、Firefly、Lightroom、Acrobat 等 70+ 工具,可在对话中直接完成照片合成、视频多平台重制、模板转 PDF 等操作。对视觉师和后期来说,意味着修图、调色、视频适配等高频操作可以并入 AI 对话工作流,减少工具切换成本。

Adobe 官方把 Photoshop、Firefly、Lightroom 等 70+ 工具塞进 ChatGPT 对话流,做视觉和后期的可以直接在聊天里改图、重剪视频、出 PDF,省掉来回切软件的功夫。

点击打开原平台查看,能否访问取决于网络环境

OpenAI 新模型 Astra 或下周发布

据 @synthwavedd 独家消息,OpenAI 即将推出新预训练模型 Astra,目标下周发布。这是 OpenAI 自 GPT-4.5 以来训练的最大模型,最近内部狗粮测试检查点(内部代号 mewfour)已是发布候选版本。

OpenAI 自 GPT-4.5 以来最大的预训练模型,内部狗粮测试已到发布候选阶段。做 AI 长片和短剧的可以蹲一下,看它会不会改变现有视频生成工作流。

World Labs 黑客马拉松 270 位建设者构建 64 个项目

World Labs 在洛杉矶举办「Worlds in Action」黑客马拉松,超 270 位建设者参与,64 个团队在一个周末内构建了沉浸式叙事、混合现实游戏、电影制作工具、桌面世界及音频响应体验等项目。官方发布了成果展示。

World Labs 黑客马拉松的成果盘点,64 个团队在周末里做出了沉浸式叙事、电影制作工具、音频响应体验等方向的项目,做 AI 叙事和工具整合的可以看看这批作品里有没有值得借鉴的玩法。

点击打开原平台查看,能否访问取决于网络环境

OpenAI 类人智能音箱曝光:甜甜圈造型售价 300-400 美元

彭博社记者 Mark Gurman 爆料 OpenAI 首款硬件设备:一款类人智能音箱,外观像甜甜圈、大小如冰球,便于手持,配备摄像头、扬声器、麦克风、灯光及可动部件以展示互动性,售价 300-400 美元。

硬件爆料,跟 AI 影视创作关系不大,做 AI 短剧和视觉的可以跳过,关注 AI 硬件的可以看一眼。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

ElevenLabs 配音 v2 上线 API,开发者可嵌入产品

ElevenLabs 官方宣布配音(Dubbing)v2 版本现已在 ElevenAPI 上可用,开发者可将 AI 配音能力直接嵌入自有产品与工作流,无需再手动导出音轨。该能力面向批量配音、多语言本地化、自动化剪辑等场景,是 ElevenLabs 配音产品线的 API 化升级。

做 AI 配音、短剧批量配音或工具链集成的,可以直接接 ElevenAPI 试 v2 的稳定性和音色表现,省掉手动导出再贴的环节。

点击打开原文,能否访问取决于网络环境

ElevenLabs 更新:口音识别更准,复杂场景多说话人处理增强

ElevenLabs 发布新版本更新:一是口音捕捉更精准,能区分卡斯蒂利亚西班牙语和拉美西班牙语等地区口音;二是优化了背景音频、音乐和音效的处理,支持多说话人和复杂场景。对做配音、后期混音和短剧批量生产的团队,口音区分度和复杂场景多说话人分离是直接影响成片质量的能力点。

做配音和后期混音的可以关注,口音区分度和背景音分离直接关系到成片听感,接 API 跑一轮实测最直观。

Grok 集成至 Blender

Elon Musk 在 X 宣布 Grok 现已集成至 Blender。具体集成方式、可用功能(如生成、编辑、材质、脚本辅助等)尚未披露,需查看官方后续说明。

xAI 官方宣布 Grok 接入 Blender,做 3D 视觉和 AI 工作流整合的可以关注下具体能调哪些能力。

点击打开原文,能否访问取决于网络环境

豆包视频通话功能升级

字节跳动旗下豆包官方公众号发布视频通话功能升级公告。

字节官方号发的功能升级公告,但摘要里没写具体升级了什么,做 AI 对话/虚拟角色场景的可以点开看下更新点,纯视觉创作向的关联不大。

Perplexity 语音模式新增音频焦点模型,嘈杂环境可隔离人声

Perplexity 语音模式新增音频焦点模型,可过滤背景噪音、音乐和其他声音,将用户声音与其他声音隔离,适用于嘈杂环境(如拥挤咖啡店)下的实时语音对话和听写。该功能现已面向 macOS 和 Windows 所有计算机用户开放。

Perplexity 语音模式上线音频焦点模型,能过滤背景噪音、音乐和其他声音,在嘈杂咖啡店也能正常对话。做 AI 配音或语音交互的后期可以关注,实时语音对话和听写场景更稳了。

点击打开原平台查看,能否访问取决于网络环境

Agent Two 新增文件夹协作与 Connect 功能

Agent Two 推出 Folders & Connect 功能,支持邀请任意协作者进入指定文件夹而无需额外付费席位,其他项目保持私密。该功能已上线 Team 和 Enterprise 版本,官方宣称速度提升 4 倍、价格减半。

Agent Two 上线文件夹级协作,邀请外部协作者不用加购席位,团队协作成本能省一半,做短剧批量生产的可以看看。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

Dreamina 全球首发 Seedance 2.5 实测

X 用户 Kim 发布 Dreamina Seedance 2.5 全球首发评测,称其为目前最好的文生视频模型,且 Dreamina 是美国区域支持该模型的最快平台,无需切换其他工具即可充分发挥其性能,并附有两段实测视频片段。

文生视频天花板换人了,做短剧和视觉的可以直接在 Dreamina 上跑 Seedance 2.5 实测出片质感,不用再切工具。

点击打开原平台查看,能否访问取决于网络环境

Zephyr 项目开源:全提示词与素材可复用

创作者 @CharaspowerAI 宣布其 Zephyr 项目全量开源,包含所有提示词、素材与角色设定,观看量达 130 万。项目基于 Higgsfield 平台的 Unlimited Seedance 制作,允许他人复用宇宙设定创作新剧集或衍生内容。

做 AI 短剧的可以直接拿这套开源资产当模板,从提示词到角色素材全公开,跑一遍看 Seedance 在 Higgsfield 上的出片稳定性。

点击打开原平台查看,能否访问取决于网络环境

PixVerse 分享 15 秒手持长镜头提示词

PixVerse 官方分享一条 15 秒、16:9、24FPS 的提示词:夜晚老式街角便利店,单次连续手持手机拍摄,无稳定器、无剪辑,店内空无一人,收银台无人值守,饮料冷柜玻璃起雾布满指纹。

官方直接甩出完整提示词,15 秒手持长镜头、无稳定器无剪辑,做 AI 短剧和视觉的可以直接抄来跑一遍,看镜头语言和氛围营造的稳定性。

Seedance 2.0 演示:照片上画路径生成一镜到底航拍

Lovart 官方演示:在照片上直接绘制相机路径,让 Seedance 2.0 沿路径生成一镜到底的航拍运镜视频,作者借此把自己放进世界杯决赛场景。展示了用草图控制镜头轨迹的创作方式。

把镜头路径直接画在照片上让 Seedance 2.0 飞一遍,做航拍感一镜到底的编导可以点开看这个工作流怎么落地。

点击打开原平台查看,能否访问取决于网络环境

创作者开源小说拆角色 skill,Claude Code 可跑

创作者「烁皓」开源一个 skill,用于将小说自动拆解为固定角色设定,输出人物画像、卡通形象 prompt 和音色 prompt,支持 Claude Code 和 Codex 运行。作者认为本地跑 MiniMax H3 后,AI 短剧制作的关键瓶颈在于先固定人物角色,该 skill 旨在解决小说改剧本分镜前的角色一致性难题。

做 AI 短剧的可以收藏这个 skill,丢本小说进去自动拆出人物画像、卡通形象和音色 prompt,省掉最磨人的角色固定环节。

点击打开原文,能否访问取决于网络环境

Flux 3 零重力视频生成效果惊艳

X 用户 fofr 分享用 Flux 3 生成的零重力空间站内高速移动片段,20 秒 demo,画面穿过一个个截然不同且怪异的房间,永不停歇。fofr 本人评价「Flux 3 让这个画面变得如此奇异」。

fofr 用 Flux 3 跑了一段零重力空间站穿越的 20 秒 demo,画面奇异感是看点。做视觉和短剧的可以点开看看 Flux 3 在这种高速运动场景下的表现力,当风格参考。

点击打开原平台查看,能否访问取决于网络环境

面壁智能黑客松:MiniCPM3-4B 微调做 AI 电影生成

面壁智能社区黑客松参与者基于 MiniCPM3-4B 微调构建 LLM Cinema 项目,让模型扮演编剧、角色设计师和导演,从创意生成结构化电影脚本、ASCII 风格角色设计,并为每个场景确定演员、动作、镜头和情绪。项目不直接生成最终画面,而是输出可编辑的结构化中间表示,实现透明可控的电影生成流程。

用 4B 小模型微调出编剧+角色设计+导演的中间层,输出可编辑的结构化脚本而非直接出画面,做 AI 短剧工作流的可以看看这个透明可控的思路。

点击打开原平台查看,能否访问取决于网络环境

创作者实测 MiniMax H3 默认状态口型与日语表现

日本创作者 @ai_haruki3 用 MiniMax H3 做 15 秒普通视频生成测试,默认状态(未超分辨率、未加速)下口型同步效果好,日语处理到位。此前该创作者主要制作 NSFW 视频,本次为常规内容测试,后续计划进行更完整验证。

个人实测:MiniMax H3 默认状态(未超分未加速)下 15 秒生成,口型同步和日语处理都不错。做短剧和配音的可以当个参考样本,等正式验证再下结论。

点击打开原平台查看,能否访问取决于网络环境

卡兹克复盘公众号数据:Prompt 选题效果仍领先

数字生命卡兹克(@Khazix0918)对公众号两年数据做用户兴趣定量分析,发现 Prompt 相关选题的互动效果至今仍遥遥领先其他类型。个人复盘分享。

行业观察:头部 AI 公众号主理人复盘两年数据,Prompt 类选题互动效果依然最好。做内容运营和工具推荐的可以当选题风向标参考。

点击打开原文,能否访问取决于网络环境

卡兹克用 Agent 手搓 X 关注自动加信源插件

数字生命卡兹克分享个人效率实践:用 Agent 花 10 分钟手搓一个小插件,点击关注 X 账号时自动弹出弹窗,可选择是否加入 AIHOT 监控信源(精选组或氛围组),选择后任务自动发送到家中 Mac 执行。属于个人工作流自动化案例,展示了 Agent 在内容监控信源管理上的轻量应用。

个人效率小工具,用 Agent 十分钟搓了个浏览器插件,关注 X 账号时自动弹窗选择加入 AIHOT 信源组。对做工具链整合的有点参考价值,编导制片路过。

点击打开原文,能否访问取决于网络环境

作品与案例

Works

《88》预告:全球首批一镜到底 AI 电影

WonderStudios 发布《88》预告,定位全球首批一镜到底 AI 电影。灵感融合韩国传统萨满文化与现代丧尸生存题材,采用动捕、实时 3D 动画叠加 AI 的全新混合工作流,主打单镜头连续叙事的视觉呈现。

一镜到底的 AI 长片,融合韩国萨满文化与丧尸题材,动捕+实时 3D+AI 的混合工作流值得拉片研究镜头连贯性处理。

点击打开原平台查看,能否访问取决于网络环境

阿里 Wan3.0 发布动画世界集锦

阿里云官方账号发布 Wan3.0 动画世界集锦,展示多组风格化动画场景,主打「无尽世界、无尽想象」的视觉概念,体现 Wan3.0 在动画风格生成和场景构建上的能力。

阿里官方放出的 Wan3.0 动画世界集锦,视觉师和编导可以拉片看风格化场景和镜头调度,做短剧的也能参考世界观构建。

点击打开原平台查看,能否访问取决于网络环境

小明修仙传25分钟优化纯享版上线

B站AI影视区作品《小明修仙传》优化纯享版,将学历对应网文战力境界的设定贯穿全片,属于AI长片级成片。

AI长片纯享版,把学历梗套进修仙战力体系,做AI短剧的可以拉片看长叙事节奏和梗的密度处理。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索