← 全部日报

AIGC 信息日报

2026 年 8 月 11 日 周二

行业与平台

Industry

Dyna Robotics 发布 Dyna-2 世界-动作模型

Dyna Robotics 推出 Dyna-2,一个在 100 万小时人类视频上预训练的世界-动作模型。官方称在该规模下首次发现世界-动作模型在人类数据上从 1000 小时到 100 万小时跨越四个数量级的缩放定律。

新公司首发世界-动作模型,100 万小时人类视频预训练,声称跨四个数量级缩放定律。做 AI 视频生成的可以关注后续能力细节和 API 接入。

点击打开原文,能否访问取决于网络环境

微软 MAI-Image-2.6 登顶文生图竞技场第二

微软 MAI-Image-2.6 在文生图竞技场以 1336 分升至第二名,距榜首 GPT Image 2 仅差 45 分,领先第三名 Grok Imagine 20 分。较上一代 MAI-Image-2.5(第 10 名,1256 分)全面提升,下周将登陆 Playground 并在 Foundry 开放早期 API 访问。

微软官方宣布 MAI-Image-2.6 在文生图竞技场冲到第二,距榜首 GPT Image 2 只差 45 分。做视觉和美术的可以下周去 Playground 实测,看风格一致性和出图质感值不值得换工具链。

点击打开原文,能否访问取决于网络环境

Meta 开源 Muse Glimmer 权重,Spark 1.2 即将发布

Meta CEO 扎克伯格宣布开源 Muse Glimmer 权重,这是一个 30B 参数稠密模型,可在本地运行;同时预告即将发布最新基础模型 Muse Spark 1.2 的权重。Meta 持续押注开源路线。对创作者来说,本地可跑的 30B 模型意味着风格化生成和批量实验可以脱离云端 API,降低依赖和成本,适合视觉师和技术整合者接入本地工作流。

Meta 把 30B 稠密模型权重开源,能本地跑,做视觉风格探索和本地化工作流的可以关注;Spark 1.2 权重也预告了,等正式发布再实测。

点击打开原文

阿里 Qwen-MM-Plugins 让 Agent 原生支持多模态

阿里 Qwen 发布 Qwen-MM-Plugins,让 Agent 原生支持多模态:可读取图像、视频、文档,编辑视频,处理 3D/CAD 文件。核心是从多模态模型升级为多模态 Agent,官方附演示视频。对 AIGC 技术整合者来说,这是把素材理解、视频编辑等能力直接嵌入自动化创作管线的现成方案,值得接 API 实测。

阿里把多模态能力做成插件塞进 Agent 框架,读图、读视频、读文档、剪视频、处理 3D/CAD 都能干。做自动化剪辑和媒体处理管线的技术整合者可以接 API 试一周,看能不能把成片链路里的素材理解环节自动化。

点击打开原平台查看,能否访问取决于网络环境

NVIDIA 开源 Magpie TTS:低延迟多语言语音 Agent

NVIDIA 发布 Magpie TTS,主打低延迟多语言语音 Agent 场景,开放权重并支持完整部署控制。面向 AI 配音、虚拟角色对话、实时字幕等后期制作场景,可本地化部署以控制延迟和数据。

NVIDIA 开源低延迟多语言 TTS,带完整部署控制权,做 AI 配音、虚拟角色对话和短剧批量配音的后期团队可以直接接进自己的管线试效果。

点击打开原文

Meta 将重启开源 AI 模型,推进个人超级智能

Meta 宣布将"很快"恢复发布开源 AI 模型,作为向数十亿人提供个人超级智能计划的一部分。扎克伯格承诺免费或可负担的访问、Meta 也无法查看的完全隐私模式,以及以用户目标而非 Meta 价值观为中心的对齐。他还提议由独立董事会批准模型发布安全标准,并让政府提前访问中间训练检查点。

Meta 战略转向,开源模型回归对用 Llama 做本地化部署的团队是利好,但具体模型和发布时间未定,先关注后续。

点击打开原文,能否访问取决于网络环境

Whodunnit AI:语音审问 AI 嫌疑人的谋杀悬疑游戏

Whodunnit AI 是一款语音驱动的谋杀悬疑游戏,玩家用自己的声音审问 AI 嫌疑人,核心玩法是追问不在场证明、抓矛盾。游戏免费可玩,但实时嫌疑人语音基于 gpt-realtime-2 运行,每分钟审讯有真实成本,作者开放了捐赠通道。在 Hacker News 获 104 分社区关注。

语音驱动交互叙事的新玩法,用 gpt-realtime-2 跑实时审问,做互动短剧和 AI 角色对话的可以拆解它的审讯逻辑和语音交互设计。

BytePlus 直播:AI 原生制作如何重塑商业视频

BytePlus 宣布 8 月 13 日与 AZ8studio 联合创始人 Shi Kang 直播,主题为 AI 原生制作如何重塑商业视频的创作、规模化与上市流程,强调真实工作流与基础设施而非单纯模型进步。

字节旗下 BytePlus 联合 AZ8studio 办直播,讲 AI 原生制作在商业视频里的规模化落地,做商业片和短剧的制片可以蹲一下案例拆解。

点击打开原文,能否访问取决于网络环境

OpenAI 发布网络安全专用模型 GPT-5.6-Cyber

OpenAI 推出网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 平台向授权研究人员开放,用于漏洞研究、漏洞利用验证与安全测试。该模型面向网络安全领域,不涉及图像、视频或音频生成,与 AIGC 创作管线无直接关联。

当天有 9 家独立信源在报同一件事,属于行业动向本身。对具体创作流程没有直接用处,但这个量级的消息值得知道。

工具与能力

Tools

Ideogram 图像模型接入 Runway,0.6 秒出图

Runway 官方宣布 P-Image-Ideogram 模型上线,支持从提示词到图像生成,最快 0.6 秒出图,提供四种质量模式供用户平衡速度与细节。该模型已集成至 Runway 平台,可直接调用。对视觉和美术创作者来说,这意味着可以在 Runway 工作流内直接使用 Ideogram 的图像生成能力,无需切换工具,适合快速产出概念图或风格参考。

Runway 把 Ideogram 的图像模型接进来了,最快 0.6 秒出图,还有四档质量模式调速度跟细节。做视觉和美术的可以直接在 Runway 里跑,省得来回切工具。

点击打开原平台查看,能否访问取决于网络环境

Recraft V4.1 跨场景保持角色与风格一致

Recraft 官方演示 V4.1 模型能力:同一角色、同一风格,在四个不同场景中保持角色一致性,头发、光影、表情等细节随场景变化,但角色身份不变。官方强调无需每次重建 prompt 即可跨生成保持风格,并附有示例 prompt 链接。

官方演示 V4.1 跨场景保持角色和风格一致,头发、光影、表情可变但角色不变。做角色 IP 和视觉开发的可以点开看效果,顺手抄一下官方给的 prompt。

点击打开原文,能否访问取决于网络环境

Grok 上线 Voice 连接器:语音备忘与个性化播客

Grok 推出 Voice 连接器,支持生成语音备忘、将每日事件转化为个性化播客、创建每日简报自动化任务。现已面向 iOS、Android 和 Web 全平台开放,无需额外设置即可使用。

Grok 把语音备忘、每日事件转播客、自动化简报做成了现成功能,全平台免设置直接用。做播客和音频内容的后期团队可以接上试试,省掉手动剪辑和配音的环节。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter 上线 auto 模型路由,自动选模型不加价

OpenRouter 推出 openrouter/auto 模型路由功能,可在任何需要填写模型字符串的位置直接使用,支持通过 cost_tier 和允许模型列表自定义选择范围,无额外费用,按实际运行模型的标准费率计费,并兼容现有 Guardrails 安全机制。对 AIGC 技术整合者来说,这意味着可以在创作流水线中用一个占位符自动调度不同模型,简化多模型切换的配置成本。

做工具链整合的可以直接把 model 字段换成 openrouter/auto,让系统按成本档位自动挑模型,省掉手动维护模型列表的活。

点击打开原文,能否访问取决于网络环境

ElevenLabs 推出网络级 AI 通话助手

ElevenLabs 推出 AI 通话助手,嵌入网络层,任何能打电话的移动设备都能用。支持通话中实时协助、实时翻译、通话转写与摘要。对做 AI 配音、虚拟角色对话和语音交互的创作者来说,这意味着语音能力从 App 内扩展到真实电话场景,可接 API 测试通话级实时翻译和转写链路。

做 AI 配音和语音交互的后期团队可以关注,实时翻译和通话转写摘要直接嵌进网络层,接 API 就能给虚拟角色加实时通话能力。

Claude Code 自动模式默认开启,无需逐项批准操作

Anthropic 将 Claude Code 的自动模式设为默认选项,用户不再需要批准每一个操作。官方解释了决定某个操作是否可以安全运行的机制。对 AIGC 技术整合者来说,这意味着批量生成、媒体处理等自动化链路可以减少人工确认环节,提升流水线效率。

做 AI 自动化工作流的可以看看这个默认行为变化,理解哪些操作会被判定为安全自动执行,能帮你减少手动确认的打断。

点击打开原平台查看,能否访问取决于网络环境

Suno 明确 stems 下载计入单次下载额度

Suno 官方明确:歌曲的所有 stems(分轨)被视为该歌曲单次下载的一部分,下载完整混音及其 stems 只计一次下载额度。对需要分轨做后期混音、剪辑或重新编排的创作者,这意味着批量获取分轨不会额外消耗下载次数。

Suno 官方澄清下载规则:完整混音加 stems 只算一次下载。做 AI 音乐和后期分轨的可以放心批量下载,不用再担心额度被扣光。

点击打开原文

方法与经验

Methods

字节开源 Seedance 2.5 与 Seedream 5.0 提示词文档

字节跳动免费开源 Seedance 2.5 与 Seedream 5.0 Pro 提示词文档,内含几十套完整案例,如盛唐 30 秒长镜头、废土科幻一镜到底,每个 Prompt 均含分镜、运镜、音效及负面词等细节。升级后视频可生成 30 秒,支持按时间戳指定画面,最多可参考 30 图+10 视频+10 音频;生图支持高密度信息图与多语言文字。

字节把 Seedance 2.5 和 Seedream 5.0 Pro 的提示词文档免费开源了,几十套完整案例带分镜、运镜、音效和负面词,做短剧和视觉的可以直接抄作业跑一遍。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 时尚 MV 实测:全镜头对口型

PixVerse 官方账号展示 MiniMax H3 生成的时尚 MV《NO LIMIT》,15 秒暗黑流行风格,男团舞蹈镜头,每个切镜都带完整对口型,巨型字体保持锐利,英文说唱与副歌咬字锁定。正文附完整工作流链接。

做 MV 和短剧的可以点开看,重点拆解全镜头对口型和英文说唱咬字怎么锁住的,工作流链接在正文里。

点击打开原平台查看,能否访问取决于网络环境

Magnific 演示:Seedance 2.5 加视频放大到 4K

Magnific 官方演示:Seedance 2.5 生成视频后,接入 Magnific Video Upscaler 放大,即可将生成内容提升至 4K 分辨率。官方称这是完整工作流,无需其他步骤。

官方演示一条极简工作流:Seedance 2.5 出片后接 Magnific 视频放大,直接上 4K。做短剧和视觉的可以收藏这条链路,出片分辨率不够时套用。

点击打开原平台查看,能否访问取决于网络环境

Glif 用 Krea 2 加 MiniMax H3 重制奥德赛

Glif 官方演示:用 Glif agent 将《奥德赛》重制为 1970 年代短剧,静态画面用 Krea 2 生成,动态镜头用 MiniMax H3 的首帧-末帧技术衔接。官方称 Krea 2 对复古风格还原出色,H3 转场无伪影。

做 AI 短剧的可以拉片看这套组合拳:Krea 2 出 70 年代风格剧照,H3 首尾帧衔接做转场,验证了风格统一和镜头流畅度。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 的 Context-IR 实测:把情绪提示词拆成镜头动作

创作者实测 MiniMax H3 官方 API 的 Context-IR 功能:用同一提示词和首帧生成两段 10 秒 768P 视频对比,Context-IR 能把「甜笑后强忍悲伤」这类抽象情绪提示词自动拆解为吸气、笑容僵住、嘴角颤动、吞咽、肩膀下沉等具体表演动作,并补充推镜和声音设计。

做 AI 短剧的可以试试这个功能,把「甜笑后强忍悲伤」这种抽象情绪提示词自动拆成吸气、嘴角颤动、推镜等具体镜头动作,角色表演的细腻度能上一个台阶。

点击打开原平台查看,能否访问取决于网络环境

卡兹克花54小时自建AI大模型排行榜并免费开放

数字生命卡兹克花54小时自建了一个AI大模型排行榜,起因是上周文章评论区一条高赞评论。该排行榜已免费开放给公众使用。

卡兹克自己搭的AI大模型排行榜,免费开放,做工具选型和模型对比的可以点开看看他的评测维度。

点击打开原文,能否访问取决于网络环境

创作者收集爆火AI视频提示词建站并接入Agent

创作者Sac收集市面上爆火AI视频的提示词(含《丧尸清道夫》等)并汇集在网站 seedance-prompts-nu.vercel.app,同时做了Agent接入,可让Codex学习站内所有提示词后自动制作AI视频。对AI短剧和视觉创作者来说,这是一个现成的提示词库和自动化出片参考。

把市面上爆火AI视频的提示词(含《丧尸清道夫》)汇总成站,还做了Agent接入让Codex学习后自动出片。做AI短剧和视觉的可以收藏当提示词库用,想自动化出片的可以试试接Agent跑一遍。

点击打开原平台查看,能否访问取决于网络环境

东方仙侠视觉导演 Skill 工作流分享

李岳(@liyue_ai)分享 AI 仙侠视频制作流程:用「东方仙侠视觉导演」Skill 生成关键帧图片,「东方仙侠运镜导演」Skill 生成单镜头运镜脚本,并称此类视频制作已可流程化。

作者用「东方仙侠视觉导演」和「运镜导演」两个 Skill 把关键帧和运镜脚本流程化,做仙侠题材短剧的可以套这套思路跑一遍。

点击打开原平台查看,能否访问取决于网络环境

Gloss 开源:提示词给任意网站换肤

个人开发者 Eric Zakariasson 开源 Gloss 工具,可用提示词将任意网站改造成禅意风、反色风或节日主题等自定义视觉风格,代码与配置已发布在 GitHub。对视觉师和工具链整合者来说,这是一个可参考的轻量级前端换肤实现思路,适合做网页风格批量定制或品牌视觉实验时借鉴。

个人开发者做的开源小工具,用提示词给任意网站换视觉风格,代码和配置都在 GitHub。做视觉和工具链的可以拉下来看看思路,当个前端换肤的参考。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

Higgsfield 发布 110 分钟 AI 长片,全流程开源

Higgsfield 官方宣布完成首部 AI 长片《The Cully Hill Boys》,由真人演员出演,制作成本 200 万美元,基于 Seedance 生成。全片提示词与素材已在 Higgsfield 平台 100% 开源,供创作者复现和拆解。

真人演员 AI 长片,成本 200 万美元,全提示词和素材开源。做 AI 长片和短剧的可以直接拉片拆解,看长叙事和真人演员一致性怎么处理。

点击打开原平台查看,能否访问取决于网络环境

Magnific 用 Seedance 2.5 端到端制作科幻剧集第一集

Magnific 官方发布科幻剧集《The Black Box》第一集成片,全程在 Magnific 平台内用 Seedance 2.5 端到端制作完成,第二集预告即将上线。

科幻剧集,全程在 Magnific 上用 Seedance 2.5 端到端产出,做 AI 短剧的可以拉片看单工具链长叙事怎么撑住。

点击打开原平台查看,能否访问取决于网络环境

PixVerse 发布四句台词原生语言短片

PixVerse 官方发布一支 AI 短片,全片仅四句台词,无字幕无旁白,使用蒙古语与俄语原生语言,强调口型同步与语言真实感,展示多语言角色对话场景下的叙事能力。

四句台词、无字幕无旁白,纯靠原生语言口型同步撑起叙事,做 AI 短剧的可以拉片看口型与情绪匹配怎么处理。

Magnific 团队发布原创系列,哥伦比亚团队全流程制作

Magnific 官方账号发布原创系列,由其在哥伦比亚的团队从零到一全流程制作完成,属于官方自产 AI 影像作品。

Magnific 官方团队全流程制作的原创系列,做 AI 短剧和视觉的可以点开看团队自产内容的成片水准和风格取向。

点击打开原文,能否访问取决于网络环境

Pika 展示 Seedance 2.5 短剧情感叙事能力

Pika 官方账号发布一支 Seedance 2.5 生成的短剧向 demo,强调模型对闪回、情绪和配乐等短剧核心要素的理解,成片以情感叙事为主。

Pika 官方用 Seedance 2.5 做了一支短剧向 demo,主打闪回、情绪和配乐,做 AI 短剧的可以点开看情感戏和音乐卡点的处理。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索