← 全部日报

AIGC 信息日报

2026 年 7 月 20 日 周一

行业与平台

Industry

阿里开放式世界模型快乐生蚝 HappyOyster 1.0 …

阿里巴巴发布开放式世界模型 HappyOyster 1.0(快乐生蚝),已登陆阿里云百炼面向企业和开发者开启灰测。模型提供世界探索与实时导演两大模式,支持用户通过一句话或一张图生成可实时交互的开放世界,并可用文字指令操控镜头与剧情。产品提供 Android/iOS/Web 三端 SDK,支持构建可玩世界、互动剧等沉浸式应用。

一句话或一张图生成可实时交互的开放世界,还能用文字指令操控镜头和剧情。做互动剧和短剧的可以直接接 SDK 试玩,看实时导演模式下的叙事自由度够不够用。

点击打开原文

阿里云推出个人Token计划,覆盖多模态

阿里云推出面向个人的Token计划,统一额度覆盖文本、图像和视频生成,支持Qwen3.8-Max-Preview、GLM-5.2、DeepSeek-V4-Pro等模型,视频生成接入Happy Horse 1.1,首月优惠后4美元/月起。

阿里云把文本、图像、视频生成额度打包成个人月付套餐,首月4美元起,做短剧和视觉的可以当个备用算力池,尤其Happy Horse 1.1视频生成模型值得跑一轮实测。

点击打开原文,能否访问取决于网络环境

MOSS-Transcribe-Diarize-0.9B 开…

OpenMOSS 开源 MOSS-Transcribe-Diarize-0.9B 模型,可将长音频一次性转为带精确时间戳和说话人标注的结构化文本,无需额外发言人识别模型。转录速度比 qwen3-asr-0.6b 慢,不支持标点符号,自定义 Prompt 与热词功能未生效。项目已在 GitHub 开源。

开源长音频转写+说话人标注一体模型,后期和剪辑团队可以直接集成到字幕/采访整理管线里,省掉单独跑发言人识别模型的步骤。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools
本日无符合条目

方法与经验

Methods

Kimi K3可能是最懂视频剪辑的模型,能够精准满足自媒体人…

用户 Sac 用 Kimi K3 的 goal 命令,输入一条需求描述后自动生成世界杯决赛前瞻视频,素材、旁白、配乐均由模型一次完成,无需手动剪辑。提示词已发评论区。K3 的多模态能力在此场景下验证了从需求到成片的端到端自动化剪辑可行性。

一条 goal 命令出片,素材旁白配乐全自动,做短视频和短剧的可以跑一遍看 K3 的剪辑理解力到底多准。

点击打开原平台查看,能否访问取决于网络环境

构建VideoAgent风格多智能体系统:视频编辑任务的意图…

MarkTechPost 发布了一套可运行的 VideoAgent 多智能体系统教程,包含意图解析器、智能体库、工具路由器、图规划器及文本梯度优化器,集成 FFmpeg、Whisper 转录、场景检测、关键帧采样、字幕生成、跨模态检索、修剪、节拍同步编辑等工具。系统支持 OpenAI、DeepSeek、Anthropic、Gemini 等多种 LLM 后端,无 API 密钥时可回退至确定性执行,最终能根据自然语言指令产出编辑后的视频成品。

一套可跑的视频多智能体工作流,从意图解析到工具路由再到FFmpeg渲染全链路打通。做后期自动化和短剧批量生产的可以直接当框架模板用,省掉自己搭管线的时间。

点击打开原文

Grok视频生成进化,质感丝滑可战Seedance

X 用户 @AYi_AInotes 实测 Grok 视频生成能力,生成超现实主义纪录片风格网球观众席片段,质感与分镜丝滑程度可对标 Seedance。附完整提示词,包含首帧锁定、手持抖动、自动对焦搜索等 2000 年代 DV 质感参数,以及精确到秒的时间轴分镜。

Grok 视频生成质感追上 Seedance,附完整提示词和分镜时间轴,做 AI 短剧和视觉的可以直接套用这个 prompt 结构跑一遍。

点击打开原平台查看,能否访问取决于网络环境

发布AI自动视频剪辑Skill

开发者 Vista 开源了 AI 自动视频剪辑 Skill(qiaomu-cut-skill),基于 npx 安装,可接入 33 台词会员获取素材字幕、Pexels 免费空镜头、Listenhub 账号,实现 AI 自动生成视频。演示效果已发布在 X 平台,适合抖音、小红书等短视频平台的批量起号场景。

个人开发者开源了一套 AI 自动剪辑 Skill,接 33 台词和 Pexels 空镜就能跑,做短视频和短剧批量出片的可以直接装起来试一周。

点击打开原平台查看,能否访问取决于网络环境

白天在WAIC太忙了没空录,回来给大家看看Kimi K3直接…

个人创作者「栗噔噔」实测 Kimi K3 一轮生成赛博养宠游戏,完整提示词已公开在主页。199 元会员卡跑 2 个项目(含一个 3D 开放世界游戏)共消耗 16% 月额度。

个人创作者实测 Kimi K3 一轮跑出赛博养宠游戏,提示词已公开,做 AI 互动叙事和游戏化短剧的可以直接抄 prompt 跑一遍看效果。

点击打开原平台查看,能否访问取决于网络环境

Kimi 自动复刻官网宣传视频,制作还原度高

用户让 Kimi 自行复刻官网宣传视频,次日 Kimi 已完成制作,并生成了快闪版、沉浸版等多个版本,还解释了部分画面缺失的原因。视频的还原度与配乐节奏均由 Kimi 自主完成。

一个有趣的实验:让 Kimi 自己复刻官网宣传片,还生成了快闪版和沉浸版。做后期和视觉的可以看看 AI 对节奏和还原度的理解到了什么程度,当个能力摸底参考。

点击打开原平台查看,能否访问取决于网络环境

笑死,我用正在开发中的视频工具复刻 Codex 的官方宣传片…

烟花老师用正在开发中的视频工具,基于 Codex + GPT 5.6 sol ultra 复刻了 OpenAI Codex 的官方宣传片,成片时长约 1 分钟,视觉风格和节奏模仿原版,属于个人创作者对官方宣传片的工作流复现与风格还原尝试。

个人创作者用 Codex + GPT 5.6 sol ultra 复刻官方宣传片,1 分钟成片,做 AI 短剧和视觉的可以拉片看风格还原度,顺便蹲一下他说的那个「正在开发中的视频工具」是什么。

点击打开原平台查看,能否访问取决于网络环境

Making a milk ad using Claude …

创作者 DStudioproject 分享用 Claude x Seedance 2.0 4K on Higgsfield MCP 制作牛奶广告的工作流,附 15 秒成片片段。Claude 负责生成/优化 prompt,Seedance 2.0 输出 4K 视频,Higgsfield MCP 作为工作流编排层串联工具链。

用 Claude 写 prompt + Seedance 2.0 出 4K 画面 + Higgsfield MCP 串工作流,做广告和短剧的可以抄这个工具链组合,15 秒一条广告片,效率够高。

点击打开原平台查看,能否访问取决于网络环境

Another example of a HeyGen av…

HeyGen 官方展示其数字人形象被 Telemundo 电视台用于电视节目的案例。核心卖点是角色一致性:同一个主持人 Pablo Mariño 的数字分身,在不同节目段落中可以变换造型和场景,但观众仍能认出是同一人。这是 HeyGen 数字人进入传统电视制作流程的又一落地案例。

HeyGen 数字人上电视的又一个案例,这次是 Telemundo 用同一张脸在不同节目段落里换造型。做虚拟主播和短剧角色 IP 的可以看看角色一致性在真实播出环境里的表现力。

点击打开原文,能否访问取决于网络环境

How to Train a Gen AI Kick Dru…

作者用 7 年前的 GTX 1660 SUPER(6GB VRAM)在本地 Linux 上训练了一个潜扩散底鼓生成模型,数据集来自个人收藏的 13000+ 个底鼓样本。项目包含 3 个模型(3 种音频表征)组成的管线,代码、模型权重和在线 Demo 均已开源。

用 6GB 显存的老显卡从零训练一个 AI 底鼓生成模型,做 AI 音乐/音效生成的后期可以当入门参考,代码和权重都开源了。

作品与案例

Works

A full fashion editorial, held…

LumaLabs 官方发布时尚影像作品,由 Eli Coleman 使用 Luma 制作,以单一眼神作为视觉锚点贯穿全片,展示 AI 在时尚广告领域的视觉一致性和风格把控能力。

Luma 官方展示的时尚影像案例,视觉师和编导可以拉片看单一眼神贯穿全片的视觉一致性处理,以及 AI 在时尚广告片里的落地质感。

点击打开原平台查看,能否访问取决于网络环境

While everyone watches the gam…

Kling 官方发布 AI 伪纪录片短片,体育题材,聚焦赛场幕后工作人员,写实风格,展示 Kling 在长叙事和真实感视觉上的能力。

Kling 官方出品的 AI 伪纪录片,体育题材,做 AI 短剧和视觉的可以拉片看叙事节奏和写实风格一致性处理。

点击打开原平台查看,能否访问取决于网络环境

可灵AI助力神话与K-pop融合MV获奖

可灵AI官方发布韩国大学生团队作品《BARIDEGI》,获可灵AI NEXTGEN 2026韩国大学创意挑战赛最佳音乐视频奖。作品融合古老神话与K-pop能量,使用可灵AI工具链完成。

可灵官方推的韩国大学生AI MV获奖作品,神话+K-pop混搭风格,做AI音乐视频和视觉开发的可以拉片看风格融合和镜头节奏。

点击打开原平台查看,能否访问取决于网络环境

地震是我经历过的最可怕的事情。 Seedance 2.0 提…

创作者 NΞXUS 用 Seedance 2.0 生成的地震逃生短片,提示词包含三个角色(父亲、女儿、儿子)的服装和动作描述,以及从厨房到街道到城市天际线的多场景分镜,镜头从 24mm 固定广角切换到低角度手持、横向跟拍、18mm 上升摇臂再到 14mm 后退跟拍,风格为写实胶片质感。

创作者用 Seedance 2.0 做的一段地震逃生短片,镜头设计从 24mm 厨房固定机位到 14mm 后退跟拍,编导和视觉师可以拉片看提示词里的分镜拆法。

点击打开原平台查看,能否访问取决于网络环境

Justine Moore 分享了一个 非常酷的AI 视频用…

AI Will 分享的AI视频用例:一支婚礼惊喜视频,用AI生成跨越不同时代的爱情故事,最后揭晓两人现实中的相遇方式。视频,3.57万观看。

婚礼惊喜视频的AI叙事创意,编导和短剧团队可以拉片看情感叙事和时代跨越的视觉处理。

点击打开原平台查看,能否访问取决于网络环境

A dark stage and a dancer who …

LumaLabs 官方发布 AI 短片,由 Joana Haars 创作,暗调舞台场景下舞蹈演员的连续运动镜头,展示 Luma 在低光环境和动态主体追踪上的生成能力。

Luma 官方发的 AI 短片 demo,暗调舞台+舞蹈镜头,视觉师和编导可以拉片看光影和运镜的一致性处理。

点击打开原平台查看,能否访问取决于网络环境

A stairwell, a late hour, and …

LumaLabs 官方账号发布创作者 Misho 使用 Luma 制作的短片,主题为深夜楼梯间的紧张氛围,镜头语言和光影处理是主要看点。

Luma 官方号推的短片 demo,氛围感和镜头调度是看点,做视觉和编导的可以拉片看 Luma 在叙事镜头上的表现力。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索