← 全部日报

AIGC 信息日报

2026 年 8 月 3 日 周一

行业与平台

Industry
本日无符合条目

工具与能力

Tools

Grok 新增视频观看与分析功能

xAI 的 Grok 新增视频观看与分析能力,用户可像上传图片一样上传视频,并向 Grok 提问视频中的任何内容。该功能面向视频理解场景,可应用于素材审阅、内容检索、镜头分析等后期工作流。

Grok 现在能像传图一样传视频,然后直接问它视频里发生了什么。做后期和审片的可以拿它当自动拉片工具,批量过素材、找镜头、查内容,省掉人工逐帧看的功夫。

点击打开原平台查看,能否访问取决于网络环境

Gemini 桌面应用将支持 MCP 与图像视频生成

Gemini 桌面应用即将为 Gemini Spark 提供完整 MCP 支持,并新增专门的图像和视频生成标签页及相机附件选项,功能上与网页版进一步对齐。目前为预告状态,具体上线时间未公布。对 AIGC 创作者来说,桌面端补齐生成能力意味着后续可在本地直接完成图像视频生成,MCP 支持则便于接入外部工具链做自动化创作流程。

Gemini 桌面端补齐 MCP 支持和图像视频生成标签页,做工具链整合的可以等正式版出来接 MCP 跑自动化流程,视觉师也能在桌面端直接出图出视频。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

RT @DreamLabLA: I Put an Octop…

Luma 官方转发 @mrjonfinger 的演示,展示其新推出的精准编辑工具 Layers 的使用方法,通过图层方式将章鱼元素合成进办公室场景。属于工具功能演示类内容,重点在图层编辑与场景合成的操作流程。

Luma 新出的 Layers 精准编辑工具,@mrjonfinger 演示怎么把章鱼分层放进办公室场景。做视觉和后期的手上有活,可以照着跑一遍看图层控制顺不顺手。

点击打开原平台查看,能否访问取决于网络环境

Karpathy 用 Opus 5 生成《指环王》3D 渲染

Andrej Karpathy 给 Opus 5 提供《指环王》第一段和 1M token 预算(约 $10),模型耗时约 2 小时写出 5500 行代码,程序化渲染出故事场景。他认为这展示了从「没人会做」到「几乎免费」的转变,并指出 LLM 在视频感知和游戏内审计能力上仍有明显短板。

Karpathy 用 1M token 预算让 Opus 5 花 2 小时写出 5500 行代码,程序化渲染《指环王》场景。做 AI 视觉和程序化生成的可以看看这个从「没人会做」到「几乎免费」的转变,以及 LLM 在视频感知和游戏内审计上的短板。

点击打开原平台查看,能否访问取决于网络环境

We tested identity preservatio…

HeyGen 官方用同一句 prompt 测试四款图像模型的身份保持能力:Flux 2.0 pro、Seedream V5、Kling V3 均生成相似但非目标真人的人物,HeyGen 头像因基于真人实拍素材训练而能还原本人。对比展示了通用图像模型与真人训练模型在身份一致性上的本质差异。

HeyGen 拿同一句 prompt 测了 Flux 2.0 pro、Seedream V5、Kling V3 和自家头像,结论是前三家都生成相似但非本人的人,只有真人训练数据能保真。做角色一致性和数字人形象的可以看看这个对比逻辑。

点击打开原文,能否访问取决于网络环境

研究了一下视频号上的 AI 内容是怎么收割中老年流量的,拆出…

博主拆出视频号 AI 内容收割中老年流量的三个配方:配方一用 AI 爬人民日报/央视金句配 AI 生成本地地标夜景视频,剪映配音加 BGM,挂励志书/养生书链接或接本地广告变现;配方二让 GPT 模仿莫言体/余华体写人生道理,配 AI 慈祥老人头像封面,靠广告分成变现;配方三用 AI 做旧/上色老照片配怀旧文案。核心逻辑是 AI 把生产成本打到零,中老年要的是被认同感和扮有文化的社交货币。

拆解视频号收割中老年流量的三个 AI 配方:权威金句+本地地标、农村老人语录、新老照片对比,每条都给了变现路径。做下沉市场短剧和流量号的可以当选题库抄作业。

海螺 H3 处理对话场景非常出色

创作者 @CharaspowerAI 分享海螺 H3 在对话场景上的表现,称面部表情、时机、镜头移动和角色一致性进步巨大。个人体验分享。

个人体验分享:海螺 H3 处理对话场景表现出色,面部表情、时机、镜头移动和角色一致性都有明显进步。做 AI 短剧和视觉的可以当个参考信号,但具体效果还得自己上手跑一遍。

点击打开原平台查看,能否访问取决于网络环境

GPT 5.6 Sol 构建 3D 人体解剖教学应用

Greg Brockman(@gdb)用 GPT 5.6 Sol 和 Codex 构建 3D 人体解剖教学应用,从一张设计图起步,通过 vibe coding 完成。每个 3D 模型从 120-150 MB 优化至 2-5.5 MB,总资源从约 900 MB 降至 28.6 MB,帧率从 16fps 提升至流畅,支持按需加载,并自动生成解剖插图和交互热点标记。

Greg Brockman 用 GPT 5.6 Sol 和 Codex 从一张设计图起步,纯 vibe coding 搭出 3D 解剖教学应用,模型从 120-150MB 压到 2-5.5MB、总资源 900MB 降到 28.6MB。做 AI 工具链整合的可以看看这套从想法到可交互应用的自动化链路。

点击打开原平台查看,能否访问取决于网络环境

这些是 Midjourney v8.2 静态图像,位于 H3…

创作者 @VictorInFocus 分享工作流:用 Midjourney v8.2 生成 gritty 风格静态图(sref 3818841042 1759006419 + 个人 profile ggob8ma),再通过 H3 做动态化,并以 Suno 曲目作为运动参考。实测结论:简化 prompt 后 H3 能更好保持原视觉风格并同步画面运动与音乐节奏。

个人实测:Midjourney v8.2 静态图喂给 H3 做动态化,配 Suno 音乐参考,核心结论是 prompt 越简单 H3 越能保持原风格并卡准节奏。做视觉风格迁移的可以照这个思路跑一遍。

点击打开原文,能否访问取决于网络环境

人生副本赛道在抖音非常火,起号也很简单,看到一个剧本人生的博…

产品经理老王霸用 Codex 拆解抖音「人生副本」赛道爆款博主(涨粉 50w+),并写成 skill:输入主题→给出脚本和方向建议→生成至少 8 分钟脚本和分镜→生成分镜图片→组装渲染成视频。作者实测全 AI 出 8 分钟视频需 100+ 张图,Codex 出图极慢,跑一小时未完成,等待出片后再汇报。

用 Codex 拆解抖音「人生副本」赛道,把爆款博主的起号逻辑做成可复用的 skill:输入主题→出脚本分镜→生成图片→渲染成片。做短剧和批量起号的可以收藏这套流程,但作者自己跑 8 分钟视频出 100+ 张图已经卡了一个小时,效率问题得自己掂量。

点击打开原平台查看,能否访问取决于网络环境

One image + one depth video—th…

个人实测:用一张图+一段深度视频即可复刻细微动作。流程为先用工具把 TikTok 视频转成深度视频,再用 GPT 生成图像,最后用 Seedance 2.0 驱动动画。作者对比后认为比直接用 Kling Motion Control 动作迁移更自然,深度视频可去除原角色。

深度视频+Seedance 2.0 做动作迁移,比直接上 Kling 运动控制更自然,视觉师和后期可以照着这套流程跑一遍试试。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

the “AI actors can’t act” deba…

作者 @EHuanglu 发布 AI 生成短片,直接回应「AI 演员不会演戏」的争议,成片标注 Made with AI。作品聚焦 AI 角色的表演表现力,验证 AI 演员在情绪传达和动作细节上的可行性。

AI 演员表演争议的正面回应,作者用成片直接回应「AI 演员不会演戏」的质疑,做 AI 短剧和编导的可以拉片看表演细节和情绪传达。

点击打开原平台查看,能否访问取决于网络环境

萌新原创末日故事连载【归墟】第十一集-破界【AI全民制作人】

B站个人创作者「萌新」的AI原创末日题材连载剧《归墟》第十一集「破界」,含AI生成内容声明。故事从失踪案切入,讲述巨蚁出现后城市失守、秩序崩塌的废土新物种时代。该系列已连载至第十一集,属长篇连载AI剧集,个人业余制作、更新不定时。

B站个人创作者连载的AI末日题材长剧,已更到第十一集,做AI短剧的可以拉片看个人团队如何用单一工具链维持长篇连载的角色一致性和叙事连贯性。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索