01
Hacker News 热门
World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型,现已开放早期访问申请,未来将驱动 Marble 等产品。
从零预训练的多模态世界模型,原生吃文本/图像/视频/3D,相机控制生成最长 1 分钟 1440p 视频,做 AI 影像和空间叙事的可以申请早期访问实测镜头控制能力。
点击打开原文
02
@ClaudeDevs
Anthropic 发布 Claude Fable 5.1,已上线 Claude Code 和 Claude Platform,定价与 Fable 5 持平,API 缓存读取降价 75%。模型在长任务中能更久自主推进、更善于提示用户它已卡住,写作风格也更自然。同期发布的还有 Claude Mythos 5.1,官方称其为编码与知识工作领域最先进的模型。
Anthropic 新模型上线,长任务自主推进和卡住自报能力提升,做 AI 短剧批量生产或搭自动化工作流的可以接 API 测一周,缓存读取降价 75% 对高频调用是真省钱。
点击打开原平台查看,能否访问取决于网络环境
03
Google DeepMind Blog
Google DeepMind 官方博客宣布推出 Gemini 的智能体视频理解能力(agentic video understanding),核心是让 AI 能像智能体一样理解视频内容并执行任务。官方发布,具体技术细节和 API 接入方式需查看博客原文。对 AI 后期和工具链整合者来说,这类能力有望接入自动化剪辑、内容审核或视频检索流程,值得跟进。
Google 官方发布 Gemini 的智能体视频理解能力,做 AI 后期和工具链整合的可以关注 API 接入,看能否把视频内容理解串进自动化剪辑或审核流程。
点击打开原文
04
@claudeai
Claude 官方发布新模型基准测试结果:在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多;在 Terminal-Bench 4.0 上得分 55.8%,Fable 5 为 42.0%。
官方基准数据,Terminal-Bench-Science 得分是 Fable 5 的两倍多。对创作工作流影响有限,搞 AI 编程和 Agent 自动化的可以看一眼。
点击打开原文,能否访问取决于网络环境
05
Google AI Blog
Google 官方发布 Google Pics,定位为 Workspace 内的图像创建与编辑工具,支持在 Docs、Slides 等办公套件中直接生成和修改图片。官方展示了多张由 Pics 生成的图片拼贴。
Google 把图像生成和编辑直接塞进 Workspace,做视觉和内容生产的可以关注它跟 Docs/Slides 的联动,看能不能省掉来回切工具的流程。
点击打开原文
06
X
Visko 团队发布 Orbis 1.0,定位为首个 Live Model,可实时流式生成可交互的动态世界,支持持久记忆、交互性和基于物理的无边界长度生成。DAIR.AI 的 Elvis Saravia 转评称实时生成交互世界的模型已到来,强调其交互、物理基础和持久记忆可带来全新体验。
实时流式生成可交互世界,带持久记忆和物理基础,做虚拟场景和互动叙事的可以关注,看能不能接进自己的创作流程。
点击打开原平台查看,能否访问取决于网络环境
07
@felixrieseberg
Felix Rieseberg 发布 Fable 5.1 和 Mythos 5.1 两款模型。Fable 5.1 在代理编码任务上成本约为 Fable 5 的一半,写作风格更自然。对依赖 AI 编程 Agent 自动化创作流程的团队,成本降低是直接利好。
做 AI 短剧和批量生产的团队,如果依赖 Agent 自动化流程,这个成本减半值得关注,能省不少预算。
点击打开原文,能否访问取决于网络环境
08
@AIatMeta
Meta Superintelligence Labs 发布 Muse Voice Transcribe,定位首个实时音频感知模型,支持实时流式 ASR、20+ 说话人 diarization 和 endpointing,多语言且可无缝 code-switching,可通过语言、关键词和上下文偏置提升准确率,在 Artificial Analysis 流式语音转文本和公开 diarization 基准上排名第一。对后期和短剧团队来说,实时多说话人转写加自动断句,能直接接进字幕生成和粗剪对白的工作流。
做 AI 短剧和后期字幕的可以关注,实时流式转写加 20+ 说话人区分,多语言混说也能切,接 API 能省掉不少人工听写和对轨的活。
点击打开原文,能否访问取决于网络环境
09
@OpenRouter
OpenRouter 宣布 Mercury 2.5 Preview(来自 @_inception_ai)独家上线,通过并行 token 生成达到 1107 tokens/秒,支持可调推理深度、并行工具调用和 schema 对齐 JSON,面向延迟敏感型工作负载。对 AIGC 技术整合者来说,这是把高速推理接进批量生成、实时字幕等创作自动化流程的现成 API 选项。
推理速度拉到 1107 tokens/秒,做 AI 短剧批量生成、实时字幕这类对延迟敏感的创作流程,可以接 OpenRouter 的 API 实测一周看吞吐提升。
点击打开原平台查看,能否访问取决于网络环境
10
@flickartHQ
Flick 平台宣布 17 位电影人的 17 部原创 AI 作品今日集中首映,强调无剧组、无大预算的制作模式,作品已可在 FLICK.ART/TV 观看。该活动展示了个人创作者在无传统剧组配置下完成 AI 影像创作的可能性,适合关注独立 AI 创作生态的编导和短剧团队参考其作品风格与制作规模。
Flick 平台集结 17 位电影人、17 部无剧组无大预算的 AI 原创作品集中首映,做 AI 短剧和独立创作的可以点进去看这批作品的成色和风格取向。
点击打开原平台查看,能否访问取决于网络环境
11
@Hailuo_AI
MiniMax Design 官方宣布「Bestiary:Miora × MiniMax H3 创意大赛」开放,单一赛道为奇异生物叙事短片,题材涵盖神话、民间传说、都市传说或原创世界观。奖品包括 8000 美元现金、Miora Design 平台 20 万创作积分,以及一二三等奖和 10 个人气奖。
MiniMax 官方联合腾讯 Miora 办创意大赛,奖金 8000 美元加 20 万创作积分,赛道是奇异生物叙事短片,做 AI 短剧和编导的可以当练手和曝光机会。
点击打开原平台查看,能否访问取决于网络环境
01
@magnific
MiniMax H3 Max 主打跨全片参考一致性:角色和场景在整部影片中保持不变,单次生成仅需 10 秒,最多支持 12 个参考图。推文附带了具体的参考图设置方法链接,面向长片和短剧制作场景,解决多镜头下角色和场景漂移问题。
做 AI 短剧和长片的重点看这条:角色和场景跨全片保持一致,10 秒出图,最多 12 个参考。点开链接看具体怎么搭参考图,直接套进自己的角色一致性工作流。
点击打开原平台查看,能否访问取决于网络环境
02
@venturetwins
World Labs 新模型支持从全新角度重拍现有视频。演示中,初始片段由三台手机在三脚架上拍摄,模型重建了场景的完整视角,从而实现对视频的重新取景。该能力对后期重构图、补拍和分镜调整有直接价值。
World Labs 新模型能从任意新角度重拍现有视频,三台手机拍的素材就能重建全场景。做后期和编导的可以关注,这直接改变补拍和分镜的玩法。
点击打开原平台查看,能否访问取决于网络环境
03
@krea_ai
Krea 官方分享电影《The Magic Needle》案例:创作者 Tedra 一人完成编剧、导演、生成与剪辑全流程,作品入选 a16z Cultural Leadership Fund x MACRO Epigraph Fellowship。官方附有她的创作过程说明。
一人包办编剧导演生成剪辑的完整 AI 电影案例,还拿了 a16z 奖学金,做 AI 长片和短剧的可以点进去看她的全流程怎么拆的。
点击打开原平台查看,能否访问取决于网络环境
04
@ring_hyacinth
创作者分享用 Seedance 将视频扩展成不同画幅比的技巧,用于前滩生活节官方宣传片的多版本制作。传统做法是在原素材上下或左右添加平面包装撑满画幅,重做开销大;改用 Seedance 转换画幅比后效果可行,Prompt 已放在评论区。
做线下大屏投放的团队可以直接抄作业,用 Seedance 扩展画幅比省掉重做成本,Prompt 在评论区,跑一遍就知道效果。
点击打开原平台查看,能否访问取决于网络环境
05
@pika_labs
Pika 官方用同一支「包里有什么」广告脚本,在相同输入下分别跑 Gemini Omni 1.1 Flash、Seedance 2.5 和 Wan 3.0 三个视频模型,对比三家对同一叙事脚本的呈现差异。适合做视觉风格和模型选型参考。
同一支包袋广告脚本分别跑 Gemini Omni 1.1 Flash、Seedance 2.5 和 Wan 3.0,做视觉和短剧的可以直接拉片看三家在叙事和质感上的差异,选型参考价值高。
点击打开原平台查看,能否访问取决于网络环境
06
@abxxai
创作者 Abdul Șhakoor 发布一条推文,承诺从头到尾完整拆解 AI 角色视频的逼真制作流程,以长推文形式分享。具体步骤、工具和参数尚未在推文正文中展开,需查看完整内容。
做AI角色视频的可以蹲这条完整流程拆解,从零到成片,视觉师和短剧团队直接当工作流模板用。
点击打开原平台查看,能否访问取决于网络环境
07
@internetphysics
开发者 @internetphysics 用 fal 平台的 H3 Max 模型构建了一个生成式视频课堂:输入任意概念,几秒内生成由虚拟角色 Tung Tung Tung Sahur 教授的动画讲解视频,支持排队生成新视频、观看时追问后续问题,课程可无限延长。展示了视频生成模型在实时交互式内容生产场景的应用。
用视频生成模型搭了个能实时问答、排队出片的互动课堂,做 AI 教育内容和交互式叙事的可以看看这套工作流怎么串起来的。
点击打开原平台查看,能否访问取决于网络环境
08
Runway
Miro 品牌团队用 Runway 为年度活动 Canvas26 生成开场视频全部底层镜头,并以场馆照片为参考图,针对 4 个城市分别本地化制作入场镜头。流程为先大量迭代静态图、再迭代视频,最后叠加 3D 动效和品牌元素;相比素材库可按需生成非标准画幅且不损失分辨率,Runway 前驻创意团队还提供专项培训帮团队建立模型选型能力。
品牌团队用 Runway 从静态图迭代到视频、再叠加 3D 动效的完整流程,做商业项目或品牌向 AI 视频的可以当模板拆解。
09
Google AI
Google 团队「Elevating Antigravity Agent Skills」五部曲系列教程的第二部分,讲解如何在 agent skill 中使用 generate_image 工具,将结构化提示词合成与原生图像生成结合,使 agent 能产出符合开发者规范的图像。面向开发者,属于官方技术教程。
Google 官方五部曲教程的第二篇,讲怎么在 agent skill 里调 generate_image 工具,把结构化提示词和原生图像生成串起来。做工具链整合的可以照着搭一套自动化出图流程。
10
@magnific
Magnific 官方账号分享一段可直接复制的多镜头动画序列提示词,示例包含镜头角度(低角度广角)、时长分段(0-3秒)、情绪节奏(忧郁喜剧感)和动作细节(看表、叹气、跺脚)等分镜要素。
官方直接甩出一段可复制的多镜头动画分镜 prompt,含镜头角度、时长、情绪节奏标注,做动画短片的可以直接抄来改。