Overview

There are the overall of paper with code for CV / AIGC / LLM / VLM.
https://github.com/Gojay001/paper-with-code-skills.
[Updating…]


MiniMax-H3 — A General-Purpose Omni-Modal Video Generation Model

把 MiniMax-H3 想象成一个「全能导演」:你随手丢给它文字、几张图、几段参考视频和几段音频,它先派一个「编剧助理」(H3-Context-IR)把这堆杂乱素材读懂、理顺时序与关系,写成一份结构化的分镜脚本(Context 中间表示);然后「导演本体」(H3-Base,330 亿参数的单流 Transformer)照着脚本一次性把画面和立体声一起拍出来——注意是画面和声音联合生成,而不是先出画面再配音;最后如果你要更高清,它不另请「放大专家」,而是把 768p 成片连同原始素材塞回自己脑子里重画一遍成 2K(H3-Regenerate-2K)。

电商视频生成:任务版图、技术路线与研究空白

通用视频生成追求“看起来合理”;电商视频还要求“与正在售卖的那个 SKU 一致”。本综述梳理商品图直生视频、人—商品演示、广告规划剪辑、品牌与商业意图、生成—真实混合等路线,并给出可复用机制与 Gap Map(G11–G20)。

Qwen-Image-Agent — Bridging the Context Gap in Real-World Image Generation

痛点:用户说「做张海报」往往缺细节——隐含意图、实时知识、历史对话。T2I 模型训练时吃「完整 prompt」,部署时吃「残缺 context」→ 作者称 Context Gap(用户 context ≠ 生成所需 context)。

InnoAds-Composer — Efficient Condition Composition for E-Commerce Poster Generation

任务:电商海报 = 一张图里同时摆对商品主体、促销文案、背景风格。多阶段 pipeline(先合成场景再贴字)常出现主体走样、文字错字、风格不统一。

MoFu — Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation

任务:多主体视频生成——给定文本 + 多张参考图,生成多主体一致、尺度自然的视频。

Your browser is out-of-date!

Update your browser to view this website correctly. Update my browser now

×