当前位置: 网站首页 >AI教程资讯 >正文

ICEdit – 浙江大学联合哈佛大学推出的指令式图像编辑框架

来源:爱论文 时间:2025-05-13 11:25:31

ICEdit是什么

ICEdit(In-Context Edit)是浙江大学和哈佛大学推出的指令式图像编辑框架。基于大规模扩散变换器(Diffusion Transformer)的强大生成能力和上下文感知能力,用自然语言指令对图像进行精准编辑。ICEdit仅需0.1%的训练数据和1%的可训练参数,相比传统方法大幅减少资源需求,在多轮编辑和多任务编辑中表现出色。ICEdit具备开源、低成本、快速处理(单张图像约9秒)等优势,适合广泛的应用场景。

ICEdit的主要功能

指令驱动的图像编辑:基于自然语言指令对图像进行精准修改,例如更换背景、添加文字、改变人物服装等。多轮编辑:支持连续多次编辑,每次编辑基于前一次的结果,适合复杂创作需求。风格转换:支持将图像转换为不同艺术风格,如水彩画、漫画等。对象替换与添加:替换图像中的对象或添加新元素,如将人物替换为卡通角色。高效处理:处理速度快(单张图像约9秒),适合快速生成和迭代。

ICEdit的技术原理

上下文编辑框架(In-Context Editing Framework):基于“上下文提示”(In-Context Prompting),将编辑指令嵌入到生成提示中,模型基于处理提示生成编辑后的图像。无需对模型架构进行修改,避免传统方法中复杂的结构调整。基于上下文理解,模型直接生成符合指令的编辑结果。LoRA-MoE混合微调策略(LoRA-MoE Hybrid Fine-Tuning):结合参数高效的LoRA(Low-Rank Adaptation)适配器和动态专家路由(Mixture-of-Experts, MoE)。LoRA基于低秩矩阵分解,高效地调整模型参数,适应不同的编辑任务。MoE基于动态选择最适合当前任务的专家模块,进一步提升编辑质量和灵活性。仅需少量数据(50K样本)进行微调,显著提高编辑成功率。推理时早期筛选策略(Early Filter Inference-Time Scaling):在推理阶段,基于视觉语言模型(VLM)评估早期生成的噪声样本,筛选出最符合编辑指令的初始噪声。用少量步骤(如4步)评估编辑效果,快速选择最优的初始噪声,进一步提高编辑质量。

ICEdit的项目地址

项目官网:https://river-zhang.github.io/ICEdit-gh-pages/GitHub仓库:https://github.com/River-Zhang/ICEditHuggingFace模型库:https://huggingface.co/sanaka87/ICEdit-MoE-LoRAarXiv技术论文:https://arxiv.org/pdf/2504.20690在线体验Demo:https://huggingface.co/spaces/RiverZ/ICEdit

ICEdit的应用场景

创意设计:将照片转为艺术风格(如水彩画),或添加创意元素,用在设计和广告。影视制作:快速生成角色设计或场景概念图,辅助影视前期开发。社交媒体:编辑个人照片(如换背景、加特效),制作吸引人的社交内容。教育领域:生成教学用图,如将历史人物转为漫画风格,辅助教学。商业广告:快速制作产品宣传图,如更换背景、添加品牌标志。
上一篇:FlexiAct – 清华联合腾讯推出的动作迁移模型
相关资讯 更多+
  • ICEdit – 浙江大学联合哈佛大学推出的指令式图像编辑框架
    ICEdit – 浙江大学联合哈佛大学推出的指令式图像编辑框架

    ICEdit(In-Context Edit)是浙江大学和哈佛大学推出的指令式图像编辑框架。基于大规模扩散变换器(Diffusion Transformer)的强大生成能力和上下文感知能力,用自然语言指令对图像进行精准编辑。

    AI教程资讯 2023-04-14

  • FlexiAct – 清华联合腾讯推出的动作迁移模型
    FlexiAct – 清华联合腾讯推出的动作迁移模型

    FlexiAct是清华大学和腾讯ARC实验室联合推出的新型动作迁移模型。FlexiAct能在给定目标图像的情况下,将参考视频中的动作迁移到目标主体上,在空间结构差异较大或跨域的异构场景中,实现精准的动作适配与外观一致性。

    AI教程资讯 2023-04-14

  • Klavis AI – 开源MCP集成平台,快速接入生产级MCP服务器
    Klavis AI – 开源MCP集成平台,快速接入生产级MCP服务器

    Klavis AI 是一个开源的 MCP(Multimodal Communication Protocol,多模态通信协议)集成平台,帮助 AI 应用快速接入生产级的 MCP 服务器和客户端。平台提供稳定可靠的 MCP 服务器,支持多种工具集成和定制化服务,具备内置的身份验证功能,保障开发人员和终端用户的安全。

    AI教程资讯 2023-04-14

  • oli – 开源的终端AI编程助手,支持代码辅助与解释
    oli – 开源的终端AI编程助手,支持代码辅助与解释

    oli 是开源的智能代码助手,支持为开发者提供强大的编程支持。基于现代化的混合架构,结合 Rust 后端的高性能和 React Ink 前端的交互式终端界面。oli 支持多种云 API及本地语言模型(基于 Ollama)。

    AI教程资讯 2023-04-14

最新录入 更多+
确定