一区二区三区三上|欧美在线视频五区|国产午夜无码在线观看视频|亚洲国产裸体网站|无码成年人影视|亚洲AV亚洲AV|成人开心激情五月|欧美性爱内射视频|超碰人人干人人上|一区二区无码三区亚洲人区久久精品

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫(xiě)文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

GPT-3、Stable Diffusion一起助攻,讓模型聽(tīng)懂甲方修圖需求

智能感知與物聯(lián)網(wǎng)技術(shù)研究所 ? 來(lái)源:智能感知與物聯(lián)網(wǎng)技術(shù)研 ? 作者:智能感知與物聯(lián)網(wǎng) ? 2022-11-21 11:57 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

AI 可以完全按照甲方意愿修圖?GPT-3、Stable Diffusion 一起助攻,讓模型秒變 PS 高手,改圖隨心所欲。

擴(kuò)散模型大火之后,很多人將注意力放到了如何利用更有效的 prompt 生成自己想要的圖像。在對(duì)于一些 AI 作畫(huà)模型的不斷嘗試中,人們甚至總結(jié)出了讓 AI 好好出圖的關(guān)鍵詞經(jīng)驗(yàn):

9b0c2b0e-68e0-11ed-8abf-dac502259ad0.jpg

也就是說(shuō),如果掌握了正確的 AI 話術(shù),作圖質(zhì)量提升效果將非常明顯(參見(jiàn):《「羊駝打籃球」怎么畫(huà)?有人花了 13 美元逼 DALL·E 2 亮出真本事 》)。

此外,還有一部分研究者在往另一個(gè)方向努力:如何動(dòng)動(dòng)嘴皮子就把一幅畫(huà)改成我們想要的樣子。

前段時(shí)間,我們報(bào)道了一項(xiàng)來(lái)自谷歌研究院等機(jī)構(gòu)的研究。只要說(shuō)出你想讓一幅圖變成什么樣子,它就能基本滿足你的要求,生成照片級(jí)的圖像,例如讓一只小狗坐下:

9b1bd0f4-68e0-11ed-8abf-dac502259ad0.png

這里給模型的輸入描述是「一只坐下的狗」,但是按照人們的日常交流習(xí)慣,最自然的描述應(yīng)該是「讓這只狗坐下」。有研究者認(rèn)為這是一個(gè)應(yīng)該優(yōu)化的問(wèn)題,模型應(yīng)該更符合人類(lèi)的語(yǔ)言習(xí)慣。

最近,來(lái)自 UC 伯克利的研究團(tuán)隊(duì)提出了一種根據(jù)人類(lèi)指令編輯圖像的新方法 InstructPix2Pix:給定輸入圖像和告訴模型要做什么的文本描述,模型就能遵循描述指令來(lái)編輯圖像。

9b87dce0-68e0-11ed-8abf-dac502259ad0.png

論文地址:https://arxiv.org/pdf/2211.09800.pdf

例如,要把畫(huà)中的向日葵換成玫瑰,你只需要直接對(duì)模型說(shuō)「把向日葵換成玫瑰」:

9b992ebe-68e0-11ed-8abf-dac502259ad0.png

為了獲得訓(xùn)練數(shù)據(jù),該研究將兩個(gè)大型預(yù)訓(xùn)練模型——語(yǔ)言模型 (GPT-3) 和文本到圖像生成模型 (Stable Diffusion) 結(jié)合起來(lái),生成圖像編輯示例的大型成對(duì)訓(xùn)練數(shù)據(jù)集。研究者在這個(gè)大型數(shù)據(jù)集上訓(xùn)練了新模型 InstructPix2Pix,并在推理時(shí)泛化到真實(shí)圖像和用戶編寫(xiě)的指令上。

InstructPix2Pix 是一個(gè)條件擴(kuò)散模型,給定一個(gè)輸入圖像和一個(gè)編輯圖像的文本指令,它就能生成編輯后的圖像。該模型直接在前向傳播(forward pass)中執(zhí)行圖像編輯,不需要任何額外的示例圖像、輸入 / 輸出圖像的完整描述或每個(gè)示例的微調(diào),因此該模型僅需幾秒就能快速編輯圖像。

盡管 InstructPix2Pix 完全是在合成示例(即 GPT-3 生成的文本描述和 Stable Diffusion 生成的圖像)上進(jìn)行訓(xùn)練的,但該模型實(shí)現(xiàn)了對(duì)任意真實(shí)圖像和人類(lèi)編寫(xiě)文本的零樣本泛化。該模型支持直觀的圖像編輯,包括替換對(duì)象、更改圖像風(fēng)格等等。

9bb17bea-68e0-11ed-8abf-dac502259ad0.png

方法概覽

研究者將基于指令的圖像編輯視為一個(gè)監(jiān)督學(xué)習(xí)問(wèn)題:首先,他們生成了一個(gè)包含文本編輯指令和編輯前后圖像的成對(duì)訓(xùn)練數(shù)據(jù)集(圖 2a-c),然后在這個(gè)生成的數(shù)據(jù)集上訓(xùn)練了一個(gè)圖像編輯擴(kuò)散模型(圖 2d)。盡管訓(xùn)練時(shí)使用的是生成的圖像和編輯指令,但模型仍然能夠使用人工編寫(xiě)的任意指令來(lái)編輯真實(shí)的圖像。下圖 2 是方法概述。

9bf20a52-68e0-11ed-8abf-dac502259ad0.png

生成一個(gè)多模態(tài)訓(xùn)練數(shù)據(jù)集

在數(shù)據(jù)集生成階段,研究者結(jié)合了一個(gè)大型語(yǔ)言模型(GPT-3)和一個(gè)文本轉(zhuǎn)圖像模型(Stable Diffusion)的能力,生成了一個(gè)包含文本編輯指令和編輯前后對(duì)應(yīng)圖像的多模態(tài)訓(xùn)練數(shù)據(jù)集。這一過(guò)程包含以下步驟:

微調(diào) GPT-3 以生成文本編輯內(nèi)容集合:給定一個(gè)描述圖像的 prompt,生成一個(gè)描述要進(jìn)行的更改的文本指令和一個(gè)描述更改后圖像的 prompt(圖 2a);

使用文本轉(zhuǎn)圖像模型將兩個(gè)文本 prompt(即編輯之前和編輯之后)轉(zhuǎn)換為一對(duì)對(duì)應(yīng)的圖像(圖 2b)。

InstructPix2Pix

研究者使用生成的訓(xùn)練數(shù)據(jù)來(lái)訓(xùn)練一個(gè)條件擴(kuò)散模型,該模型基于 Stable Diffusion 模型,可以根據(jù)書(shū)面指令編輯圖像。

擴(kuò)散模型學(xué)習(xí)通過(guò)一系列估計(jì)數(shù)據(jù)分布分?jǐn)?shù)(指向高密度數(shù)據(jù)的方向)的去噪自編碼器來(lái)生成數(shù)據(jù)樣本。Latent diffusion 通過(guò)在預(yù)訓(xùn)練的具有編碼器9c0d0816-68e0-11ed-8abf-dac502259ad0.jpg和解碼器9c212774-68e0-11ed-8abf-dac502259ad0.png的變分自編碼器的潛空間中操作來(lái)提高擴(kuò)散模型的效率和質(zhì)量。

對(duì)于一個(gè)圖像 x,擴(kuò)散過(guò)程向編碼的 latent9c30754e-68e0-11ed-8abf-dac502259ad0.png 中添加噪聲,它產(chǎn)生一個(gè)有噪聲的 latent z_t,其中噪聲水平隨時(shí)間步 t∈T 而增加。研究者學(xué)習(xí)一個(gè)網(wǎng)絡(luò)9c47b45c-68e0-11ed-8abf-dac502259ad0.png,它在給定圖像調(diào)節(jié) C_I 和文本指令調(diào)節(jié) C_T 的情況下,預(yù)測(cè)添加到帶噪 latent z_t 中的噪聲。研究者將以下 latent 擴(kuò)散目標(biāo)最小化:

9c56efc6-68e0-11ed-8abf-dac502259ad0.png

此前,曾有研究(Wang et al.)表明,對(duì)于圖像翻譯(image translation)任務(wù),尤其是在成對(duì)訓(xùn)練數(shù)據(jù)有限的情況下,微調(diào)大型圖像擴(kuò)散模型優(yōu)于從頭訓(xùn)練。因此在新研究中,作者使用預(yù)訓(xùn)練的 Stable Diffusion checkpoint 初始化模型的權(quán)重,利用其強(qiáng)大的文本到圖像生成能力。

為了支持圖像調(diào)節(jié),研究人員向第一個(gè)卷積層添加額外的輸入通道,連接 z_t 和9c6c4e84-68e0-11ed-8abf-dac502259ad0.png。擴(kuò)散模型的所有可用權(quán)重都從預(yù)訓(xùn)練的 checkpoint 初始化,同時(shí)在新添加的輸入通道上運(yùn)行的權(quán)重被初始化為零。作者在這里重用最初用于 caption 的相同的文本調(diào)節(jié)機(jī)制,而沒(méi)有將文本編輯指令 c_T 作為輸入。

實(shí)驗(yàn)結(jié)果

在下面這些圖中,作者展示了他們新模型的圖像編輯結(jié)果。這些結(jié)果針對(duì)一組不同的真實(shí)照片和藝術(shù)品。新模型成功地執(zhí)行了許多具有挑戰(zhàn)性的編輯,包括替換對(duì)象、改變季節(jié)和天氣、替換背景、修改材料屬性、轉(zhuǎn)換藝術(shù)媒介等等。

9c7d6070-68e0-11ed-8abf-dac502259ad0.png

9c9c2c30-68e0-11ed-8abf-dac502259ad0.png

9cbfe2ec-68e0-11ed-8abf-dac502259ad0.png

9d0131f2-68e0-11ed-8abf-dac502259ad0.png

研究人員將新方法與最近的一些技術(shù),如 SDEdit、Text2Live 等進(jìn)行了比較。新模型遵循編輯圖像的說(shuō)明,而其他方法(包括基準(zhǔn)方法)需要對(duì)圖像或編輯層進(jìn)行描述。因此在比較時(shí),作者對(duì)后者提供「編輯后」的文本標(biāo)注代替編輯說(shuō)明。作者還把新方法和 SDEdit 進(jìn)行定量比較,使用兩個(gè)衡量圖像一致性和編輯質(zhì)量的指標(biāo)。最后,作者展示了生成訓(xùn)練數(shù)據(jù)的大小和質(zhì)量如何影響模型性能的消融結(jié)果。

9d37cba4-68e0-11ed-8abf-dac502259ad0.png

9d656320-68e0-11ed-8abf-dac502259ad0.png

審核編輯 :李倩

聲明:本文內(nèi)容及配圖由入駐作者撰寫(xiě)或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 圖像
    +關(guān)注

    關(guān)注

    2

    文章

    1094

    瀏覽量

    41240
  • AI
    AI
    +關(guān)注

    關(guān)注

    88

    文章

    35109

    瀏覽量

    279595
  • 模型
    +關(guān)注

    關(guān)注

    1

    文章

    3519

    瀏覽量

    50411

原文標(biāo)題:GPT-3、Stable Diffusion一起助攻,讓模型聽(tīng)懂甲方修圖需求

文章出處:【微信號(hào):tyutcsplab,微信公眾號(hào):智能感知與物聯(lián)網(wǎng)技術(shù)研究所】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評(píng)論

    相關(guān)推薦
    熱點(diǎn)推薦

    ?Diffusion生成式動(dòng)作引擎技術(shù)解析

    Diffusion生成式動(dòng)作引擎 Diffusion生成式動(dòng)作引擎是種基于擴(kuò)散模型Diffusion Models)的生成式人工智能技術(shù)
    的頭像 發(fā)表于 03-17 15:14 ?1815次閱讀

    使用OpenVINO GenAI和LoRA適配器進(jìn)行圖像生成

    借助生成式 AI 模型(如 Stable Diffusion 和 FLUX.1),用戶可以將平平無(wú)奇的文本提示詞轉(zhuǎn)換為令人驚艷的視覺(jué)效果。
    的頭像 發(fā)表于 03-12 13:49 ?841次閱讀
    使用OpenVINO GenAI和LoRA適配器進(jìn)行圖像生成

    為什么Caffe模型可以直接與OpenVINO?工具套件推斷引擎API一起使用,而無(wú)法轉(zhuǎn)換為中間表示 (IR)?

    推斷 Caffe 模型直接基于 英特爾? 神經(jīng)電腦棒 2 (英特爾? NCS2)。 無(wú)法確定為什么 Caffe 模型可以直接與OpenVINO?工具套件推斷引擎 API 一起使用,而無(wú)法轉(zhuǎn)換為中間表示 (IR)。
    發(fā)表于 03-05 06:31

    OpenAI即將推出GPT-5模型

    先進(jìn)技術(shù),其中包括備受矚目的o3工具。通過(guò)整合這些技術(shù),GPT-5模型將實(shí)現(xiàn)更加強(qiáng)大的功能和性能。 值得提的是,GPT-5
    的頭像 發(fā)表于 02-13 11:21 ?584次閱讀

    AN-166:與Linduino一起飛行中更新

    電子發(fā)燒友網(wǎng)站提供《AN-166:與Linduino一起飛行中更新.pdf》資料免費(fèi)下載
    發(fā)表于 01-12 10:09 ?0次下載
    AN-166:與Linduino<b class='flag-5'>一起</b>飛行中更新

    將UCC39002與3個(gè)PT4484模塊一起使用

    電子發(fā)燒友網(wǎng)站提供《將UCC39002與3個(gè)PT4484模塊一起使用.pdf》資料免費(fèi)下載
    發(fā)表于 12-21 10:23 ?0次下載
    將UCC39002與<b class='flag-5'>3</b>個(gè)PT4484模塊<b class='flag-5'>一起</b>使用

    如何開(kāi)啟Stable Diffusion WebUI模型推理部署

    如何開(kāi)啟Stable Diffusion WebUI模型推理部署
    的頭像 發(fā)表于 12-11 20:13 ?557次閱讀
    如何開(kāi)啟<b class='flag-5'>Stable</b> <b class='flag-5'>Diffusion</b> WebUI<b class='flag-5'>模型</b>推理部署

    深信服發(fā)布安全GPT4.0數(shù)據(jù)安全大模型

    近日,深信服在數(shù)據(jù)安全領(lǐng)域邁出了重要步,正式發(fā)布了安全GPT4.0數(shù)據(jù)安全大模型。這創(chuàng)新的大模型技術(shù),旨在為用戶提供更高效、精準(zhǔn)的數(shù)據(jù)安
    的頭像 發(fā)表于 10-29 11:12 ?611次閱讀

    Llama 3GPT-4 比較

    隨著人工智能技術(shù)的飛速發(fā)展,我們見(jiàn)證了代又代的AI模型不斷突破界限,為各行各業(yè)帶來(lái)革命性的變化。在這場(chǎng)技術(shù)競(jìng)賽中,Llama 3GPT
    的頭像 發(fā)表于 10-27 14:17 ?1149次閱讀

    英偉達(dá)預(yù)測(cè)機(jī)器人領(lǐng)域或迎“GPT-3時(shí)刻”

    未來(lái)2-3年內(nèi),機(jī)器人基礎(chǔ)模型的研究將迎來(lái)重大突破,這時(shí)刻被形象地比喻為機(jī)器人領(lǐng)域的“GPT-3時(shí)刻”。
    的頭像 發(fā)表于 09-20 17:05 ?1073次閱讀

    Jim Fan展望:機(jī)器人領(lǐng)域即將迎來(lái)GPT-3式突破

    英偉達(dá)科學(xué)家9月19日,科技媒體The Decoder發(fā)布了則引人關(guān)注的報(bào)道,英偉達(dá)高級(jí)科學(xué)家Jim Fan在近期預(yù)測(cè),機(jī)器人技術(shù)將在未來(lái)兩到三年內(nèi)迎來(lái)類(lèi)似GPT-3在語(yǔ)言處理領(lǐng)域的革命性突破,他稱之為機(jī)器人領(lǐng)域的“GPT-3
    的頭像 發(fā)表于 09-19 15:13 ?942次閱讀

    Pura 70系列AI大師再上新!小藝AI擴(kuò)開(kāi)啟魔幻新體驗(yàn)

    在智能手機(jī)攝影日漸火熱的今天,我們對(duì)于手機(jī)影像能力的要求也更加精細(xì)。此前,HUAWEI Pura 70系列的小藝AI消除功能經(jīng)首發(fā)上線,便廣受關(guān)注和喜愛(ài),為滿足大家日益多元化的需求
    的頭像 發(fā)表于 08-01 13:22 ?1463次閱讀

    普通門(mén)電路的輸出端能否連在一起

    普通門(mén)電路的輸出端能否連在一起,取決于具體的應(yīng)用場(chǎng)景和需求。普通門(mén)電路的輸出端能否連在一起個(gè)復(fù)雜的問(wèn)題,涉及到數(shù)字電路設(shè)計(jì)、邏輯電路分析、信號(hào)完整性、電源管理等多個(gè)方面。 門(mén)電路的
    的頭像 發(fā)表于 07-30 15:13 ?1807次閱讀

    實(shí)操: 如何在AirBox上跑Stable Diffusion 3

    StableDiffusion3Medium是種多模態(tài)擴(kuò)散變換器(MMDiT)文本到圖像模型,在圖像質(zhì)量、排版、復(fù)雜提示理解和資源效率方面具有顯著提升的性能。目前瑞莎團(tuán)隊(duì)
    的頭像 發(fā)表于 07-23 08:34 ?588次閱讀
    實(shí)操: 如何在AirBox上跑<b class='flag-5'>Stable</b> <b class='flag-5'>Diffusion</b> <b class='flag-5'>3</b>

    OpenAI 推出 GPT-4o mini 取代GPT 3.5 性能超越GPT 4 而且更快 API KEY更便宜

    GPT-4. GPT-4o mini的定價(jià)為每百萬(wàn)輸入標(biāo)記15美分和每百萬(wàn)輸出標(biāo)記60美分,比之前的前沿模型便宜了個(gè)數(shù)量級(jí),比GPT-3.
    的頭像 發(fā)表于 07-21 10:20 ?1676次閱讀
    OpenAI 推出 <b class='flag-5'>GPT</b>-4o mini 取代<b class='flag-5'>GPT</b> 3.5 性能超越<b class='flag-5'>GPT</b> 4 而且更快 API KEY更便宜