Cos'è la generazione di immagini AI? Comprendere il meccanismo e i principali servizi

Cos'è la generazione di immagini AI? Comprendere il meccanismo e i principali servizi | 杉山宣嗣

Perché la generazione di immagini tramite intelligenza artificiale blocca il cantiere

Penso che molte persone abbiano già incontrato la generazione di immagini AI.、Quando provo ad usarlo nella pratica, si ferma nello stesso punto.。

  • Anche se le istruzioni sono le stesse, i risultati non sono stabili.
  • L'output è completamente diverso a seconda del servizio.
  • Non so quale scegliere

Questa non è una questione di abilità。

La causa è、Non comprendere separatamente il meccanismo e la struttura del servizioです。

La generazione di immagini AI non è uno “strumento”、È un sistema che entra nel processo di produzione.。
Devo sistemare questa cosa prima.、Qualunque cosa usi, la riproducibilità non migliorerà.。


Perché i risultati variano (comprendere il meccanismo)

Struttura per generare immagini dal rumore

Molte delle attuali IA per la generazione di immagini、Funziona su un meccanismo chiamato modello di diffusione.。

Questo è、

  • Inizia con un rumore casuale
  • gradualmente trasformati in immagini

Questo è il processo。

In altre parole、Non stiamo creando un modulo completo dall'inizio.、
Converge stocasticamente ad uno “stato probabile”Soltanto。

Pertanto, in pratica、

  • Stesse istruzioni, risultati diversi
  • non può essere completamente riprodotto
  • Il compito è “avvicinarlo”

La premessa è questa。


I suggerimenti non sono “istruzioni” ma “ponderati”

L'immissione di testo (prompt) non è un'istruzione。

  • È più probabile che gli elementi scritti in modo forte vengano riflessi
  • Gli elementi deboli possono essere ignorati

In altre parole、Questo è
Piuttosto che specificare le condizioni、controllo della tendenzaです。

Se fraintendi questo、

  • È meglio scrivere a lungo
  • Più dettagli scrivi, più accurato sarà.

Credo di si.、In realtà è il contrario、
Progettare a cosa dare prioritàdiventa importante。


L'input dell'immagine è un "dispositivo di controllo"

Perché il testo da solo è instabile、Usa le immagini nella pratica。

Quando inserisci un'immagine、

  • La composizione è stabile
  • I colori corrispondono
  • i dettagli sono fissi

In altre parole、

  • Testo = Direzione
  • Immagine = Controllo

Il ruolo sarà。

Mi chiedo se sia possibile separare questi due、In pratica fa una grande differenza。


Differenza tra l'intelligenza artificiale di tipo cloud per la generazione di immagini e l'intelligenza artificiale locale

Questo è il primo ramo nella comprensione della generazione di immagini AI.。

Tuttavia, anziché "che è meglio"、
Differenze nella quantità di controllo richiestadovrebbe essere inteso come。


IA basata sul cloud:Meccanismo per produrre l'immagine completata

Cose rappresentative:

  • A metà viaggio
  • DALL-E
  • Adobe Firefly
  • Gemelli
  • ChatGPT
  • Grok et al.

Caratteristiche:

  • generato lato server
  • Alta qualità iniziale
  • Ottieni risultati subito

Comportamento in pratica:

  • Funziona anche con istruzioni vaghe
  • l'atmosfera è forte
  • Tuttavia, un controllo dettagliato è difficile

In termini di riprese、
Riprese in uno studio già ultimatoです。


IA locale:Meccanismo di controllo del processo produttivo

rappresentare:

  • Diffusione stabile

Caratteristiche:

  • Funziona su PC
  • Configurabile/personalizzabile
  • Può creare riproducibilità

Comportamento in pratica:

  • le condizioni possono essere fissate
  • Può riprodurre la stessa composizione
  • Forte nella produzione di massa

In termini di riprese、
Assemblare l'illuminazione e l'attrezzaturaです。

Esistono pochi tipi locali di IA per la generazione di immagini。


Cloud e locale hanno ruoli diversi

Questi due non sono in competizione。

In pratica è così suddiviso。

  • Nuvola → approssimativa/direzione/generazione iniziale
  • Locale → controllo/riproduzione/produzione di massa

Senza questa comprensione、

  • Errore durante il tentativo di produzione di massa nel cloud
  • È inefficiente creare informazioni approssimative a livello locale.

Si verifica una discrepanza.。


Differenze nei principali servizi (prospettiva pratica)

Non si tratta di "prestazioni" qui.、Differenze nella filosofia progettualeLo vedrò a。


A metà viaggio:creare una direzione

  • atmosfera forte
  • Orientato all'arte
  • Forte contro la generazione rude

utilizzo:

  • Esame visivo chiave
  • disegno del tono

DALL-E:Verificare le istruzioni

  • Testo di facile comprensione
  • Composizione stabile
  • Meno fallimenti

utilizzo:

  • Conferma le istruzioni
  • Disposizione compositiva

Adobe Firefly:Incorporare nella produzione

  • Collaborazione con gli strumenti di progettazione
  • Forte generazione parziale

utilizzo:

  • Aiuto per il ritocco
  • Lavori di sostituzione

Diffusione stabile:controllo e produzione di massa

  • Personalizzabile
  • riproducibile

utilizzo:

  • Produzione in serie di immagini del prodotto
  • Generazione di composizioni fisse

Quadro generale della generazione di immagini AI (flusso di produzione)

La generazione di immagini AI non è un'operazione autonoma、Utilizzato diversamente nel processo。

① Design approssimativo/direzionale

→ A metà viaggio

② Istruzioni/verifica della composizione

→ DALL-E

③ Collegamento alla produzione effettiva

→ Lucciola

④ Produzione/operazione di massa

→ Diffusione stabile

così、
I ruoli sono divisi nel processo produttivoè la realtà。


Modelli di fallimento comuni

Questi tre sono i più comuni nella pratica.。

① Prova a fare tutto con un unico servizio

→ Ci sarà sempre un limite

② Prova a risolvere il problema utilizzando le istruzioni

→ Il controllo si ottiene attraverso la struttura.

③ Usalo immediatamente per la produzione di produzione

→ Il processo di verifica viene saltato.

In termini di riprese、

  • Produzione senza test
  • Il tutto supportato da apparecchiature fisse

è nello stesso stato di。


Connettere la produzione umana e l’intelligenza artificiale

Sistemerò la cosa alla fine。

L'intelligenza artificiale è responsabile

  • generazione grezza
  • Verifica della composizione
  • Sviluppo della variazione

Responsabile per le persone

  • progettazione concettuale
  • giudizio sul marchio
  • qualità finale

Solo dopo che questa separazione è stata raggiunta、
L’intelligenza artificiale sarà incorporata nella produzione。


riepilogo:Comprendere la generazione di immagini AI in termini di struttura

Ci sono tre punti da comprendere sulla generazione di immagini AI.。

  • Come funziona (perché si rompe)
  • Servizio (perché diverso)
  • Processo (dove utilizzarlo)

Se premi questo、

  • Non preoccuparti della scelta degli strumenti
  • Migliora la riproducibilità
  • Può essere incorporato nella produzione

Sembrerà così。

La generazione di immagini AI non è una tecnologia、
Elementi di progettazione del processo produttivoです。

Se riesci a capire fin qui、
Sarà pronto per l'uso pratico per la prima volta.。

▶︎ [Ambiente richiesto per la generazione di immagini AI | Differenza tra AI cloud e AI locale]

▶︎ [La generazione di immagini AI dipende dalle prestazioni del PC | Differenze tra ambienti Mac e Windows]

▶︎ [La GPU è necessaria per la generazione di immagini AI? Differenza da CPU e ruolo]