KitanaYapay Zeka Fotoğraf & Video
Fotoğraf Aracı · 4 dk okuma

Yapay Zeka ile Görsel Oluşturma: Metinden Görsele Nasıl Çalışır?

Yapay zeka ile görsel oluşturmanın matematiksiz anlatımı: model ne öğrendi, aynı komut neden asla aynı resmi vermiyor ve bunun komut yazmak için anlamı ne.

Kitana ekibi
YZFOTOĞRAF ARACI

Yapay zeka ile görsel oluşturma, bu alanda yaygın zihinsel modelin en yanlış olduğu kısım ve yanlış model doğrudan kötü komutlara yol açıyor. Bu yüzden doğru anlamaya değer.

Hiçbir şey aramıyor

En yaygın varsayım, modelin devasa bir görsel kütüphanesi olduğu ve kelimelerinize uyanları birbirine diktiği. Öyle değil. Kütüphane yok.

Sahip olduğu şey, çok sayıda görsel ve açıklama çiftine bakarak kurulmuş, dil ile görsel yapı arasındaki öğrenilmiş ilişkiler. "Golden retriever" ifadesinin belirli bir şekil düzeni, tüy dokusu ve renkle birlikte görüldüğünü öğrendi; "gün batımında" ifadesinin uzun gölgeler ve sıcak, alçak ışıkla birlikte görüldüğünü öğrendi.

Ona bir komut verdiğinizde bir şey getirmiyor. Bu öğrenilmiş ilişkileri karşılayan pikseller üretiyor. Hiç fotoğraflanmamış bir şeyi çizebilmesinin ve hatırladığınız bir resmi bulmasını isteyememenizin nedeni bu.

Resim aslında nasıl ortaya çıkıyor

Tekniğin adı difüzyon ve sezgisi adından daha basit.

Eğitim sırasında modele bir görsel gösterildi, üstüne biraz rastgele gürültü eklendi, sonra daha fazla, sonra daha fazla; ta ki görsel saf karlanmaya dönene kadar. Model bunu geriye doğru çalıştırmayı öğrendi: gürültülü bir görsel verildiğinde, biraz daha az gürültülü hâlinin neye benzediğini tahmin etmeyi.

Üretmek için saf rastgele gürültüden başlar ve öğrendiği bu adımı tekrar tekrar uygular; yirmi, otuz, elli kez. Her seferinde biraz gürültü kaldırır ve tutarlı bir şeye doğru ilerler. Komutunuz her adımı yönlendirir, sonucu kelimelerinizin çağrıştırdığı ilişkilere doğru iter.

Görsel, sisin içinden bir şeklin belirmesi gibi ortaya çıkar: fırça darbesi fırça darbesi çizilmez, bir bütün olarak, yavaş yavaş netleşir.

Bundan hemen iki sonuç çıkar.

Aynı komut farklı görseller verir. Farklı başlangıç gürültüsü, farklı yol, farklı varış noktası. Bu bir hata değil ve yaklaşılmaya çalışılan "doğru" bir çıktı yok.

Hiçbir şey getirilmediği için hiçbir şey garanti değil. Model kelimeleriniz için makul bir şey üretir. Makul, doğru demek değil; üretilen yazının anlamsız, üretilen ellerin güvenilmez olmasının nedeni bu.

Bunun komutlar için anlamı

Model kelimeler ile görsel yapı arasındaki öğrenilmiş ilişkileri eşleştiriyorsa, iyi bir komut güçlü görsel çağrışımları olan kelimelerden oluşan komuttur.

İşe yarar: somut, görünür şeyler:

  • "Göl kenarında cam bir sera, sabah sisi, yumuşak ışık"
  • "Ahşap bir masanın tepeden görünümü, dağınık pirinç aletler, sıcak lamba ışığı"
  • "Taş duvar üzerinde yıpranmış halat, yakın çekim, sığ alan derinliği"

İşe yaramaz: görsel karşılığı olmayan yargılar:

  • "Muhteşem başyapıt, 8k, ödüllü, en iyi kalite"
  • "Güzel ve profesyonel"

İkinci grup yardımcı olacakmış gibi hissettirir ve çoğu insan oradan başlar. Ama "ödüllü" ifadesinin tutarlı bir görsel biçimi yok; her türde ve her tarzda açıklamalarda geçti, bu yüzden hiçbir şeyi yönlendirmez. Daha kötüsü, tarif edilebilir bir detayın kullanabileceği dikkati işgal eder.

Zayıf bir komutta yapılabilecek en faydalı düzenleme, resimde parmağınızla gösterebileceğiniz bir şeyi tarif etmeyen her sıfatı silmek.

Bir komutu adım adım kurmak

Yukarıdakileri pratiğe dökmenin en kolay yolu, komutu her seferinde aynı sırayla kurmak.

  1. Konu. Karede ne var? "Eski bir bisiklet", "bir fincan kahve", "sisli bir liman". Tek bir cümle, tek bir ana konu.
  2. Mekân ve bağlam. Nerede duruyor? "Taş döşeli dar bir sokakta", "pencere kenarındaki ahşap bir masada".
  3. Işık. Günün hangi saati, ışık nereden geliyor? "Öğleden sonra, soldan gelen alçak güneş" ifadesi "güzel ışık" ifadesinden kat kat fazla iş görür.
  4. Kamera. Yakın çekim mi, geniş açı mı, tepeden mi? Bu kelimelerin görsel karşılığı güçlüdür.
  5. Tarz, gerekiyorsa. Fotoğraf mı, suluboya mı, düz illüstrasyon mu? Bir sanatçının adı yerine tarzın görsel özelliklerini yazın.

Sonra üretin, sonucu okuyun ve yalnızca tek bir şeyi değiştirip tekrar deneyin. Aynı anda üç kelimeyi değiştirirseniz hangisinin işe yaradığını öğrenemezsiniz. Beğendiğiniz bir sonuç çıkarsa hemen indirin; aynı komut bir daha aynı resmi vermeyecek.

Hâlâ güvenilmez olan kısımlar

  • Yazı. Harf biçimleri model için dil değil, görsel kalıp. Kısa kelimeler bazen tutar; cümleler tutmaz.
  • Eller ve parmaklar. İyileşiyor, hâlâ en yaygın ipucu.
  • Sayma. "Beş kuş" güvenilir biçimde üç ile sekiz arası bir şey üretir.
  • Mekânsal ilişkiler. "Kitabın solundaki fincan" gevşek biçimde uygulanır.
  • Olgusal her şey. Olgu bilmez, yalnızca çağrışım bilir.

Bunlar yanlış yaptığınız ayarlar değil. Modelin çalışma biçiminin sonuçları ve hiçbir komut mühendisliği onları tamamen çözmüyor.

Düzenleme araçlarının yanında yeri

Metinden görsel, hiçten bir şey yaratır. Diğer araçlar elinizdeki bir fotoğrafı alıp değiştirir. Farklı işler ve hangisine ihtiyacınız olduğunu netleştirmeye değer: fotoğraf arka planı değiştirme konunuzu korur, metinden üretmek korumaz.

Sizin farklı bir tarzdaki görselinizi istiyorsanız bu yeniden stillendirme ya da avatar işidir, metinden görsel değil; yöntemi fotoğrafı anime yapma yazısında anlatıyoruz. Bir komut yüzünüzü üretemez, çünkü yüzünüz öğrendiği çağrışımlardan biri değil.

Metinden görsel, Kitana'nın tarayıcı stüdyosundaki dört araçtan biri; hiç fotoğraf gerektirmeyen tek araç olduğu için komutların nasıl davrandığını görmenin en kolay yeri. Diğer on üç fotoğraf aracı uygulamalarda.

Sık sorulan sorular

Model görsel arayıp onları birleştiriyor mu?
Hayır. Aranacak bir görsel veritabanı yok. Model öğrenilmiş kalıplar, yani kelimeler ile görsel yapı arasındaki istatistiksel ilişkiler taşır ve her seferinde yeni pikseller üretir. Bu yüzden belirli bir fotoğrafı bulmasını isteyemezsiniz ve bu yüzden hiç var olmamış şeyler üretebilir.
Aynı komuttan neden farklı bir resim alıyorum?
Üretim rastgele gürültüyle başlar ve onu adım adım inceltir. Farklı bir başlangıç gürültüsü, farklı bir yoldan farklı bir makul görsele gider. Çoğu araç bunu seed olarak sunar; seed'i ve komutu sabitlemek tekrarlanabilir bir sonuç verir.
Üretilen görsellerdeki yazılar neden hep yanlış?
Model yazının neye benzediğini öğrendi, ne dediğini değil. Harf biçimleri onun için görsel kalıplardır ve yazının dokusunu altındaki kurallar olmadan yeniden üretir. Yeni modeller kısa kelimelerde daha iyi, cümlelerde hâlâ güvenilmez.
Uzun komutlar daha mı iyi çalışır?
Bir noktaya kadar. Belirli görsel detay yardımcı olur; sıfat yığmak olmaz. Bir komut sabit miktarda dikkat için yarışır, bu yüzden görünür bir şeyi tarif etmeyen her kelime, tarif edenleri sulandırır.
Ürettiğim görselin sahibi kim?
Henüz netleşmedi ve ülkeden ülkeye değişiyor. ABD Telif Hakkı Ofisi, insan yaratıcılığı içermeyen eserlerin telif hakkıyla korunamayacağına karar verdi; bu da yalnızca komutla üretilmiş görselleri belirsiz bir zemine koyuyor. Kullandığınız aracın koşullarına bakın ve münhasırlık varsaymayın.
Belirli bir sanatçının tarzını kopyalayabilir mi?
Eğitim sırasında gördüğü tarzlara yaklaşabilir ve birçok araç artık yaşayan sanatçıların adını kullanmayı kısıtlıyor. Bunun kabul edilebilir olup olmadığı tartışmalı ve ülkeye göre değişiyor; pratik tavsiye, bir kişinin adını ödünç almak yerine istediğiniz görsel özellikleri tarif etmek.

Uygulamaya dökmeye hazır mısınız?

Bu rehbere uyan araçla Kitana'da üretin.

Metinden görsel oluşturun

Kendiniz denemeye hazır mısınız?

Kitana'yı indirin ve ilk yapay zeka fotoğrafınızı bir dakikadan kısa sürede oluşturun.