AI u Srbiji i regionu

NVIDIA i Hugging Face omogućili širi fine-tuning difuzionih modela kroz NeMo Automodel

Foto: Unsplash

Hugging Face i NVIDIA predstavili su integraciju koja omogućava fine-tuning difuzionih modela za slike i video na većem broju grafičkih procesora, bez ručnog prebacivanja checkpointova i bez prepisivanja modela za svaki novi slučaj.

Reč je o povezivanju biblioteke NVIDIA NeMo Automodel sa ekosistemom Diffusers, popularnim otvorenim alatom za rad sa difuzionim modelima. Prema navodima iz objave, cilj je da istraživači i timovi koji grade AI alate dobiju jedinstven radni tok za trening, adaptaciju i generisanje sadržaja, uz podršku za modele koji su već dostupni na Hugging Face Hub-u.

Šta donosi NeMo Automodel

NVIDIA opisuje NeMo Automodel kao open-source PyTorch biblioteku zasnovanu na DTensor pristupu za raspodeljeni trening. U praksi, to znači da se isti recept može koristiti i na jednom GPU-u i na velikom klasteru, uz izbor paralelizacije kroz konfiguraciju, a ne kroz prepisivanje koda.

  • direktno učitavanje Diffusers modela sa Hugging Face Hub-a
  • podrška za različite oblike paralelizacije, uključujući FSDP2, tensor, context i pipeline paralelizaciju
  • povratak fine-tunovanih checkpointova nazad u Diffusers format
  • podrška za full fine-tuning i LoRA pristup, odnosno Low-Rank Adaptation, efikasniji oblik prilagođavanja modela

U objavi se navodi i da Automodel trenutno podržava samo flow-matching modele, dok se za ubrzanje koristi trening u latentnom prostoru, keširanje podataka i grupisanje po rezolucijama.

Koji modeli su trenutno obuhvaćeni

U tekstu je navedeno nekoliko modela za koje već postoje gotovi recepti za fine-tuning. Među njima su FLUX.1-dev i FLUX.2-dev za generisanje slika, Wan 2.1 i Wan 2.2 za tekst-u-video, HunyuanVideo 1.5 i Qwen-Image.

Za pojedine modele objava navodi i okvirne dimenzije. Na primer, Wan 2.1 T2V 1.3B može da stane na jedan NVIDIA A100 od 40 GB, dok su veći modeli, poput FLUX.2-dev od 32 milijarde parametara, namenjeni zahtevnijim konfiguracijama.

Šta korisnici dobijaju ovom integracijom

Prema NVIDIA i Hugging Face, glavna praktična korist je to što korisnici više ne moraju da konvertuju modele između različitih formata. Fine-tuned verzija može direktno da se koristi kroz Diffusers pipeline, a to olakšava i dalje korišćenje alata kao što su kvantizacija, LoRA adapteri i prilagođeni sampleri.

Druga prednost je lakše uvođenje novih modela. Kada se novi difuzioni model pojavi u Diffusers ekosistemu, za Automodel je, prema autorima, dovoljno dodati manji deo koda za obradu podataka i adapter modela, umesto pisanja potpuno nove trening skripte.

Integracija je dostupna kroz otvorenu dokumentaciju, a projekat je objavljen pod Apache 2.0 licencom.

Primer fine-tuninga na tarot datasetu

Objava prikazuje i praktičan primer: fine-tuning modela FLUX.1-dev na skupu od 78 tarot karata iz Rider–Waite kolekcije. Kao priprema, dataset se prvo enkodira u keširane VAE latent reprezentacije i tekstualne embeddinge, umesto da se slike kodiraju u svakom trening koraku.

Zatim se koristi postojeći YAML recept za FLUX, uz komandne override vrednosti. U opisanom run-u korišćeno je osam GPU-ova, efektivna veličina batch-a od 32 i 200 koraka treninga. Model je, prema navodima, učio stil povezan sa trigger tokenom trtcrd.

Pri generisanju slike, isti checkpoint je korišćen sa i bez trigger tokena. Kada je token prisutan, generisani izlazi zadržavaju sadržaj prompta, ali dobijaju vintage paletu, tamne konture i kompoziciju nalik tarot karti. Bez triggera, model ostaje bliži originalnom, fotografskom izgledu.

Izmerene performanse na H100 sistemu

Autori navode da su merenja prikupljena na jednom čvoru sa osam NVIDIA H100 80GB GPU-ova. Rezultati su prikazani kao srednja vrednost uz standardnu devijaciju na osnovu tri stabilna prozora od po 10 koraka.

U tabelama su upoređeni full fine-tuning i LoRA režimi za modele slike i video. Na primer, za FLUX.1-dev pri treningu slika sa rezolucijom 512×512 zabeležen je korak od oko 0,9 sekundi, dok je za Wan 2.1 14B pri video treningu vreme koraka oko 3,8 sekundi u full režimu, uz aktiviran checkpointing.

Važno je da se ove vrednosti odnose na konkretno okruženje i datasetove koje su autori koristili, pa ih treba čitati kao referencu, a ne kao univerzalnu garanciju performansi.

Zašto je ova integracija bitna

Za timove koji rade sa otvorenim modelima, ova integracija smanjuje razliku između eksperimentisanja i produkcijskog treninga. Umesto odvojenih alata za svaku arhitekturu, moguće je koristiti zajednički pristup za više modela slika i videa, uz isti tok rada za pripremu podataka, trening i generisanje.

Za korisnike u Srbiji i regionu to je posebno korisno ako rade na lokalnim AI projektima, vizuelnim alatima, internim prototipovima ili komercijalnim servisima koji moraju da ostanu u open-source ekosistemu. Najveća praktična vrednost je u tome što se smanjuje količina ručnog inženjerskog posla oko prilagođavanja modela.

NVIDIA najavljuje i sledeći korak: Python API za iste recepte, kako bi se pored YAML konfiguracija dobio i programatski pristup iz postojećeg koda i notebokova.

Šta je dostupno odmah

  • NeMo Automodel repozitorijum na GitHub-u
  • vodič za diffusion fine-tuning
  • dokumentacija za pripremu diffusion datasetova
  • postojeći primeri za full fine-tuning i LoRA

Za one koji već rade sa Diffusers modelima, poruka ove objave je jasna: fine-tuning više nije vezan za jedan model ili jednu veličinu sistema, već za širi, standardizovan proces koji može da se prilagodi različitim potrebama.