
前回記事では StyleGAN 2.0 と ADA で FID を 17.39 まで改善した話を書きました。今回は本編に載せきれなかった実装の比較的どうでもいい細部の話です。 …

前回記事(執筆のやる気がなさすぎて二年近くも開いている)では StyleGAN 1.0 でプリキュアの顔画像を生成しましたが、FID 80 というなんとも微妙な結果で終わりました。今回は StyleGAN 2.0 と Adaptive Discriminator Augmentation (ADA) を導入して、FID を 17.39 まで改善した話です。 …

画像生成の主戦場はすっかり拡散モデルですが、大学時代に作成していた「プリキュア StyleGAN」を紹介します。プロフィールアイコン程度に使える画像の生成を目標としていました。
最終形態(この記事よりもさらに追加で改善を実施)のリポジトリは以下です。 Chainer で出来ているので、保守作業がやや面倒なことになっていますが、ちゃんと動くはずです。 …

仕事上必要になり、OpenAI CLIP によるエンコーディングを使って画像分類をするロジスティック回帰モデルを作成していました。
反応位置を見るために、Grad-CAM を適用できそうだなと考えていたのですが、Grad-CAM は One-Hot エンコーディングによる出力を想定しているように見えるので、スカラー値で出力をする二項のロジスティック回帰だと、どう計算すれば良いか自明ではありませんでした(少なくとも私には)。 …

DiffBIR は、拡散過程に基づく画像復元モデルです。 Stable Diffusion の重みを利用しているようです。 …