手探りしてみる CV/ ML/ NN: 24日目 Flow Matchingを理解しようとしてみた2
Flow Matching実践編:テキストから点群を生成する はじめに 前回の記事では、Flow Matchingの理論的な基礎を深く掘り下げました。今回は、その理論を実践に移します。 やりたい...
29 search resultsShowing 1~20 results
You need to log-in
Flow Matching実践編:テキストから点群を生成する はじめに 前回の記事では、Flow Matchingの理論的な基礎を深く掘り下げました。今回は、その理論を実践に移します。 やりたい...
まとめ 1日目で言ってたテンソルの形を追ってネットを潜るのは非常に重要だと感じてます。大体のバグ・errorはテンソルの形の不一致で起こったりもします。テンソルの形というのはある意味機械学習にお...
離散データが“連続的な意味”を持ち始める 機械学習(ML)はしばしば「高度な数学」「深いネットワーク構造」といった難しいイメージがありますが、その根っこにある考え方はとてもシンプルです。 一言で...
続・手作りデータセットで学習させてみる 前回はデータセットとモデルを作成したので、今回は学習を行い評価をしようかと思ってます。 3. 学習ループ 学習はデータセットから取り出したデータをモデルに...
手作りデータセットで学習させてみる 前回は、PCA を使って • 離散データ(顔画像)が • 統計的な「連続空間」として扱えるようになる という話をしてきました。 ここではもう少し踏み込んで、実...
離散データが作る連続性 前回は、 • バラバラな離散データでも、大量に集まると • 連続的なパターン(確率分布)が浮かび上がり、 • それが ML の「モデル」になる という話をしました...
Flow Matching:ノイズからデータへの「まっすぐな道」を理解する はじめに Flow Matchingは、ノイズから画像を生成する新しいアプローチです。Diffusion Modelと...
tensorを形をみながらネットを潜ってみる話 このジャンルにおいて大きく大前提となってる考え方として、入力 -> 出力 と言ったものがあります。この入力と出力の間を行き来するものを大雑把...
VACEで現実的なワークフロー・自動処理を考えてみる 今回は番外編です。VACEには直接的には関わらないですが、VACEでのある程度現実的に実現可能なワークフローとその自動化を考えてみました。 ...
VACEの限界を探る: 矩形マスクは絶対なのか?キーフレーム補間のようなタスクは可能か? 今回はいくつかの実験を通じて、VACEの能力の限界と可能性を探りました。 結論から言うと、矩形マスクは必...
VACEを深掘りする話2 深掘り回の2回目です。今回はさらにコードベースで見ていこうと思ってます。 第1回を別側面から見た説明になります。内容としてはほぼ同じなのですが、もっとコード側から見た考...
VACEを深掘りする話1 画像/動画生成において成功例・失敗例をある程度経験則でわかっておくのは非常に有効だろうとは思うのですが、ここまでの流れでくれば、もちろん深掘りするしかないと思うのです。...
色々試してみる 前回 マスクはバウンディングボックスであるべきということがわかった。 今回は、そのほかの条件をどういうのがうまくいくのかを試してみようと思う。 スタート地点として(基本設定) 入...
動画生成モデルを使ってみる 動画生成モデルと言っても今は色々と出てきていて、そのタスクの種類によっても多種多様です。stable-video-diffusion に代表されるテキストプロンプトの...
Depth Anything V3 の backbone multi-view - local/globalでcross-view mixingを起こす これは 生成AIアドベントカレンダー16...
Depth Anything V3 - 深度推定から3D幾何理解へ この記事は生成AIアドベントカレンダー16日目の記事です。 gifアニメ 単眼深度推定モデルはいくつもあるけど、その中でもDe...
「点は具体的で曖昧、言葉は抽象的で明確」SAM3が解決した入力のパラドックス ここ何回で、DetectorやTrackerの実装詳細、そしてその役割分担を深掘りしてきました。 実装レベルでの理解...
情報ボトルネック作戦は成功したけど・・・ 3x3の代償 前回までで、3x3の極小ボトルネックを用いたFaceSwapモデルの設計と思想について語りました。「情報を絞ることでIdentityを捨て...
情報ボトルネックを超深掘りする話 - なぜ3x3は成功し、7x7は失敗したのか 前回(13日目 auto-encoderで自前のモデルを作る話2)、512x512への解像度拡大で予想外の問題に直...
512x512への挑戦 - 情報ボトルネックの罠 前回、256x256のFaceswap-AutoEncoderを設計しました。3x3というボトルネックによって情報を極限まで絞り込み、アイデンテ...
29 search resultsShowing 1~20 results
Qiita is a knowledge sharing service for engineers.