【前編:データセット作成】OpenAIの新OSSモデル:Privacy Filter を日本語+リハビリ医療文書にファインチューニングしてみた
はじめに:GWの宿題、進捗報告です 前回の記事で「ゴールデンウィークは Privacy Filter の日本語ファインチューニングに挑戦したい」と宣言しました。 結論からお伝えすると、ファインチ...
9 search resultsShowing 1~9 results
You need to log-in
はじめに:GWの宿題、進捗報告です 前回の記事で「ゴールデンウィークは Privacy Filter の日本語ファインチューニングに挑戦したい」と宣言しました。 結論からお伝えすると、ファインチ...
はじめに:個人情報のマスキング、どうしてますか? テキストデータに含まれる個人情報(PII)のマスキング作業、大変ですよね。 「手作業は辛いからAIに任せたい!」と思っても、現場では以下のような...
1. 背景:なぜ日本語マルチモーダル RAG か 注意書き:本記事の内容は参考程度にしてください 本記事における検証コードの多くはAIを活用して記述しており、細部まで完全な実行確認を行えたわけ...
ハイライト 各種ツールの公式ドキュメントを収集 → Obsidian Vault化 → グラフ化 → RAGにした個人プロジェクトの記録です。 6製品・約1,900ページを取り込み、BM25+グ...
はじめに 前編では、ゴールデンウィークの宿題として「FakerとLLMを組み合わせたデータセット作成」の泥臭い戦いをお届けしました。 後編となる本記事では、作成したデータセットを握りしめてGoo...
Google DeepMind が 2026/6/10 に公開した DiffusionGemma(拡散でテキストを生成する実験的オープンモデル)を、llama.cpp + 4bit量子化(GGU...
前回「llama.cpp は GPU だと他エンジンの 1/3〜1/2 で遅い」と書いた。それは llama.cpp のバージョンが古かっただけ だった、という訂正と教訓の記事です。 ハイライト...
Colab T4 と CPU で 9つの組み合わせ を計測。速度も VRAM もエンジンで大きく変わり、計測ノイズにも散々ハマった ハイライト 速度はエンジンで激変する: 同じ4bit量子化(Q...
PC Watchの記事で紹介されていた、外出先から自宅のGPUを叩くサービス「LM Link」。 「自前で再現してみたい」と思い立ったのが始まりでした。 本記事では、GPUを搭載したデスクトップ...
9 search resultsShowing 1~9 results
Qiita is a knowledge sharing service for engineers.