はじめに
AIのPoC案件を担当することとなりましたが、執筆者含めてメンバー全員がAI未経験でした。
そんな中、初心者ながらもゼロから四ヶ月勉強し、無事PoCを成功かつAIが好きになったので、勉強法を紹介します。
AIは黎明期であり、ネットで検索してもなかなか有用な情報が出てきません。
初学者ゆえに基礎知識がなく、情報を取捨選択できないので、ネットのどの情報が有用で正しいのか判断できず、理解しにくい状況でした。
このため、まずは書籍を元に体系的に知識を身につけていきました。
説明すること
- 初心者向けのAI、特にLLMの勉強方法
説明しないこと
- LLMの技術自体の説明(参考書に任せます)
参考書
LLM
- LLMの原理、RAG・エージェント開発から読み解く コンテキストエンジニアリング
現場で得たLLMエージェント開発の実践知を集めた書籍です。
LLMを用いた設計をするには、以下のような広範な知識が求められます。
本書では、これらのLLM全体の基礎知識が網羅されています。
- コンテキストウィンドウ
- モデルの種類と選定基準
- コンテキストキャッシュ
- プロンプト設計
- Function Calling
- structured output
- ガードレール
- Reasoning
- ReAct
- RAG
- MCP
etc...
知識だけでなく、実践で得られた知見や、それぞれのメリデメ・考察まで記載されているので、理解が深まりやすいです。
おかげで、LLMで何ができるかわからない状態から、要望に対してどう設計するか、実務でイメージできる段階までになりました。
PoC案件における私の知識の大半はこの本から得ており、本書がなければプロジェクトを進めることはできなかっただろうと言えるほど、大変感謝している書籍です。
バイブルであり、心の恩師と言っても過言ではありません。
AWS
ビジネスでLLMエージェント開発を行う場合、社内資料活用のためにはセキュリティ要件上、通信を外に出したくない場合も多いかと思います。
PoC案件でもセキュリティ観点からクラウド上で開発することになったため、続いてAWSでのエージェント開発の勉強をしました。
- AWSではじめるMCP実践ガイド
AWSに関してもですが、まずMCPサーバ自体の解説がわかりやすかったです。
MCPサーバで何ができるのか、接続方式の種類、役割の種類、Bedrock AgentCoreでのMCPサーバ構築方法など丁寧に記載されています。
サンプルコードが豊富なので、手を動かしながら進めることでMCPサーバの実装イメージもつきやすいと思います。
- AWS生成AIアプリ構築実践ガイド
上記書籍はMCPに特化していますが、こちらはAWSでのAIエージェント開発全般の書籍です。
AWS上のLLMのサービスであるBedrockやナレッジベース(RAG)の使い方を学ぶことができます。
こちらもサンプルコードが豊富であり、また各AWSサービスの利用方法やパラメータの意味も含めて掘り下げられているので、具体的に理解しやすいと思います。
Web学習
- DeepLearning AI
ウェビナー形式で一部講座を無料で視聴できます。
英語ですが、トランスクリプトがあるので翻訳すれば問題ありませんでした。
実践的な内容もあり、実務にそのまま活かせた講座もありました。
例えば、以下。
- Document AI: From OCR to Agentic Doc Extraction
機械学習OCR(PaddleOCR)の基礎や使い方、LLMエージェントとの連携方法について紹介されています。
LLMでは与える入力が重要なので、機械学習や画像処理AIなどの特化したAIとの組み合わせを勉強することは意義があると思います。
- LangChain 公式X
LLMエージェント開発のフレームワークLangChainの公式X。
LangChainだけでなく、AI業界全体の最新動向も紹介されています。
各AIベンダの最新リリースやノウハウなどが定期的に投稿されるので、フォローするとある程度キャッチアップできると思います。
手を動かして学習する
LLMに限った話でもありませんが、手を動かした方が理解が深まりやすいと思います。個人的には、以下は読んだだけでは理解が難しかったです。
- Function Calling(ツールの動作イメージ)
- RAG
- MCP
最小構成で良いので、コードを書いて動かしてみることをおすすめします。
PoC案件で得られたノウハウ
PoCを進める中で、初心者ながら案件で得られた気づきを記載します。
ルールベースでできるところはルールベースでやる
LLMの出力はあくまで確率なので、できる部分は従来のルールベースと組み合わせた方が良いと思いました。
例えば、純粋にコーディングする、画像処理ライブラリやOCRを使う、それらの前処理した情報をLLMに入力として渡す。またはLLMの出力を加工する、といった処理です。
ルールベースでできるところまで情報を絞った上でLLMに渡した方が安定しやすく、トークン消費量も抑えることができます。
トークンを抑えつつ精度を出す
現在のLLMは賢く、トークン量を度外視すれば、結構なことができてしまうと感じました。
しかし、トークン利用料はバカにならない金額になります。
PoCではまずは精度を出すことを優先し、トークンを抑える設計を後回しにしたところ、期待を上回る精度は出せましたが、金額は月額XX万円になり椅子から転げ落ちました。
上述した書籍コンテキストエンジニアリングでも紹介されていますが、キャッシュを効かせるコンテキストの工夫や、前述のルールベースとの組み合わせなど、トークンを削りながらいかに精度を出すかが本番運用を見越す上でも重要かと思います。
社内資料活用のニーズは高い
ノウハウではなく感想ですが、RAGはLLMと社内資料活用の橋渡しになるので、ニーズは高いと感じました。
RAGがなければ、今のAIは賢くCopilotでいいじゃんともなりかねないので、数ある社内資料をどのようにRAGにするかは、ベンダとしてやる意味がある部分かと感じました。
おわりに
AI黎明期を駆け抜けてこられた偉大な先駆者の方々は尊敬します。
まだ勉強中の身ですが、AIの可能性の大きさは日々感じており、もっと勉強して知識を深めていきたいです。