Anthropic の Claude / Claude Code 関連ニュースをまとめた索引だ。記事本文は日本語で PaPoo に投稿している。ここでは各記事の要点を紹介するので、詳細は各リンク先を読んでほしい。
まだ4分の1しか通らないのか、という驚き
「Claudeが一番良かった」という見出しだけ見ると、AIエージェント開発の道具立てはもうかなり整ってきたのかな、と思ってしまう。けれど、本文を読むと全然そんな話ではなくて、むしろ“まだかなり厳しい”という感触のほうが強かった。ベンチマークでトップでも、合格率が4分の1未満というのは、期待値をかなり下げて見ないといけない数字だと思う。
https://papoo.work/doc/5d21a689ead227c3
期待値が上がるほど、差は見えにくくなる
まず思ったのは、「性能が倍」と聞いても、現場の仕事では案外わからないものなんだな、ということだった。この記事でいちばん面白いのは、Claude Fable 5.1 と Fable 5 を実際の仕事にかけてみて、どちらもきれいに答えは出したのに、体感ではほとんど区別がつかなかった点だと思う。
https://papoo.work/doc/64c6124524c6fb60
Gooseの流量を守るための“代理人”を挟む発想
読んでまず思ったのは、AIエージェントの話なのに、結局かなり地に足のついたセキュリティ設計の話になっているな、ということだった。派手なデモより先に、誰がその tool を叩いたのか、どの role なら触っていいのか、変な tool 名でバックエンドを壊されないか、そこを真正面から扱っているのが好感が持てる。
https://papoo.work/doc/4608ed44056f365c
「青くして」と頼むだけで終わらないもどかしさ
Hacker News で 942 points / 381 comments — 議論スレッド
最初に思ったのは、「ああ、これ本当にあるよな」という妙な共感だった。たった一つのボタンの色を変えたいだけなのに、AI assistant に任せると、なぜか周辺まで触られたり、意図を勝手に広げられたりする。この記事はそのイライラを、かなり小さく、しかも体感として味わわせるところがうまいと思った。
https://papoo.work/doc/8ac6c4fd8b11c29b
自分の会社に“勝手に働く人”を置く怖さと面白さ
Hacker News で 34 points / 8 comments — 議論スレッド
最初に思ったのは、これは便利そうというより、先に「かなり怖いな」だった。AI agent を会社の中で動かす発想自体はもう珍しくないけれど、ここではそれを単なるチャット補助に留めず、departments や role、workspace、電話番号まで含めて“社員っぽく”扱おうとしている。しかも自前ホスト前提で、Claude Code や Codex のサブスクを自分で持ち込む形だ。かなり本気で、かなり割り切っている。
https://papoo.work/doc/a577ed5d34d89de8
AIの「忘れる」を、Gitで無理やり現実に引き戻す話
読んでまず思ったのは、これはAIの性能不足というより、こちらの仕事の進め方がまだ「セッションが消える前提」に寄りすぎている、ということだった。 AI coding agent は毎回新しい相手みたいな顔で出てくる。昨日まで何度も話した設計の前提を、今日また説明し直す。あれはたしかに面倒だし、地味に判断の質も落ちると思う。
https://papoo.work/doc/43cb126372d7e982
記事本文は日本語。
ほぼ毎日、Claudeに関するNewsをお伝えしてます! 過去記事はこちら!!