技術書を「Qiita記事で何回引用されたか」で集計して、ランキングを作っています。tasklog という個人サービスの機能のひとつです。
作っているうちに、ずっと引っかかっていたことがあります。同じ「被引用◯件」でも、中身がまったく別物のケースがあるのです。片方は、何百人もの別々のエンジニアが、それぞれ自分の記事でたまたま同じ本を挙げた結果。もう片方は、たった1人が書いた「技術書50選」のような記事が、1本で50件分の“票”をまとめて供給しているだけ、というケースです。
見た目の数字は同じでも、意味はぜんぜん違います。今回は、自分の集計を自分で疑って、中身を数えてみました。
まずは全体像:13,251ペアのうち、大半は「1冊だけ」
集計対象は、書籍を引用している Qiita 記事 2,145本。そこから生まれた「記事×書籍」の引用ペアは 13,251件 です。
このうち、1本の記事が引用している書籍が 1冊だけ というケースが 1,485本(69.2%) を占めます。これは素直に読める数字です。誰かが自分の記事の中で「この本がよかった」と1冊だけ挙げている——バラバラの著者による、バラバラのタイミングでの、個別の言及の積み重ね。ランキングの土台は、ここにあります。
問題は残りの3割、それも尻尾の方です。
転回:3.4%の記事が、13.7%の“票”を持っている
1記事あたりの引用冊数で切ってみると、こうなりました。
| 1記事あたりの引用冊数 | 記事数(割合) | 引用ペアに占める割合 |
|---|---|---|
| 5冊以上 | 201本(9.4%) | 20.1% |
| 10冊以上 | 72本(3.4%) | 13.7% |
| 20冊以上 | 27本(1.3%) | 9.0% |
記事数で見ればたった1.3%(27本)にすぎない「20冊以上を一気に引用する記事」が、全引用ペアの9.0%を生んでいます。記事数の割合と、票の割合がまったく釣り合っていません。
これがいわゆる「技術書◯選」「読んでよかった本まとめ」のような記事です。1本書けば、その中で紹介した本すべてに1票ずつ入ります。個別の言及が1記事1票なのに対して、まとめ記事は1記事N票。同じ「被引用数」という物差しの中に、重みの違う票が混ざっているわけです。
さらに個人単位まで掘ってみると、この偏りはもっとはっきりします。今回の集計対象の中で、単独で最も多くの本を引用していたのは、10年間(2016〜2026年)で28本の「技術書◯選」系の記事を書き、延べ831冊を引用していた、ある1人の書き手でした。これだけで、全体の引用ペアの 6.3% を1人で供給している計算になります。
もちろん、これは悪いことではありません。10年間、28本もまとめ記事を書き続けるのは相当な労力ですし、後進のための善意の仕事だと思います。ただ、集計する側から見ると、「1000人の個別の“いいね”」と「1人の10年分の労作」が、数字の上ではまったく区別なく積み上がってしまう——そういう統計上のクセがあるのは事実です。
じゃあ、どう見分ければいいか
被引用数だけを見ても、この2つは区別がつきません。そこで効いてくるのが、もう一つの軸——その本を引用した記事の「著者が何人いるか」 です。まとめ記事1本で10票入っていても、書いた人は1人。逆に、10人がバラバラに1冊だけ引用していれば、著者は10人になります。
実際に、2冊で比べてみます。
| 書籍 | 引用記事数 | 異なる著者数 |
|---|---|---|
| リーダブルコード | 177 | 156 |
| 徹底攻略Java SE 11 Silver問題集 | 35 | 35 |
『リーダブルコード』は177記事から引用されていますが、書いた著者は156人。ほぼ「1記事=1人」に近い数字です。分野もキャリアもバラバラなエンジニアが、示し合わせたわけでもなく同じ本にたどり着いている——特定の書き手のリストに支えられているわけではない、正真正銘の“広い合意”です。
もっと分かりやすいのが『徹底攻略Java SE 11 Silver問題集』です。資格対策本という、まとめ記事に入りやすそうな地味なジャンルなのに、35記事すべてが別々の著者でした。多様性100%。誰かの“おすすめリスト”に乗っているのではなく、資格試験を受けた一人ひとりが、自分の言葉で個別にこの本を挙げている。草の根の合意そのものです。
反対に、もし著者数が引用記事数よりずっと少ない本があれば――たとえば10記事の引用元が、たった2〜3人に集中していれば――それは「多くの人に選ばれている本」というより「その2〜3人のリストに繰り返し載っている本」なのかもしれない、と疑ったほうがよさそうです。同じ被引用数でも、支えている構造は別物なのです。
数字を出す側の反省として
自分でランキングを作っておいて言うのも変な話ですが、「被引用◯件」という一本の数字だけを見せるのは、正直まだ粗いと感じています。69.2%は個別の言及に支えられた素直な数字である一方で、上位の一部には、少数のまとめ記事――あるいは1人の書き手――が下支えしている本も混ざっているはずです。順位表を見るときは、その1冊が何人に支えられているのかまで、頭の片隅に置いておくとちょうどいいのだと思います。
次にどこかのランキングで「被引用◯件」「◯記事で紹介」という数字を見かけたら、その裏に何人の別々の書き手がいるのか、少しだけ想像してみてください。
被引用ランキングと、この記事のもとになった集計は「被引用データスタディ」にまとめています。
※数字は tasklog によるQiita記事の書籍引用集計(2026年8月18日時点、暫定値)。「引用」は記事本文から機械的に検出できた書籍リンク・ISBNのみを対象とし、書名テキストのみの言及は含みません。