128 search resultsShowing 1~20 results

Stocked

自己相関で周期性を見る:時系列の“似ている間隔”をPythonで探す

はじめに 時系列データを見ていると、 なんとなく周期性がありそう 同じような波形が繰り返している気がする でも、何時間ごと・何ステップごとに似ているのかを定量的に見たい という場面があります。 ...

1
2
Comment0

フィルタをかけると波形はきれいになる。でも真実に近づいたとは限らない:Pythonで見る平滑化の落とし穴

はじめに 時系列データを扱っていると、こんな場面によく出会います。 波形がノイズでギザギザしている。 フィルタをかけると、なめらかできれいになった。 では、この波形は「真の波形」に近づいたと言っ...

1
0
Comment0

ロジスティック曲線はなぜS字になるのか?成長モデルをPythonで見る

はじめに ロジスティック曲線は、生命科学、人口動態、化学反応、感染症モデル、機械学習の分類確率など、いろいろな場面で出てくる有名なS字曲線です。 ただ、教科書で $$ \frac{dN}{dt}...

2
1
Comment0

指数関数的減衰をPythonで理解する:半減期・時定数・フィッティング

はじめに 「指数関数的減衰」という言葉は、物理、化学、生物、医学、工学、データ解析など、かなり広い分野で出てきます。 たとえば、次のような現象です。 温度差が時間とともに小さくなる 蛍光強度が時...

1
0
Comment0

PCAは何をしているのか?2次元データを回転して“よくばらつく方向”を見る

はじめに PCA、つまり主成分分析は、データサイエンスや機械学習でよく出てくる基本的な手法です。 ただ、最初に学ぶときには、 主成分とは何か 固有値・固有ベクトルがなぜ出てくるのか 次元削減とは...

0
0
Comment0

相互相関で時間遅れを測る:2つの時系列のズレをPythonで推定する

はじめに 2つの時系列データを見比べていると、 片方の変化が、もう片方より少し遅れて起きている気がする という場面があります。 例えば、一般的なデータ解析では次のような状況です。 入力信号と出力...

0
0
Comment0

ランダムウォークから拡散へ:ばらつきが時間とともに広がる理由をPythonで見る

はじめに 「ランダムウォーク」と「拡散」は、物理、化学、生物、統計、データサイエンスなど、いろいろな分野に登場する基本概念です。 たとえば、次のような現象を考えるときに関係します。 水中の小さな...

1
1
Comment0

平均点は上がったのに「日本語×要約」だけ壊れた:サーバー不要のClickHouse(chDB)で150万行のダミーAI評価ログを分析する

はじめに 私は普段、ClickHouseを活用・運用しているわけではありません。今回のQiita Tech Festaをきっかけに、「AIの評価結果を継続的に蓄積し、後から検証するためのデータベ...

0
0
Comment0

微分するとノイズが暴れる理由:位置から速度を求める前に考えること

はじめに 時系列データを扱っていると、 位置データから速度を求めたい 距離の変化から変化速度を知りたい 蛍光強度の変化速度を見たい 画像トラッキング結果から移動速度を出したい という場面がよくあ...

2
0
Comment0

サンプリング周波数が足りないと何が起きる?エイリアシングをPythonで見る

はじめに 時系列データを扱うとき、よく出てくる言葉にサンプリング周波数があります。 例えば、センサー、音声、心電図、顕微鏡画像の時系列、物理計測データなどでは、連続的に変化している現象を、一定時...

0
0
Comment0

フーリエ変換は何を見ているのか?混ざった波を周波数に分ける

はじめに フーリエ変換は、信号処理、画像解析、物理、生命科学、音声解析、センサデータ解析など、さまざまな場面で出てきます。 ただ、初めて学ぶと、 フーリエ変換は、時間変化するデータを周波数成分に...

0
0
Comment0

正則化は何をしているのか?Ridge回帰で係数を小さくする意味を見る

機械学習や統計モデリングを学んでいると、よく 正則化 という言葉が出てきます。 「過学習を防ぐらしい」 「Ridge回帰では係数を小さくするらしい」 「でも、係数を小さくするとなぜ嬉しいのか?」...

1
0
Comment0

過学習はなぜ起きるのか?多項式回帰で見る「モデルの曲がりすぎ」

はじめに 機械学習では、学習データにぴったり合うモデルほど良いとは限りません。 学習データ上の誤差がとても小さいのに、新しいデータでは予測を外してしまうことがあります。これが過学習(overfi...

0
0
Comment0

最小二乗法は何を最小にしているのか?直線フィットをダミーデータとPythonで図解する

散布図に直線を当てはめる「直線フィット」は、統計解析やデータサイエンスで頻繁に登場します。 Pythonでは、たとえばnumpy.polyfit()を使うと、わずか1行で直線を求められます。 し...

0
2
Comment0

中心極限定理はなぜ強いのか?平均値の分布をPythonで見る

はじめに データを集めたとき、まず「平均値」を計算することは多いと思います。 しかし、同じ母集団からデータを取り直すと、平均値は毎回少しずつ変わります。では、何度も標本を取り、そのたびに平均値を...

0
0
Comment0

平均値だけでデータを語ってよいのか?「同じ平均・違う分布」をPythonで可視化する

はじめに 実験結果やアンケート、センサーデータなどを要約するとき、最初に計算することが多いのが平均値です。 平均値はとても便利です。たくさんの数値を、たった1つの数値に要約できます。 しかし、1...

0
1
Comment0

p値だけで判断してよいのか?効果量とBootstrapをPythonで図解する

はじめに 2群の測定値を比較したとき、解析結果を次のようにまとめることがあります。 $p < 0.05$ だったので、2群には有意差があった。 これは間違いとは限りません。しかし、p値だけ...

1
0
Comment2

p値は何ではないのか?帰無分布をPythonで作り、シミュレーションで理解する

統計解析の結果として、しばしば次のような値を目にします。 $p=0.04$ このとき、次のように読みたくなるかもしれません。 「帰無仮説が正しい確率は4%」 「96%の確率で差がある」 「偶然だ...

1
2
Comment0

95%信頼区間は「95%の確率で真値が入る」ではない:Pythonシミュレーションで理解する

はじめに データ分析では、次のような結果をよく見かけます。 標本平均は47.6、母平均の95%信頼区間は43.4〜51.8だった。 ここで、つい次のように読みたくなります。 「母平均が43.4〜...

0
1
Comment0

標準偏差・標準誤差・95%信頼区間は何が違うのか?ダミーデータとPythonで図解する

はじめに データ解析では、次のような表記をよく見かけます。 平均値 $\pm$ 何か ところが、この「何か」には少なくとも次の候補があります。 標準偏差(Standard Deviation: ...

0
0
Comment0

128 search resultsShowing 1~20 results

Qiita is a knowledge sharing service for engineers.

  1. You can follow users and tags
  2. You can stock useful information
  3. You can make edit suggestions for articles
Functions that can be used after logging in