Python プログラムを動かすために, Windows では「python」, Ubuntu では「python3」などのコマンドを使う.
あるいは, 開発環境や Python コンソール(Jupyter Qt Console,Spyder,PyCharm,PyScripter など)の利用も便利である.
あるいは,オンラインで動くGoogle Colaboratory のノートブックの利用も,場合によっては便利である.
Google Colaboratory のノートブックを使うか, 自分のパソコンで Python を動かすなどがありえる.
Google Colaboratory のノートブックを新規作成を行う.
https://colab.research.google.com
Google Colab はオンラインの Python 開発環境. 使用するには Google アカウントが必要
システム Python を使うことができる(システム Python を使う場合,Python のインストールは行わない)
システム Python を用いるときは,pip, setuptools の更新は次のコマンドで行う.
sudo apt -y update sudo apt -y install python3-pip python3-setuptools
Ubuntu で,システム Python 以外の Python をインストールしたい場合は pyenv が便利である: 別ページで説明している.
Python の URL: http://www.python.org/
【Python, pip の使い方】
Python, pip は,次のコマンドで起動できる.
【Python 開発環境のインストール】
JupyterLab, spyder, nteract (Python 開発環境) のインストールは, Windows でコマンドプロンプトを管理者として実行し, 次のコマンドを実行.
python -m pip install -U pip setuptools jupyterlab jupyter jupyter-console jupytext nteract_on_jupyter spyder
詳しくは,: 別ページで説明している.
JupyterLab, spyder, nteract (Python 開発環境) のインストール: : 別ページで説明している.
コマンドプロンプトを管理者として実行し,次のコマンドを実行.
python -m pip install -U numpy pandas seaborn matplotlib pandasql
端末で,次のコマンドを実行
sudo apt -y update sudo apt -y install python3-numpy python3-pandas python3-seaborn python3-matplotlib sudo pip3 install -U pandasql
import pandas as pd
import seaborn as sns
sns.set()
iris = sns.load_dataset('iris')
titanic = sns.load_dataset('titanic')
print(iris.head()) print(titanic.head())
import pandas as pd
from pandasql import sqldf
import seaborn as sns
sns.set()
iris = sns.load_dataset('iris')
pysqldf = lambda q: sqldf(q, globals())
print(pysqldf("SELECT * FROM iris WHERE sepal_length > 5;"))
import pandas as pd
from pandasql import sqldf
import seaborn as sns
sns.set()
iris = sns.load_dataset('iris')
pysqldf = lambda q: sqldf(q, globals())
print(pysqldf("SELECT sepal_length, sepal_width FROM iris WHERE sepal_length > 5;"))
列を1つ選ぶことで、グループを作り、各グループの要素数を求める
pandasql と SQL を使う場合
import pandas as pd
from pandasql import sqldf
import seaborn as sns
sns.set()
iris = sns.load_dataset('iris')
titanic = sns.load_dataset('titanic')
pysqldf = lambda q: sqldf(q, globals())
print( pysqldf("SELECT species, count(*) FROM iris group by species;") );
print( pysqldf("SELECT embark_town, count(*) FROM titanic group by embark_town;") );
Iris データセットで,各グループの最大値を求める場合のみを載せる.
pandasql と SQL を使う場合
import pandas as pd
from pandasql import sqldf
import seaborn as sns
sns.set()
iris = sns.load_dataset('iris')
titanic = sns.load_dataset('titanic')
pysqldf = lambda q: sqldf(q, globals())
print( pysqldf("SELECT species, max(sepal_length), max(sepal_width), max(petal_length), max(petal_width) FROM iris group by species;") );