Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Calcula estatísticas especificadas para colunas numéricas e de strings. As estatísticas disponíveis são: contagem, média, stddev, mínimo, máximo, percentis aproximados arbitrários especificados como percentagem (por exemplo, 75%).
Sintaxe
summary(*statistics: str)
Parâmetros
| Parâmetro | Tipo | Descrição |
|---|---|---|
statistics |
STR, opcional | Nomes das colunas para calcular estatísticas (por defeito: Todas as colunas). |
Devoluções
DataFrame: Um novo DataFrame que fornece estatísticas para o DataFrame dado.
Notes
Esta função destina-se à análise exploratória de dados, pois não garantimos a compatibilidade retroativa do esquema do DataFrame resultante.
Exemplos
df = spark.createDataFrame(
[("Bob", 13, 40.3, 150.5), ("Alice", 12, 37.8, 142.3), ("Tom", 11, 44.1, 142.2)],
["name", "age", "weight", "height"],
)
df.select("age", "weight", "height").summary().show()
# +-------+----+------------------+-----------------+
# |summary| age| weight| height|
# +-------+----+------------------+-----------------+
# | count| 3| 3| 3|
# | mean|12.0| 40.73333333333333| 145.0|
# | stddev| 1.0|3.1722757341273704|4.763402145525822|
# | min| 11| 37.8| 142.2|
# | 25%| 11| 37.8| 142.2|
# | 50%| 12| 40.3| 142.3|
# | 75%| 13| 44.1| 150.5|
# | max| 13| 44.1| 150.5|
# +-------+----+------------------+-----------------+
df.select("age", "weight", "height").summary("count", "min", "25%", "75%", "max").show()
# +-------+---+------+------+
# |summary|age|weight|height|
# +-------+---+------+------+
# | count| 3| 3| 3|
# | min| 11| 37.8| 142.2|
# | 25%| 11| 37.8| 142.2|
# | 75%| 13| 44.1| 150.5|
# | max| 13| 44.1| 150.5|
# +-------+---+------+------+