Amostrar
amostra com semente, e por que a amostra reproduzível é a única que serve.
Trabalhar com uma amostra é o que torna possível explorar um arquivo de dez milhões de linhas — e só serve se a mesma análise, rodada amanhã, escolher as mesmas linhas. Por isso a amostra aceita uma semente.
dataforge
adopt Arcane.Quadro as Q
clientes := Q.de_colunas({"id": range(1, 1001)})
a := clientes.amostra(5, 42)
b := clientes.amostra(5, 42)
assert a.coluna("id") is b.coluna("id") // mesma semente, mesmas linhas
assert a.altura() is 5
out a.coluna("id")| Quero | Faça |
|---|---|
| explorar rápido | amostra(1000, semente) |
| um relatório que outra pessoa refaz | a mesma semente, escrita no relatório |
| treinar e testar um modelo | Cortex.dividir(dados, 0.2, semente, alvo) — estratificado pela classe |
| as primeiras linhas para olhar a forma | topo(5) — e não confundir com amostra |