Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

8
Medida de qualidade de cluster
Eu tenho um algoritmo de cluster (não k-means) com o parâmetro de entrada (número de clusters). Após executar o cluster, eu gostaria de obter uma medida quantitativa da qualidade desse cluster. O algoritmo de clustering tem uma propriedade importante. Para se eu alimentar pontos de dados sem nenhuma distinção significativa …
17 clustering 

7
A mediana é mais justa que a média?
Recentemente, li o conselho de que você geralmente deve usar mediana não para eliminar discrepâncias. Exemplo: o seguinte artigo http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ possui 16 avaliações no momento: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. 1st Qu. Median …
17 mean  median  average 

6
R: calcular correlação por grupo
Bloqueado . Esta pergunta e suas respostas estão bloqueadas porque a questão está fora do tópico, mas tem um significado histórico. No momento, não está aceitando novas respostas ou interações. Em R, eu tenho um quadro de dados que compreende um rótulo de classe C (um fator) e duas medições, …
17 r  correlation 

9
Qual é a diferença entre estatística e bioestatística?
Ocorreu-me que, embora tenha reunido algumas idéias ao longo dos anos sobre as diferenças entre estatística e bioestatística, nunca ouvi uma explicação formal. Qual a distinção entre essas duas disciplinas (atualmente)? E por que essa distinção começou em primeiro lugar? Edição: Eu não fui específico o suficiente na minha pergunta …




2
Se larguras variáveis ​​do kernel costumam ser boas para a regressão do kernel, por que geralmente não são boas para a estimativa da densidade do kernel?
Esta questão é motivada por discussões em outros lugares . Núcleos variáveis ​​são frequentemente usados ​​na regressão local. Por exemplo, o loess é amplamente usado e funciona bem como uma regressão mais suave, e é baseado em um kernel de largura variável que se adapta à escassez de dados. Por …




4
Teste t robusto para média
Estou tentando testar o nulo , em relação à alternativa local , para uma variável aleatória , sujeita a inclinação leve a média e curtose da variável aleatória. Seguindo as sugestões de Wilcox em 'Introdução à estimativa robusta e testes de hipóteses', observei os testes com base na média aparada, …




Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.