Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados


3
Teoria da resposta ao item vs análise fatorial confirmatória
Fiquei imaginando quais são as principais diferenças significativas entre a Teoria da resposta ao item e a Análise fatorial confirmatória. Entendo que existem diferenças nos cálculos (focando mais no item vs. covariâncias; log-linear vs. linear). No entanto, não tenho idéia do que isso significa de uma perspectiva de nível superior …


5
O que exatamente são dados censurados?
Eu li diferentes descrições de dados censurados: A) Conforme explicado neste tópico, dados não quantificados abaixo ou acima de um determinado limite são censurados. Não quantificado significa que os dados estão acima ou abaixo de um determinado limite, mas não sabemos o valor exato. Os dados são marcados no valor …

3
Bootstrap: a questão do overfitting
Suponha que se execute a chamada inicialização não-paramétrica, desenhando BBB amostras de tamanho nnn cada uma das nnn observações originais com substituição. Eu acredito que este procedimento é equivalente a estimar a função de distribuição cumulativa pelo cdf empírico: http://en.wikipedia.org/wiki/Empirical_distribution_function e, em seguida, obtendo as amostras de autoinicialização simulando nnn …

1
Faixas de confiança para a linha QQ
Esta questão não se refere especificamente R, mas optei Rpor ilustrá-la. Considere o código para produzir faixas de confiança em torno de uma linha qq (normal): library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") Estou procurando uma explicação de (ou um link alternativo para um documento em papel / online explicando) como essas faixas …

2
k-significa vs k-mediana?
Eu sei que existe algoritmo de agrupamento k-means e mediana k. Um que usa a média como o centro do cluster e o outro usa a mediana. Minha pergunta é: quando / onde usar qual?


3
Os coeficientes de regressão logística têm um significado?
Eu tenho um problema de classificação binária de vários recursos. Os coeficientes de uma regressão logística (regularizada) têm um significado interpretável? Eu pensei que eles poderiam indicar o tamanho da influência, considerando que os recursos são normalizados de antemão. No entanto, no meu problema, os coeficientes parecem depender sensivelmente dos …

2
Subjetividade nas Estatísticas Frequentistas
Costumo ouvir a afirmação de que as estatísticas bayesianas podem ser altamente subjetivas. O argumento principal é que a inferência depende da escolha de um prior (mesmo que alguém possa usar o princípio de indiferença ou entropia máxima para escolher um prior). Em comparação, afirma a alegação, as estatísticas freqüentistas …




1
Classificadores de aprendizado de máquina big-O ou complexidade
Para avaliar o desempenho de um novo algoritmo classificador, estou tentando comparar a precisão e a complexidade (grande O no treinamento e classificação). No Machine Learning: uma revisão , recebo uma lista completa de classificadores supervisionados, também uma tabela de precisão entre os algoritmos e 44 problemas de teste no …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.