Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Referência para ?
Em sua resposta à minha pergunta anterior, @Erik P. dá a expressão onde é o excesso de curtose da distribuição. É fornecida uma referência à entrada da Wikipedia sobre a distribuição da variação da amostra , mas a página da Wikipedia diz "citação necessária".κV a r [ s2] = σ4( …

2
Por que não realizar metanálise em dados parcialmente simulados?
Fundo: Uma meta-análise típica em psicologia pode procurar modelar a correlação entre duas variáveis ​​X e Y. A análise normalmente envolveria a obtenção de um conjunto de correlações relevantes da literatura, juntamente com o tamanho da amostra. As fórmulas podem então ser aplicadas para calcular uma correlação média ponderada. Em …




2
Usando Adaboost com SVM para classificação
Eu sei que o Adaboost tenta gerar um classificador forte usando uma combinação linear de um conjunto de classificadores fracos. No entanto, li alguns artigos sugerindo que o Adaboost e os SVMs trabalham em harmonia (embora o SVM seja um classificador forte) em determinadas condições e casos . Não consigo …



2
Existe algo como um dado justo?
Existe algo como um dado justo? Nos dados em que o número é representado por um ponto extraído, certamente isso faz a diferença? Alguém já fez alguma pesquisa? De fato, pensando nisso, por que uma moeda seria justa? a física de cada lado é completamente diferente.
11 dice 

1
Seleção de modelo ABC
Foi demonstrado que a escolha do modelo ABC usando fatores Bayes não é recomendada devido à presença de um erro proveniente do uso de estatísticas resumidas. A conclusão deste artigo baseia-se no estudo do comportamento de um método popular para aproximação do fator Bayes (algoritmo 2). É sabido que os …

2
Preditores significativos tornam-se não significativos na regressão logística múltipla
Quando analiso minhas variáveis ​​em dois modelos de regressão logística separados (univariados), obtenho o seguinte: Predictor 1: B= 1.049, SE=.352, Exp(B)=2.85, 95% CI=(1.43, 5.69), p=.003 Constant: B=-0.434, SE=.217, Exp(B)=0.65, p=.046 Predictor 2: B= 1.379, SE=.386, Exp(B)=3.97, 95% CI=(1.86, 8.47), p<.001 Constant: B=-0.447, SE=.205, Exp(B)=0.64, p=.029 mas quando os insiro em …


2
Intervalos de previsão e tolerância
Eu tenho algumas perguntas para intervalos de previsão e tolerância. Vamos concordar com a definição dos intervalos de tolerância primeiro: recebemos um nível de confiança, digamos 90%, a porcentagem da população a capturar, digamos 99%, e um tamanho de amostra, digamos 20. A distribuição de probabilidade é conhecida, digamos normal …

3
Melhorando nomes de variáveis ​​em um conjunto de dados
Os bons nomes de variáveis ​​são: a) curto / fácil de digitar, b) fácil de lembrar, c) compreensível / comunicativo. Estou esquecendo alguma coisa? Consistência é algo a procurar. O que eu diria é que convenções de nomenclatura consistentes contribuem para as qualidades acima. A consistência contribui para (b) facilidade …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.