Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Diferença entre análise fatorial exploratória e confirmatória na determinação da independência de construto
Os pesquisadores costumam usar duas medidas que possuem itens muito semelhantes e argumentam que medem coisas diferentes (por exemplo, "sempre me preocupo quando estou perto de carros"; "tenho medo de carros"). Vamos chamar as medidas hipotéticas de Medição e Ansiedade do Medo dos Carros na Escala de Automóveis. Estou interessado …

2
PCA e florestas aleatórias
Para uma competição recente do Kaggle, eu (manualmente) defini 10 recursos adicionais para o meu conjunto de treinamento, que seriam usados ​​para treinar um classificador de florestas aleatórias. Decidi executar o PCA no conjunto de dados com os novos recursos, para ver como eles se comparavam. Eu descobri que ~ …

2
Como reduzir o número de itens usando análise fatorial, consistência interna e teoria da resposta ao item em conjunto?
Estou desenvolvendo empiricamente um questionário e usarei números arbitrários neste exemplo para ilustrar. Para contextualizar, estou desenvolvendo um questionário psicológico destinado a avaliar padrões de pensamento comumente identificados em indivíduos com transtornos de ansiedade. Um item pode se parecer com " Preciso verificar o forno repetidamente, porque não tenho certeza …

4
Séries temporais de diferença antes de Arima ou dentro de Arima
É melhor diferenciar uma série (supondo que seja necessária) antes de usar um Arima OU melhor para usar o parâmetro d no Arima? Fiquei surpreso com a diferença entre os valores ajustados, dependendo de qual rota é tomada com o mesmo modelo e dados. Ou estou fazendo algo incorretamente? install.packages("forecast") …
12 r  time-series  arima 


1
Representando graficamente uma curva de probabilidade para um modelo Logit com vários preditores
Eu tenho a seguinte função de probabilidade: Prob=11+e−zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} Onde z=B0+B1X1+⋯+BnXn.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. Meu modelo parece Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid})]\right)} Isso é visualizado através de uma curva de probabilidade que se parece com a abaixo. Estou pensando em …

1
O que é correção de viés? [fechadas]
Fechado . Esta pergunta precisa de detalhes ou clareza . No momento, não está aceitando respostas. Deseja melhorar esta pergunta? Adicione detalhes e esclareça o problema editando esta postagem . Fechado há 4 anos . Eu já vi muitos lugares em que eles têm conjuntos de dados de entrada / …


1
Como otimizar a eficiência computacional ao ajustar um modelo complexo a um grande conjunto de dados repetidamente?
Estou tendo problemas de desempenho usando o MCMCglmmpacote no R para executar um modelo de efeitos mistos. O código fica assim: MC1<-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) Existem cerca de 20.000 observações nos dados e elas estão agrupadas em cerca de 200 escolas. Soltei todas as …

2
Análise residual de regressão logística
Essa pergunta é geral e prolongada, mas por favor, tenha paciência comigo. No meu aplicativo, tenho muitos conjuntos de dados, cada um consistindo em ~ 20.000 pontos de dados com ~ 50 recursos e uma única variável binária dependente. Estou tentando modelar os conjuntos de dados usando regressão logística regularizada …

2
Como simular dados funcionais?
Estou tentando testar várias abordagens funcionais de análise de dados. Idealmente, eu gostaria de testar o painel de abordagens que tenho em dados funcionais simulados. Eu tentei gerar FD simulado usando uma abordagem baseada em um somar ruídos gaussianos (código abaixo), mas as curvas resultantes parecem muito resistentes em comparação …



2
Determinar automaticamente a distribuição de probabilidade, considerando um conjunto de dados
Dado um conjunto de dados: x <- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) .. Gostaria de determinar a distribuição de probabilidade mais adequada (gama, beta, normal, exponencial, poisson, qui-quadrado etc.) com uma estimativa dos parâmetros. Já estou ciente da pergunta no link a seguir, onde uma solução é fornecida usando R: /programming/2661402/given-a-set-of-random-numbers-drawn-from-a- distribuição-univariada-contínua-f, a melhor …

1
Como gerar previsões com rjags?
Eu usei o rjags para executar o MCMC em um modelo, especificado na linguagem JAGS. Existe uma boa maneira de extrair esse modelo e executar previsões com ele (usando as distribuições posteriores dos meus parâmetros)? Posso re-especificar o modelo em R e conectar os modos dos meus parâmetros posteriores; Só …
12 r  jags 

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.