Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
ANOVA para comparar modelos
Estou procurando neste site um workshop sobre o GAM em R: http://qcbs.ca/wiki/r_workshop8 No final da seção, 2. Multiple smooth termseles mostram um exemplo, onde eles usam anovapara comparar três modelos diferentes para determinar o melhor modelo de ajuste. A saída é Analysis of Deviance Table Model 1: y ~ x0 …
9 r  anova  gam  mgcv 

1
Como escolher o tipo de parâmetros GAM
Comecei a trabalhar com o GAM em R e adquiri o excelente livro de Simon Wood sobre o tópico ( "Modelos aditivos generalizados, uma introdução ao R" ). Com base em um de seus exemplos, estou analisando o seguinte: library(mgcv) data(trees) ct1<-gam(log(Volume) ~ Height + s(Girth), data=trees) Eu tenho duas …



2
Entendendo o risco de Bayes
Ao avaliar um estimador, os dois critérios usados ​​provavelmente mais comuns são o risco máximo e o risco de Bayes. Minha pergunta se refere à última: O risco de bayes sob o anterior é definido da seguinte forma:ππ\pi Bπ(θ^)=∫R(θ,θ^)π(θ)dθBπ(θ^)=∫R(θ,θ^)π(θ)dθB_{\pi} (\hat{\theta}) = \int R(\theta, \hat{\theta} ) \pi ( \theta ) d …

4
Como evitar a colinearidade de variáveis ​​categóricas na regressão logística?
Estou com o seguinte problema: Estou executando uma regressão logística múltipla em várias variáveis, cada uma das quais com uma escala nominal. Eu quero evitar a multicolinearidade em minha regressão. Se as variáveis ​​fossem contínuas, eu poderia calcular o fator de inflação de variação (VIF) e procurar variáveis ​​com um …

3
Quando usar o GLM em vez do LM?
Quando usar um modelo linear generalizado sobre um modelo linear? Eu sei que o modelo linear generalizado permite, por exemplo, que os erros tenham alguma outra distribuição além da normal, mas por que alguém se preocupa com as distribuições dos erros? Como por que diferentes distribuições de erro são úteis?

3
Autocorrelação alta ao tomar a L-ésima ordem de diferença de uma sequência de números aleatórios independentes
Para explicar essa pergunta com mais detalhes, primeiro elaborarei minha abordagem: Simulei uma sequência de números aleatórios independentes .X={x1,...,xN}X={x1,...,xN}X = \{x_1,...,x_N\} Tomo então vezes a diferença; ou seja, eu crio as variáveis:LLL dX1={X(2)−X(1),...,X(N)−X(N−1)}dX1={X(2)−X(1),...,X(N)−X(N−1)}dX_{1} = \{X(2)-X(1),...,X(N)-X(N-1)\} dX2={dX1(2)−dX1(1),...,dX1(N−1)−dX1(N−1−1)}dX2={dX1(2)−dX1(1),...,dX1(N−1)−dX1(N−1−1)}dX_{2} = \{dX_{1}(2)-dX_{1}(1),...,dX_{1}(N-1)-dX_{1}(N-1-1)\} ......... dXL={dXL−1(2)−dXL−1(1),...,dXL−1(N−L)−dXL−1(N−L−1)}dXL={dXL−1(2)−dXL−1(1),...,dXL−1(N−L)−dXL−1(N−L−1)}dX_{L} = \{dX_{L-1}(2)-dX_{L-1}(1),...,dX_{L-1}(N-L)-dX_{L-1}(N-L-1)\} Observo que a autocorrelação (absoluta) de aumenta à …

3
Teste de Friedman e teste post-hoc para Python
No meu conjunto de dados, tenho cinco grupos (ordinais) com uma quantidade x de medida. Como a homoscedasticidade é violada, realizei o teste do qui-quadrado de Friedman para verificar se existem diferenças estatísticas entre os grupos: fried = stats.friedmanchisquare(*[grp for idx, grp in df.iteritems()])) Isso retornou uma diferença estatística, mas …

4
Existe uma versão do coeficiente de correlação menos sensível aos valores discrepantes?
O coeficiente de correlação é: r =∑k(xk-x¯) (yk-yk¯)sxsyn - 1r=∑k(xk−x¯)(yk−yk¯)sxsyn−1 r = \frac{\sum_k \frac{(x_k - \bar{x}) (y_k - \bar{y_k})}{s_x s_y}}{n-1} A média da amostra e o desvio padrão da amostra são sensíveis a valores discrepantes. Além disso, o mecanismo em que, r =∑kcoisakn - 1r=∑kstuffkn−1 r = \frac{\sum_k \text{stuff}_k}{n -1} …


2
Como resolver a regressão logística usando mínimos quadrados comuns?
Eu estava aprendendo auto-aprendizado. Encontrei esta seção da página da Wikipedia sobre regressão logística , onde ela afirma Como o modelo pode ser expresso como um modelo linear generalizado (veja abaixo), para 0 Parece-me que posso reformular uma configuração de regressão logística em uma configuração de regressão linear. Mas não …

1
max_delta_step no xgboost
Não consigo entender completamente como esse parâmetro funciona a partir da descrição na documentação [max_delta_step [padrão = 0]] Etapa delta máxima que permitimos que a estimativa de peso de cada árvore seja. Se o valor estiver definido como 0, significa que não há restrição. Se estiver definido como um valor …
9 xgboost 



Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.