Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados





2
Como justificar rigorosamente as taxas de erro falso-positivas / falso-negativas escolhidas e a relação de custo subjacente?
Contexto Um grupo de cientistas sociais e estatísticos ( Benjamin et al., 2017 ) sugeriu recentemente que a taxa de falso positivo típica ( αα\alpha = 0,05) usada como limiar para determinar a "significância estatística" precisa ser ajustada para um limiar mais conservador ( αα\alpha = 0,005). Um grupo concorrente …


1
Forma matricial de retropropagação com normalização em lote
A normalização de lotes foi creditada com melhorias substanciais de desempenho em redes neurais profundas. Muito material na internet mostra como implementá-lo, ativação por ativação. Eu já implementei backprop usando álgebra matricial e, como estou trabalhando em linguagens de alto nível (enquanto confio em Rcpp(e eventualmente GPUs) para multiplicação densa …


1
Are
Meu colega deseja analisar alguns dados após transformar a variável de resposta, elevando-a ao poder de (isto é,Y0,125).1818\frac18y0.125y0.125y^{0.125} Estou desconfortável com isso, mas estou tentando entender o porquê. Não consigo pensar em nenhuma lógica mecanicista para essa transformação. Também nunca vi isso antes, e me preocupo com o fato de …

5
quando
XXX eYYY são independentemente distribuídos variáveis aleatórias ondeX∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)} eY∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right). Qual é a distribuição deZ=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X ? A densidade conjunta de (X,Y)(X,Y)(X,Y) é dada por fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}f_{X,Y}(x,y)=f_X(x)f_Y(y)=\frac{e^{-\frac{x}{2}}x^{\frac{n-1}{2}-1}}{2^{\frac{n-1}{2}}\Gamma\left(\frac{n-1}{2}\right)}\cdot\frac{y^{\frac{n}{2}-2}(1-y)^{\frac{n}{2}-2}}{B\left(\frac{n}{2}-1,\frac{n}{2}-1\right)}\mathbf1_{\{x>0\,,\,00\,,\,|z|

3
O pesquisador 1 executa 1000 regressões, o pesquisador 2 executa apenas 1, ambos obtêm os mesmos resultados - devem fazer inferências diferentes?
Imagine que um pesquisador esteja explorando um conjunto de dados e execute 1000 regressões diferentes e encontre uma relação interessante entre eles. Agora imagine outro pesquisador com os mesmos dados executando apenas 1 regressão, e é o mesmo que o outro pesquisador fez 1000 regressões para encontrar. O pesquisador 2 …

1
Modelos aditivos generalizados (GAMs), interações e covariáveis
Eu estive explorando várias ferramentas de previsão e constatei que os Modelos Aditivos Generalizados (GAMs) têm o maior potencial para essa finalidade. GAMs são ótimos! Eles permitem que modelos complexos sejam especificados de maneira muito sucinta. No entanto, essa mesma sucessão está me causando alguma confusão, especificamente no que diz …
12 r  modeling  gam  mgcv 



2
Compreendendo a regressão logística e a probabilidade
Como a estimativa de parâmetros / treinamento de regressão logística realmente funciona? Vou tentar colocar o que tenho até agora. A saída é y a saída da função logística em forma de probabilidade, dependendo do valor de x: P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)={1\over1+e^{-\omega^Tx}}\equiv\sigma(\omega^Tx) P(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1-P(y=1|x)=1-{1\over1+e^{-\omega^Tx}} Para uma dimensão, as chamadas Odds são definidas da seguinte …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.