Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

1
Resumo de um ajuste de GAM
Se encaixarmos em um GAM como: gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) Onde, usamos o conjunto de dados College, que pode ser encontrado …
12 anova  gam 

2
Exemplo de construção mostrando
Como construir um exemplo de uma distribuição de probabilidade para a qual mantém, assumindo ?E ( 1X )=1E ( X )E(1X)=1E(X)\mathbb{E}\left(\frac{1}{X}\right)=\frac{1}{\mathbb{E}(X)} P(X≠0)=1P(X≠0)=1\mathbb{P}(X\ne0)=1 A desigualdade resultante da desigualdade de Jensen para um RV com valor positivo é como (a desigualdade inversa se ). Isso ocorre porque o mapeamento x \ mapsto …

3
Existe alguém mais rápido que Usain Bolt hoje?
EDIT: Estou mais interessado nas questões técnicas e na metodologia para determinar a probabilidade de um máximo "verdadeiro" em uma determinada população, dada uma estatística de amostra. Há problemas em estimar a probabilidade de corredores mais rápidos do que Bolt nos tempos recordes, que são óbvios e sutis. Me humor, …

1
Como os dados ausentes podem ser tratados ao usar splines ou polinômios fracionários?
Estou lendo Multivariable Model Building: Uma Abordagem Pragmática à Análise de Regressão Baseada em Polinômios Fracionários para Modelagem de Variáveis ​​Contínuas de Patrick Royston e Willie Sauerbrei. Até agora, estou impressionado e é uma abordagem interessante que não havia considerado antes. Mas os autores não lidam com dados ausentes. De …

2
Splines em GLM e GAM
É errado que os splines estejam disponíveis apenas nos modelos GAM, e não nos modelos GLM? Ouvi isso um tempo atrás, e me pergunto se isso é apenas um equívoco ou se tem alguma verdade. Aqui está uma ilustração:

1
Por que a parametrização média redundante acelera o Gibbs MCMC?
No livro de Gelman & Hill (2007) (Análise de dados usando regressão e modelos multiníveis / hierárquicos), os autores afirmam que a inclusão de parâmetros médios redundantes pode ajudar a acelerar o MCMC. O exemplo dado é um modelo não aninhado de "simulador de vôo" (Eq 13.9): yiγjδk∼N(μ+γj[i]+δk[i],σ2y)∼N(0,σ2γ)∼N(0,σ2δ)yi∼N(μ+γj[i]+δk[i],σy2)γj∼N(0,σγ2)δk∼N(0,σδ2) \begin{align} y_i …

3
A otimização do PCA é convexa?
A função objetivo da Análise de Componentes Principais (PCA) é minimizar o erro de reconstrução na norma L2 (consulte a seção 2.12 aqui . Outra visão é tentar maximizar a variação na projeção. Também temos um excelente post aqui: Qual é a função objetivo do PCA ? ). Minha pergunta …



2
É errado escolher recursos com base no valor-p?
Existem várias postagens sobre como selecionar recursos. Um dos métodos descreve a importância do recurso com base nas estatísticas t. Em R varImp(model)aplicado no modelo linear com características padronizadas , o valor absoluto da estatística t para cada parâmetro do modelo é usado. Então, basicamente escolhemos um recurso com base …

2
Como usar um filtro Kalman?
Eu tenho uma trajetória de um objeto em um espaço 2D (uma superfície). A trajetória é dada como uma sequência de (x,y)coordenadas. Sei que minhas medições são barulhentas e às vezes tenho discrepâncias óbvias. Então, eu quero filtrar minhas observações. Tanto quanto eu entendi o filtro Kalman, ele faz exatamente …


2
O gráfico QQ parece normal, mas o teste Shapiro-Wilk diz o contrário
No R, tenho uma amostra de 348 medidas e quero saber se posso assumir que ela é normalmente distribuída para testes futuros. Essencialmente, seguindo outra resposta da pilha , estou analisando o gráfico de densidade e o gráfico QQ com: plot(density(Clinical$cancer_age)) qqnorm(Clinical$cancer_age);qqline(Clinical$cancer_age, col = 2) Eu não tenho uma forte …



Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.