Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Resultados adversos dos critérios de agrupamento
Fiz um agrupamento de pontos de coordenadas (longitude, latitude) e encontrei resultados adversos surpreendentes dos critérios de agrupamento para o número ideal de agrupamentos. Os critérios são retirados do clusterCrit()pacote. Os pontos que estou tentando agrupar em um gráfico (as características geográficas do conjunto de dados são claramente visíveis): O …
8 r  clustering 

1
Projeto de pesquisa qui quadrado
Alguém conhece um método para comparar duas variáveis ​​com um teste do qui quadrado se as variáveis ​​são de pesquisas diferentes com svydesign()declarações diferentes ? Estou procurando testar uma diferença em uma distribuição variável em duas ondas de uma pesquisa, mas a svychisq()declaração é limitada a um objeto de design. …
8 r  chi-squared  survey 



3
Escolhendo entre transformações na regressão logística
Na regressão linear, as transformações das variáveis ​​explicativas são feitas para ter correlação máxima com a variável dependente. Qual é a melhor medida de escolha entre várias transformações na regressão logística, pois a variável dependente é binária e não contínua? O objetivo final é maximizar a sustentação (potência preditiva) do …



2
Pesos em regressão quantílica para pesquisa complexa em R
Quero incluir pesos de amostra no meu modelo de regressão quantil, mas não sei como fazer isso. Já defini meu peso, que são pesos replicados já fornecidos no conjunto de dados da pesquisa (calculado no pacote de pesquisa): w<-svrepdesign(variables=data[,1:10],repweights=data[,11:30],type="BRR", combined.weights=TRUE, weights=r.weights, rho=0.5,dbname="") e meu modelo rq é: rq(y~x,tau=c(.1,.2,.3,.4,.5,.6,.7,.8,.9),data=my.data)) Eu tentei …


1
Distância de Mahalanobis em dados não normais
A distância de Mahalanobis, quando usada para fins de classificação, normalmente assume uma distribuição normal multivariada, e as distâncias do centróide devem seguir uma (com graus de liberdade iguais ao número de dimensões / características). Podemos calcular a probabilidade de um novo ponto de dados pertencer ao conjunto usando sua …

2
Como combinar vários conjuntos de dados imputados?
Eu preciso de um único conjunto de dados imputados (por exemplo, para criar um manequim de grupo de países a partir dos dados de renda per capita do país imputado). O R oferece pacotes de pacotes para criar vários dados imputados (por exemplo, Amelia) e combinar resultados de vários conjuntos …

2
Não normalidade em resíduos
Refiro-me a este post, que parece questionar a importância da distribuição normal dos resíduos, argumentando que isso, juntamente com a heterocedasticidade, poderia ser potencialmente evitado usando erros padrão robustos. Eu considerei várias transformações - raízes, logs etc. - e tudo está se mostrando inútil para resolver completamente o problema. Aqui …


1
Estacionariedade - premissas e exame
Estou examinando capturas de roedores em seis grades permanentes de captura de roedores medindo 150 x 150 metros e consistindo em 121 estações de captura espaçadas uniformemente a 15 metros. Existem seis grades de captura no local do estudo com tamanho <1000 hectares. Gostaria de interpolar os dados de captura …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.