Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Distribuições em subconjuntos de
Gostaria de saber se há algum tipo de distribuição padrão em subconjuntos de números inteiros . De maneira equivalente, poderíamos expressar isso como uma distribuição em um vetor de comprimento de resultados binários, por exemplo, se então corresponde ao vetor (1, 0, 1, 0, 1) .{1,2,...,J}{1,2,...,J}\{1, 2, ..., J\}JJJJ=5J=5J = …


4
Como plotar 20 anos de dados diários em séries temporais
Eu tenho o seguinte conjunto de dados: https://dl.dropbox.com/u/22681355/ORACLE.csv e gostaria de plotar as alterações diárias em 'Abrir' por 'Data', então fiz o seguinte: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") e recebo o seguinte: Agora, obviamente, este não é o melhor enredo de todos os tempos, então estou me perguntando …

1
Referências estatísticas freqüentistas para alguém bem versado na teoria moderna das probabilidades
Vindo de uma formação rigorosa na análise e na teoria moderna das probabilidades, considero as estatísticas bayesianas diretas e fáceis de entender, e as estatísticas freqüentistas incrivelmente confusas e pouco intuitivas. Parece que os freqüentadores estão realmente fazendo estatísticas bayesianas, exceto com "antecedentes secretos" que não são bem motivados ou …


2
Determinando o maior colaborador de um grupo
Eu não sei muito sobre estatísticas, então tenha paciência comigo. Digamos que eu tenho um conjunto de 1000 trabalhadores. Quero descobrir quem é o trabalhador mais esforçado, mas só posso medir a quantidade de trabalho realizado em grupos de 1 a 100 em mais de uma hora de trabalho. Supondo …


2
Cálculo de problemas, interpretação de conjuntos de regsubs e perguntas gerais sobre o procedimento de seleção de modelos
Eu quero selecionar modelos usando regsubsets(). Eu tenho um quadro de dados chamado olympiadaten (upload de dados: http://www.sendspace.com/file/8e27d0 ). Primeiro anexo esse quadro de dados e, em seguida, começo a analisar, meu código é: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + …

1
Intervalos de confiança e previsão do modelo de regressão linear
Ok, estou tentando entender a regressão linear. Eu tenho um conjunto de dados e parece tudo bem, mas estou confuso. Este é o meu resumo-modelo linear: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 ‘***’ …
9 r  regression 



3
Tarefa aleatória: por que se preocupar?
A atribuição aleatória é valiosa porque garante a independência do tratamento dos possíveis resultados. É assim que leva a estimativas imparciais do efeito médio do tratamento. Mas outros esquemas de atribuição também podem garantir sistematicamente a independência do tratamento dos possíveis resultados. Então, por que precisamos de atribuição aleatória? Em …




Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.