Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

4
Seleção de penalidade ideal para o laço
Existem resultados analíticos ou artigos experimentais sobre a escolha ideal do coeficiente do termo de penalidade . Por ótimo , quero dizer um parâmetro que maximiza a probabilidade de selecionar o melhor modelo ou que minimiza a perda esperada. Estou perguntando porque muitas vezes é impraticável escolher o parâmetro por …

2
Aplicando regressão logística com baixa taxa de eventos
Eu tenho um conjunto de dados no qual a taxa de eventos é muito baixa (40.000 de ). Estou aplicando regressão logística sobre isso. Eu tive uma discussão com alguém de onde saiu que a regressão logística não daria uma boa matriz de confusão em dados tão baixos de taxa …
15 logistic 

2
Como calcular a variação de uma partição de variáveis
Estou executando um experimento em que estou coletando amostras (independentes) em paralelo, calculo a variação de cada grupo de amostras e agora quero combinar tudo para encontrar a variação total de todas as amostras. Estou tendo dificuldade em encontrar uma derivação para isso, pois não tenho certeza da terminologia. Eu …
15 variance 

3
CDF elevado a um poder?
Se é um CDF, parece que ( ) também é um CDF.F Z ( z ) α α > 0FZFZF_ZFZ(z)αFZ(z)αF_Z(z)^\alphaα > 0α>0\alpha \gt 0 P: Esse é um resultado padrão? P: Existe uma boa maneira de encontrar uma função com st , ondeX ≡ g ( Z ) F X …

3
Como plotar a saída de dados do clustering?
Tentei agrupar um conjunto de dados (um conjunto de marcas) e obtive 2 clusters. Eu gostaria de representá-lo graficamente. Um pouco confuso sobre a representação, já que não tenho as coordenadas (x, y). Também procurando pela função MATLAB / Python para fazer isso. EDITAR Acho que a publicação de dados …



2
Quais são algumas técnicas para amostrar duas variáveis ​​aleatórias correlacionadas?
Quais são algumas técnicas para amostrar duas variáveis ​​aleatórias correlacionadas: se suas distribuições de probabilidade são parametrizadas (por exemplo, log-normal) se eles tiverem distribuições não paramétricas. Os dados são duas séries temporais para as quais podemos calcular coeficientes de correlação diferentes de zero. Desejamos simular esses dados no futuro, assumindo …







4
Aceitação de hipótese nula
Esta é uma questão de discussão sobre a interseção de estatística e outras ciências. Costumo enfrentar o mesmo problema: pesquisadores da minha área tendem a dizer que não há efeito quando o valor-p não é menor que o nível de significância. No começo, respondi muitas vezes que não é assim …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.