Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

1
Regressão logística para dados de distribuições de Poisson
De algumas notas de aprendizado de máquina, falando sobre alguns métodos de classificação discriminativa, em particular a regressão logística, onde y é o rótulo da classe (0 ou 1) e x são os dados, diz-se que: se x|y=0∼Poisson(λ0)x|y=0∼Poisson(λ0)x|y = 0 \sim \mathrm{Poisson}(λ_0) , e x|y=1∼Poisson(λ1)x|y=1∼Poisson(λ1)x|y = 1 \sim \mathrm{Poisson}(λ_1) , …

3
Contra-exemplos em que a mediana está fora de [Mode-Mean]
Este artigo está acima da minha liga, mas fala sobre um tópico no qual estou interessado, a relação entre média, moda e mediana. Diz : Acredita-se amplamente que a mediana de uma distribuição unimodal é "geralmente" entre a média e o modo. No entanto, isso nem sempre é verdade... Minha …
11 mean  median  mode 

2
Como começar a construir um modelo de regressão quando o preditor mais fortemente associado é binário
Eu tenho um conjunto de dados contendo 365 observação de três variáveis pm, a saber , tempe rain. Agora eu quero verificar o comportamento pmem resposta a alterações em outras duas variáveis. Minhas variáveis ​​são: pm10 = Resposta (dependente) temp = preditor (independente) rain = preditor (independente) A seguir está …






3
Confiabilidade de uma curva ajustada?
Gostaria de estimar a incerteza ou a confiabilidade de uma curva ajustada. Intencionalmente, não cito uma quantidade matemática precisa que estou procurando, pois não sei o que é. Aqui (energia) é a variável dependente (resposta) e (volume) é a variável independente. Gostaria de encontrar a curva Energia-Volume, , de algum …



1
Por que uma grande variedade de K está diminuindo minha pontuação de validação cruzada?
Brincando com o Boston Housing Dataset e RandomForestRegressor(com parâmetros padrão) no scikit-learn, notei algo estranho: a pontuação média de validação cruzada diminuiu à medida que aumentava o número de dobras além de 10. Minha estratégia de validação cruzada era a seguinte: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, …

2
Distribuição beta ao lançar uma moeda
O livro bayesiano de Kruschke diz que, com relação ao uso de uma distribuição beta para lançar uma moeda, Por exemplo, se não temos conhecimento prévio além do conhecimento de que a moeda tem um lado da cabeça e um da cauda, ​​isso equivale a ter observado anteriormente uma cabeça …

4
A soma das variáveis ​​aleatórias lognormal independentes aparece lognormal?
Estou tentando entender por que a soma de duas (ou mais) variáveis ​​aleatórias lognormal se aproxima de uma distribuição lognormal à medida que você aumenta o número de observações. Procurei on-line e não encontrei nenhum resultado sobre isso. Claramente, se e são variáveis ​​lognormal independentes, então pelas propriedades dos expoentes …

3
Quais são as vantagens de um gerador aleatório exponencial usando o método de Ahrens e Dieter (1972) e não por transformação inversa?
Minha pergunta é inspirada no gerador de números aleatórios exponenciais embutidos de R , a função rexp(). Ao tentar gerar números aleatórios distribuídos exponencialmente, muitos livros recomendam o método de transformação inversa, conforme descrito nesta página da Wikipedia . Estou ciente de que existem outros métodos para realizar essa tarefa. …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.