Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados


1
Técnicas para detectar sobreajuste
Eu tive uma entrevista de emprego para uma posição de ciência de dados. Durante a entrevista, perguntaram-me o que devo fazer para garantir que o modelo não seja ajustado demais. Minha primeira resposta foi usar a validação cruzada para avaliar o desempenho do modelo. No entanto, o entrevistador disse que …

2
O estado aleatório é um parâmetro para ajustar?
Um problema que ocorre com frequência em meus experimentos é que o modelo varia no desempenho quando o estado aleatório do algoritmo é alterado. Portanto, a pergunta é simples, devo tomar o estado aleatório como um hiperparâmetro? Por que é que? Se meu modelo supera outras pessoas com diferentes estados …

1
Momento / mgf de cosseno de vetores direcionais?
Alguém pode sugerir como eu posso calcular o segundo momento (ou a função geradora de momentos inteiros) do cosseno de dois vetores aleatórios gaussianos , cada um distribuído como , independente um do outro? IE, momento para a seguinte variável aleatóriaN ( 0 , Σ )x,yx,yx,yN(0,Σ)N(0,Σ)\mathcal N (0,\Sigma) ⟨x,y⟩∥x∥∥y∥⟨x,y⟩‖x‖‖y‖\frac{\langle x, …

2
Os dados de treinamento estão desequilibrados - mas meu conjunto de validação também deve ser?
Eu rotulei dados compostos por 10000 exemplos positivos e 50000 exemplos negativos, fornecendo um total de 60000 exemplos. Obviamente esses dados estão desequilibrados. Agora, digamos que quero criar meu conjunto de validação e quero usar 10% dos meus dados para fazer isso. Minha pergunta é a seguinte: Devo garantir que …

1
Bloquear bootstrap para um iniciante
Para colocar minha pergunta em contexto, sou físico, mas com exposição limitada à estatística e o que aprendi sobre isso há mais de 30 anos. Estou tentando aprender sobre a inicialização do bloco, pois essa técnica pode ser adequada para resolver um problema no qual estou trabalhando. Eu posso encontrar …



2
Semelhanças e diferenças entre o modelo de TRI e o modelo de regressão logística
Apesar das semelhanças básicas como os dois modelos, a probabilidade de sucesso, em vez de modelar diretamente a variável resposta; Acredito que existem respostas mais confiáveis ​​que apontam as diferenças e semelhanças entre esses modelos. Uma diferença é que, na logística, pode-se usar diferentes tipos e diferentes números de variáveis …

2
Estatística completa de
Gostaria de saber se a estatística está concluída para em uma configuração . σ2N(μ,σ2)T(X1,…,Xn)=∑ni=1(Xi−X¯n)2n−1T(X1,…,Xn)=∑i=1n(Xi−X¯n)2n−1T(X_1,\ldots,X_n)=\frac{\sum_{i=1}^n (X_i-\bar{X}_n)^2}{n-1}σ2σ2\sigma^2N(μ,σ2)N(μ,σ2)N(\mu,\sigma^2) Isso depende se é previamente conhecido ou não? Se estiver completo para , então por Lehmann-Scheffé é UMVUE . Mas se fosse conhecido, poderíamos considerar cuja variação é igual a Cramer-Rao ligou e é estritamente …

1
Valor esperado da razão de variáveis ​​aleatórias correlacionadas?
Para variáveis ​​aleatórias independentes e , existe uma expressão de formulário fechado paraαα\alphaββ\beta E[αα2+β2√]E[αα2+β2]\mathbb E \left[ \frac{\alpha}{\sqrt{\alpha^2 + \beta^2}} \right] em termos dos valores e variações esperados de e ? Caso contrário, existe um bom limite inferior a essa expectativa?αα\alphaββ\beta Atualização: Também posso mencionar que e . Posso controlar a …



2
A Random Forest é uma boa opção para a classificação de dados não balanceados? [fechadas]
Fechado . Esta questão precisa ser mais focada . No momento, não está aceitando respostas. Deseja melhorar esta pergunta? Atualize a pergunta para que ela se concentre apenas em um problema editando esta postagem . Fechado há 3 anos . Apesar das abordagens semelhantes e outras crescentes de variabilidade de …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.