市场调研数据分析
概述
本笔记合并市场调研数据分析两讲,从描述统计与假设检验,到关联分析与回归分析。
一、市场调研数据分析(一):描述统计与假设检验(原 F229·A)
一句话概括
本讲系统讲解市场调研数据分析的基础方法,包括描述性统计(集中趋势、离散程度、异常值处理)和推断性假设检验(t检验、单因素方差分析)的原理、步骤与Excel/统计软件操作。
关键结论
- 描述统计分两类:集中趋势指标(众数、中位数、均值)反映”典型”答案,离散程度指标(极差、标准差)反映答案的分散程度,二者应搭配报告(p.5-9)。
- 不同测量尺度(名义、顺序、区间、比率)对应不同的合适统计量,例如性别只能用众数和频数,而定量数据可用均值和标准差(p.8)。
- 异常值可通过”均值±2.5倍标准差”或”四分位距(IQR)1.5倍法则”两种方法识别,但应先排查数据录入错误再决定是否剔除(p.13-15)。
- 假设检验遵循统一流程:设立原假设H0与备择假设Ha、计算检验统计量、与临界值比较、依据p值(p≤α则拒绝H0)做出判断,显著性水平通常取1%或5%(p.21-25)。
- 两组均值比较用t检验(独立样本或配对样本,公式与自由度不同),三组及以上均值比较用单因素方差分析(ANOVA),其原理是将总变异分解为组内变异与组间变异,F值越大越可能拒绝H0(p.26-43)。
相关 A 级笔记
- 无
二、市场调研数据分析(二):关联分析与回归分析(原 F224·B)
一句话概括
本讲延续市场调研数据分析主题,讲解两个分类变量间关联性的卡方检验、两个定量变量间线性关系的相关分析,以及用于预测和解释多变量关系的回归分析(含虚拟变量应用)。
关键结论
- 卡方检验(χ²)用于检验列联表(cross-tabulation)中两个分类变量是否存在关联,步骤为设立H0(无关联)、计算期望频数、求χ²统计量并与临界值比较,p<0.05则拒绝H0、判定变量间存在关联(p.4-8)。
- 相关分析衡量两个定量变量间线性关联的强弱和方向(皮尔逊相关系数r介于-1到1),但相关不代表因果关系,且系数需经t检验验证是否显著(p.9-12)。相关系数强度可按|r|区间分级:0.81-1.00为极强,0.61-0.80为强,0.41-0.60为中等,0.21-0.40为弱,0.20以下几乎无相关。
- 回归分析在确认变量存在因果假设的前提下,用自变量预测因变量水平,可通过判定系数R²评估模型整体拟合度,用F检验判断模型是否有效、t检验判断各自变量系数是否显著(p.13-18)。(据课件,未经核实)
- 多元回归可同时纳入价格、促销等多个自变量,通过标准化系数比较不同量纲变量的相对影响力,还可基于估计方程代入具体数值做销量预测(p.19-23)。
- 虚拟变量(0/1编码)可用于在回归模型中量化分类变量(如性别、节假日)对因变量的影响,n个类别需设(n-1)个虚拟变量,其系数体现截距的平移而非斜率变化(p.24-26)。
相关 A 级笔记
- 无
术语表(合并)
| 中文 | 原文 |
|---|---|
| 集中趋势 | measures of central tendency |
| 离散程度 | measures of variability |
| 假设检验 | hypothesis testing |
| 原假设/备择假设 | null hypothesis (Ho) / alternative hypothesis (Ha) |
| 显著性水平 | significance level (α) |
| 独立样本t检验 | independent samples t test |
| 配对样本t检验 | paired samples t test |
| 单因素方差分析 | one-way ANOVA |
| 四分位距 | interquartile range (IQR) |
| 卡方检验 | chi-square test |
| 列联表 | cross-tabulation / contingency table |
| 皮尔逊相关系数 | Pearson correlation coefficient |
| 判定系数 | coefficient of determination (R²) |
| 虚拟变量 | dummy variable |
| 最小二乘法 | OLS method |