市场调研数据分析

概述

本笔记合并市场调研数据分析两讲,从描述统计与假设检验,到关联分析与回归分析。

一、市场调研数据分析(一):描述统计与假设检验(原 F229·A)

一句话概括

本讲系统讲解市场调研数据分析的基础方法,包括描述性统计(集中趋势、离散程度、异常值处理)和推断性假设检验(t检验、单因素方差分析)的原理、步骤与Excel/统计软件操作。

关键结论

  1. 描述统计分两类:集中趋势指标(众数、中位数、均值)反映”典型”答案,离散程度指标(极差、标准差)反映答案的分散程度,二者应搭配报告(p.5-9)。
  2. 不同测量尺度(名义、顺序、区间、比率)对应不同的合适统计量,例如性别只能用众数和频数,而定量数据可用均值和标准差(p.8)。
  3. 异常值可通过”均值±2.5倍标准差”或”四分位距(IQR)1.5倍法则”两种方法识别,但应先排查数据录入错误再决定是否剔除(p.13-15)。
  4. 假设检验遵循统一流程:设立原假设H0与备择假设Ha、计算检验统计量、与临界值比较、依据p值(p≤α则拒绝H0)做出判断,显著性水平通常取1%或5%(p.21-25)。
  5. 两组均值比较用t检验(独立样本或配对样本,公式与自由度不同),三组及以上均值比较用单因素方差分析(ANOVA),其原理是将总变异分解为组内变异与组间变异,F值越大越可能拒绝H0(p.26-43)。

相关 A 级笔记

二、市场调研数据分析(二):关联分析与回归分析(原 F224·B)

一句话概括

本讲延续市场调研数据分析主题,讲解两个分类变量间关联性的卡方检验、两个定量变量间线性关系的相关分析,以及用于预测和解释多变量关系的回归分析(含虚拟变量应用)。

关键结论

  1. 卡方检验(χ²)用于检验列联表(cross-tabulation)中两个分类变量是否存在关联,步骤为设立H0(无关联)、计算期望频数、求χ²统计量并与临界值比较,p<0.05则拒绝H0、判定变量间存在关联(p.4-8)。
  2. 相关分析衡量两个定量变量间线性关联的强弱和方向(皮尔逊相关系数r介于-1到1),但相关不代表因果关系,且系数需经t检验验证是否显著(p.9-12)。相关系数强度可按|r|区间分级:0.81-1.00为极强,0.61-0.80为强,0.41-0.60为中等,0.21-0.40为弱,0.20以下几乎无相关。
  3. 回归分析在确认变量存在因果假设的前提下,用自变量预测因变量水平,可通过判定系数R²评估模型整体拟合度,用F检验判断模型是否有效、t检验判断各自变量系数是否显著(p.13-18)。(据课件,未经核实)
  4. 多元回归可同时纳入价格、促销等多个自变量,通过标准化系数比较不同量纲变量的相对影响力,还可基于估计方程代入具体数值做销量预测(p.19-23)。
  5. 虚拟变量(0/1编码)可用于在回归模型中量化分类变量(如性别、节假日)对因变量的影响,n个类别需设(n-1)个虚拟变量,其系数体现截距的平移而非斜率变化(p.24-26)。

相关 A 级笔记

术语表(合并)

中文原文
集中趋势measures of central tendency
离散程度measures of variability
假设检验hypothesis testing
原假设/备择假设null hypothesis (Ho) / alternative hypothesis (Ha)
显著性水平significance level (α)
独立样本t检验independent samples t test
配对样本t检验paired samples t test
单因素方差分析one-way ANOVA
四分位距interquartile range (IQR)
卡方检验chi-square test
列联表cross-tabulation / contingency table
皮尔逊相关系数Pearson correlation coefficient
判定系数coefficient of determination (R²)
虚拟变量dummy variable
最小二乘法OLS method