1xBET

Xcalibre 软件:项目反映理论(IRT)入门、模型与示例

欢迎您接见环中1xBET!

什么是项目反映理论(IRT)?

IRT 是生理丈量学领域中的一类模型 ,用于设计、分析、验证和计吩炖估考试。它是一套壮大的生理丈量范式 ,宽泛利用于教育、生理学、人力资源等领域。IRT 解决了诸多关键丈量问题 ,如跨年等值、自适应考试设计及垂直量尺构建等。

IRT 是模型驱动的 ,即如果一个特定的数学方程 ,而后基于原始数据拟合模型 ,类似于线性回归。模型将人和标题置于统一个潜在量尺(通常称为 θ ,theta)上 ,该量尺代表所丈量的特质(如智商、焦虑水平或特定知识)。IRT 曾被称为潜在特质理论和项目特点曲线理论。

Xcalibre 的作用:IRT 必要使用专门设计的软件。Xcalibre 提供了一个用户敦睦且可视化的平台 ,用于执行 IRT 分析。

?

为什么必要 IRT?

IRT 代表了生理丈量学的沉要创新。它不仅是分析考试数据的一种方式 ,更是驱动考试设计、构建、施测、计分和分析全周期的范式。IRT 的优势蕴含:

  • 比经典丈量理论(CTT)更正确地评估考试分数

  • 为被试提供更精准的反馈

  • 通过差距项目职能(DIF)等技术削减工具误差

  • 实现跨年等值 ,维持分数意思

  • 支持垂直量尺构建(如跨年级课程衔接)

  • 是实现自适应考试的必要前提

  • 合用于多种考试体式(速度考试和难度考试均可)

IRT 必要较大的样本量和更深的领域知识(通常需博士级生理丈量学家) ,因而不合用于幼规模考试(如大学期末考) ,但全球险些所有大型考试均选取 IRT。

?

CTT 的局限性驱动 IRT 的发展

CTT 已有约百年汗青 ,因其单一向观 ,仍被宽泛利用。但其局限性蕴含:

  • 统计量依赖样本 ,无法迁徙到分歧样本

  • 统计量绑定于特定考试大局

  • 不合用于稀少矩阵数据(如多大局、线性按需考试或自适应考试)

  • 等值能力较弱

  • 重要针对中等能力被试 ,对高、低能力被试丈量禁绝

  • 未思考猜测成分

  • 计分不依赖标题难度

  • 不支持自适应考试

  • 如果所有被试丈量误差一样(现实中并非如此)

  • 如果标题与被试关系为线性(现实不成能)

IRT 较好地解决了上述问题。

?

IRT 的参数

对于二分计分题(正确/谬误) ,每个标题有三个参数:

  • a(分辨度参数):衡量标题分辨高、低能力被试的能力 ,通常领域 0~2 ,越高越好 ,但无数标题不超过 1.0。

  • b(难度参数):批示标题合用于哪一能力水平的被试 ,通常领域 -3~+3 ,0 代表均匀能力水平。

  • c(伪猜测参数):即项目反映函数的下渐近线 ,通常取 1/k(k 为选项数)。

这些参数共同界说了项目反映函数(IRF) ,暗示答题正确的概率随能力变动的曲线。例如 ,a≈1.0 批注分辨度尚可 ,b≈0.0 批注难度适中 ,c≈0.20 类似五选一的选择题。

凭据是否必要猜测 ,可选用三参数、双参数(a,b)或单参数(Rasch 模型 ,仅 b)。多分计分题(如里克特量表或部门计分题)则扩大模型以蕴含更多参数。

?

IRT 的现实利用示例

IRT 利用 IRF 实现多种用处 ,蕴含:

  • 解读和改善标题机能

  • 选取最大似然或贝叶斯步骤计分

  • 考试组卷(蕴含线性按需考试和预等值)

  • 推算被试分数的正确性

  • 开发推算机自适应考试(CAT)

  • 后等值

  • 差距项目职能查抄(寻找误差)

  • 数据取证(发现舞弊或其他问题)

此表 ,通过组合各标题标 IRF ,可得到考试信息函数(TIF)和前提丈量尺度误(CSEM)。TIF 越高 ,暗示该能力区间丈量信息越多;CSEM 是 TIF 的倒数 ,可用于构建相信区间(如分数 ± 1.96×SEM)。

?

IRT 的如果

  • 所丈量的潜在特质是单维的(若为多维 ,可使用多维 IRT 或别离处置)

  • 标题间部门独立性(作答一题不受其他题影响)

  • 正确作答概率由被试能力水平和模型参数决定 ,允许随机误差

?

IRT 的重要优势

  • 量表样本独立性(分歧样本了局可在线性变换下转换到统一量尺)

  • 统计量不绑定于特定考试大局

  • 合用于稀少矩阵

  • 更强的等值能力

  • 能更好丈量高、低能力被试

  • 支持垂直量尺

  • 思考猜测成分

  • 计分基于标题难度

  • 支持自适应考试

  • 误差估计因人而异

  • 支持更强的考试组卷

  • 不如果线性关系

?

IRT 模型家族

IRT 蕴含多种模型 ,凭据标题计分方式和维度划分:

单维模型

  • 二分计分:Rasch 模型(1PL)、2PL、3PL、4PL

  • 多分计分:Rasch 部门计分、Rasch 等级量表、广义部门计分、广义等级量表、分级响应模型

多维模型(每个标题涉及多个潜在因子)

  • 赔偿型(一种能力可赔偿另一种)

  • 非赔偿型(各能力均需较高水平)

  • 双因子模型

多维 IRT 虽已存在数十年 ,但在现实中利用较少。

?

若何使用 Xcalibre 进行 IRT 分析

首先是获取尺度软件 ,贸易软件如 Xcalibre ,也可使用 R 或 Python 中的包。软件会通过迭代循环拟合模型 ,并评估模型拟合度。

?

Xcalibre 输出示例(二分计分题)

  • 标题编号、使用模型(如 3PL)、作答人数、正确率

  • 经典分辨度(点二列有关)和 IRT 分辨度(a 参数)

  • 难度(b 参数)、伪猜测(c 参数)

  • 拟合统计量(卡方和 z-Resid) ,用于判断模型与数据匹配水平

?

Xcalibre 输出示例(多分计分题——广义部门计分模型)

  • 显示各分数等级(如 0、1、2、3 分)的概率曲线

  • 天堑地位(曲线交叉点)暗示分歧分数等级转化的能力阈值

  • 援手判断标题各分数等级是否合理分辨分歧能力被试

?

?

有关文章?
更多文章 →

?

  • ?
查看Xcalibre软件详情

热点资讯

2026-07-15 17:00
首页    技术文档    Xcalibre 软件:项目反映理论(IRT)入门、模型与示例
【网站地图】