语言测试(欧陆娱乐语言测试学)

2023-05-07 栏目:解决方案 查看()

本文:

如何测试自己的英语水平

学习英语一段时间后,还不清楚自己的英语水平是怎么样怎么办,别担心,这里有全方位测试你英语水平的方法。下面是我给大家整理的如何测试自己的英语水平,供大家参阅!

如何测试自己的英语水平

一、 大学英语四、六级等级考试

毋需多言,绝大多数人都经历过疯狂的四、六级考试,以及与一纸证书并不相称的“哑巴英语”。这种极具“中国特色”的考试,与国际语言的评判标准完全不接轨。当然也无法代表语言的实际应用能力。

二、 雅思、托福考试

众所周知,雅思、托福考试是为申请赴欧美国家留学、移民的非英语国家学生而设,用来评定考生运用日常生活英语的能力考试。一方面,考纲针对生存生活的比重很大,不能覆盖职场商务;另一方面,在习惯了“冲刺”棚搜并、“机经”的中国考生中,大部分人针对这两种考试的学习也是遵循“应试”的套路,与“能力”水平仍有一定的差距。

三、 题库机测

有不少培训机构标榜自己可以测出学员的真实水平,但仅凭电脑上的几套题库,是根本无法做到这一点的。以选择题为主的测试,答卷者的很多分数是靠“蒙”和“中式答题技巧”获得的。只出测试分数就能评判英语水平,这种测试结果水分颇大。

四、 网络测试

在搜索引擎输入“链迹英语测试”,会出来惊人的搜索结果。但这种网络测试多以娱乐性为主,或是雷同于以上提到的电脑题库,大量的测试针对的是分数,而不是真实的水平。这样的测试毫无科学性而言。

如何测试自己的英语水平

国际通用的英语水平评价标准

CEFR 欧洲现代语言教学大纲

A Common European Framework of Reference for Languages: Learning, Teaching, Assessment,简称CEF或者CEFR,一般翻译做“欧洲现代语言教学大纲”,也有人翻译成“欧洲语言学习、教学、评估共同参考框架”。 该标准是欧盟各国外语教学和评估的标准,旨在为欧洲语言教学的课程设计、大纲制订、语言测试和教材编纂提供一个共同的基础和参考。该标准详细地描述了语言学习者进行有效交流时所必须掌握的技能和达到的标准。

CEFR将语言的实际运用能力分成三等,共六个级别:

一等:Basic User初级使用者(A),包括入门级(A1)和基础级(A2);

二等:Independent User独立使用者(B),包括进阶级(B1)和高阶级(B2); 三等:Proficient User熟练使用者(C),包括流利运用级(C1)和精漏衡通级(C2)。 值得注意的是以上六个级别并不是各自封闭的,我们还可以根据每一等的标准在其基础上继续细分。它只是一个标准框架,是可修改和可扩展的。

CEFR的语言能力描述和语言交际活动:

CEFR将语言能力分为“一般语言能力”和“语言交际能力”。前者包括知识、技能、个性、学习能力等;后者包括语言学能力、社会语言学能力和语用能力三方面。

CEFR以行动为导向(Action Oriented),它把语言交际活动分为“语言理解”、“语言产出”和“互动”,强调通过现实的语言交流来实现交际任务。

填个人简历时如何判断自己的英文能力

一、一般:

有浅易英语能力,能了解及正确运用实用的生活对话,学习英文一年以上,能听懂简单句子、自我介绍、简单对答、对话,如问候、问事物、打电话等,可识读 1500 字生活化字汇及阅读简单文章,熟悉基础句型,能写简单的句子及段落,并能以简短的文字描述或说明日常生活相关事物 。

二、熟练:

可以灵活运用简单句句型,作多种情境之英语生活对话,学习英文二年以上,可听懂情境对话及生活相关信息,如家人、居住、上学、读书、餐厅、外食点餐、问路、买书、购物等,可识读2500字实用字汇,能活用多种时态之句型,能以短篇文章表达与个人经历相关的事物,如游记、书信、阅读心得等。

三、精通:

可以灵活运用复合句句型,具有直接用英文思考及反应能力,阅读能力及写作技巧增强,学习英文二年半以上,能听懂英语演讲、报告和新闻,如饮食、服饰、家庭、人物、文化、休闲、健康、居家环境等;能理解应用英语、俚语及惯用语,可识读4000字综合性字汇,能有条理地写作专题报告、书信、与生活、学校相关之文章等。

三大英语水平测试大对比

雅思(International English Language Testing System,简称IELTS,中文名为国际英语语言测试系统)是由英国文化协会,即英国驻华大使馆/总领事馆文化教育处、剑桥大学考试委员会(CESOL)和澳大利亚教育国际开发署(IDP Australia)共同举办的国际英语水平测试。此项考试是为申请赴英语国家(美国、英国、澳大利亚、加拿大、新西兰等)留学、移民的非英语国家学生而设,用来评定考生运用英语的能力。

雅思考试包括四个部分,依次为听力、阅读、写作和口语,考试时间共2小时45分钟。每一部分都独立评分,四部分得分的平均分作为考生的雅思综合得分(小数部分取舍到最近的一分或半分,即如果平均分为6.125分,雅思得分算作6分)。成绩单上将列出考生每一部分的得分,同时给出考生的综合得分。雅思考试满分为9分。考试成绩在考试后十个工作日内通知考生。成绩有效期为两年。

TOEIC-Test of English for International Communication——是针对在国际工作环境中使用英语交流的人们而指定的"是针对在国际工作环境中使用英语交流的人们而指定的英语能力测评。每年在60多个国家有超过3百多万人次参加TOEIC考试,5000多家国际化的公司或机构承认并使用TOEIC考试成绩。因为TOEIC考试能对人们使用英语进行交流的能力做出公正客观的测量,所以它成为当今世界上顶级的职业英语能力测评。

英语是国际商务和贸易语言。国际上众多商业机构和组织已越来越深刻地意识到英语能力在国际竞争中的至关重要的作用。他们需要不断地评估现有员工和求职者的英语水平。为了迎合这种需要,美国教育考试服务处(ETS)()设计了“国际交流英语考试”(Test of English for International Communication -- TOEIC),简称“托业考试”。 TOEFL(Test of English as a Foreign Language,作为外语的英语考试——托福)是由美国教育考试服务处Educational Testing Service,ETS)举办的为申请去美国或加拿大等国家上大学或入研究生院学习的非英语国家学生提供的一种英语水平考试。美国教育考试服务处由1965年开始承办此项考试的管理工作。

对比

去美国最好考托福。雅思只有70-80%的美国学校认可,越好的学校越不认可 而且存在偏见。就是说你必须达到相应更高的分数。

本科的话托福一般要求80-100分,雅思要求6.5-7分。

IELTS考试的词汇要求并不高,主要偏向应用能力,但答题技巧因与TOEFL(托福)和国内英语考试(4-6级)完全不同,所以掌握题型和快速解答就显得非常重要。多用于 IELTS考试的词汇要求并不高,主要偏向应用能力,但答题技巧因与TOEFL(托福)和国内英语考试(4-6级)完全不同,所以掌握题型和快速解答就显得非常重要。

美国两者都承认,3000多所大学中有接近700所承认雅思成绩。

澳大利亚两者都承认。大学承认托福成绩,但政府签证要求雅思成绩。

日本两者都承认,但偏向承认托福。

韩国两者都承认,但偏向承认雅思。

加拿大两者都承认。

新西兰两者都承认。

新加坡两者都承认。

欧洲两者都承认。

托福的听力要求大于雅思,如果你听力很强,考托福,托福中不仅仅听力需要听力,口语,写作同样需要考察你的听力能力。而雅思听力相比较下简单很多。

口语,雅思简单。

阅读,托福简单,雅思文章不用我说你也知道很长,托福短一些

写作差不多。只不过托福第一段写作需要听力能力。

托福选择题较多,比较适合中国考生。雅思大部分是填空题。

就分项来说,雅思的作文比较难,很难拿高分。而托福的口语比较难,特别是新托福添加的综合部分,真的很变态。

年限都两年

实用

考托业对以后的求职有利,特别是外企在工作中无论是雅思还是托福都不受重视,只有雅思老师或者雅思学校工作人员有些作用。 其他个别企业还会以为你有出国的打算。所以说不出国,建议不要考雅思或者托福。如果想在外企工作可以考BEC商务英语或者托业。这个很重要。

出国去美国最好考托福,美国对雅思门槛高是一个(去美国一些大学雅思要7.5分以上,不是人啊!去英国6.5就够了!!) 到美国听得教授讲课都是美语学雅思练得听力和口语都适应了英式的,不适宜。

出国有意向英联邦国家的考雅思,承认度高,比托福还简单。

摘了一句话 托福是一流大专校的水平 雅思是生活水平 SAT是美国高考水平 托业是商业应用英语水平

词汇量

托福 8000~12000 雅思 6000左右 托业750分大概相当于四级和六级之间的水平词汇量应该是和四级差不多,和四级的词汇范围不同,偏重经济商业计算机等一些专业常用词汇,可以都不难

都考口语、阅读、写作、听力,托福更综合

更多信息请访问:新浪雅思频道 雅思论坛

特别说明:由于各方面情况的不断调整与变化,新浪网所提供的所有考试信息仅供参考,敬请考生以权威部门公布的正式信息为准。

 

语言测试是学什么的?

 

语言测试作为一个学科,为什么要研究测试理论(教学、科研、人才选拔)。

语言或祥测试的种类:按测试用途分:成绩测试(achievement test)、水平测试(proficiency test)、语言学能测试(language aptitude test)、诊断测试(diagonistic test)。按评分方式分:主观测试戚知(subject testing)和客观测试(objective testing)。按分数解释的方式分:常模参照性测试(norm referenced testing)和标准参照性测试(criterion referenced testing)。从高团消理论角度分:心理测量结构主义方式(psychometric-structural approach)和心理语言学——社会语言学方式(psycholinguitic-soeiolinguistic approach)。

语言测试的作用和目的

语言测试的目的:

(1)语言测试使学生在英语课程的学习过程中不断体验进步与成功,认识自我,建立自信,促进学生综合语言运用能力的全面发展。

(2)语言测试使教师获取英语教学的反馈信息,对自己的教学行为进行反思和适当的调整,促使教师不断提高教育教学水平。

(3)语言测试使学校及时了解课程标准的执行情况,改进教学管理,促进英语课程的不断发展和完善世败御。

语言测试可划分为以下几种类型:

(1)成绩测试(Achievement Test)

成绩测试旨在用来了解在一段时期内学生对所学课程内枯庆容的掌握情况,以便对学生的学习成绩做出评定。这种测试的特点是测试的内容与过去的教学有关,即考试内容即所学内容。考试题型具有代表性,一般由教师根据所教内容进行命题,各类题型在考试中所占比重与其在教学中所占比重一致。学校英语教学中的期中和期末测试就属于这一类测试。

(2)水平测试(Proficiency Test)

水平测试旨在评定受试者现有的英语水平是否达到能胜任某一新的学习任务或工作需要的程度。水平测试的命题内容不以具体的教材为依据,因此,水平测试一般具有较高的区分度,能将不同水平的受试者区分开来。水平测试一般都在全国或国际范围内举行。

(3)潜能测试(Aptitude Test)

潜能测试也叫预测性测试,是一种预测学习者学习某一新语言的能力倾向的测试,旨在衡量受试者今后学习该语言时是否具有较强的学习能力。潜能测试的命题依据是对语言能力的结构分析。

(4)诊断测试(Diagnostic Test)

诊断测试旨在诊断和分析学生在学习过程中存在的问题。诊断测试能为教师提供直接的教学反馈信息,便于教师及时改进教学手段,提高教学质量。诊断测试是为了了解学生学习的困难,找出教学上的薄弱环搜岩节,以便采取补救措施来完善教学。诊断测试常常基于教师的教学经验以及学生对某些语言点尚未完全掌握所表现出的种种迹象来命题。诊断测试的成绩一般不用来衡量和评估学生的学习水平。教学过程中的单元测试、项目测试都是这类测试。

(5)结业测试(Exit Test)

结业测试是一种仪式性的考试。大多数的结业测试更注重形式,因此结业测试内容既可以是所学课程的成绩考试,又可以是一般语言水平的测试。

语言测试的效,信,难,区

1 语言测试标准项回顾

谈到语言测试的标准,大凡都不能不谈到效度(validity)、信度(reliability)、难度(difficulty level)与区分度(differentiation)。各种语言测试,无论是在语言试题设计的前期的控制,或者是对其设计产品的评估,再或者是对后期测试工作流程结束后的评估分析,都有一个倾向,既要考虑主要影响前期操作的三大标准项,又需考虑考虑主要影响后期操作的两大标准项。即便是对于效度(语言测试的目的性)和信度(语言测试的可信程度)之间的关系的处理上,也经常呈现出一种必须以语言的真实使用来牺牲语言测试的客观量化的结果,具体体现在各类语言测试主观题量的增加和客观题量的降低方面。

究其原因,主要在于对各个语言测试标准项关系的不同理解。对于效度和信度的关系,一般的观点都认为他们是一对矛盾,即是一种跷跷板(seesaw)的关系:提高信度便意味着损失效度,反之亦然。李筱菊从影响因素以及构成因素的角度具体讨论了效度和信度,并在包括效度-信度关系在内的七大关系方面进行了深入的讨论(见李延林2005),并列举了常见的四大关系处理方案,然而,似乎并没有从根本上解决效度和信度的矛盾关系问题。中国大学英语四、六级英语考试和英语专业四、八级的改革似乎也主要停留在主观试题的增加、口语的增加和对测试结果的所谓解释方面(有借鉴IELTS考试的倾向)汪巧。语言测试并不只针对高校学生,从覆盖面上讲,中学乃至小学和幼儿语言教育在语言测试方面,尤其是测试标准方面的讨论在当前更应当受到重视。而对于测试效度和信度的普遍性处理方法和对难度与区分度的简单偏执显然不利于基础语言教育的改革,只能使考教越发分离,使教学与考试脱离的现象愈加严重。毫无疑问,如果难度和区分度对于高考而言还有一定意义,选拔研究生考试和出国考试应当考虑加大一些试题的难度,以造成一定的区分度,达到选拔人才的目的的话,那么,在任何考试中都必须让考生分出来个一二三的主观想法显然是幼稚的;仅仅认为主观题是高效度而客观题是低效度的看法也是偏激不合实际情况的。

2 效度和信度的关系

语言测试的效度必须首先考虑。因为它决定语言测试是否达到其目的。简单地说,听说技能的测试效度必须由听说试题来反映;读写试题的效度也必须由读写来实施。从这个道理上讲,它和我们汉语里的‘效果’虽然不存在对等关系,但还是有着不可分的内在关系。另外,期中考试作为一种提供信息的考试(informative),和主要目的在于总结语言学习的期末测试应当有相同点和不同点共存的特点,也会对困御键语言测试的效度有影响。如果期中考试仅仅是以一篇作文甚至是一次作业作为考察的手段,那么期末考试理应在作文方面占据相当的比例。追求高信度是统计学的一大特点。把语言分解成若干单元从语言使用的角度看似

乎不可思议,但语言学习不可能是一蹴而就的,对于语境(这里指使用语言的情景而非语言学语境或上下文)也不可能是空中楼阁,拆判它需要我们对语言的单句上下文掌握的前提下再进一步考虑,对于语言测试而言更是如此。一般认为,没有信度的测试是无用的;没有效度的测试谈不上信度。我们以为,这种理论上的关系讨论对于语言测试实践没有任何的意义。没有信度是零的语言测试,除非是大面积的作弊。也没有完全缺少效度的测试,除非出题人完全不懂语言教学规律和语言测试技术。因此,单个看待语言的效度和信度要比这种武断的矛盾一元论理论观点更加实在一些。李筱菊对于效度和信度的关系处理给我们提供了一个视角,即不仅仅从这两个词的定义入手,而是从其构成和影响因素着手。从她的讨论不难看出,影响信度的因素远比影响效度的因素要多。这样,从追求双高,即高效度和高信度的角度看,我们似乎看到了一丝希望。对于某些影响因素的改善如果可以提高效度或者信度而不至于影响到整体平衡(语言测试毕竟不同于跷跷板,不会稍有差异就会出现天壤之别的现象),那么语言测试实践就会减轻很多压力。解决这一对看似矛盾的另外一个办法在于从上一层系统来看待他们的关系,也就是需我们从一个系统角度而不是从对抗角度(trade-off)来关注这种关系。如果语言学习输入和输入强化对于初学者起到很大作用的话,如果学习者输入(learner input)在学习初期根本没有可能或者不现实的话,那么,语言测试的首要标准项就不应当以所谓的语言输出(或者称作语言生产)为主,而应当考虑以联想和激发回忆为主的语言识别的能力。这样,我们就可以借鉴应用语言学家给我们提供的连续体(continuum)的模式(见Bachman:1990)来考虑语言测试中效度和信度的关系(见表1)。在连续体的一端是高效度,在另外一端是高信度。对其不同的需要决定试题是高信度或者高效度,或者居中,但不存在好与不好的问题,或者,确切地说,它的好坏完全由测试的目的(不同于效度)和种类决定。

 A 语言输入 语言识别 B

高信度―――――┼―――――――高效度

 C 语言输出 语言生产 D

以上图表显示,比较理想的试题应当在D区和A区。虽然语言学习者终身都离不开语言输入,但对于初学者和低年级学习者而言,语言的识读能力的培养应当重于组织能力;体现在语言测试中,其高信度应当重于高效度。而对于语言水平较高的学习者而言,其语言组织能力的培养应当是重中之重,应当体现在语言生产的试题之中。当然,这里面还牵扯一个语言测试种类的问题和与教学课本相关的教学内容以及测试内容效度的问题,鉴于不是本文讨论的焦点,在此不再赘述。

3 难度与区分度的关系

语言测试在设计方面有一个常规,即试题在内容及试题题型方面应遵从从‘易’到‘适合’再到‘难’的规则。这在理想测试结果图上也有体现:两头小,中间大的弧形模式。这样做的目的在于让参加测试的语言学生能够熟悉、适应测试过程并最终形成所谓的理想弧度。

语言测试技术有一个原则,即不给考生设定陷阱。难度作为一个相对的概念,不应体现在试题的题型上,而更应体现在学生的所学内容方面。为了降低难度而将主观题变更为客观题的做法如果还算可以理解的话,那么,通过这种办法增加难度的做法就不可思议了;而为了增加难度将很少出现或使用的语言项目大量纳入试题的做法就更显得荒唐(除非是语言禀赋测试,即aptitude测试)。对于普通语言测试而言,应当和所学挂起钩来。只要课本选择合适,只要教学内容与方法合适,平时的小测验也好,期中考试也好,或者期末考试也好,都应当反映平时所学,以检测学生在该门课程方面的学习情况,更多地反映学习者的进步程度(progress或achievement),而不完全是其语言水平(proficiency test),更不是通过语言测试在学习者之间进行比较,形成竞争压力甚致于引起负面学习焦虑情绪。增加难度的目的在于区分,而区分度的本质在于把学习者分为不同等级,如果因此而进行动态班级调整施行分班或者分级教学的话还有一定的道理,但仅仅为了区分而忽略语言学习中竞争带来的负面影响,强化常模测试(norm-based testing)的作用,忽略语言标准测试(criteria-based testing)的存在,则对于语言教学与测试实践都不会带来很大的益处。对于语言试题难度和区分度,对于分数分布曲线的考虑或者对于偏态值和峰值的考虑在分班/级测试和常模测试的情况下必须涉及外,仅从标准测试角度看没有必要一定要考虑。另外,为了区分而影响到语言测试的反拨效度(wash-back effect),则在很大程度上会影响到语言学习这一主要矛盾,会损失语言学习和语言测试的主要方面。

语言测试的标准一致是应用语言学家关注的事情。对效度和信度之间的关系研究长期以来一直在语言教学与实践中徘徊,不是偏左就是偏右,再就是折中。我们认为,除了在平衡方面想办法,如可以考虑提高信度的完型填空题,还可以考虑从不同的角度分别考虑。本文在这个基础上提出了与测试种类相关的测试目的的老概念,试图从语言测试需求的角度,从Bachman提出的系统连续体的角度重新审视效度和信度之间的关系。至于语言的难度和区分度,本文以为,应当视需求而实施,而不应当盲目地甚至是无限制地推广,使之成为‘放之四海而皆准’的准绳。

语言教育教学和语言测试理论及实践的研究不会停止,对于语言测试的标准也会继续。如果我们在语言教学和测试方面能够找到一个好的契合点,如果我们能够逐步解决高考英语测试指挥棒和四/六级或四/八级指挥棒的问题,那么我们所倡导的减负和减压等措施便能真正落到实处,培养创新人才,而不是应试能手。无论对于语言教学或者对于语言测试实践而言,Leech在2001年第三届中国英语教学国际研讨会上所提交的主题报告Teach the Frequent before the Rare(教授常用语言项先于罕见语言项)无疑都具有一定的启发意义,而这也是包括中国在内的英语教学的一大症结所在。

分类

测试的效度一般可分为以下几类:

1)表面效度(face validity)

指测试应达到的卷面标准,即一套测试题从表面看来是否是合适的。例如,若一次阅读理解力的测试包括许多受试者没有学过的方言词汇,则可认为这次测试缺乏表面效度。表面效度是测试出受试者正常水平的一种保证因素。

2)内容效度(content validity)

指一套测试题是否测试了应该测试的内容或者说所测试的内容是否反映了测试的要求,即测试的代表性和覆盖面的程度。例如,如果某一套发音技能测试题仅仅考查发音所必须具备的某些技能,如只考单一音素的发音,而不考查重读、语调或音素在词语中的发音,那么,该测试的内容效度就很低。

3)编制效度(construct validity)

指一套测试题的诸项目对编制该测试所依据的理论的各个基本方面的反映程度。例如,以结构主义语言理论为基础,认为系统的语言习惯是通过句型而获得的,那么,强调词汇和语法环境的测试题目就失去了编制效度。

4)经验效度(empirical validity)

经验效度是一种衡量测试有效性的量度,通过把一次测试与一个或多个标准尺度相对照而得出。经验效度可分为两种:一是共时效度(concurrent validity),即将一次测试的结果同另一次时间相近的有效测试的结果相比较,或同教师的鉴定相比较而得出的系数;二是预测效度(predictive validity),即将一次测试的结果同后来的语言能力相比较,或是同教师后来对学生的鉴定相比较而得出的系数。

一般来说,对某次测试的效度进行检验时,除了要根据教学大纲的要求和观念有效性的理论对试卷的内容进行考查以外,还须采用计算相关系数的定量方法,即计算出本次试卷与另一份已被确定能正确反映受试者水平的试卷之间的相关系数。系数高则有效性大。课堂测试的效度应在0.4-0.7之间,规模较大的测试其效度应在0.7以上。

影响因素

测量的效度就是指测量的有效性,即能测量到所要测量目标的程度。一般来说,效度的作用比信度的作用更为重要。如果一个测验效度很低,无论它的信度有多高,这项测验都没有应用价值。较高的效度是一个良好的测验最重要的特性,是必要条件,也是选择和评鉴测验的重要依据。但是很多方面都在影响测量的效度,下面主要从测验本身、样本团体、效标因素进行具体分析。

测验的因素

由测验本身带来的影响因素有测验题目的质量、测验实施中的干扰、测验的长度、被试的因素等。

测验题目的质量

题目的指导语不明确、试题的表达不清晰、试题太难或太容易、题目中出现额外的线索、诱答设计不合理、题目过少、试题的安排和组织不恰当、试题不符合测验目的等因素,都会影响测验的效度,使效度降低。

实施测验时的干扰因素

测验的环境太差、被试不遵从指导语、记分错误,都会使测验的效度降低。

测验的长度

一般来说,增加测验的长度通常可以提高测验的信度,而效度系数能否达到最大值也受信度的影响,因此,增加测验的题目往往也能提高测验的效度。不过,效度增加的前提是这些增加的题目必须与测量的目标相关。

被试的影响因素

被试的反应定势、测验动机、情绪和身心状态都会对测量效度的影响。

样本团体性质

对效度的计算往往是通过对样本团体的分数进行各种分析而得到的,所以样本团体的性质也会对测验的效度产生影响。这些影响体现在三个方面。

(1) 同一测验对不同的团体所测量的功能可能是不同的;

(2) 对于同一个测验,样本团体的性质不同,效度也会有较大的差别;

(3) 样本团体的异质性对效度也会有影响。

效标性质

在采用效标关联效度时,效标的性质如何,会影响对测验效度的评价。一般来说,如果其他条件相同,所测量的行为或心理特质与效标行为或特质越相似,效度系数就越高。另外,效标与测验分数之间的关系是否线性也是一个很重要的影响因素。

测试信度(test reliability)也叫测试的可靠性,指的是测试结果是否稳定可靠。

也就是说,测试的成绩是不是反映了受试者的实际语言水平。例如,如果同一套测试在对同一测试对象(即受试者本身没有变化)进行的数次测试中,受试者的分数忽高忽低的话,则说明该测试缺乏信度。测试的信度与测试的效度有着密切的关系。

一般说来,只有信度较高的测试才能有较高的效度,但效度较高不能保证信度也一定较高。测试的信度主要涉及到试题本身的可靠性和评分的可靠性这两个方面。试题本身是否可靠主要取决于试题的范围、数量、试题的区分度等因素;评分是否可靠则要看评分标准是否客观和准确。

应用实例

测试的信度通常用一种相关系数(即两个数之间的比例关系)来表示,相关系数越大,信度则越高。当系数为1.00时,说明测试的可靠性达到最高程度;而系数是0.00时,则测试的可靠性降到最低程度。在一般情况下,系数不会高到1.00,也不会降到0.00,而是在两者之间。对信度指数的要求因测试类别的不同而不同,人们通常对标准化测试的信度系数要求在0.90以上,例如“托福”的信度大致为0.95,而课堂测试的信度系数则以0.70-0.80之间为可接受性系数。测试信度的计算方法有很多种,以下仅介绍三种易于操作的方法:

1)重测法

(the retesting method)。用同一套试卷在两个不同时间内来测试同一批受试者,这样便获得两组分数,然后计算出两组分数的相关系数。当然,在两次测试中,学生第二次的测试成绩理应比第一次的要高,因为在第二次测试时学生已经有了进步而且临场经验也更丰富了。但是若该试题是比较可靠的,每个学生在两次测试中的排名次序应该是基本不变的。

2)交替形式法

(the alternative method)。对同一批受试者使用试题类型完全相同,难易程度相当,但具体题目不同的两套对等试卷先后进行两次测试,然后计算出两次得分的相关系数。

3)对半法

(the split-half method)。测试只进行一次,但将整份试卷的题目按单、双数分成两组来分别计分,算出两组分数的相关系数,然后再用Spearman-Brown的公式计算整份试卷的信度系数。具体计算步骤是:将两组分数的相关系数乘以2,再除以1加两组分数的相关系数。

试题难度(item difficulty)衡量试题质量高低的指标之一测验(试卷)中试题(项目)的难度,是衡量该试题对被试者全体的适合程度.用d表示难度水平,0=d=1. d=1表示难度水平最高,即该试题没有一个被试者做对;d=0,表示该试题全体被试者都做对,即难度水平最低.。

试题难度(item difficulty)衡量试题质量高低的指标之一测验(试卷)中试题(项目)的难度是衡量该试题对被试者全体的适合程度.用d表示难度水平,0镇d1. d=1表示难度水平最高,该试题没有一个被试者做对;d=。表示该试题全体被试者都做对,即难度水平最低.

试题的难度水平d值的大小必然会影响到区分度、信度、效度的大小.计算d值的主要方法是平均数法:用a表示试题的满分,厉表示全体被试者得分的平均值,则

若对某试题,答对得a分,答错得0分(无中间分数,例如,对选择题或是非题等),则x/a为全体被试者在该试题的答对率,记p^}/a,则d一1-p.若被试者人数为N,该试题答对的被试者人数为R,

区分度是指试题对被试者情况的分辨能力的大小,主要用于评价以选拔为目的的选题。

试卷区分度反映试题区分不同水平受试者的程度,即考出学生的不同水平,把优秀、一般、差三个层次的学生真正分别开。区分度高的考试,优秀、一般、差三个层次的学生都有一定比例,如果某一分数区间学生相对集中,高分太多或不及格太多的考试,区分度则低。

计算

如果把成绩从高往低排序,前50%的考生为高分组,后50%为低分组。其计算公式为:D=2(XH—XL)/W,其中,D为区分度,XH为高分组平均分,XL为低分组平均分,W为试卷总分(一般为100分或150分)。

为了简单计算, 教师可以使用下面的一种方法进行计算区分度:

先将分数排序,P1=27%高分组的难度,P2=27%低分组的难度,区分度D=(27%高分组的平均分-27%低分组的平均分)÷满分值。

区分度一般在-1~+1之间,值越大区分度越好。试题的区分度在0.4以上表明此题的区分度很好,0.3~0.39表明此题的区分度较好,0.2~0.29表明此题的区分度不太好需修改,0.19以下表明此题的区分度不好应淘汰。

计算区分度的方法很多,需要特别注意的是对同一个试题的考试成绩采用不同的方法所得到的区分度的值是不同的。

语言测试和评价的区别

语言测试和评价的区别为:性质不同、包括不皮咐同、作用不同。

一、性质不同

1、语言测试:语言测试指的是外语测试,是语言教学过程中的一个重要有机组成部分。

2、语言评价:语言评价是指在语言活动运行的过程中,为使活动效果更好而修正其本身轨道所进行的评价。

二、包括不同

1、语言测试:语言测试包括离散项目测试、综合性测试。

2、语言评价:语言评价包括形成性评价、总结性评价。

三、作用不同

1、语言测试:语言测试主要用于外语教学和外语研究,是衡量外语教学的重要手段,语言测试为汪握局外语教困让学提供反馈信息,对教学具有反拨作用,测试结果对改进教学方式、提供教学质量有着重要的作用。

2、语言评价:语言评价是“激励学生学习,帮助学生有效调控自己的学习过程,使学生获得成就感,增强自信心,培养合作精神”。形成性评价使学生“从被动接受评价转变成为评价的主体和积极参与者。

什么是言语测试?

言语测试就是

通过和用户语言交流评估咐衫用户听力

的严重程度

它能客观与专业的反应出患者个体

的社交能力和交流能力

对助坦败听的效果评估有着重让简颤大意义

扫二维码与项目经理沟通

我们在微信上24小时期待你的声音

解答本文疑问/技术咨询/运营咨询/技术建议/互联网交流

郑重申明:以外的任何单位或个人,不得使用该案例作为工作成功展示!