Значение словосочетания РЕЗУЛЬТАТЫ ТЕСТА Что такое РЕЗУЛЬТАТЫ ТЕСТА?
Лабораторные тесты несовершенны и могут ошибочно определить некоторых здоровых людей как больных (ложноположительный результат) или могут ошибочно определить некоторых больных людей как здоровых (ложноотрицательный результат). Способность теста правильно выделять пациентов с заболеванием зависит от того, насколько вероятно то, что у человека имеется заболевание (априорная вероятность), и от результат (Result) сущностных рабочих характеристик теста. В
случаях недостаточности информативности
какого-либо теста прибегают к использованию
батареи тестов. Однако последнее, даже
при наличие высоких раздельных критериев
информативности (судя по коэффициентам
корреляции), не позволяет получить
единое число. Здесь на помощь может
прийти более сложный метод математической
статистики – факторный
анализ.

Такая проверка содержания широко используется при измерении академической успеваемости, но с признанием неизбежной роли суждений. Так, тест по геометрии обладает валидностью содержания (или учебной программы), если эксперты (например, учителя) считают, что он адекватно отражает школьную программу по данной теме. При широком толковании содержание охватывает как желаемые навыки (например, вычислительные способности), так и пункты информации в случае тестов достижений.
НЕКОТОРЫЕ ТЕХНИКИ ТЕСТ-ДИЗАЙНА
Однако то, что является разумным периодом времени тестирования, частично зависит от решений, которые должны быть приняты на основе теста. Каждый тест должен сопровождаться практичной и экономически целесообразной схемой подсчета баллов, предпочтительнее та, которая может быть подсчитана машиной или быстро обученным персоналом. Измерить какое-либо свойство или действие – значит присвоить ему уникальную позицию на числовой шкале. Когда числа используются только для идентификации отдельных людей или классов (как на спинах спортсменов футбольной команды), они представляют собой номинальную шкалу. Когда набор чисел отражает только относительный порядок вещей (например, приятность-неприятность запахов), он представляет собой порядковую шкалу. Интервальная шкала имеет равные единицы измерения и произвольно назначаемую нулевую точку; одной из таких шкал, например, является температурная шкала Фаренгейта.
- Тестом называется измерение или испытание, проводимое с целью определение состояния или способностей спортсмена.
- Более общие вопросы с множественным выбором более приемлемы, когда требуется только выбрать лучший ответ; они гибкие, имеют высокую надежность и не ограничиваются простым знанием фактов.
- Силовые тесты, как правило, более актуальны для таких целей, как оценка академической успеваемости, для которой наивысший уровень сложности, на котором человек может преуспеть, представляет больший интерес, чем его скорость при выполнении легких заданий.
- Она должна сделать вывод о таких ненаблюдаемых частных ощущениях, услышав плач или бульканье ребенка, увидев, как он размахивает руками, хмурится или улыбается.
- Например, во многих видах
спорта нет зависимости между собственным
весом тела и спортивным результатом. - С другой стороны, в популяциях низкого риска или для редких заболеваний, лечение которых менее выгодно или обладает большим риском, предпочтительнее тесты с более высокой специфичностью.
Вебер обнаружил, например, что, хотя люди могут просто заметить разницу после незначительного изменения веса 10-граммового предмета, им требуется более значительное изменение, прежде чем они смогут просто обнаружить разницу со 100-граммовым весом. Этот вывод, известный как закон Вебера, более технически выражается в утверждении, что воспринимаемая (субъективная) интенсивность изменяется математически как логарифм физической (объективной) интенсивности стимула. Хотя предпринимались изобретательные попытки создать психологические шкалы с абсолютным нулем, психологи обычно довольствуются приближениями к интервальным шкалам; часто используются и порядковые шкалы.
Тесты со свободным ответом и тесты с ограниченным ответом
Например, оценки учащихся по тесту на академические способности могут сравниваться с их школьными оценками (широко используемый критерий). В той степени, в которой эти два показателя статистически соответствуют друг другу, тест эмпирически предсказывает критерий успеваемости в школе. Предсказательная валидность имеет наиболее важное применение в тестировании способностей (например, при отборе кандидатов на работу, при распределении в учебные заведения, при назначении военнослужащих на различные должности). Степень информативности может характеризоваться количественно на основе опытных данных (так называемая эмпирическая информативность) и качественно ¾ на основе содержательного анализа ситуации (содержательная, или логическая информативность). Хотя в практической работе содержательный анализ всегда должен предшествовать математическому, здесь для удобства изложения рассматриваются сначала методы расчета эмпирической информативности. Бета-тестирование в целом ограничено техникой чёрного ящика (хотя постоянная часть тестировщиков обычно продолжает тестирование белого ящика параллельно бета-тестированию).

Обычные тесты способностей явно подразумевают оценку одного человека другим, хотя самооценка испытуемого может вмешиваться; например, ему может не хватать уверенности до такой степени, что он не будет стараться сделать все возможное. Среди основных методов, с помощью которых оценивается надежность теста, есть метод сравнимых форм, в котором оценки группы людей по одной форме теста сравниваются с оценками, полученными ими по другой форме. Теоретически, метод сравнимых форм может отражать надежность оценщика, содержания и временную надежность. В идеале это требует, чтобы каждая форма теста была составлена разными, но одинаково компетентными людьми, чтобы формы давались в разное время и оценивались вторым экспертом (если не установлен объективный ключ). Для большинства целей результаты испытуемого по одному и тому же тесту изо дня в день должны быть постоянными.
Для оценки точности диагностического метода необходимо[править]
Людей можно попросить указать членов группы, которых они предпочитают в качестве лидера, товарища по играм или коллеги. Сделанный выбор можно затем отобразить на социограмме, по которой можно с первого взгляда определить клику или социально изолированных людей. Действительно, измерение путем умозаключений особенно характерно для психологии. Такие абстрактные свойства или атрибуты, как интеллект или интроверсия, никогда не измеряются напрямую, а должны выводиться из наблюдаемого поведения. Если люди отвечают разумно (например, правильно рассуждают) на тесте способностей, можно с уверенностью заключить, что они обладают интеллектом в той или иной степени. Информативность теста – это степень точности, с какой он измеряет свойство (качество, способность, характеристику и т.п.), для оценки которого используется.

Она должна сделать вывод о таких ненаблюдаемых частных ощущениях, услышав плач или бульканье ребенка, увидев, как он размахивает руками, хмурится или улыбается. Таким же образом, многое из того, что называется измерением, должно быть сделано путем умозаключения. Так, мать, подозревая, что у ее ребенка жар, может использовать термометр, и в этом случае она определяет его температуру, глядя на термометр, а не непосредственно прикасаясь к его голове. В таких учреждениях, как бюро профориентации, клиники психического здоровья и психиатрические больницы, тесты способностей и личности могут быть полезны для диагностики и выявления проблемного поведения. Как промышленность, так и правительство активно используют тесты для отбора работников. Исследователи часто полагаются на тесты, чтобы перевести теоретические концепции (например, интеллект) в экспериментально полезные показатели.
Нормы теста
Чаще используется обобщение этой ступенчатой оценки надежности с разделением пополам, одна из формул Кудера-Ричардсона. Эта формула представляет собой среднее значение оценок, полученных в результате всех возможных способов разделения теста на половины. В качестве альтернативы, тест может быть проверен просто для того, чтобы убедиться, что его содержание соответствует его предполагаемой цели.
Основным требованием к тесту является валидность – традиционно определяемая как степень, в которой тест действительно измеряет то, что он призван измерять. Тест надежен в той степени, в какой он последовательно измеряет, но надежность не имеет значения, если тест не валиден. Поскольку человек, делающий выводы из теста, должен определить, насколько хорошо он служит его целям, оценка валидности неизбежно требует суждения. В зависимости от используемых критериев суждения, тесты демонстрируют несколько различных видов валидности. Например, броски в баскетбольную корзину можно выполнять с разных точек; спринтерский бег может проводиться на дистанции, скажем, 50, 60 или 100 м; подтягивания можно выполнять на кольцах или перекладине, хватом сверху или снизу и т.п. В таких случаях может использоваться так называемый метод параллельных форм, когда испытуемым предлагают выполнить две разновидности одного и того же теста и затем оценивают степень совпадения результатов.
Определение положительного результата теста
Может показаться, что некоторые пункты теста заслуживают дополнительного, положительного веса; некоторые ответы в тестах с несколькими вариантами ответов, хотя и являются неправильными, кажутся лучше других, поскольку они привлекают людей, набравших высокие баллы в целом. Кропотливые усилия по взвешиванию предметов, как правило, не стоят того. Чистый тест на скорость однороден по содержанию (например, простой тест на проверку канцелярских навыков), задания настолько просты, что при наличии неограниченного времени с ними успешно справятся все, кроме самых некомпетентных испытуемых.
При прочих равных условиях предпочтительнее тесты, допускающие объективное оценивание. Если тест используется для определения состояния спортсмена в момент обследования, то говорят о диагностической информативности теста. Если же на основе результатов тестирования хотят сделать вывод о возможных будущих показателях спортсмена, – о прогностической информативности. Тест может быть диагностически информативен, а прогностически – нет, и наоборот. Говоря о надежности тестов, необходимо различать их стабильность (воспроизводимость), согласованность, эквивалентность.