Здравствуйте, гость ( Вход | Регистрация )
![]() ![]() |
16.08.2025 - 13:13
Сообщение
#91
|
|
|
Группа: Пользователи Сообщений: 290 Регистрация: 1.06.2022 Из: Донецк Пользователь №: 39632 |
Если Вы считаете слово "творения" оскорбительным, то ой. Даже в мыслях не было нарываться на конфронтацию, хотел просто подискутировать по существу. Однако, раз уж Вы первым перешли на личности, извольте алаверды:
1. Во всех темах данного форума, к месту и не к месту, Вы достаточно агрессивно рекламируете собственное ПО. Но при этом любую конструктивную критику в его адрес воспринимаете как личное оскорбление. Это не нормально. Если считаете, что раз оно бесплатное, то следует жрать, что дают без претензий и нахваливать, то это контрпродуктивно. Нормальный разработчик наоборот должен быть благодарен тестерам за любые выявленные баги. 2. Вы систематически не читаете или же игнорируете посты, посвящённые конкретным статистическим проблемам, и даже не отвечаете на прямые вопросы по существу. В том числе по работе Вашего же ПО. Например, на вопрос о том, какой прогноз даст ваша модель пуассоновской регрессии при равенстве правой части уравнения нулю, мне пришлось отвечать самому, путем изучения мануала. Только так я смог понять, что к моей задачи она не применима, вопреки Вашему предложению. За мануал, конечно спасибо, но все-таки очень странно, что единоличный автор и владелец не дает простой ответ на такой такой вопрос. Что уж говорить о вопросах более отвлеченных, относительно которых хотелось бы услышать Ваше мнения как статистика, например о чуть выше озвученном "mid-p". 3. Ваши предложения по решению статистических задач, более чем в половине случаев довольно странны. Как то предложение в соседней теме использовать Zero-trunpated для предсказания пуассоновского распределения с параметром ноль. Вследствие чего можно заподозрить, что мое ранее высказанное предположение о том, что несмотря на колоссальные библиографические списки в мануалах, Вы толком не читаете литературу, близко к истине. Можете размышлять над этими "обвинениями" хоть 100 лет. Или не размышлять - мне безразлично. |
|
|
![]() |
![]() |
26.08.2025 - 19:58
Сообщение
#92
|
|
![]() Группа: Пользователи Сообщений: 1162 Регистрация: 10.04.2007 Пользователь №: 4040 |
Думаю, что мы немного погорячились. Да и я, виноват, непроверенную информацию давал в качестве предмета обсуждения, а топикстартеру нужен конкретный ответ. Поэтому удалил предыдущие посты. Цель, во всяком случае моя, остается той же - используя информацию о замеченных ошибках и неточностях, но не навязывая, предоставить пользователям надежное ПО. Поэтому собрал в данном посте свои изыскания по теме.
Теория ---------- Как правильно считать p-значение. Если взглянуть на график функции плотности распределения статистики критерия (площадь под всей кривой равна 1), то видим, что левое одностороннее p-значение - это площадь под кривой, отмеченная от -∞ (теоретически) до левостороннего значения статистики критерия (например, p = 0,01) - это результат проверки гипотезы A > B (назовем условно так - пусть это будут средние, медианы или что-то еще). Правое одностороннее p-значение - площадь под кривой, отмеченная от -∞ (теоретически) до правостороннего значения статистики критерия (например, p = 0,99) - это результат проверки гипотезы B > A. Двустороннее значение - это сумма min(левостороннее, 1 - левостороннее) и min(правостороннее, 1 - правостороннее), т.е. сумма двух площадей, в данном примере 0,02. Правило действительно для любой функции плотности распределения - симметричной и несимметричной. Это очень важно. Для малых выборок, которые обсуждаются в данной теме, точная функция плотности распределения статистики несимметрична (примеры с иллюстрациями несложно найти), а убедиться в правильности данного тезиса легко, формально поменяв решающее правило и выполнив соответствующий расчет в соответствии со схемой вычисления статистического теста. Для больших выборок функция плотности распределения стремится к симметричной и поэтому может быть корректно аппроксимирована, например, нормальным распределением. Левостороннее p-значение в данном случае равно (1 - правостороннее), а двустороннее равно удвоенному одностороннему, точнее 2 * min(одностороннее, 1 - одностороннее). Повторю - для малых выборок это не так, и левостороннее p-значение не равно (1 - правостороннее), поэтому вычислять двустороннее p-значение удвоением одностороннего p-значения в данном случае некорректно. Практика ------------- Теперь практически, как вычислять. Рассмотрим одну из возможных схем, которую мы считаем удачной. Предположим, мы составили (или используем готовую) правильную функцию вычисления статистики и p-значения критерия, в соответствии со схемой его вычисления. 1. Функция вызывается с параметрами A,B. Выводим левостороннее p-значение. 2. Функция вызывается с параметрами B,A. Выводим правостороннее p-значение. 3. Вычисляем и выводим двустороннее значение min(левостороннее, 1 - левостороннее) + min(правостороннее, 1 - правостороннее). Некоторые источники и программы в качестве двустороннего значения выводят удвоенное min(одностороннее, 1 - одностороннее). Это имеет место, например, в том случае, если распределение статистики аппроксимируется нормальным распределением (Mehta) либо симметрия распределения постулируется (Motulsky). Но позволю себе процитировать (машинный перевод) источник Kaiser "A general-purpose method for two-group randomization tests": "Значение p=0,03072 идентично значению permtest2; однако tsrtest даёт другое двустороннее значение, поскольку tsrtest, в отличие от permtest2, не предполагает симметрии верхнего и нижнего хвостов при расчёте двустороннего p-значения, а вместо этого отдельно подсчитывает значения в верхнем и нижнем хвостах." Как-то так. Сообщение отредактировал Игорь - 21.09.2025 - 07:08 ![]() Ebsignasnan prei wissant Deiws ainat! As gijwans! Sta ast stas arwis!
|
|
|
![]() |
![]() |
26.08.2025 - 23:54
Сообщение
#93
|
|
|
Группа: Пользователи Сообщений: 290 Регистрация: 1.06.2022 Из: Донецк Пользователь №: 39632 |
Тогда и меня простите. Но это касается исключительно тона общения, а ни коем образом не статистки, где я продолжу настаивать на своем. Во-первых, симметричность распределения в данном случае зависит не от объемов выборок, а от их равенства. При равных сколь угодно малых объемах "точное" распределение статистики типа Стьюдента или разности средних будет симметричным, при неравных - ассиметричным. Можете проверить моделированием. Во-вторых, повторю свой ранее заданный вопрос: при сложении левостороннего p c правосторонним куда Вы деваете случаи тождественного равенства наблюдаемой статистики моделируемой, которые ни то, ни другое не учитывает? Именно от этого, а вовсе не от симметрии появляется различие между вашим двусторонним значением, и тем, что выдает тот же coin. Последнему начхать на симметрию, он ничего не складывает и не умножает на на два, а тупо считает все случаи, когда моделируемая статистика столь или более экстремальна, сколь наблюдаемая. Данный эффект будет уменьшаться с ростом объемов выборок. А для асимптотических тестов такой проблемы нет вообще.
По последнему абзацу с цитатой, хотелось бы спросить: а в чем же мораль сей басни? Т. е. какой из наpванных тестов господин Кайзер считает верным и какие аргументы приводит в пользу той точки зрения? Сообщение отредактировал ИНО - 26.08.2025 - 23:57 |
|
|
![]() |
![]() |
27.08.2025 - 08:09
Сообщение
#94
|
|
![]() Группа: Пользователи Сообщений: 1162 Регистрация: 10.04.2007 Пользователь №: 4040 |
Во-первых, симметричность распределения в данном случае зависит не от объемов выборок, а от их равенства. При равных сколь угодно малых объемах "точное" распределение статистики типа Стьюдента или разности средних будет симметричным, при неравных - ассиметричным. Можете проверить моделированием. Встречал у авторов данное мнение, совпадающее с Вашим. Раз уж если мы обсуждаем перестановочный тест, сделал также вариант расчета по классической формуле из Higgins "An introduction to modern nonparametric statistics", чтобы по крайней мере для себя снять данный вопрос.Во-вторых, повторю свой ранее заданный вопрос: при сложении левостороннего p c правосторонним куда Вы деваете случаи тождественного равенства наблюдаемой статистики моделируемой, которые ни то, ни другое не учитывает? Именно от этого, а вовсе не от симметрии появляется различие между вашим двусторонним значением, и тем, что выдает тот же coin. Последнему начхать на симметрию, он ничего не складывает и не умножает на на два, а тупо считает все случаи, когда моделируемая статистика столь или более экстремальна, сколь наблюдаемая. Данный эффект будет уменьшаться с ростом объемов выборок. А для асимптотических тестов такой проблемы нет вообще. Ответ, аналогичный предыдущему. Сделал отдельную функцию вычисления двустороннего значения по Higgins.По последнему абзацу с цитатой, хотелось бы спросить: а в чем же мораль сей басни? Т. е. какой из наpванных тестов господин Кайзер считает верным и какие аргументы приводит в пользу той точки зрения? Лучше посмотреть источник. Для себя я понял, что в данной работе авторы не считают предпочтительным ни один из вариантов. Они как бы равноправно сосуществуют в STATA в виде различных функций. Интересно, что данная точка зрения также исповедуется в документации по программе Dataplot. Я также не анализировал несколько существующих модулей в R, ограничившись только coin, а встречались еще как минимум 3 модуля (https://www.cfholbert.com/blog/two_sample_permutation_test/), выполняющих вычисления рассматриваемым тестом, и надо бы посмотреть подробнее, хотя вводная информация по ссылке показывает, что не надо.
Сообщение отредактировал Игорь - 9.09.2025 - 10:50 ![]() Ebsignasnan prei wissant Deiws ainat! As gijwans! Sta ast stas arwis!
|
|
|
![]() |
![]() |
27.08.2025 - 16:26
Сообщение
#95
|
|
|
Группа: Пользователи Сообщений: 290 Регистрация: 1.06.2022 Из: Донецк Пользователь №: 39632 |
Ну все ж хотелось бы докопаться до истины - какой вариант меньше врет. Думается, что на самом деле в случае малых выборок будут сильно врать все, поскольку распределение получается очень дискретным, соответственно любое "точное" p будет грубым приближением (да еще и с жестким порогом). Думается, врать будут в сторону ошибки второго рода. Т. е. та же история что с ДИ Клоппера-Пирсона, который точный в том смысле что свято блюдет номинальную ошибку первого рода, но ценой ужасной консервативности. А при больших выборках разница между всеми тремя методами должна сойти на нет.
|
|
|
![]() |
![]() |
4.09.2025 - 19:12
Сообщение
#96
|
|
![]() Группа: Пользователи Сообщений: 1162 Регистрация: 10.04.2007 Пользователь №: 4040 |
В комментариях исходников coin есть названия источников (в-основном по технике вычислений). Критерий с примерами и смежные проблемы описаны в нескольких монографиях (Runyon, Siegel, Higgins, Mehta, Motulsky) и статьях (Kaiser 2007 и 2009 года).
А при больших выборках разница между всеми тремя методами должна сойти на нет. Это так, но анализируем мы очень малые выборки. Три метода, это видимо: Runyon (предполагаемая симметрия функции плотности распределения, двустороннее как удвоенное одностороннее), Kaiser 2009 года (асимметрия функции плотности распределения, двустороннее значение вычисляется как минимум из 1, 2*левое и 2*правое) и представленный выше.P.S. Прошу прощения, убрал весь мусор из своих предыдущих сообщений, оставив только факты и ссылки, которые считаю значимыми. Сообщение отредактировал Игорь - 21.09.2025 - 06:58 ![]() Ebsignasnan prei wissant Deiws ainat! As gijwans! Sta ast stas arwis!
|
|
|
![]() |
![]() |
![]() ![]() |