Здравствуйте, гость ( Вход | Регистрация )
![]() ![]() |
3.06.2025 - 01:08
Сообщение
#16
|
|
|
Группа: Пользователи Сообщений: 6 Регистрация: 20.05.2025 Пользователь №: 39693 |
"Уже предложение к топикстартеру - привести численный пример. Мы посмотрим, посчитаем и сравним. Численный пример - лучший способ пояснить, что именно имеется в виду и правильно ли сделан расчет."
Честно говоря, я не убеждён в этом. Просто опасаюсь ухода дискуссии не в ту сторону. |
|
|
![]() |
![]() |
3.06.2025 - 12:33
Сообщение
#17
|
|
|
Группа: Пользователи Сообщений: 290 Регистрация: 1.06.2022 Из: Донецк Пользователь №: 39632 |
Таким образом природа "дырок" в данных носит не случайный характер, но в некотором смысле квазислучайный, а также преднамеренный (не хотелось бы уходить в обсуждение типов пропусков). При подсчёте корреляций надо учесть множественность сравнений. ВСЁ ОЧЕНЬ ПРОСТО! В таком случае (неслучайность пропусков) наоборот ВСЕ ОЧЕНЬ НЕПРОСТО. Вроде когда-то читал о чем-то подобном но мимоходом, т. к. у меня подобных данных и быть не может. Вообще, математическая обработка сиквенсов, часто называемая биоинформатикой, - отдельная область со своими инновациями, спрашивать лучше у тех, кто в ней работает. Вроде, здесь таковых нет. Но замечу что, например, в молекулярной филогении результаты по достоверности так себе - у разных авторов, использующих разные методы и разные наборы данных, получаются очень разные филогенетические деревья для одних и тех же организмов. Похоже, данная наука до сих пор сильно страдает детскими болезнями. Во всяком случае кавалерийским наскоком тут точно не разобраться. |
|
|
![]() |
![]() |
20.06.2025 - 21:09
Сообщение
#18
|
|
|
Группа: Пользователи Сообщений: 1219 Регистрация: 13.01.2008 Из: Челябинск Пользователь №: 4704 |
Пара-тройка идей, не связанных напрямую с коррекцией уровней значимости в массе парных корреляций.
1) Часто исследователи углубляются в корреляции, просто потому, что не имеют практики работы многомерными методами. Однако в очень многих случаях за массой парных связей реально лежит пара-тройка разных процессов, которые и обусловливают эту скоррелированность. В этом смысле намного важнее выйти на эти несколько паттернов и интерпретировать их. А корреляции могут просто размываться при наличии нескольких групп (например, в одной группе корреляция в паре положительная, в другой - отрицательная). Или даже хуже: при наличии в выборке нескольких групп с разными средними значениями мы можем даже прийти к обратным выводам, когда в каждой из групп в отдельности корреляция будет, скажем, положительной, а во всём массиве данных - отрицательной (так называемый парадокс Симпсона, или парадокс объединений). Поэтому корреляции всегда нужно визуализировать: парные, чтобы посмотреть не натянута ли связь фиктивно наличием нескольких групп - здесь поможет построение двумерной плотности распределения, а множественные - с использованием ординационных (проекционных) техник типа анализа главных компонент. Если на ординационной диаграмме мы видим, что все показатели чётко распались, скажем на 2 группы, то какая разница, какие р-значения для пар внутри этих двух групп, если паттерны удастся объяснить: достаточно подтвердить парочку парных, а далее идти дальше. 2) Есть многомерные техники, которые позволяют работать не со всей корреляционной/ковариационной структурой, а только с той её частью, которая задаётся несколькими регрессорами (например: диагноз, пол, возраст). Это так называемые ограниченные (constrained) техники анализа, типа канонического анализа соответствий для бинарных признаков или анализа избыточности для количественных. Там есть тонкости, но иногда очень хорошо получается достать из данных что нужно. 3) Если вы работаете в области генетики и биоинформатики, то наверное сталкивались с вулканными графиками (Volcano plot). Аналогичный принцип можно попробовать "прикрутить" к корреляциям. Право и лево будут, соответственно, положительные и отрицательные корреляции (от -1 через 0 до 1), а верх и низ - соответственно наименее и наиболее статистически значимые. Таким образом в верхних углах графика будут и самые сильные, и самые статистически значимые парные корреляции. Введение поправок будет просто двигать фигуру вверх-вниз, но лидеры всё равно останутся теми же, по их списку можно работать с литературой. Сообщение отредактировал nokh - 20.06.2025 - 21:12 |
|
|
![]() |
![]() |
14.07.2025 - 08:25
Сообщение
#19
|
|
![]() Группа: Пользователи Сообщений: 1162 Регистрация: 10.04.2007 Пользователь №: 4040 |
Название темы немного вводит в заблуждение, т.к. обсуждение изначально посвящено эффекту множественных сравнений, якобы возникающему при анализе корреляций (в литературе мне не встречалось обсуждение этой темы). Полагаю, что если речь заходит об анализе корреляционных матриц в смысле выявления взаимодействия параметров (в линейной постановке), то первое, что должно придти в голову, это факторный анализ и его вариант - анализ главных компонент. У нас уже было плодотворное обсуждение этой темы Факторный анализ смешанных признаков. Выше был вопрос - в теме указано программное обеспечение, которым можно легко и бесплатно воспользоваться: AtteStat и StatAnt. Лучшие графики в факторном анализе, конечно, получились в StatAnt - сказался пользовательский опыт. С момента обсуждения добавился новый бесплатный программный пакет Criterial.
Сообщение отредактировал Игорь - 14.07.2025 - 08:45 ![]() Ebsignasnan prei wissant Deiws ainat! As gijwans! Sta ast stas arwis!
|
|
|
![]() |
![]() |
![]() ![]() |