Несмотря на многообещающие результаты ранних исследований, последние данные не подтверждают целесообразность использования моделей искусственного интеллекта, сочетающих визуальное и языковое восприятие (VLM), для обнаружения узлов в легких на рентгеновских снимках, как заявила группа исследователей из Японии.
Исследователи из Университета Кобе протестировали производительность шести моделей VLM в режиме «нулевого примера» (без подсказок, специфичных для задачи, или тонкой настройки) на наборе данных из 247 изображений, и, хотя модели показали умеренную или даже отличную специфичность, чувствительность варьировалась от менее 1% до 27%, отметили Мизухо Нисио, доктор медицинских наук, и ее коллеги.
«Таким образом, полученные результаты не подтверждают целесообразность использования протестированных VLM для выявления узлов в легких на рентгенограммах и подчеркивают необходимость осторожности при их применении для интерпретации рентгенограмм грудной клетки», — написала группа исследователей. Исследование было опубликовано 5 августа в журнале American Journal of Roentgenology .
Авторы пишут, что узлы в легких имеют важное клиническое значение, но часто остаются незамеченными на рентгеновских снимках, особенно если они небольшие или скрыты перекрывающимися анатомическими структурами. Хотя виртуальные модели легких продемонстрировали способность генерировать текстовые интерпретации рентгеновских снимков грудной клетки, их эффективность в выявлении конкретных изменений остается недостаточно изученной, добавили они.
Для дальнейшего тестирования моделей исследователи использовали базу данных рентгенограмм грудной клетки Японского общества радиологических технологий (JSRT), которая включает 247 рентгенограмм грудной клетки в передне-задней проекции: 154 с одним узлом (средний размер 17,3 мм; подтверждено КТ-сканированием) и 93 без него. Были протестированы шесть моделей VLM: RadVLM, GPT-4o-mini, Qwen3-VL-8B-Instruct, MedGemma-4b-it, LLaVA-Rad и CheXpert Plus.
Пять из моделей получили общее указание на создание «краткого отчета» без каких-либо инструкций, специфичных для конкретного узла, в то время как CheXpert Plus не получил никакого текстового указания. Два сертифицированных радиолога проверили результаты работы каждой модели и классифицировали их как положительные или отрицательные на наличие узла.
LLaVA-Rad показала лучшую чувствительность — 27%. CheXpert Plus выявила всего один узелок из 154 случаев. Полные результаты представлены в таблице ниже.
|
Эффективность VLM для обнаружения узлов в легких на 247 рентгенограммах грудной клетки |
|||
|
ВЛМ |
Чувствительность |
Специфичность |
Точность |
|
RadVLM |
11% |
100% |
44,5% |
|
ГПТ-4о-мини |
6,5% |
93,5% |
39,3% |
|
Qwen3-VL-8B-Instruct |
7,8% |
88,2% |
38,1% |
|
MedGemma-4b-it |
5,2% |
100% |
40,9% |
|
ЛЛаВА-Рад |
27,3% |
71% |
43,7% |
|
CheXpert Plus |
0,6% |
95,7% |
36,4% |
«Результаты этого исследования указывают на низкую эффективность шести моделей VLM при обнаружении узлов в легких на рентгенограммах грудной клетки в режиме “нулевого запуска”», — написали авторы.
Группа отметила, что из-за неполноты общедоступной документации исходных данных для обучения виртуальных машин протезирования (VLM) невозможно с уверенностью определить, были ли эти машины протезирования в процессе разработки ознакомлены с рентгеновскими снимками JSRT или с другими ресурсами, разработанными с использованием рентгеновских снимков JSRT.
К ограничениям исследования относятся небольшой размер выборки, использование одного набора данных, отсутствие информации о типе узла, неполная общедоступная информация о потенциальном совпадении рентгенограмм JSRT и обучающих данных VLM, отсутствие исследования с участием экспертов-диагностов и отсутствие сравнения со специализированными системами автоматизированного обнаружения, добавили они.
«В будущих исследованиях можно было бы оценить, улучшает ли разработка подсказок, специфичных для конкретной задачи, эффективность обнаружения узелков», — заключили авторы.
Полный текст исследования, включая видеозапись с участием автора , доступен здесь .
Внимание, автоперевод! За ошибки перевода ответственности не несём. Первоисточник по ссылке.