Исследование: язык обращения к ИИ и страна проживания способны влиять на качество медицинских ответов
Клинические рекомендации и распространенность заболеваний могут различаться в зависимости от региона, поэтому одинаковые ответы модели не всегда подходят пользователям из разных стран, к такому выводу пришла группа международная группа исследователей. Результаты исследования опубликованы в Digital Medicine. Авторы статьи обнаружили, что качество работы больших языковых моделей (LLM) при решении медицинских задач может существенно зависеть от языка запроса. Наиболее заметное снижение точности в проведенном эксперименте наблюдалось при работе с арабским и бенгальским языками. Исследователи заключают, что различия необходимо учитывать при внедрении искусственного интеллекта в здравоохранение.
Одной из причин ученые называют неравномерное представительство языков в данных, на которых обучаются ИИ-модели. Например, в корпусе ROOTS (крупном наборе текстов на разных языках для обучения ИИ) на английский приходится 30,03% данных, китайский – 16,16%, французский – 12,9%, испанский – 10,85%. Еще заметнее дисбаланс в специализированных медицинских данных: MMedC объемом 25,5 млрд токенов (слов и частей слов, на которые ИИ разбивает текст при обработке) включает шесть языков, причем 41,4% приходится на английский. Арабский, хинди, бенгальский и португальский в нем отсутствуют.
Чтобы оценить последствия такого дисбаланса, авторы отобрали 442 вопроса из MedQA (набора заданий медицинских лицензионных экзаменов) на английском и китайском языках. Вопросы перевели на арабский, бенгальский, хинди и португальский, после чего предложили их четырем моделям – DeepSeek Chat от DeepSeek, Gemini 2.5 Flash от Google, GPT-3.5 Turbo и GPT-4o от OpenAI.
Далее исследователи сравнили результаты с показателями моделей на исходных английских и китайских вопросах. Для португальского точность снизилась всего на 0,73%, хинди – на 4,64%, бенгальского – на 7,24%, арабского – на 10,29%. Небольшое снижение для португальского авторы связывают с его близостью к другим романским языкам, которые лучше представлены в обучающих данных. Результаты, по их мнению, показывают, что способность современных LLM хорошо переводить тексты не позволяет полностью компенсировать нехватку обучающих данных на отдельных языках. Часть выявленных различий могла быть связана с ошибками автоматического перевода вопросов, что авторы называют одним из ограничений эксперимента.
По итогам исследования следует, что в здравоохранении значение имеет не только язык, на котором пациент обращается к ИИ, но и страна его проживания. Клинические рекомендации и распространенность заболеваний могут различаться в зависимости от региона, поэтому одинаковые ответы модели не всегда подходят пользователям из разных стран.
В этой связи исследователи приходят к необходимости создание международной базы клинических рекомендаций из разных стран и расширение многоязычных медицинских наборов данных, размеченных специалистами. Кроме того, предлагается разработать специальные тесты для проверки качества медицинских LLM на разных языках, регулярно публиковать результаты таких проверок и учитывать обратную связь врачей и пациентов.