Gebelerin Sıkça Sorduğu Sorulara ChatGPT'nin Yanıtlarının Değerlendirilmesi ve Diller Arası Karşılaştırması: Çok Dilli Prospektif Gözlemsel Bir ÇalışmaEnes Serhat Coşkun1, Ali Selcuk Yeniocak2, Havva Betül Bacak1, Erkan Aslan3, Fatma Ketenci Gencer1, Suleyman Salman11Gaziosmanpaşa Eğitim Ve Araştırma Hastanesi, Kadın Hastalıkları Ve Doğum Anabilim Dalı, Istanbul, Turkey 2Başakşehir Çam Ve Sakura Şehir Hastanesi, Kadın Hastalıkları Ve Doğum Anabilim Dalı, Istanbul, Turkey 3Büyük Anadolu Meydan Hastanesi, Kadın Hastalıkları Ve Doğum Anabilim Dalı, Samsun, Turkey
Amaç: Bu çalışmanın amacı, ChatGPT’nin gebelikle ilgili sağlık bilgilerini İngilizce, Türkçe ve Arapça dillerinde sağlama konusundaki etkinliğini; tıbbi doğruluk, empatik iletişim, açıklık ve kadın doğum uzmanına yönlendirme uygunluğu açısından değerlendirmektir. Bu araştırma, farklı dillerde yanıtların doğruluğu ve kalitesiyle ilgili değişkenlik endişelerini ele almayı amaçlamaktadır. Gereç ve Yöntem: Kadın Hastalıkları ve Doğum Anabilim Dalı bünyesinde prospektif gözlemsel bir çalışma yürütülmüştür. Sıkça sorulan 15 gebelikle ilgili soru, dilsel doğruluğu sağlamak amacıyla yeminli tercümanlar tarafından Türkçe ve Arapçaya çevrilmiştir. ChatGPT tarafından İngilizce, Türkçe ve Arapça olarak verilen yanıtlar, deneyimli dört kadın doğum uzmanı tarafından bağımsız olarak değerlendirilmiştir. Değerlendirme kriterleri tıbbi doğruluk, empatik ton, açıklık ve yönlendirme uygunluğunu içermektedir. İstatistiksel analizler ki-kare testleri kullanılarak yapılmış, istatistiksel anlamlılık p <0,05 olarak kabul edilmiştir. Bulgular: Tıbbi doğruluk (p=0,0012), empatik ton (p <0,001) ve açıklık (p <0,001) açısından diller arasında istatistiksel olarak anlamlı farklılıklar tespit edilmiştir. İngilizce verilen yanıtlar vakaların %73,3’ünde “mükemmel” olarak değerlendirilirken, bu oran Türkçe için %40, Arapça için ise %41,6 olmuştur. Genel olarak, tüm yanıtların %80’inden fazlası “iyi” veya “mükemmel” olarak değerlendirilmiştir. Yönlendirme önerilerinin uygunluğu açısından anlamlı bir fark bulunmamıştır (p=0,0885). Sonuç: ChatGPT, gebelikle ilgili sağlık sorularını yanıtlamada güvenilir bir araç olma potansiyeli göstermektedir. Ancak, diller arasında yanıtların doğruluğu ve açıklığı açısından gözlemlenen farklılıklar, özellikle az temsil edilen diller için dil desteğinin iyileştirilmesi gerektiğini ortaya koymaktadır. Gelecekteki araştırmalar, daha geniş bir soru yelpazesi ve daha fazla dili içerecek şekilde genişletilmeli, böylece bu teknolojinin güvenilirliği ve klinik uygulanabilirliği artırılmalıdır. Anahtar Kelimeler: Yapay Zeka, Yapay Sinir Ağları, ChatGPT, Büyük Dil Modeli, Çok Dilli, Gebelik
Assessment and Cross-Language Comparison of ChatGPT’s Responses to Frequently Asked Questions by Pregnant Women: A Multilingual Prospective Observational StudyEnes Serhat Coşkun1, Ali Selcuk Yeniocak2, Havva Betül Bacak1, Erkan Aslan3, Fatma Ketenci Gencer1, Suleyman Salman11Gaziosmanpaşa Training And Research Hospital, Department Of Obstetrics And Gynecology, Istanbul, Turkey 2Basaksehir Cam And Sakura City Hospital, Department Of Obstetrics And Gynecology, Istanbul, Turkey 3Büyük Anadolu Meydan Hospital, Department Of Obstetrics And Gynecology, Samsun, Turkey
Aim: To evaluate the efficacy of ChatGPT in providing pregnancyrelated health information in English, Turkish, and Arabic, focusing on medical accuracy, empathetic communication, clarity, and appropriate referrals to obstetricians. This research aims to address concerns about variability in response accuracy and quality across languages. Materials and methods: A prospective observational study was conducted within the Department of Obstetrics and Gynecology. Fifteen commonly asked pregnancy-related questions were translated into Turkish and Arabic by certified translators to ensure linguistic accuracy. Responses generated by ChatGPT in English, Turkish, and Arabic were independently assessed by four experienced obstetricians. Evaluation criteria included medical accuracy, empathetic tone, clarity, and appropriateness of referral. Statistical analysis was performed using chi-square tests, with statistical significance defined as p <0.05. Results: Statistically significant differences were observed across languages in medical accuracy (p=0.0012), empathetic tone (p <0.001), and clarity (p <0.001). Responses provided in English were rated as “excellent” in 73.3% of cases, compared to 40% in Turkish and 41.6% in Arabic. Overall, more than 80% of all responses were rated as either “good” or “excellent.” No significant difference was observed concerning the appropriateness of referral recommendations (p=0.0885). Conclusion: ChatGPT demonstrates potential as a reliable tool for addressing pregnancy-related health inquiries. However, discrepancies in response accuracy and clarity across languages highlight the need for improved language support, particularly for underrepresented languages. Future research should include a broader range of questions and additional languages to enhance the reliability and clinical applicability of this technology. Keywords: Artificial intelligence, Artificial Neural Networks, ChatGPT, Large language model, Multilingual, Pregnancy
Enes Serhat Coşkun, Ali Selcuk Yeniocak, Havva Betül Bacak, Erkan Aslan, Fatma Ketenci Gencer, Suleyman Salman. Assessment and Cross-Language Comparison of ChatGPT’s Responses to Frequently Asked Questions by Pregnant Women: A Multilingual Prospective Observational Study. Kafkas J Med Sci. 2026; 16(2): 188-195
Sorumlu Yazar: Enes Serhat Coşkun, Türkiye |
|