Evaluation of large language model responses to different types of questions based on European Society of Endodontology position statements
Abstract
Objectives: This study aimed to compare the performance of DeepSeek-V3, ChatGPT 4.0, ChatGPT 4.5, Gemini Advanced 2.0, and Grok in answering single-correct answer multiple-choice (SCQ), multiple-correct answer multiple-choice (MCQ), binary (true/false) (BQ), and open-ended questions (OEQ) based on the European Society of Endodontology (ESE) position statements.
Materials and Methods: A total of 70 questions (24 SCQ/MCQ, 29 BQ, and 17 OEQ) were posed to five LLMs. Responses were scored on a 0–10 scale for comprehensiveness, scientific accuracy, clarity, and relevance. SCQ, MCQ, and BQ formats were additionally evaluated for correctness (1 = correct, 0 = incorrect). Data were analyzed using Pearson’s chi-square test and the Kruskal-Wallis H test (p < 0.05).
Results: In the SCQ/MCQ format, Gemini Advanced 2.0 scored significantly higher than Grok. In the BQ format, ChatGPT 4.5 and Gemini Advanced 2.0 achieved significantly higher scores than ChatGPT 4.0 and Grok. In the OEQ format, ChatGPT 4.5 obtained significantly higher scores than Grok (p < 0.05). Accuracy rates were 67.9% for ChatGPT 4.5, 66.0% for Gemini Advanced 2.0, 58.5% for DeepSeek-V3, 52.8% for ChatGPT 4.0, and 49.1% for Grok (p > 0.05). In all models, scientific accuracy scores were significantly lower than relevance scores (p < 0.05).
Conclusions: ChatGPT 4.5 and Gemini Advanced 2.0 demonstrated stronger performance than the other models, whereas Grok showed lower response-content performance. However, since LLMs may appear convincing even when generating incorrect clinical information, they should be used only as supplementary tools in endodontic education and preliminary information retrieval. Clinically relevant outputs should be verified by an endodontist or an appropriately qualified clinician.
Keywords
Ethical Statement
This study was based exclusively on AI-generated responses and publicly available professional position statements. No human participants, patient data, animal subjects, or identifiable personal information were used. Therefore, ethics committee approval and informed consent were not applicable.
Thanks
This study was presented as an oral presentation at the 28th International Dental Congress of the Turkish Dental Association, held in Diyarbakır, Türkiye, on September 18–21, 2025
Avrupa Endodonti Derneği Pozisyon Bildirgelerine Dayalı Farklı Soru Türlerine Büyük Dil Modellerinin Verdiği Yanıtların Değerlendirilmesi
Abstract
Amaç: Bu çalışmanın amacı, DeepSeek-V3, ChatGPT 4.0, ChatGPT 4.5, Gemini Advanced 2.0 ve Grok’un Avrupa Endodonti Derneği’nin pozisyon bildirgelerine dayalı olarak hazırlanan tek doğru yanıtlı çoktan seçmeli, birden fazla doğru yanıtlı çoktan seçmeli, ikili doğru/yanlış ve açık uçlu sorulara verdikleri yanıt performanslarını karşılaştırmaktır.
Gereç ve Yöntemler: Beş büyük dil modeline toplam 70 soru yöneltildi. Bu soruların 24’ü tek doğru yanıtlı/birden fazla doğru yanıtlı çoktan seçmeli, 29’u ikili doğru/yanlış ve 17’si açık uçlu soru formatındaydı. Yanıtlar kapsamlılık, bilimsel doğruluk, açıklık ve konuya uygunluk açısından 0–10 puanlık bir ölçek kullanılarak değerlendirildi. Tek doğru yanıtlı çoktan seçmeli, birden fazla doğru yanıtlı çoktan seçmeli ve ikili doğru/yanlış soru formatları ayrıca doğru yanıt için 1, yanlış yanıt için 0 olacak şekilde doğruluk açısından değerlendirildi. Veriler Pearson ki-kare testi ve Kruskal-Wallis H testi kullanılarak analiz edildi (p < 0,05).
Bulgular: Tek doğru yanıtlı/birden fazla doğru yanıtlı çoktan seçmeli soru formatında Gemini Advanced 2.0, Grok’tan anlamlı düzeyde daha yüksek puan aldı. İkili doğru/yanlış soru formatında ChatGPT 4.5 ve Gemini Advanced 2.0, ChatGPT 4.0 ve Grok’a kıyasla anlamlı düzeyde daha yüksek puan elde etti. Açık uçlu soru formatında ise ChatGPT 4.5, Grok’a kıyasla anlamlı düzeyde daha yüksek puan elde etti (p < 0,05). Doğruluk oranları ChatGPT 4.5 için %67,9, Gemini Advanced 2.0 için %66,0, DeepSeek-V3 için %58,5, ChatGPT 4.0 için %52,8 ve Grok için %49,1 olarak belirlendi (p > 0,05). Tüm modellerde bilimsel doğruluk puanları, konuya uygunluk puanlarından anlamlı düzeyde daha düşüktü (p < 0,05).
Sonuçlar: ChatGPT 4.5 ve Gemini Advanced 2.0 diğer modellere kıyasla daha güçlü performans göstermiştir; Grok ise daha düşük yanıt içeriği performansı sergilemiştir. Bununla birlikte, büyük dil modelleri yanlış klinik bilgiler üretmelerine rağmen ikna edici görünebileceğinden, endodonti eğitiminde ve ön bilgi edinme sürecinde yalnızca tamamlayıcı araçlar olarak kullanılmalıdır. Klinik açıdan önemli çıktılar bir endodontist veya uygun nitelikte bir klinisyen tarafından doğrulanmalıdır.
Keywords
Ethical Statement
Bu çalışma yalnızca yapay zekâ tarafından oluşturulan yanıtlar ve kamuya açık profesyonel pozisyon bildirgeleri esas alınarak yürütülmüştür. Çalışmada insan katılımcılar, hasta verileri, hayvan denekler veya kimliği belirlenebilir herhangi bir kişisel bilgi kullanılmamıştır. Bu nedenle etik kurul onayı ve bilgilendirilmiş onam gerekli değildir.
Thanks
Bu çalışma, 18–21 Eylül 2025 tarihlerinde Diyarbakır, Türkiye’de düzenlenen Türk Dişhekimleri Birliği 28. Uluslararası Diş Hekimliği Kongresi’nde sözlü sunum olarak sunulmuştur.