Взаємні самооцінки загальних характеристик деяких популярних безоплатних інструментів ШІ

Автор(и)

  • В.А. Литвинов https://orcid.org/0000-0001-5568-7629 , Інститут проблем математичних машин і систем НАН України image/svg+xml
  • С.В. Грибков https://orcid.org/0000-0002-2552-2839 , Національний університет харчових технологій image/svg+xml
  • І.М. Оксанич https://orcid.org/0000-0002-1208-3427 , Інститут проблем математичних машин і систем НАН України image/svg+xml

DOI:

https://doi.org/10.34121/1028-9763-2025-3-4-3-12

Ключові слова:

прикладні LLM-моделі, інтелектуальні асистенти, самооцінки безоплатних моделей ШІ

Анотація

На теперішній час з’являється велика кількість публікацій, присвячених аналізу, оцінці та оптимальному вибору моделей ШІ для конкретних застосувань, і кількість ринкових пропозицій щодо надання послуг по порівнянню і вибору інструментів ШІ для конкретних задач. Поряд із цим інформаційним мейнстрімом заслуговує на інтерес огляд можливостей і характеристик інструментів на основі «власних думок» самих моделей ШІ відносно себе і своїх «колег». Мета статті полягає в експериментальному порівняльному огляді оцінок характеристик моделей і виявленні можливих тенденцій у цих оцінках. Для огляду обрані поточні покоління популярних доступних інтелектуальних асистентів, орієнтованих на широке коло користувачів і їх задачі. Зокрема, одержуються й обговорюються взаємооцінки характеристик моделей ChatGPT версій 3.5+DALL-E,4o і 5, DeepSeek V3, Gemini 1.5 і 2.5, Claude Sonnet 3 і 4). Наводяться й аналізуються перехресні 5-бальні самооцінки поточних поколінь моделей за заданими критеріями та їх оцінки очікуваних можливостей ChatGPT-5. Обговорюються переваги моделей у контексті збалансованих оцінок та рекомендацій щодо їх застосування. Виявлено неоднозначність, суперечливість і можливі відхилення від об’єктивності. Моделі часто демонструють упередженість, завищуючи власні можливості. Серед можливих причин цього (застарілість деяких баз знань, своєрідна галюціногенність тощо) найбільш імовірною вважається конкуренто-маркетингова спрямованість моделей різних виробників. Тому при використанні самих моделей для відповідних оцінок і вибору суттєвою має бути саме зважена колективність їх думок і виключення самооцінок. Відзначається значення появи GPT-5 у змінах «конкурентного ландшафту» і підходах до критеріїв оцінок моделей.

Посилання

1. Choosing the right AI model for your task. URL: https://docs.github.com/en/copilot/using-githubcopilot/ai-models/choosing-the-right-ai-model-for-your-task. 12 ISSN 1028-9763. Математичні машини і системи. 2025. № 3-4

2. Evaluating generative AI tools: A comparative guide for new users. URL: https://www.researchgate.net/publication/385613747_Evaluating_generative_AI_tools_A_comparative_guide_for_new_users.

3. Comparison of Models: Intelligence, Performance & Price Analysis. URL: https://artificialanalysis.ai/models.

4. Deep Research Tools Comparison: A Side-by-Side Evaluation of AI Platforms. URL: https://cbtw.tech/insights/deep-research-tools-comparison-a-side-by-side-evaluation-of-ai-platforms.

5. Market Research AI Tools: A Comparative Analysis. URL: https://bytebridge.medium.com/marketresearch-ai-tools-a-comparative-analysis-ef8a90132877.

6. Top 10 AI Tools for Performance Reviews: A Comparative Analysis of Features and Benefits. URL: https://superagi.com/top-10-ai-tools-for-performance-reviews-a-comparative-analysis-of-features-andbenefits.

7. AI Tools Comparison made easy. URL: https://aireviewbattle.com.

8. Top 6 AI Evaluation Tools for Accurate Model Testing in 2025. URL: https://insight7.io/top-6-aievaluation-tools/.

9. Reddit — The heart of the internet. URL: https://www.reddit.com.

10. AI NOW — Штучний інтелект. URL: https://x.com/AiNow_Ua.

Завантаження

Views: 50
Downloads: 13

Опубліковано

2025-12-29

Номер

Розділ

ОБЧИСЛЮВАЛЬНІ СИСТЕМИ