A user has compiled a comprehensive dataset of outputs from various Qwen models, totaling 1109 examples. This collection aims to provide a resource for comparing the performance of different Qwen versions across 35 prompts. The dataset is accessible via a dedicated website, allowing users to explore and analyze the results from models like Qwen 3.7, Qwen 3.6, and Qwen 3.5, among others. AI
IMPACT Provides a comparative dataset for evaluating Qwen model performance.
RANK_REASON User-generated comparison of multiple model versions. [lever_c_demoted from research: ic=1 ai=1.0]
AI-generated summary · Google Gemini · from 1 sources. How we write summaries →