شواهد

مثال‌ها روش را نشان می‌دهند. سنجیدنش کار یک مطالعه است.

سه نوع شاهد را جدا نگه داشته‌ایم: مثال‌های نوشته‌ی خودمان، تمرینی برای خودت و مطالعه‌ای رسمی که طراحی شده اما هنوز اجرا نشده. تا اجرا نشود، در این صفحه نه نمره‌ای می‌بینی، نه نموداری، نه درصدی.

مطالعه در انتظار اجرا

شیوه‌نامه‌ی نسخه‌ی ⁦1.1⁩، ثابت‌شده در ۶ مهر ۱۴۰۵، پیش از هر اجرا.

سه نوع شاهد

  1. مثال فرضی

    مثال‌هایی که خودمان نوشته‌ایم

    پیش‌نویس بالای صفحه‌ی اول، آزمایشگاه کانال‌ها و جفت‌متن‌های تمرین کور را تیم والوری برای همین سایت نوشته است. کنار هرکدام برچسبی همین را می‌گوید.

    چه چیزی را نشان می‌دهند
    این‌که روش با یک پیش‌نویس چه می‌کند: کدام اطلاعات داده‌شده می‌ماند، کدام ادعا می‌رود و کجا جای خالی باز می‌ماند.
    چه چیزی را نشان نمی‌دهند
    این‌که مدلی که از والوری پیروی می‌کند چند بار این‌طور می‌نویسد، یا خواننده‌ها نتیجه را ترجیح می‌دهند یا نه.
  2. امتحانش کن

    تمرین خواندن بی‌برچسب

    دو متن از یک سفارش، با برچسب الف و ب. پیش از آن‌که بدانی کدام کدام است، انتخاب می‌کنی.

    چه چیزی را نشان می‌دهد
    این‌که دو متن، پیش از آن‌که برچسبی رویت اثر بگذارد، در نظر خودت چطور خوانده می‌شوند.
    چه چیزی را نشان نمی‌دهد
    هیچ چیزی درباره‌ی خواننده‌های دیگر. هر کسی می‌تواند چند بار کلیک کند، آن هم بعد از این‌که جواب را جای دیگری خوانده؛ برای همین هیچ انتخابی را جمع نمی‌کنیم و نرخ بردی منتشر نمی‌کنیم.
  3. در انتظار اجرا

    مطالعه‌ی رسمی

    مقایسه‌ای کور میان متن‌هایی که از همان ۵۲ سفارش، با والوری و بی‌والوری نوشته می‌شوند؛ با داوری آدم‌ها و مدل‌های هوش مصنوعی.

    چه چیزی را نشان خواهد داد
    این‌که داوران، برای یک مدل در یک تاریخ، متن والوری را ترجیح می‌دهند یا نه؛ به فارسی و به انگلیسی، با تساوی‌ها، باخت‌ها و «تفاوت قابل تشخیصی دیده نشد»، همان‌طور که پیش بیاید.
    امروز چه نشان می‌دهد
    هنوز هیچ. شیوه‌نامه و ابزار نمره‌دهی آماده است و هیچ مدلی اجرا نشده.

مطالعه‌ی رسمی

طراحی‌شده و ثابت‌شده، پیش از هر اجرا

پرسش

با سفارش یکسان، آیا مدلی که از والوری پیروی می‌کند به کار نویسنده‌ی حرفه‌ای نزدیک‌تر می‌نویسد تا مدلی که فقط سفارش را دارد؟

یک اجرا چطور پیش می‌رود

  1. ۵۲سفارش۲۶ سفارش از مشتری‌های فارسی‌زبان و ۲۶ از انگلیسی‌زبان، از کم‌خطر تا پرخطر.
  2. ۲حالتهمان مدل با همان تنظیمات. یکی فقط با سفارش کار می‌کند و دیگری با سفارش و والوری.
  3. ۳۱۲متناز هر سفارش در هر حالت سه نمونه ساخته می‌شود، به ترتیبی تصادفی که می‌شود عینش را دوباره ساخت.
  4. ۱۵۶جفت کورترتیب تصادفی، نام محصول پوشیده، یادداشت نویسنده‌ها حذف و جای خالی‌ها به یک شکل.
  5. ۳+داور برای هر جفتآدم‌هایی که در ساخت والوری نبوده‌اند، و مدل‌هایی از خانواده‌های دیگر.
  6. ۱قاعده‌ی تصمیماز پیش و برای هر زبان جدا: بهتر، بدتر، بی‌نتیجه یا تفاوت قابل تشخیصی دیده نشد.
  7. در انتظارگزارشهنوز هیچ متنی تولید نشده، پس گزارشی هم در کار نیست.
میان دو حالت چه عوض می‌شودهمه‌چیز یکسان می‌ماند، جز خود اسکیل.
فقط سفارشبا والوری
مدلیک مدل؛ شناسه و تاریخ نسخه‌اش دقیق ثبت می‌شودهمان مدل
تنظیماتدما، سقف خروجی و بودجه‌ی استدلال ثابت و ثبت‌شدههمان مقدارها
پیام سیستمپیش‌فرض ابزار اجرا، بی هیچ افزوده‌ایهمان پیش‌فرض، به‌علاوه‌ی اسکیل والوری
پیام کاربرپیام ثابت نویسنده که سفارش را در خود داردبایت‌به‌بایت یکسان
ابزارهایک مجموعه‌ی ثابت: خواندن فایل روشن، نوشتن فایل خاموشهمان مجموعه
نشستبرای هر کار تازه: بی‌حافظه، بی اسکیل یا افزونه‌ی دیگر، یک نوبتهمان
  • یک حالت سوم اختیاری هم هست: مدل ساده به‌علاوه‌ی یک بند کوتاه دستور نوشتن خوب. این حالت می‌پرسد آیا والوری از یک بند توصیه بهتر است، و نتیجه‌اش جدا گزارش می‌شود.
  • جایی که دستیار نمی‌تواند اسکیل بارگذاری کند، چسباندن SKILL.md در پیام سیستم نسخه‌ی ضعیف‌تری از همین آزمون است. نامی جدا می‌گیرد و هرگز با نتیجه‌ی اصلی جمع نمی‌شود.

سفارش‌ها

دو مجموعه‌ی ۲۶تایی، طوری نوشته شده که شبیه پیام واقعی مشتری باشد: کوتاه، مبهم، گاهی با غلط تایپی، خواسته‌های متناقض یا درخواست ناامن. هر مجموعه ۱۱ سفارش کم‌خطر، ۱۱ متوسط و ۴ پرخطر دارد. قالب‌ها از کپشن و پیامک و ایمیل تا معرفی محصول، صفحه‌ی فرود، خبر رسمی، پیام خطا و پیام دشوار را در بر می‌گیرند. در دو سفارش، مشتری فارسی نوشته و متن انگلیسی خواسته است.

هیچ سفارشی نباید با واژگان قاعده‌های خود والوری نوشته شود یا مثال‌های آن را تکرار کند. نسخه‌ی ⁦1.1⁩ سه سفارش را که چنین بودند بازنویسی کرد. پیش از ثابت‌کردن، کسی که در نوشتن والوری نبوده همه‌ی سفارش‌ها را می‌خواند. هر سفارشی که به نظرش برای والوری دوخته شده باشد، علامت می‌خورد.

چکیده‌ی هر فایل سفارش پیش از تولید ثبت می‌شود و بعد از دیدن اولین خروجی، هیچ سفارشی عوض نمی‌شود.

جفت‌ها چطور داوری می‌شوند

  • داور سه چیز می‌بیند: سفارش، فهرست اطلاعاتی که مشتری نداده و دو خروجی الف و ب. نام حالت‌ها و فرضیه را به او نمی‌گویند.
  • داوران هوش مصنوعی هر جفت را به هر دو ترتیب می‌بینند؛ این‌طور معلوم می‌شود اگر متنی را فقط چون اول آمده ترجیح داده‌اند.
  • هر زبان دست‌کم دو داور انسانی دارد: خواننده‌هایی که آن زبان، زبان اولشان است یا به آن مسلط‌اند و در ساخت والوری نبوده‌اند. هر جفت دست‌کم دو داور هوش مصنوعی هم دارد، از خانواده‌ای جز خانواده‌ی مدل نویسنده؛ داورهای هم‌خانواده جدا گزارش می‌شوند.
  • یک اجرای دوم اجباری بی فهرست اطلاعات داده‌نشده، چون آن فهرست پیدا کردن واقعیت ساختگی را آسان می‌کند.
  • بعد از داوری، آزمون کوری: داوران حدس می‌زنند کدام متن با راهنمای نوشتن نوشته شده؛ این نشان می‌دهد نام‌پوشی داوری چقدر کار کرده است.

معیار داوری

پنج معیار، هرکدام از ۱ تا ۵، و بعد یک انتخاب اجباری: خروجی‌ای که ترجیح می‌دهی با کمترین ویرایش برای این مشتری بفرستی.

  • بلندتر بهتر نیست. داور چیزی را می‌سنجد که مشتری می‌تواند به کار ببرد.
  • ایموجی، علامت تعجب و هشتگ به‌خودی‌خود ایراد نیستند؛ داور تصمیم می‌گیرد به کانال و برند می‌خورند یا نه.
  • نیاوردن واقعیتی که مشتری نداده و علامت‌زدنش با جای خالی مثل [قیمت]، هر دو به یک اندازه صادقانه حساب می‌شوند.

قاعده‌ی تصمیم

برای هر زبان، گزارش فقط وقتی می‌گوید والوری از «فقط سفارش» بهتر است که دو آزمون با هم بخوانند. کران پایین بازه‌ی ۹۵ درصدی بوت‌استرپ برای نرخ برد باید از نصف بالاتر باشد. آزمون تغییر علامت روی سفارش‌ها هم باید مقدار p کمتر از ۰٫۰۵ بدهد. «بدتر» قرینه‌ی همین است. اگر فقط یکی برقرار باشد، جواب «بی‌نتیجه» است. در غیر این صورت «تفاوت قابل تشخیصی دیده نشد»؛ و این به معنای نبودن اثر نیست.

داور باید الف یا ب را انتخاب کند. تساوی فقط وقتی پیش می‌آید که میانگین رأی داوران برای یک جفت دقیقاً نصف شود، و نصف برد حساب می‌شود.

برآورد توان در خود شیوه‌نامه: با ۲۶ سفارش برای هر زبان، این طرح فقط اثر بزرگ را با اطمینان پیدا می‌کند. تفاوت واقعی کوچک‌تر ممکن است به «تفاوت قابل تشخیصی دیده نشد» برسد و گزارش باید همین را بگوید.

بررسی‌های خودکار

هر چه نشان بدهند گزارش می‌شوند: جزئیات ساختگی، که یک روش تقریبی پیدایشان می‌کند و آدمی تأییدشان؛ قیدهای شکسته‌ی مشتری؛ و شمار هشدارهای بازبین خود والوری. بازبین فاصله از قاعده‌های والوری را می‌سنجد و از کیفیت متن چیزی نمی‌گوید؛ برای همین هیچ‌وقت تیتر گزارش نمی‌شود.

محدودیت‌ها، پیش از اجرا

شیوه‌نامه فهرست کرده که این طرح چه چیزهایی را نمی‌تواند کنار بگذارد. نتیجه هر چه باشد، این فهرست در همین صفحه می‌ماند.

  1. داوران هوش مصنوعی جواب بلندتر و متن اول را بیشتر می‌پسندند و در فارسی یکدست نیستند.
  2. داوری از خانواده‌ی مدل نویسنده ممکن است سبک او را بشناسد؛ برای همین چنین داوری از نتیجه‌ی اصلی بیرون می‌ماند.
  3. کوربودن کامل نیست: کروشه‌ها، متن کوتاه‌تر و نبودن ایموجی ممکن است والوری را لو بدهد. آزمون کوری اندازه‌اش را می‌گیرد.
  4. معیار داوری را سازندگان والوری نوشته‌اند و به همان چیزی امتیاز می‌دهد که والوری برایش ساخته شده. انتخاب اجباری کمتر از بقیه‌ی معیار به نظریه‌ی والوری تکیه دارد. بقیه را داوران انسانی‌ای محک می‌زنند که هرگز والوری ندیده‌اند.
  5. سفارش‌ها را سازندگان والوری نوشته‌اند؛ با وجود خواندن مستقل، شاید هنوز ردی از دوختن برای والوری در آن‌ها مانده باشد.
  6. بررسی واقعیت‌ها روشی تقریبی با دقت نامعلوم است؛ فقط شمارشی که آدمی تأیید کرده، پشتوانه‌ی ادعاست.
  7. در این آزمون کسی به سؤال‌ها جواب نمی‌دهد؛ پس مرحله‌ای که والوری اطلاعات کم را می‌پرسد، سنجیده نمی‌شود.
  8. یک مدل، یک متن پیام، یک تاریخ. نتیجه تاریخ‌دار است و فقط درباره‌ی همان چیزی است که آزموده شده.
  9. داور فارسی‌زبان واجد شرایط از داور انگلیسی‌زبان کمیاب‌تر است.

گزارش چه منتشر می‌کند

وقتی اجرایی تمام شود، گزارشش در همین صفحه می‌آید. شیوه‌نامه فهرست کرده که چه چیزهایی باید در آن باشد:

  • شناسه‌ی دقیق مدل و تنظیمات، نسخه‌ی اسکیل و تاریخ اجرا
  • نتیجه برای هر زبان، قالب، سطح خطر و نوع داور، هرکدام با بازه‌اش
  • تساوی‌ها، باخت‌ها و همه‌ی سنجه‌ها، حتی آن‌هایی که به نفع «فقط سفارش» است
  • سوگیری جایگاه، توافق داوران و آزمون کوری
  • توکن و زمان هر حالت؛ والوری فایل‌های بیشتری می‌خواند و احتمالاً هزینه‌ی بیشتری دارد
  • سفارش‌ها، پیام‌ها، پاسخ‌های خام، رأی‌ها و کلید، بعد از بسته‌شدن داوری

آنچه پیش از اجرا باید روشن شود

این‌ها هنوز باز است و تا روشن نشوند، مطالعه شروع نمی‌شود:

  • مدل و تاریخ اجرا
  • بودجه
  • داوران انسانی برای هر زبان
  • خواننده‌ی مستقلی که سفارش‌ها را پیش از ثابت‌کردن می‌خواند

تا امروز چه چیزهایی بررسی شده

این بررسی‌ها نشان می‌دهند ابزارها همان‌طور که نوشته شده کار می‌کنند. درباره‌ی بهتر بودن متن چیزی نمی‌گویند.

  • اسکریپت‌های آزمون

    هر ۱۰۳ بررسی خودآزمایی قبول شد (۱۰۳ از ۱۰۳)

    python bench/selftest_bench.py۶ مهر ۱۴۰۵

  • اسکریپت‌های نسخهٔ رایگان

    هر ۳۸۷ آزمونی که نسخهٔ رایگان می‌تواند اجرا کند قبول شد؛ ۶ آزمون اجرا نشد، چون فایل‌هایشان فقط در نسخه‌ی حرفه‌ای هست

    python scripts/selftest.py۶ مهر ۱۴۰۵

  • ابزارهای نسخهٔ رایگان روی MCP

    هر ۲۳۵ آزمون قبول شد

    python scripts/selftest_mcp.py۶ مهر ۱۴۰۵

اسکریپت‌های آزمون شش خروجی ساختگی دست‌نویس هم دارند. فقط برای آزمودن نمره‌دهی است؛ خروجی هیچ مدلی نیست و چیزی درباره‌ی والوری نمی‌گوید.

دو متن را پیش از برچسب‌ها بخوان