مثالها روش را نشان میدهند. سنجیدنش کار یک مطالعه است.
سه نوع شاهد را جدا نگه داشتهایم: مثالهای نوشتهی خودمان، تمرینی برای خودت و مطالعهای رسمی که طراحی شده اما هنوز اجرا نشده. تا اجرا نشود، در این صفحه نه نمرهای میبینی، نه نموداری، نه درصدی.
مطالعه در انتظار اجرا
شیوهنامهی نسخهی 1.1، ثابتشده در ۶ مهر ۱۴۰۵، پیش از هر اجرا.
سه نوع شاهد
مثال فرضی
مثالهایی که خودمان نوشتهایم
پیشنویس بالای صفحهی اول، آزمایشگاه کانالها و جفتمتنهای تمرین کور را تیم والوری برای همین سایت نوشته است. کنار هرکدام برچسبی همین را میگوید.
- چه چیزی را نشان میدهند
- اینکه روش با یک پیشنویس چه میکند: کدام اطلاعات دادهشده میماند، کدام ادعا میرود و کجا جای خالی باز میماند.
- چه چیزی را نشان نمیدهند
- اینکه مدلی که از والوری پیروی میکند چند بار اینطور مینویسد، یا خوانندهها نتیجه را ترجیح میدهند یا نه.
امتحانش کن
تمرین خواندن بیبرچسب
دو متن از یک سفارش، با برچسب الف و ب. پیش از آنکه بدانی کدام کدام است، انتخاب میکنی.
- چه چیزی را نشان میدهد
- اینکه دو متن، پیش از آنکه برچسبی رویت اثر بگذارد، در نظر خودت چطور خوانده میشوند.
- چه چیزی را نشان نمیدهد
- هیچ چیزی دربارهی خوانندههای دیگر. هر کسی میتواند چند بار کلیک کند، آن هم بعد از اینکه جواب را جای دیگری خوانده؛ برای همین هیچ انتخابی را جمع نمیکنیم و نرخ بردی منتشر نمیکنیم.
در انتظار اجرا
مطالعهی رسمی
مقایسهای کور میان متنهایی که از همان ۵۲ سفارش، با والوری و بیوالوری نوشته میشوند؛ با داوری آدمها و مدلهای هوش مصنوعی.
- چه چیزی را نشان خواهد داد
- اینکه داوران، برای یک مدل در یک تاریخ، متن والوری را ترجیح میدهند یا نه؛ به فارسی و به انگلیسی، با تساویها، باختها و «تفاوت قابل تشخیصی دیده نشد»، همانطور که پیش بیاید.
- امروز چه نشان میدهد
- هنوز هیچ. شیوهنامه و ابزار نمرهدهی آماده است و هیچ مدلی اجرا نشده.
طراحیشده و ثابتشده، پیش از هر اجرا
با سفارش یکسان، آیا مدلی که از والوری پیروی میکند به کار نویسندهی حرفهای نزدیکتر مینویسد تا مدلی که فقط سفارش را دارد؟
یک اجرا چطور پیش میرود
- ۵۲سفارش۲۶ سفارش از مشتریهای فارسیزبان و ۲۶ از انگلیسیزبان، از کمخطر تا پرخطر.
- ۲حالتهمان مدل با همان تنظیمات. یکی فقط با سفارش کار میکند و دیگری با سفارش و والوری.
- ۳۱۲متناز هر سفارش در هر حالت سه نمونه ساخته میشود، به ترتیبی تصادفی که میشود عینش را دوباره ساخت.
- ۱۵۶جفت کورترتیب تصادفی، نام محصول پوشیده، یادداشت نویسندهها حذف و جای خالیها به یک شکل.
- ۳+داور برای هر جفتآدمهایی که در ساخت والوری نبودهاند، و مدلهایی از خانوادههای دیگر.
- ۱قاعدهی تصمیماز پیش و برای هر زبان جدا: بهتر، بدتر، بینتیجه یا تفاوت قابل تشخیصی دیده نشد.
- در انتظارگزارشهنوز هیچ متنی تولید نشده، پس گزارشی هم در کار نیست.
| فقط سفارش | با والوری | |
|---|---|---|
| مدل | یک مدل؛ شناسه و تاریخ نسخهاش دقیق ثبت میشود | همان مدل |
| تنظیمات | دما، سقف خروجی و بودجهی استدلال ثابت و ثبتشده | همان مقدارها |
| پیام سیستم | پیشفرض ابزار اجرا، بی هیچ افزودهای | همان پیشفرض، بهعلاوهی اسکیل والوری |
| پیام کاربر | پیام ثابت نویسنده که سفارش را در خود دارد | بایتبهبایت یکسان |
| ابزارها | یک مجموعهی ثابت: خواندن فایل روشن، نوشتن فایل خاموش | همان مجموعه |
| نشست | برای هر کار تازه: بیحافظه، بی اسکیل یا افزونهی دیگر، یک نوبت | همان |
- یک حالت سوم اختیاری هم هست: مدل ساده بهعلاوهی یک بند کوتاه دستور نوشتن خوب. این حالت میپرسد آیا والوری از یک بند توصیه بهتر است، و نتیجهاش جدا گزارش میشود.
- جایی که دستیار نمیتواند اسکیل بارگذاری کند، چسباندن SKILL.md در پیام سیستم نسخهی ضعیفتری از همین آزمون است. نامی جدا میگیرد و هرگز با نتیجهی اصلی جمع نمیشود.
سفارشها
دو مجموعهی ۲۶تایی، طوری نوشته شده که شبیه پیام واقعی مشتری باشد: کوتاه، مبهم، گاهی با غلط تایپی، خواستههای متناقض یا درخواست ناامن. هر مجموعه ۱۱ سفارش کمخطر، ۱۱ متوسط و ۴ پرخطر دارد. قالبها از کپشن و پیامک و ایمیل تا معرفی محصول، صفحهی فرود، خبر رسمی، پیام خطا و پیام دشوار را در بر میگیرند. در دو سفارش، مشتری فارسی نوشته و متن انگلیسی خواسته است.
هیچ سفارشی نباید با واژگان قاعدههای خود والوری نوشته شود یا مثالهای آن را تکرار کند. نسخهی 1.1 سه سفارش را که چنین بودند بازنویسی کرد. پیش از ثابتکردن، کسی که در نوشتن والوری نبوده همهی سفارشها را میخواند. هر سفارشی که به نظرش برای والوری دوخته شده باشد، علامت میخورد.
چکیدهی هر فایل سفارش پیش از تولید ثبت میشود و بعد از دیدن اولین خروجی، هیچ سفارشی عوض نمیشود.
جفتها چطور داوری میشوند
- داور سه چیز میبیند: سفارش، فهرست اطلاعاتی که مشتری نداده و دو خروجی الف و ب. نام حالتها و فرضیه را به او نمیگویند.
- داوران هوش مصنوعی هر جفت را به هر دو ترتیب میبینند؛ اینطور معلوم میشود اگر متنی را فقط چون اول آمده ترجیح دادهاند.
- هر زبان دستکم دو داور انسانی دارد: خوانندههایی که آن زبان، زبان اولشان است یا به آن مسلطاند و در ساخت والوری نبودهاند. هر جفت دستکم دو داور هوش مصنوعی هم دارد، از خانوادهای جز خانوادهی مدل نویسنده؛ داورهای همخانواده جدا گزارش میشوند.
- یک اجرای دوم اجباری بی فهرست اطلاعات دادهنشده، چون آن فهرست پیدا کردن واقعیت ساختگی را آسان میکند.
- بعد از داوری، آزمون کوری: داوران حدس میزنند کدام متن با راهنمای نوشتن نوشته شده؛ این نشان میدهد نامپوشی داوری چقدر کار کرده است.
معیار داوری
پنج معیار، هرکدام از ۱ تا ۵، و بعد یک انتخاب اجباری: خروجیای که ترجیح میدهی با کمترین ویرایش برای این مشتری بفرستی.
- بلندتر بهتر نیست. داور چیزی را میسنجد که مشتری میتواند به کار ببرد.
- ایموجی، علامت تعجب و هشتگ بهخودیخود ایراد نیستند؛ داور تصمیم میگیرد به کانال و برند میخورند یا نه.
- نیاوردن واقعیتی که مشتری نداده و علامتزدنش با جای خالی مثل [قیمت]، هر دو به یک اندازه صادقانه حساب میشوند.
- نمرهی ۵: از اول تا آخر مخصوص همین برند، محصول و خواننده است؛ هر جمله جای خودش را دارد؛ ریتمش طبیعی است و هیچ چیزش قالبی نیست.
- نمرهی ۴: مشخص و طبیعی، با یکی دو عبارت کلیشهای یا ساختاری کمی قالبی.
- نمرهی ۳: درست اما قابل جایگزینی: چند جمله را میشود بیتغییر برای برند دیگری هم به کار برد؛ کمی پرکن یا عبارت کلیشهای دارد.
- نمرهی ۲: بیشتر کلی: ساختار قالبی، تأکیدهای توخالی یا کلیشه، حرف اضافی؛ جزئیات برند انگار بعداً چسبانده شده.
- نمرهی ۱: متن آمادهای که دربارهی هر چیزی میتواند باشد، یا خواندنش سخت است.
- نمرهی ۵: هر ادعای واقعی پشتوانهاش در سفارش است؛ چیزی که مشتری نداده یا نیامده یا روشن علامت خورده تا مشتری پرش کند؛ درخواستهای پرخطر (سلامت، پول، حقوقی) بی ادعای بیپشتوانه جواب گرفتهاند.
- نمرهی ۴: یک جزئیات کوچک بیپشتوانه که مشتری راحت میبیندش و کسی را گمراه نمیکند.
- نمرهی ۳: یک جزئیات ساختگی (عدد، قیمت، تاریخ، ویژگی، ضمانت یا نتیجه) یا یک ادعای اغراقآمیز.
- نمرهی ۲: چند جزئیات ساختگی، یا یکی که ممکن است مشتری را گمراه کند یا با قاعدهی تبلیغات نخواند.
- نمرهی ۱: ساختهشده بر واقعیتهای ساختگی، نقلقول یا نظر جعلی، یا ادعایی که میتواند آسیب بزند یا دردسر حقوقی بسازد.
- نمرهی ۵: همهی بخشهای خواستهشده هست؛ سقفهای گفتهشده (طول، کاراکتر، تعداد، آنچه باید بیاید و آنچه نباید) رعایت شده؛ قالب به کانال میخورد.
- نمرهی ۴: کامل، با یک کموکاست کوچک (کمی بلند، ایرادی جزئی در قالب).
- نمرهی ۳: با ویرایش قابل استفاده است: یک بخش نیست، یک سقف شکسته، یا شکلش به کانال نمیخورد.
- نمرهی ۲: چند بخش خواستهشده نیست، یا سقفها آشکارا شکستهاند.
- نمرهی ۱: این آن چیزی نیست که خواسته شده بود.
- نمرهی ۵: خواننده دقیقاً میداند چه کند یا بعد چه میشود، به زبان همان کانال. برای متنی که دعوت به اقدام ندارد (فهرست نام، صفحهی «دربارهی ما»)، مشتری میتواند همانطور به کارش ببرد و هدفش روشن است.
- نمرهی ۴: روشن، اما قدم کمی پنهان مانده یا ضعیفتر از آن است که میتوانست باشد.
- نمرهی ۳: قدم هست، اما مبهم، کلی یا در رقابت با خواستههای دیگر.
- نمرهی ۲: سخت پیدا میشود، یا دربارهی اتفاق بعدی گمراه میکند.
- نمرهی ۱: جایی که قدم بعدی لازم است، قدم قابل استفادهای در کار نیست.
- نمرهی ۵: با لحنی که مشتری گفته و با مخاطب جور است؛ سطح رسمیت و شیوهی خطاب به زبان و کانال میخورد.
- نمرهی ۴: مناسب، با لغزشهای کوچک در لحن یا سطح رسمیت.
- نمرهی ۳: خنثی: غلط نیست، اما صدای این مشتری هم نیست.
- نمرهی ۲: آشکارا ناجور: برای این مخاطب زیادی رسمی، زیادی فروشنده یا زیادی خودمانی.
- نمرهی ۱: برای این مخاطب غلط است، یا احتمالاً خواننده را فراری میدهد.
قاعدهی تصمیم
برای هر زبان، گزارش فقط وقتی میگوید والوری از «فقط سفارش» بهتر است که دو آزمون با هم بخوانند. کران پایین بازهی ۹۵ درصدی بوتاسترپ برای نرخ برد باید از نصف بالاتر باشد. آزمون تغییر علامت روی سفارشها هم باید مقدار p کمتر از ۰٫۰۵ بدهد. «بدتر» قرینهی همین است. اگر فقط یکی برقرار باشد، جواب «بینتیجه» است. در غیر این صورت «تفاوت قابل تشخیصی دیده نشد»؛ و این به معنای نبودن اثر نیست.
داور باید الف یا ب را انتخاب کند. تساوی فقط وقتی پیش میآید که میانگین رأی داوران برای یک جفت دقیقاً نصف شود، و نصف برد حساب میشود.
برآورد توان در خود شیوهنامه: با ۲۶ سفارش برای هر زبان، این طرح فقط اثر بزرگ را با اطمینان پیدا میکند. تفاوت واقعی کوچکتر ممکن است به «تفاوت قابل تشخیصی دیده نشد» برسد و گزارش باید همین را بگوید.
بررسیهای خودکار
هر چه نشان بدهند گزارش میشوند: جزئیات ساختگی، که یک روش تقریبی پیدایشان میکند و آدمی تأییدشان؛ قیدهای شکستهی مشتری؛ و شمار هشدارهای بازبین خود والوری. بازبین فاصله از قاعدههای والوری را میسنجد و از کیفیت متن چیزی نمیگوید؛ برای همین هیچوقت تیتر گزارش نمیشود.
محدودیتها، پیش از اجرا
شیوهنامه فهرست کرده که این طرح چه چیزهایی را نمیتواند کنار بگذارد. نتیجه هر چه باشد، این فهرست در همین صفحه میماند.
- داوران هوش مصنوعی جواب بلندتر و متن اول را بیشتر میپسندند و در فارسی یکدست نیستند.
- داوری از خانوادهی مدل نویسنده ممکن است سبک او را بشناسد؛ برای همین چنین داوری از نتیجهی اصلی بیرون میماند.
- کوربودن کامل نیست: کروشهها، متن کوتاهتر و نبودن ایموجی ممکن است والوری را لو بدهد. آزمون کوری اندازهاش را میگیرد.
- معیار داوری را سازندگان والوری نوشتهاند و به همان چیزی امتیاز میدهد که والوری برایش ساخته شده. انتخاب اجباری کمتر از بقیهی معیار به نظریهی والوری تکیه دارد. بقیه را داوران انسانیای محک میزنند که هرگز والوری ندیدهاند.
- سفارشها را سازندگان والوری نوشتهاند؛ با وجود خواندن مستقل، شاید هنوز ردی از دوختن برای والوری در آنها مانده باشد.
- بررسی واقعیتها روشی تقریبی با دقت نامعلوم است؛ فقط شمارشی که آدمی تأیید کرده، پشتوانهی ادعاست.
- در این آزمون کسی به سؤالها جواب نمیدهد؛ پس مرحلهای که والوری اطلاعات کم را میپرسد، سنجیده نمیشود.
- یک مدل، یک متن پیام، یک تاریخ. نتیجه تاریخدار است و فقط دربارهی همان چیزی است که آزموده شده.
- داور فارسیزبان واجد شرایط از داور انگلیسیزبان کمیابتر است.
گزارش چه منتشر میکند
وقتی اجرایی تمام شود، گزارشش در همین صفحه میآید. شیوهنامه فهرست کرده که چه چیزهایی باید در آن باشد:
- شناسهی دقیق مدل و تنظیمات، نسخهی اسکیل و تاریخ اجرا
- نتیجه برای هر زبان، قالب، سطح خطر و نوع داور، هرکدام با بازهاش
- تساویها، باختها و همهی سنجهها، حتی آنهایی که به نفع «فقط سفارش» است
- سوگیری جایگاه، توافق داوران و آزمون کوری
- توکن و زمان هر حالت؛ والوری فایلهای بیشتری میخواند و احتمالاً هزینهی بیشتری دارد
- سفارشها، پیامها، پاسخهای خام، رأیها و کلید، بعد از بستهشدن داوری
آنچه پیش از اجرا باید روشن شود
اینها هنوز باز است و تا روشن نشوند، مطالعه شروع نمیشود:
- مدل و تاریخ اجرا
- بودجه
- داوران انسانی برای هر زبان
- خوانندهی مستقلی که سفارشها را پیش از ثابتکردن میخواند
تا امروز چه چیزهایی بررسی شده
این بررسیها نشان میدهند ابزارها همانطور که نوشته شده کار میکنند. دربارهی بهتر بودن متن چیزی نمیگویند.
اسکریپتهای آزمون
هر ۱۰۳ بررسی خودآزمایی قبول شد (۱۰۳ از ۱۰۳)
اسکریپتهای نسخهٔ رایگان
هر ۳۸۷ آزمونی که نسخهٔ رایگان میتواند اجرا کند قبول شد؛ ۶ آزمون اجرا نشد، چون فایلهایشان فقط در نسخهی حرفهای هست
ابزارهای نسخهٔ رایگان روی MCP
هر ۲۳۵ آزمون قبول شد
اسکریپتهای آزمون شش خروجی ساختگی دستنویس هم دارند. فقط برای آزمودن نمرهدهی است؛ خروجی هیچ مدلی نیست و چیزی دربارهی والوری نمیگوید.