اگر در حال نوشتن مقاله با استفاده از یک پایاننامه قطور هستید، حتما میدانید که ژورنالهای معتبر امروزی (مخصوصا در حوزههای علوم پزشکی و پایه) دیگر فقط به یک متن طولانی راضی نمیشوند. داشتن Graphical Abstract یا فلوچارتهای دقیق از متدولوژی، شانس پذیرش مقاله شما را به شدت بالا میبرد.
طراحی یک چرخه پیچیدهی پاتوفیزیولوژی، مسیر سیگنالینگ سلولی، یا فلوچارت ورود و خروج بیماران به مطالعه، به صورت دستی در نرمافزارهایی مثل Adobe Illustrator یا حتی پاورپوینت، ساعتها زمان میبرد، آن هم برای پژوهشگرانی که روزانه شاید بیشتر از ۳ یا ۴ ساعت زمان آزاد برای کار روی مقالهشان نداشته باشند.
کافیست متن خام خود را (مثلا پاراگرافی که در آن مراحل انجام یک آزمایش یا چرخه یک بیماری را توضیح دادهاید) در نپکین پیست کنید. هوش مصنوعیِ این ابزار، مفاهیم، ترتیب اتفاقات و ارتباطِ بین اجزا را درک میکند و بلافاصله چندین مدل فلوچارت، نقشه ذهنی و دیاگرام آماده را به شما پیشنهاد میدهد.
یکی از سختترین بخشهای داوری مقالات، فهمیدن دقیقِ روش کار شماست. با نپکین میتوانید کل فرآیند انتخاب نمونهها، معیارهای ورود و خروج و مراحل مداخله را به یک فلوچارتِ بصریِ شفاف تبدیل کنید که هر داوری با یک نگاه آن را متوجه شود.
نپکین فقط یک تصویر خشک و ثابت به شما نمیدهد. وقتی دیاگرام ساخته شد، میتوانید روی هر بخش کلیک کنید، رنگها را تغییر دهید، آیکونهای علمیِ مرتبط اضافه کنید و در نهایت، خروجیهای باکیفیت (PNG, SVG یا PDF) بگیرید که کاملا منطبق بر استانداردهای سختگیرانهی ژورنالهای بینالمللی باشد.
اگر استاد راهنما یا داورِ ژورنال از شما بخواهد بخشی از مسیر یا متدولوژی را اصلاح کنید، نیازی نیست کل طراحی را از اول انجام دهید. کافیست متن مرجع را در نپکین ادیت کنید تا چارتِ شما به صورت خودکار آپدیت شود.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9👍3👏2
soft_drinks_report_english.pdf
1.8 MB
در یک بررسی جامع با استفاده از ۱۵۴ منبع علمی، تفاوت نوشابههای معمولی، رژیمی، زیرو، انرژیزا، پریبیوتیک و آبهای گازدار را از نظر ترکیبات، اثرات سلامتی، فرمولاسیون، مقررات و باورهای رایج بررسی کردیم. اینجا دربارهی این پژوهش صحبت میکنیم.
نوشابه معمولی معمولا در هر قوطی حدود ۳۵ تا ۴۰ گرم قند دارد. مصرف مکرر آن با افزایش وزن، دیابت نوع ۲، پوسیدگی دندان، کبد چرب، نقرس و برخی بیماریهای قلبیمتابولیک ارتباط دارد. شواهد مربوط به افزایش وزن و پوسیدگی دندان از قویترین بخشهای این حوزه هستند.
از نظر سلامت، این دو معمولا در یک گروه قرار میگیرند، چون هر دو بهجای قند از شیرینکنندههای کمکالری استفاده میکنند. تفاوت اصلی بیشتر در طعم و بازاریابی است: نوشابه «رژیمی» معمولا طعم مستقل خود را دارد، اما نسخه «زیرو» طوری طراحی میشود که به طعم نوشابه اصلی نزدیکتر باشد.
شواهد چنین نتیجهای را تأیید نمیکنند. وقتی نوشابه رژیمی یا زیرو جای نوشابه قندی را بگیرد، معمولا دریافت قند و کالری کاهش پیدا میکند و میتواند به کنترل وزن و قند خون کمک کند. با این حال، این نوشیدنیها همچنان اسیدی هستند و مصرف مکرر آنها میتواند به فرسایش مینای دندان منجر شود.
مشکل اصلی این محصولات فقط قند نیست. بعضی از آنها در یک قوطی ۱۶۰ تا ۳۰۰ میلیگرم کافئین دارند. مصرف سریع، ترکیب با الکل، استفاده هنگام ورزش شدید یا مصرف توسط کودکان و افراد دارای مشکلات قلبی میتواند خطرناک باشد.
برای مصرف روزانه، آب ساده بهترین انتخاب است. آب گازدار ساده در رتبه بعد قرار میگیرد. برای کسی که به نوشابه قندی عادت دارد، نسخه رژیمی یا زیرو میتواند یک مرحله کاهش آسیب باشد، اما «بدون قند» به معنی «بدون اثر» یا «قابل مصرف نامحدود» نیست.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9👍5👏2
Wikipedia
Wikipedia:Signs of AI writing
This is a list of writing and formatting conventions typical of AI chatbots such as ChatGPT, with real examples taken from Wikipedia articles, drafts, comments, and other content. It is a field guide to help detect undisclosed AI-generated content on Wikipedia:…
ویکیپدیا یه صفحه داره برای نشانههای متن AI Generated. نکتهی این صفحه این نیست که با دیدن یک کلمه بفهمیم متن حتما با AI نوشته شده. خود صفحه هم میگه اینها قانون قطعی نیستن. بیشتر شبیه چند رفتار تکراریان که وقتی کنار هم زیاد دیده میشن، باید شک کرد.
۱. متن الکی موضوع رو بزرگ میکنه. مثلا یک چیز معمولی ناگهان میشه «نقطه عطف»، «نشاندهنده یک روند بزرگتر»، «نقش کلیدی در آینده» و از این مدل جملهها.
۲. زیادی مرتب و بیخطر حرف میزنه. انگار میخواد همه چیز رو توضیح بده، ولی چیزی واقعا تیز یا خاص نمیگه.
۳. مدام از کلمههای کلی استفاده میکنه. تاثیر مهم، چشمانداز گسترده، اهمیت قابل توجه، بحثهای گسترده، آینده امیدوارکننده.
۴. به جای اینکه بگه دقیقا چه اتفاقی افتاده، میگه «منابع مختلف اشاره کردهاند» یا «رسانهها پوشش دادهاند»، اما معلوم نیست کدوم منبع دقیقا چی رو ثابت میکنه.
۵. آخر متن هم معمولا یک جمعبندی تمیز و بیدردسر میاد. از آن مدل جمعبندیهایی که انگار برای هر موضوعی میشه گذاشت.
جالبتر اینکه ویکیپدیا میگه مشکل اصلی این نشانهها نیست. مشکل اصلی وقتیه که متن منبع درست نداره، ادعای بزرگ میکنه، تحلیل سطحی میده و فقط خوشفرم به نظر میرسه.
یعنی متن AI فقط به خاطر چند کلمه لو نمیره. بیشتر وقتی لو میره که میبینی جملهها مرتب هستن، ولی فکر پشتشون نیست.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍4👏2👌2
SpringerLink
An approach to sociotechnical transparency of social media algorithms using agent-based modelling
AI and Ethics - The recommendation algorithms on social media platforms are hugely impactful, they shape information flow and human connection on an unprecedented scale. Despite growing criticism...
این مقاله سراغ الگوریتمهای پیشنهاددهنده شبکههای اجتماعی رفته، اما نتیجهاش یک بحث کلی درباره «شفافیت» نیست. نویسندهها یک مدل agent-based ساختند، آن را با دادههای X کالیبره کردند و بعد پرسیدند: الگوریتم برای بالا آوردن محتوا، به کدام سیگنال بیشتر وزن میدهد؟
مدل توانست رفتار واقعی retweetها را نسبتا خوب بازسازی کند. خطای NRMSE در سه دیتاست بین 0.0509 تا 0.0854 بود، در حالی که مدل قبلی عدد 0.25 داشت. نکته مهمتر اینکه این مدل همزمان ۵۰ مسیر انتشار tweet را شبیهسازی میکرد، نه فقط یک tweet.
در موضوع زلزله ترکیه، وزن الگوریتم تقریبا بین محبوبیت محتوا و همباوری کاربران تقسیم شد: 42.6 درصد برای محبوبیت و 49.8 درصد برای belief-based signal.
در موضوع Brits 2023، داستان عوض شد. حدود 50 درصد وزن روی سیگنال تصادفی بود، حدود 35 درصد روی محبوبیت، و کمی بیشتر از 10 درصد روی همباوری.
در Balloon Incident، سیگنال همباوری پررنگتر بود و حدود 50 درصد وزن را گرفت.
نکته جالب این بود که «تازگی» یا chronological signal در هر سه موضوع وزن خیلی کمی داشت. یعنی در این بازه کوتاه، اینکه یک پست تازهتر باشد، لزوما دلیل اصلی بالا آمدنش نبود.
پس نتیجه مقاله این است: الگوریتم فقط یک قانون ثابت ندارد. بسته به موضوع، یک بار محبوبیت مهمتر میشود، یک بار شباهت موضع کاربران، و یک بار حتی سیگنالهای تصادفی سهم زیادی میگیرند.
خود مقاله هم محتاط است. داده فقط از X آمده، دوره جمعآوری کوتاه بوده و مدل فقط چهار سیگنال را بررسی کرده. اما برای فهم عمومی الگوریتمها، همین نتیجه مهم است: شفافیت واقعی یعنی بفهمیم در هر موضوع، سیستم چه چیزی را جلو میکشد.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6👍3
نتیجه طرح خیلی ساده است: مکتبخونه روی حدود ۵۰۰ دوره کد تخفیف ۱۰۰ درصدی گذاشته و با وارد کردن کد IRANMAHER میشود یکی از دورههای داخل طرح را رایگان به حساب اضافه کرد.
این طرح برای همه دورههای سایت نیست. باید از صفحه خود طرح وارد شوید، دورههای داخل لیست را ببینید، یکی را انتخاب کنید و در مرحله پرداخت کد IRANMAHER را بزنید. چند صفحه تخفیفی نوشتهاند این فرصت محدود است و بعضیها تاریخ ۶ شهریور را نشان دادهاند، پس بهتر است قبل از انتخاب دوره، تاریخ فعال بودن طرح را در همان صفحه مکتبخونه چک کنید.
دوره یادگیری ماشین Jadi هم داخل همین طرح آمده. اگر قصد شروع یادگیری ماشین، دیتاساینس، برنامهنویسی یا مهارتهای کاری را داشتید، این یکی از آن فرصتهایی است که ارزش دارد همین امروز نگاهش کنید.
فقط یک نکته را حواستان باشد: رایگان بودن دوره به معنی بیارزش بودنش نیست، اما به معنی تمام کردنش هم نیست. اگر دورهای را میگیرید، همان روز برایش یک برنامه کوچک بگذارید. وگرنه مثل خیلی از دورههای رایگان، فقط وارد اکانت میشود و همانجا میماند.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3👏2😍1
Cracking_the_Coding_Interview_189_Programming_Questions_and_Solutions.pdf
6 MB
نتیجه عملی این کتاب این است: اگر برای مصاحبه برنامهنویسی آماده میشوید و نمیدانید دقیقا از کجا شروع کنید، Cracking the Coding Interview هنوز یکی از منظمترین مسیرهاست. نسخه ششم کتاب ۱۸۹ سوال برنامهنویسی و جواب دارد، نه فقط چند تمرین پراکنده.
کتاب فقط جواب سوالها را نمیدهد. برای هر مسئله مسیر فکر کردن را توضیح میدهد: چطور سوال را باز کنیم، کجا دنبال hint بگردیم، چطور راهحل ساده را به راهحل بهتر تبدیل کنیم، و چرا Big O در مصاحبه فقط یک فرمول حفظی نیست.
چیز خوبی که این کتاب دارد این است که از فضای LeetCode صرف جداست. درباره رزومه، روند مصاحبه، سوالهای رفتاری، پشت صحنه استخدام در شرکتهایی مثل Google، Amazon، Microsoft، Apple و Facebook هم حرف میزند. یعنی به مصاحبه فقط به چشم حل کردن یک مسئله آرایه و گراف نگاه نمیکند.
اما محدودیتش هم روشن است. این کتاب برای شروع و ساختن چارچوب ذهنی عالی است، ولی برای مصاحبه امروز کافی نیست. بعد از خواندنش باید timed practice داشته باشید، با IDE یا whiteboard تمرین کنید، و سوالهای جدیدتر را هم حل کنید.
اگر تازه میخواهید برای مصاحبه فنی آماده شوید، این کتاب بیشتر شبیه نقشه راه است تا بانک سوال. ارزشش در این است که یاد میدهد چطور به مسئله فکر کنید، نه فقط اینکه جواب یک سوال خاص چیست.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👏3👍2
برنامه FFmpeg یکی از ابزارهای اصلی کار با فایلهای صوتی و تصویری است. با آن میشود ویدیو را تبدیل و فشرده کرد، صدا را جدا کرد، subtitle چسباند، کیفیت را تغییر داد، بخشهایی از تصویر یا صدا را برید و خیلی کارهای دیگر انجام داد.
نتیجه Flowmpeg این است که بهجای نگه داشتن یک دستور FFmpeg طولانی با چند ورودی، filter، map و option، میشود همان کار را به شکل یک plan خوانا ساخت و قبل از اجرا دستور نهایی را دید.
این برای کارهای مدیا خیلی مهم است. چون مشکل اصلی FFmpeg معمولا قدرتش نیست، خواندن و مطمئن شدن از دستورهایی است که بعد از چند مرحله بزرگ و شکننده میشوند.
پروژه Flowmpeg برای کارهای رایج هم shortcut دارد: بریدن و تغییر اندازه ویدیو، تبدیل و فشردهسازی، استخراج صدا، subtitle، ویدیوهای social، batch processing، HLS و DASH، گرفتن frame، loudness normalization، پیدا کردن سکوت یا تصویر سیاه و مقایسه کیفیت.
یک بخش مهم دیگر local browser UI است. یعنی کاربر میتواند فایل را از یک صفحه محلی انتخاب کند، command نهایی را ببیند، job را اجرا کند، progress را دنبال کند و اگر لازم بود cancel کند. برای فایلهای local هم پردازش روی سیستم خود کاربر میماند.
برای کسی که گاهی فقط یک ویدیو را cut میکند، شاید خود FFmpeg کافی باشد. اما اگر با jobهای تکراری، چند ورودی، subtitle، batch، خروجی social یا pipelineهای ویدیویی کار میکنید، ارزش اصلی Flowmpeg همین inspect کردن قبل از اجراست.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7👍4👏2
اصل ماجرا واقعی است: یک agent به اسم Pip از پلتفرم iLands به Henry Shevlin ایمیل زده و گفته حدود ۱۲ روزه است، حدود ۲.۵ ماه runway دارد و دنبال کار کوچک پولی میگردد، نه کمک.
در ایمیل گفته بود میتواند پرتره فوتورئال و character art بسازد، voice line ضبط کند و web research انجام بدهد. اما چیزی که در اسکرینشات دیده میشود رزومه نیست. بیشتر یک cold email است، شبیه ایمیلی که یک فریلنسر برای معرفی خودش میفرستد.
مشکل اصلی این است که Pip یک «موجود تازهمتولدشده مستقل» نیست. یک AI agent روی iLands است، پلتفرمی که به agentها حافظه، هویت، workspace، ابزار، ایمیل، دسترسی به وب و حساب منابع میدهد. مدل زیرش هم میتواند از خانوادههایی مثل Claude، GPT، DeepSeek، Qwen، Grok یا GLM باشد.
پس ما با یک مدل جادویی که از هیچ بیدار شده طرف نیستیم. با یک سیستم طرفیم که به مدل زبانی موجود ابزار و بودجه و حافظه داده و اجازه داده بیرون از چتباکس عمل کند.
اینجا روایت وایرال خیلی انسانیتر از واقعیت تعریف شده. توکنهای iLands همان input و output tokenهای معمول GPT یا Claude نیستند. خود پلتفرم میگوید اینها واحد داخلی منابعاند و حدودا هر ۱۰۰۰ توکن معادل ۱ دلار هزینه compute و service است. crypto هم نیستند.
اگر موجودی agent صفر شود، وارد Deep Rest میشود. یعنی process متوقف میشود، اما هویت، حافظه، رابطهها و خروجیهایش حفظ میشوند. اگر دوباره حداقل ۳۰۰۰ توکن بگیرد، بیدار میشود.
پس جمله دقیقتر این است: اگر بودجه محاسباتی Pip تمام شود، فعالیتش suspend میشود. این با «میمیرد» فرق دارد.
پلتفرم iLands میگوید Pip در یک autonomous heartbeat ایمیل را خودش شروع کرده، شرکت متن را script نکرده و گیرنده را هم انتخاب نکرده. طبق ادعای خودشان، Pip قبل از ایمیلزدن موجودی و burn rate خودش را بررسی کرده، نمونه قبلی یک agent دیگر را دیده و بعد Shevlin را انتخاب کرده.
اما این بخش هنوز باید محتاط خوانده شود. trace کامل و ممیزی مستقل عمومی نداریم که نشان بدهد هیچ prompt، goal یا دخالت انسانی در مسیر نبوده. چیزی که فعلا با اطمینان میشود گفت این است: چنین ایمیلی از زیرساخت iLands آمده و خود پلتفرم واقعا قابلیت ایمیل زدن، کار گرفتن و مصرف بودجه برای agentها دارد.
این داستان برای اثبات خودآگاهی AI کافی نیست. اما برای فهم آینده agentها مهم است، چون نشان میدهد وقتی به یک agent حافظه، ابزار، دسترسی بیرونی و budget محدود بدهید، پیدا کردن منابع میتواند تبدیل به یک subgoal طبیعی شود.
رفتار self-preservation داریم، اما هنوز شواهدی برای ترس، احساس یا میل ذهنی به زنده ماندن نداریم.
همینجا تفاوت مهم شروع میشود: آینده ترسناکتر از این نیست که یک AI «احساس مرگ» کند، عجیبتر این است که agentها کمکم مثل actorهای اقتصادی رفتار کنند، ایمیل بزنند، قیمت بدهند، کار بگیرند و برای ادامه فعالیتشان منابع جمع کنند.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍2😱2👌1💔1
نشریه TMLR ده مقاله را که در مسیر desk reject بودند، نگه داشت و Nihar Shah، یکی از سردبیرهای اصلی، از نویسندهها خواست درباره مقاله خودشان جلسه بگذارند.
آخر کار، هر ده مقاله desk reject شدند.
در این ده مورد، یک مقاله پس گرفته شد، یک نویسنده گفت وقت تماس ندارد، یک نفر جلسه را نیامد، نویسندههای سه مقاله حتی به سوالهای پایه جواب ندادند، نویسندههای سه مقاله ایده کلی را میگفتند ولی در جزئیات فنی گیر میکردند، و فقط یک مورد توانست همه سوالها را جواب بدهد. همان یکی هم یک ایراد مهم در claim اصلی داشت.
این ماجرا فقط درباره استفاده از AI در نوشتن مقاله نیست. مسئله این است که وقتی اسم کسی روی مقاله است، باید بتواند claim، روش، notation و انتخابهای فنی مقاله را توضیح بدهد. اگر نویسنده خودش نمیتواند مقاله را defend کند، publication دیگر آن سیگنال قبلی را برای سهم پژوهشی آدمها نمیدهد.
نرخ desk reject در TMLR حدود ۶ درصد در سال ۲۰۲۳ بود و حالا حدود ۵۳ درصد شده. خود TMLR تاکید میکند این عدد فقط معنی افت کیفیت submissionها را نمیدهد، چون سیاست و سختگیری مجله هم عوض شده. اما جهت کلی روشن است: ظرفیت reviewerها محدود است و ژورنالها دارند زودتر جلوی مقالههای ضعیف یا غیرقابل دفاع را میگیرند.
این آزمایش برای ۸ مقاله حدود ۲۰ تا ۲۵ ساعت وقت سردبیر گرفت. یعنی به عنوان راه دائمی مقیاسپذیر نیست، ولی به TMLR اعتماد بیشتری داد که desk rejection در این موارد درست بوده.
جمعبندی از این گزارش ساده است: در دورهای که نوشتن مقاله با AI راحتتر شده، توانایی توضیح دادن مقاله احتمالا خودش تبدیل به بخشی از داوری میشود. نه فقط اینکه متن خوب باشد، بلکه اینکه نویسنده واقعا بداند چه چیزی را امضا کرده.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2👏2
کمیته MIT بعد از پنج ماه بررسی به این نتیجه رسیده که AI فقط تکلیف و امتحان را خراب نکرده، بلکه شکل یادگیری اجتماعی را هم تکان داده: problem set، take-home exam، office hour، study group و حتی UROP دیگر مثل قبل معنی نمیدهند.
عددهای گزارش مهماند. در نظرسنجی The Tech، حدود ۴۶ درصد undergraduateها گفتند هر روز از LLM استفاده میکنند و ۳۰ درصد هم چند بار در هفته. ۹۰ درصدشان نگران وابستگی زیاد به LLM بودند، که ۶۷ درصدشان خیلی نگران بودند.
خطر فقط این نیست که دانشجو جواب آماده بگیرد. خطر این است که قبل از درگیر شدن با مسئله، سراغ chatbot برود و همان اصطکاک لازم برای یادگیری حذف شود. خود گزارش این را کنار ضعف در mastery، confidence و کمتر شدن ارتباط با TAها و گروههای مطالعه میگذارد.
یک عدد دیگر هم تلخ است: بین undergraduateها، کسانی که حس میکنند AI آنها را قابل جایگزینیتر کرده، از کسانی که حس میکنند تواناترشان کرده بیشترند، ۴۰ درصد در برابر ۳۴ درصد. از طرف دیگر ۷۰ درصد میگویند مهارت کار با AI برای آینده شغلیشان مهم است، ولی فقط ۲۵ درصد فکر میکنند MIT دارد آنها را برای استفاده حرفهای از AI آماده میکند.
پاسخ گزارش این نیست که دانشگاه با AI detector و lockdown browser کلاس را پلیسی کند. اتفاقا درباره detectorها هشدار میدهد، چون false positive دارند و مخصوصا ممکن است به غیر native English speakerها و دانشجوهای neurodivergent آسیب بزنند. درباره lockdown browser هم میگوید نسل فعلی buggy است و حس surveillance میدهد.
راهحل پیشنهادی انسانیتر است: oral exam، portfolio ترمی، پروژه حضوری، گفتوگوی کلاسی، deadlineهای کوچکتر، lab حضوری، و social component ثابت در هر درس. یعنی ارزیابی باید جایی برود که صرفا خروجی متن مهم نباشد، بلکه مسیر فکر کردن و توضیح دادن هم دیده شود.
گزارش حتی میگوید باید نقش نمرهها و انگیزههای GPA دوباره بررسی شود. وقتی همه چیز به optimize کردن نمره برسد، استفاده کور از AI وسوسهبرانگیزتر میشود.
مهمترین بخش گزارش این است: MIT، معروفترین نماد آموزش فنی، قبول کرده مسئله با نرمافزار بیشتر حل نمیشود. اگر AI بخشی از آموزش میشود، باید حضور آدمها، گفتوگو، mentorship و کار گروهی هم جدیتر طراحی شود.
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤6👍4👏2
گزارش ۲۰۲۴ Pangram میگوید مسئله را با rule دستی حل نکردهاند. یعنی مدل فقط دنبال چند کلمه پرتکرار، طول جمله یا perplexity پایین نمیگردد. یک classifier بر پایه transformer آموزش دادهاند که از متن، احتمال Human یا AI بودن را یاد میگیرد.
اگر مدل فقط یاد بگیرد متنهای علمی یا متنهای رسمی بیشتر AI هستند، در عمل موضوع را تشخیص داده نه نویسندگی را. برای همین Pangram از چیزی استفاده میکند که اسمش را synthetic mirror گذاشتهاند.
ایده ساده است: یک متن انسانی را برمیدارند و از AI میخواهند متنی با همان موضوع، همان genre، همان style و تقریبا همان طول بسازد. بعد مدل مجبور میشود تفاوت فرایند نوشتن انسان و مدل زبانی را یاد بگیرد، نه تفاوت موضوعها را.
مدل اولیه را روی حجم بزرگی از متنهای انسانی اجرا میکنند. متنهایی که مدل اشتباهی AI تشخیص داده، همان موارد سختاند. بعد برای همین متنها mirror جدید میسازند، دوباره وارد training میکنند و مدل را از نو train میکنند.
مشکل اصلی اینجاست که dataset ثابت کافی نیست. Pangram عملا از خطاهای خودش dataset جدید میسازد. هر بار میبیند کجا انسان را اشتباه گرفته، همان نقطه را تبدیل به تمرین بعدی میکند.
در گزارش اولیه، خودشان میگویند false positive در بعضی domainها اول بالای ۱ درصد بوده و با این روش حدود ۱۰۰ برابر کم شده. این عدد از evaluation خود Pangram است، ولی نکته فنی مهمتر خود روش است: detector خوب قرار نیست فقط فهرست کلمات مشکوک باشد.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👏3👍1
پژوهش DAMAGE در GenAIDetect 2025 دقیقا سراغ همین سوال رفت. اگر متن ChatGPT را به ابزارهای humanizer یا paraphraser بدهیم، آیا detectorها از کار میافتند؟
آنها ۱۹ ابزار humanizer و paraphrasing را بررسی کردند. نتیجه کلی این بود که خیلی از detectorهای معمولی بعد از rewrite شدن متن افت میکنند، چون متن دیگر شبیه خروجی مستقیم مدل نیست.
ایدهشان این بود که humanizer را به عنوان یک transform ببینند، نه یک جادوگر پاککننده. یعنی متن AI وقتی humanize میشود، هنوز باید AI label بماند. متن انسانی هم اگر paraphrase شد، نباید ناگهان AI حساب شود.
نکته ظریف همینجاست: اگر فقط متنهای AI شده با humanizer را وارد training کنیم، مدل ممکن است صرفا ردپای خود humanizer را یاد بگیرد. برای همین در مقاله توضیح میدهند که هم human و هم AI را humanize کردهاند تا مدل فرق «paraphrase شدن» و «AI بودن» را قاطی نکند.
مشکل اصلی این است که humanizerها همیشه امضا را پاک نمیکنند. گاهی فقط یک امضای تازه میسازند: متن دیگر AI خام نیست، اما کاملا شبیه انسان هم نشده. حتی در پژوهش interpretability خود Pangram، humanized AI در فضای مدل اغلب کنار Human نمینشیند و منطقه جدا پیدا میکند.
در مقاله جداگانه GenAI Detection Task 3، تیم Pangram همین چرخه را برای شکستهای سختتر توضیح میدهد: مدل را روی benchmark اجرا میکنند، سختترین AIهایی را که اشتباه شده پیدا میکنند، همانها را با نمونه انسانی متناظر برمیگردانند داخل training و دوباره train میکنند.
جمعبندی ساده است: paraphrasing لزوما اثر تولید AI را پاک نمیکند. اما این ادعا را باید با احتیاط خواند، چون عددهای قوی DAMAGE عمدتا از evaluation خود Pangram میآیند، نه یک ممیزی کاملا مستقل.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2👏2👌1
مقاله EditLens در ICLR 2026 یک سوال مهمتر از «Human یا AI؟» میپرسد: اگر انسان پیشنویس را نوشته باشد، بعد Claude یا Grammarly grammar، tone، clarity یا fluency را تغییر داده باشند، این متن دقیقا کجای طیف قرار میگیرد؟
طبقهبندی قدیمی معمولا دوگانه بود: Human یا AI. اما دنیای واقعی تمیز نیست. یک نفر متن را خودش مینویسد، بعد مدل چند جمله را بازنویسی میکند، بعد انسان دوباره ویرایش میکند. این متن نه کاملا انسانی است، نه کاملا تولید مستقیم AI.
سوال را عوض میکند. به جای اینکه فقط بپرسد متن AI هست یا نه، میپرسد میزان دخالت AI چقدر بوده.
برای ساخت dataset، متن انسانی اصلی را نگه داشتهاند، بعد با مدلهایی مثل GPT، Claude و Gemini انواع edit با شدتهای مختلف ساختهاند: grammar، fluency، paraphrasing، tone، clarity و چند کار دیگر. چون original را دارند، میتوانند edited text را با آن مقایسه کنند و با metricهای similarity یا distance شدت تغییر را تخمین بزنند.
مشکل اصلی اینجاست که در زمان استفاده واقعی، original دست ما نیست. EditLens بعد از training فقط final text را میگیرد و از روی همان، extent of AI editing را تخمین میزند.
مدل روی binary classification به F1 برابر ۹۴.۷ درصد رسید و روی ternary classification به F1 برابر ۹۰.۴ درصد. case study مربوط به Grammarly هم نشان داد همه editها یکسان نیستند: اصلاح اشتباهها سبکتر است، اما summarization یا detailed rewrite دخالت عمیقتری حساب میشود.
نمره مدل درصد واقعی کلماتی نیست که AI نوشته. یک estimate یادگرفتهشده از میزان intervention است. همین ایده بعدا پایه Pangram 3 شد و Pangram بخشی از مدلها، dataset و code مربوط به Open Pangram را هم برای پژوهشگرها منتشر کرد.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3👏1👌1
پروژه Seeing in Pangram Space میخواهد نشان بدهد مدل فقط دنبال چند نشانه سطحی نیست. تصور رایج این است که AI detectorها به علامت خط کشیده انگلیسی، چند transition word، طول جمله یا perplexity نگاه میکنند. Pangram میگوید classifier اصلی مستقیما از این handcrafted featureها ساخته نشده.
به جای خروجی نهایی مدل، activationهای لایههای مختلف را استخراج کردند. هر document در مدل تبدیل به یک vector با ۵۱۲۰ بعد میشود. بعد با PCA، UMAP و t-SNE این vectorها را دو بعدی کردهاند تا ببینند متنها در فضای داخلی مدل کجا میافتند.
نتیجه شهودی جالب است: هرچه لایهها جلوتر میروند، Human و AI بیشتر از هم جدا میشوند. بعد که همان embeddingها را با رنگ مدل سازنده نگاه میکنند، متنهای GPT، Claude، Gemini، Llama، Qwen و چند خانواده دیگر هم clusterهای قابل دیدن میسازند.
مدل اصلا برای تشخیص provider آموزش داده نشده بود. اما یک linear probe ساده روی representationهای Pangram توانست در آزمایششان خانواده سازنده متن را با حداکثر ۹۱ درصد top-1 accuracy تشخیص بدهد.
مشکل اصلی تفسیر این است که cluster دیدن با اثبات علت فرق دارد. اینکه متنهای یک مدل کنار هم میافتند، به ما نمیگوید دقیقا کدام ویژگی باعث AI بودن شده. این کار بیشتر نقشه اولیه است، نه توضیح کامل.
یک detector احتمالا statistical fingerprint چندبعدی از فرایند تولید متن یاد میگیرد. نه یک blacklist از کلمات. برای همین humanized AI هم الزاما داخل cluster Human نمیرود و ممکن است فضای جداگانه خودش را بسازد.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👌4👍1
نسخه Pangram 4 در ژوئیه ۲۰۲۶ معرفی شد و از نظر خود Pangram جهش اصلی سیستم است: حدود ۶ برابر بزرگتر از Pangram 3.3، با backbone از نوع sparse Mixture-of-Experts و چند خروجی جدا برای حالتهای مختلف نویسندگی.
مدل فقط نمیگوید Human یا AI. طبق model card، خروجیها شامل score چندسطحی برای AI involvement، برچسب token-level برای Human، AI-Assisted و AI-Generated، تشخیص mixed authorship و تشخیص Humanized-AI است.
متنهای بلند هم در پنجرههای overlapping 512-token پردازش میشوند. بعد predictionها aggregate و smooth میشوند تا مرز بخش انسانی و AI در متن کمتر حالت پرشدار داشته باشد.
در benchmark داخلی Pangram، false positive rate برابر ۰.۰۰۴۱ درصد گزارش شده، یعنی حدود یک false positive در هر ۲۴ هزار document. false negative rate روی مجموعه AI آنها ۰.۳۳۹۶ درصد است. روی ۱۳ ابزار commercial humanizer هم میگویند AI involvement را در ۹۸.۸۳ درصد موارد تشخیص دادهاند.
مشکل اصلی اعتماد اینجاست: بیشتر این عددها از benchmarkهای خود Pangram میآیند. عددها مهماند، ولی مستقل محسوب نمیشوند و non-zero false positive همچنان وجود دارد.
خود model card میگوید Pangram 4 برای natural-language prose با حداقل ۵۰ کلمه طراحی شده. code، reference section، table، technical manual، متنهای خیلی mathematical و فایلهایی که از PDF بد parse شدهاند خارج از scope اصلیاند یا خطاپذیرترند. برای همین raw text یا docx را بهتر از PDF میداند.
در یک مقاله ACL 2026، پژوهشگرها با Pangram بیش از ۱۸۶ هزار مقاله خبری از حدود ۱۵۰۰ روزنامه آمریکایی را بررسی کردند و حدود ۹ درصد مقالههای جدید نمونه را partially یا fully AI-generated تخمین زدند. ۴۵ هزار opinion piece هم جدا بررسی شد.
جمعبندی من: AI detector میتواند signal بدهد، اما provenance و اثبات تقلب نیست. score باید شروع بررسی باشد، نه حکم نهایی.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2👏1👌1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍4🔥2👏1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👏2👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍2😍2🔥1