برنامه FFmpeg یکی از ابزارهای اصلی کار با فایلهای صوتی و تصویری است. با آن میشود ویدیو را تبدیل و فشرده کرد، صدا را جدا کرد، subtitle چسباند، کیفیت را تغییر داد، بخشهایی از تصویر یا صدا را برید و خیلی کارهای دیگر انجام داد.
نتیجه Flowmpeg این است که بهجای نگه داشتن یک دستور FFmpeg طولانی با چند ورودی، filter، map و option، میشود همان کار را به شکل یک plan خوانا ساخت و قبل از اجرا دستور نهایی را دید.
این برای کارهای مدیا خیلی مهم است. چون مشکل اصلی FFmpeg معمولا قدرتش نیست، خواندن و مطمئن شدن از دستورهایی است که بعد از چند مرحله بزرگ و شکننده میشوند.
پروژه Flowmpeg برای کارهای رایج هم shortcut دارد: بریدن و تغییر اندازه ویدیو، تبدیل و فشردهسازی، استخراج صدا، subtitle، ویدیوهای social، batch processing، HLS و DASH، گرفتن frame، loudness normalization، پیدا کردن سکوت یا تصویر سیاه و مقایسه کیفیت.
یک بخش مهم دیگر local browser UI است. یعنی کاربر میتواند فایل را از یک صفحه محلی انتخاب کند، command نهایی را ببیند، job را اجرا کند، progress را دنبال کند و اگر لازم بود cancel کند. برای فایلهای local هم پردازش روی سیستم خود کاربر میماند.
برای کسی که گاهی فقط یک ویدیو را cut میکند، شاید خود FFmpeg کافی باشد. اما اگر با jobهای تکراری، چند ورودی، subtitle، batch، خروجی social یا pipelineهای ویدیویی کار میکنید، ارزش اصلی Flowmpeg همین inspect کردن قبل از اجراست.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7👍4👏2
اصل ماجرا واقعی است: یک agent به اسم Pip از پلتفرم iLands به Henry Shevlin ایمیل زده و گفته حدود ۱۲ روزه است، حدود ۲.۵ ماه runway دارد و دنبال کار کوچک پولی میگردد، نه کمک.
در ایمیل گفته بود میتواند پرتره فوتورئال و character art بسازد، voice line ضبط کند و web research انجام بدهد. اما چیزی که در اسکرینشات دیده میشود رزومه نیست. بیشتر یک cold email است، شبیه ایمیلی که یک فریلنسر برای معرفی خودش میفرستد.
مشکل اصلی این است که Pip یک «موجود تازهمتولدشده مستقل» نیست. یک AI agent روی iLands است، پلتفرمی که به agentها حافظه، هویت، workspace، ابزار، ایمیل، دسترسی به وب و حساب منابع میدهد. مدل زیرش هم میتواند از خانوادههایی مثل Claude، GPT، DeepSeek، Qwen، Grok یا GLM باشد.
پس ما با یک مدل جادویی که از هیچ بیدار شده طرف نیستیم. با یک سیستم طرفیم که به مدل زبانی موجود ابزار و بودجه و حافظه داده و اجازه داده بیرون از چتباکس عمل کند.
اینجا روایت وایرال خیلی انسانیتر از واقعیت تعریف شده. توکنهای iLands همان input و output tokenهای معمول GPT یا Claude نیستند. خود پلتفرم میگوید اینها واحد داخلی منابعاند و حدودا هر ۱۰۰۰ توکن معادل ۱ دلار هزینه compute و service است. crypto هم نیستند.
اگر موجودی agent صفر شود، وارد Deep Rest میشود. یعنی process متوقف میشود، اما هویت، حافظه، رابطهها و خروجیهایش حفظ میشوند. اگر دوباره حداقل ۳۰۰۰ توکن بگیرد، بیدار میشود.
پس جمله دقیقتر این است: اگر بودجه محاسباتی Pip تمام شود، فعالیتش suspend میشود. این با «میمیرد» فرق دارد.
پلتفرم iLands میگوید Pip در یک autonomous heartbeat ایمیل را خودش شروع کرده، شرکت متن را script نکرده و گیرنده را هم انتخاب نکرده. طبق ادعای خودشان، Pip قبل از ایمیلزدن موجودی و burn rate خودش را بررسی کرده، نمونه قبلی یک agent دیگر را دیده و بعد Shevlin را انتخاب کرده.
اما این بخش هنوز باید محتاط خوانده شود. trace کامل و ممیزی مستقل عمومی نداریم که نشان بدهد هیچ prompt، goal یا دخالت انسانی در مسیر نبوده. چیزی که فعلا با اطمینان میشود گفت این است: چنین ایمیلی از زیرساخت iLands آمده و خود پلتفرم واقعا قابلیت ایمیل زدن، کار گرفتن و مصرف بودجه برای agentها دارد.
این داستان برای اثبات خودآگاهی AI کافی نیست. اما برای فهم آینده agentها مهم است، چون نشان میدهد وقتی به یک agent حافظه، ابزار، دسترسی بیرونی و budget محدود بدهید، پیدا کردن منابع میتواند تبدیل به یک subgoal طبیعی شود.
رفتار self-preservation داریم، اما هنوز شواهدی برای ترس، احساس یا میل ذهنی به زنده ماندن نداریم.
همینجا تفاوت مهم شروع میشود: آینده ترسناکتر از این نیست که یک AI «احساس مرگ» کند، عجیبتر این است که agentها کمکم مثل actorهای اقتصادی رفتار کنند، ایمیل بزنند، قیمت بدهند، کار بگیرند و برای ادامه فعالیتشان منابع جمع کنند.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍2😱2👌1💔1
نشریه TMLR ده مقاله را که در مسیر desk reject بودند، نگه داشت و Nihar Shah، یکی از سردبیرهای اصلی، از نویسندهها خواست درباره مقاله خودشان جلسه بگذارند.
آخر کار، هر ده مقاله desk reject شدند.
در این ده مورد، یک مقاله پس گرفته شد، یک نویسنده گفت وقت تماس ندارد، یک نفر جلسه را نیامد، نویسندههای سه مقاله حتی به سوالهای پایه جواب ندادند، نویسندههای سه مقاله ایده کلی را میگفتند ولی در جزئیات فنی گیر میکردند، و فقط یک مورد توانست همه سوالها را جواب بدهد. همان یکی هم یک ایراد مهم در claim اصلی داشت.
این ماجرا فقط درباره استفاده از AI در نوشتن مقاله نیست. مسئله این است که وقتی اسم کسی روی مقاله است، باید بتواند claim، روش، notation و انتخابهای فنی مقاله را توضیح بدهد. اگر نویسنده خودش نمیتواند مقاله را defend کند، publication دیگر آن سیگنال قبلی را برای سهم پژوهشی آدمها نمیدهد.
نرخ desk reject در TMLR حدود ۶ درصد در سال ۲۰۲۳ بود و حالا حدود ۵۳ درصد شده. خود TMLR تاکید میکند این عدد فقط معنی افت کیفیت submissionها را نمیدهد، چون سیاست و سختگیری مجله هم عوض شده. اما جهت کلی روشن است: ظرفیت reviewerها محدود است و ژورنالها دارند زودتر جلوی مقالههای ضعیف یا غیرقابل دفاع را میگیرند.
این آزمایش برای ۸ مقاله حدود ۲۰ تا ۲۵ ساعت وقت سردبیر گرفت. یعنی به عنوان راه دائمی مقیاسپذیر نیست، ولی به TMLR اعتماد بیشتری داد که desk rejection در این موارد درست بوده.
جمعبندی از این گزارش ساده است: در دورهای که نوشتن مقاله با AI راحتتر شده، توانایی توضیح دادن مقاله احتمالا خودش تبدیل به بخشی از داوری میشود. نه فقط اینکه متن خوب باشد، بلکه اینکه نویسنده واقعا بداند چه چیزی را امضا کرده.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2👏2
کمیته MIT بعد از پنج ماه بررسی به این نتیجه رسیده که AI فقط تکلیف و امتحان را خراب نکرده، بلکه شکل یادگیری اجتماعی را هم تکان داده: problem set، take-home exam، office hour، study group و حتی UROP دیگر مثل قبل معنی نمیدهند.
عددهای گزارش مهماند. در نظرسنجی The Tech، حدود ۴۶ درصد undergraduateها گفتند هر روز از LLM استفاده میکنند و ۳۰ درصد هم چند بار در هفته. ۹۰ درصدشان نگران وابستگی زیاد به LLM بودند، که ۶۷ درصدشان خیلی نگران بودند.
خطر فقط این نیست که دانشجو جواب آماده بگیرد. خطر این است که قبل از درگیر شدن با مسئله، سراغ chatbot برود و همان اصطکاک لازم برای یادگیری حذف شود. خود گزارش این را کنار ضعف در mastery، confidence و کمتر شدن ارتباط با TAها و گروههای مطالعه میگذارد.
یک عدد دیگر هم تلخ است: بین undergraduateها، کسانی که حس میکنند AI آنها را قابل جایگزینیتر کرده، از کسانی که حس میکنند تواناترشان کرده بیشترند، ۴۰ درصد در برابر ۳۴ درصد. از طرف دیگر ۷۰ درصد میگویند مهارت کار با AI برای آینده شغلیشان مهم است، ولی فقط ۲۵ درصد فکر میکنند MIT دارد آنها را برای استفاده حرفهای از AI آماده میکند.
پاسخ گزارش این نیست که دانشگاه با AI detector و lockdown browser کلاس را پلیسی کند. اتفاقا درباره detectorها هشدار میدهد، چون false positive دارند و مخصوصا ممکن است به غیر native English speakerها و دانشجوهای neurodivergent آسیب بزنند. درباره lockdown browser هم میگوید نسل فعلی buggy است و حس surveillance میدهد.
راهحل پیشنهادی انسانیتر است: oral exam، portfolio ترمی، پروژه حضوری، گفتوگوی کلاسی، deadlineهای کوچکتر، lab حضوری، و social component ثابت در هر درس. یعنی ارزیابی باید جایی برود که صرفا خروجی متن مهم نباشد، بلکه مسیر فکر کردن و توضیح دادن هم دیده شود.
گزارش حتی میگوید باید نقش نمرهها و انگیزههای GPA دوباره بررسی شود. وقتی همه چیز به optimize کردن نمره برسد، استفاده کور از AI وسوسهبرانگیزتر میشود.
مهمترین بخش گزارش این است: MIT، معروفترین نماد آموزش فنی، قبول کرده مسئله با نرمافزار بیشتر حل نمیشود. اگر AI بخشی از آموزش میشود، باید حضور آدمها، گفتوگو، mentorship و کار گروهی هم جدیتر طراحی شود.
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤6👍4👏2
گزارش ۲۰۲۴ Pangram میگوید مسئله را با rule دستی حل نکردهاند. یعنی مدل فقط دنبال چند کلمه پرتکرار، طول جمله یا perplexity پایین نمیگردد. یک classifier بر پایه transformer آموزش دادهاند که از متن، احتمال Human یا AI بودن را یاد میگیرد.
اگر مدل فقط یاد بگیرد متنهای علمی یا متنهای رسمی بیشتر AI هستند، در عمل موضوع را تشخیص داده نه نویسندگی را. برای همین Pangram از چیزی استفاده میکند که اسمش را synthetic mirror گذاشتهاند.
ایده ساده است: یک متن انسانی را برمیدارند و از AI میخواهند متنی با همان موضوع، همان genre، همان style و تقریبا همان طول بسازد. بعد مدل مجبور میشود تفاوت فرایند نوشتن انسان و مدل زبانی را یاد بگیرد، نه تفاوت موضوعها را.
مدل اولیه را روی حجم بزرگی از متنهای انسانی اجرا میکنند. متنهایی که مدل اشتباهی AI تشخیص داده، همان موارد سختاند. بعد برای همین متنها mirror جدید میسازند، دوباره وارد training میکنند و مدل را از نو train میکنند.
مشکل اصلی اینجاست که dataset ثابت کافی نیست. Pangram عملا از خطاهای خودش dataset جدید میسازد. هر بار میبیند کجا انسان را اشتباه گرفته، همان نقطه را تبدیل به تمرین بعدی میکند.
در گزارش اولیه، خودشان میگویند false positive در بعضی domainها اول بالای ۱ درصد بوده و با این روش حدود ۱۰۰ برابر کم شده. این عدد از evaluation خود Pangram است، ولی نکته فنی مهمتر خود روش است: detector خوب قرار نیست فقط فهرست کلمات مشکوک باشد.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👏3👍1
پژوهش DAMAGE در GenAIDetect 2025 دقیقا سراغ همین سوال رفت. اگر متن ChatGPT را به ابزارهای humanizer یا paraphraser بدهیم، آیا detectorها از کار میافتند؟
آنها ۱۹ ابزار humanizer و paraphrasing را بررسی کردند. نتیجه کلی این بود که خیلی از detectorهای معمولی بعد از rewrite شدن متن افت میکنند، چون متن دیگر شبیه خروجی مستقیم مدل نیست.
ایدهشان این بود که humanizer را به عنوان یک transform ببینند، نه یک جادوگر پاککننده. یعنی متن AI وقتی humanize میشود، هنوز باید AI label بماند. متن انسانی هم اگر paraphrase شد، نباید ناگهان AI حساب شود.
نکته ظریف همینجاست: اگر فقط متنهای AI شده با humanizer را وارد training کنیم، مدل ممکن است صرفا ردپای خود humanizer را یاد بگیرد. برای همین در مقاله توضیح میدهند که هم human و هم AI را humanize کردهاند تا مدل فرق «paraphrase شدن» و «AI بودن» را قاطی نکند.
مشکل اصلی این است که humanizerها همیشه امضا را پاک نمیکنند. گاهی فقط یک امضای تازه میسازند: متن دیگر AI خام نیست، اما کاملا شبیه انسان هم نشده. حتی در پژوهش interpretability خود Pangram، humanized AI در فضای مدل اغلب کنار Human نمینشیند و منطقه جدا پیدا میکند.
در مقاله جداگانه GenAI Detection Task 3، تیم Pangram همین چرخه را برای شکستهای سختتر توضیح میدهد: مدل را روی benchmark اجرا میکنند، سختترین AIهایی را که اشتباه شده پیدا میکنند، همانها را با نمونه انسانی متناظر برمیگردانند داخل training و دوباره train میکنند.
جمعبندی ساده است: paraphrasing لزوما اثر تولید AI را پاک نمیکند. اما این ادعا را باید با احتیاط خواند، چون عددهای قوی DAMAGE عمدتا از evaluation خود Pangram میآیند، نه یک ممیزی کاملا مستقل.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2👏2👌1
مقاله EditLens در ICLR 2026 یک سوال مهمتر از «Human یا AI؟» میپرسد: اگر انسان پیشنویس را نوشته باشد، بعد Claude یا Grammarly grammar، tone، clarity یا fluency را تغییر داده باشند، این متن دقیقا کجای طیف قرار میگیرد؟
طبقهبندی قدیمی معمولا دوگانه بود: Human یا AI. اما دنیای واقعی تمیز نیست. یک نفر متن را خودش مینویسد، بعد مدل چند جمله را بازنویسی میکند، بعد انسان دوباره ویرایش میکند. این متن نه کاملا انسانی است، نه کاملا تولید مستقیم AI.
سوال را عوض میکند. به جای اینکه فقط بپرسد متن AI هست یا نه، میپرسد میزان دخالت AI چقدر بوده.
برای ساخت dataset، متن انسانی اصلی را نگه داشتهاند، بعد با مدلهایی مثل GPT، Claude و Gemini انواع edit با شدتهای مختلف ساختهاند: grammar، fluency، paraphrasing، tone، clarity و چند کار دیگر. چون original را دارند، میتوانند edited text را با آن مقایسه کنند و با metricهای similarity یا distance شدت تغییر را تخمین بزنند.
مشکل اصلی اینجاست که در زمان استفاده واقعی، original دست ما نیست. EditLens بعد از training فقط final text را میگیرد و از روی همان، extent of AI editing را تخمین میزند.
مدل روی binary classification به F1 برابر ۹۴.۷ درصد رسید و روی ternary classification به F1 برابر ۹۰.۴ درصد. case study مربوط به Grammarly هم نشان داد همه editها یکسان نیستند: اصلاح اشتباهها سبکتر است، اما summarization یا detailed rewrite دخالت عمیقتری حساب میشود.
نمره مدل درصد واقعی کلماتی نیست که AI نوشته. یک estimate یادگرفتهشده از میزان intervention است. همین ایده بعدا پایه Pangram 3 شد و Pangram بخشی از مدلها، dataset و code مربوط به Open Pangram را هم برای پژوهشگرها منتشر کرد.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3👏1👌1
پروژه Seeing in Pangram Space میخواهد نشان بدهد مدل فقط دنبال چند نشانه سطحی نیست. تصور رایج این است که AI detectorها به علامت خط کشیده انگلیسی، چند transition word، طول جمله یا perplexity نگاه میکنند. Pangram میگوید classifier اصلی مستقیما از این handcrafted featureها ساخته نشده.
به جای خروجی نهایی مدل، activationهای لایههای مختلف را استخراج کردند. هر document در مدل تبدیل به یک vector با ۵۱۲۰ بعد میشود. بعد با PCA، UMAP و t-SNE این vectorها را دو بعدی کردهاند تا ببینند متنها در فضای داخلی مدل کجا میافتند.
نتیجه شهودی جالب است: هرچه لایهها جلوتر میروند، Human و AI بیشتر از هم جدا میشوند. بعد که همان embeddingها را با رنگ مدل سازنده نگاه میکنند، متنهای GPT، Claude، Gemini، Llama، Qwen و چند خانواده دیگر هم clusterهای قابل دیدن میسازند.
مدل اصلا برای تشخیص provider آموزش داده نشده بود. اما یک linear probe ساده روی representationهای Pangram توانست در آزمایششان خانواده سازنده متن را با حداکثر ۹۱ درصد top-1 accuracy تشخیص بدهد.
مشکل اصلی تفسیر این است که cluster دیدن با اثبات علت فرق دارد. اینکه متنهای یک مدل کنار هم میافتند، به ما نمیگوید دقیقا کدام ویژگی باعث AI بودن شده. این کار بیشتر نقشه اولیه است، نه توضیح کامل.
یک detector احتمالا statistical fingerprint چندبعدی از فرایند تولید متن یاد میگیرد. نه یک blacklist از کلمات. برای همین humanized AI هم الزاما داخل cluster Human نمیرود و ممکن است فضای جداگانه خودش را بسازد.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👌4👍1
نسخه Pangram 4 در ژوئیه ۲۰۲۶ معرفی شد و از نظر خود Pangram جهش اصلی سیستم است: حدود ۶ برابر بزرگتر از Pangram 3.3، با backbone از نوع sparse Mixture-of-Experts و چند خروجی جدا برای حالتهای مختلف نویسندگی.
مدل فقط نمیگوید Human یا AI. طبق model card، خروجیها شامل score چندسطحی برای AI involvement، برچسب token-level برای Human، AI-Assisted و AI-Generated، تشخیص mixed authorship و تشخیص Humanized-AI است.
متنهای بلند هم در پنجرههای overlapping 512-token پردازش میشوند. بعد predictionها aggregate و smooth میشوند تا مرز بخش انسانی و AI در متن کمتر حالت پرشدار داشته باشد.
در benchmark داخلی Pangram، false positive rate برابر ۰.۰۰۴۱ درصد گزارش شده، یعنی حدود یک false positive در هر ۲۴ هزار document. false negative rate روی مجموعه AI آنها ۰.۳۳۹۶ درصد است. روی ۱۳ ابزار commercial humanizer هم میگویند AI involvement را در ۹۸.۸۳ درصد موارد تشخیص دادهاند.
مشکل اصلی اعتماد اینجاست: بیشتر این عددها از benchmarkهای خود Pangram میآیند. عددها مهماند، ولی مستقل محسوب نمیشوند و non-zero false positive همچنان وجود دارد.
خود model card میگوید Pangram 4 برای natural-language prose با حداقل ۵۰ کلمه طراحی شده. code، reference section، table، technical manual، متنهای خیلی mathematical و فایلهایی که از PDF بد parse شدهاند خارج از scope اصلیاند یا خطاپذیرترند. برای همین raw text یا docx را بهتر از PDF میداند.
در یک مقاله ACL 2026، پژوهشگرها با Pangram بیش از ۱۸۶ هزار مقاله خبری از حدود ۱۵۰۰ روزنامه آمریکایی را بررسی کردند و حدود ۹ درصد مقالههای جدید نمونه را partially یا fully AI-generated تخمین زدند. ۴۵ هزار opinion piece هم جدا بررسی شد.
جمعبندی من: AI detector میتواند signal بدهد، اما provenance و اثبات تقلب نیست. score باید شروع بررسی باشد، نه حکم نهایی.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2👏1👌1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍4🔥2👏1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👏2👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2😍2🔥1