این فناوری بدون افزودن نماد یا کاراکتر پنهان، با تغییر نحوه انتخاب کلمات، یک الگوی آماری قابل تشخیص در متن ایجاد میکند.
آنتروپیک میگوید این روش میتواند به شناسایی محتوای تولیدشده توسط کلود کمک کند، اما هویت نویسنده یا کاربر را فاش نمیکند.
این فناوری که با عنوان «اثر انگشت» متون شناخته میشود، برخلاف برخی روشهای مرسوم، به درج نمادها، کاراکترها یا توکنهای پنهان در متن متکی نیست. در عوض، آنتروپیک نحوه انتخاب کلمات توسط مدل را هنگام تولید متن به شکلی کنترلشده تغییر میدهد تا یک الگوی آماری نامحسوس در خروجی ایجاد شود؛ الگویی که بعدها میتوان آن را با ابزارهای تخصصی شناسایی کرد.
آنتروپیک میگوید این روش توکن اضافی به متن اضافه نمیکند و انتظار نمیرود تأثیر قابلتوجهی بر کیفیت، سرعت تولید یا هزینه پردازش متن داشته باشد.
الگویی آماری که ردپای کلود را آشکار میکند
مبنای این فناوری، موقعیتهایی است که کلود هنگام تولید متن با چندین گزینه زبانی مناسب روبهرو میشود. در چنین شرایطی، سیستم با استفاده از یک کلید ویژه و با در نظر گرفتن کلمات پیشین، انتخاب برخی گزینهها را بهصورت هدفمند هدایت میکند.
تکرار این فرایند در سراسر یک متن طولانی باعث شکلگیری الگویی آماری میشود. یک ابزار تشخیص تخصصی میتواند با بررسی این الگو، احتمال نقش داشتن کلود در تولید متن را تخمین بزند.
آنتروپیک اعلام کرده است که فناوری مورد استفاده، بر نسخهای از روش «SynthID-Text» مبتنی است؛ روشی که توسط گوگل دیپمایند (Google DeepMind) توسعه یافته است. آزمایشهای این شرکت نیز نشان دادهاند که این فرایند تأثیر قابلتوجهی بر کیفیت، خلاقیت یا خوانایی متون ایجاد نمیکند.
هرچه متن طولانیتر باشد، تشخیص دقیقتر است
عملکرد این روش به ماهیت و طول متن وابسته است. هرچه متن طولانیتر باشد و مدل گزینههای زبانی بیشتری برای بیان یک مفهوم در اختیار داشته باشد، احتمال شناسایی اثر انگشت نیز افزایش پیدا میکند.
در مقابل، این فناوری برای متنهای کوتاه یا محتواهایی که انتخاب دقیق کلمات در آنها اهمیت زیادی دارد، محدودیت بیشتری خواهد داشت. برای نمونه، قطعات بزرگ کد که در آنها گزینههای زبانی چندان متنوع نیست، ممکن است هدف مناسبی برای این روش نباشند.
این محدودیت درباره متنهایی که در اصل توسط انسان نوشته شدهاند و سپس تنها تغییرات جزئی توسط کلود روی آنها اعمال شده نیز میتواند وجود داشته باشد.
از سوی دیگر، بازنویسی گسترده یک متن ممکن است اثر انگشت آماری ایجادشده را تضعیف یا حتی از بین ببرد. با این حال، ترجمه متن توسط کلود میتواند امضای آماری قابلتشخیصتری ایجاد کند؛ زیرا در این حالت، مدل کنترل بیشتری بر انتخاب واژههای متن نهایی دارد.
اثر انگشت کلود، هویت نویسنده را مشخص نمیکند
آنتروپیک تأکید کرده است که این فناوری برای اثبات هویت نویسنده طراحی نشده است. شناسایی اثر انگشت صرفاً میتواند احتمال دخالت کلود در تولید یا ویرایش یک متن را نشان دهد و نمیتواند مشخص کند چه فردی آن را نوشته است.
این شرکت همچنین اعلام کرده است که فناوری مذکور اطلاعاتی درباره هویت کاربر، سازمان استفادهکننده یا مکالمهای که متن در آن تولید شده، افشا نمیکند.
عرضه ابزار تشخیص در راه است
آنتروپیک در حال توسعه یک رابط نرمافزاری برای تشخیص این اثر انگشت است و اعلام کرده که این فناوری را در چارچوب آمادهسازی برای رعایت الزامات شفافیت اتحادیه اروپا توسعه میدهد.
این شرکت قصد دارد ابزار مذکور را پس از راهاندازی، در سطح جهانی عرضه کند و بهتدریج پشتیبانی از آن را به مدلهای قدیمیتر کلود نیز گسترش دهد.
در همین حال، تصاویر و فایلهای تولیدشده توسط مدلهای آنتروپیک از سازوکار جداگانهای استفاده خواهند کرد. این محتوا قرار است بر اساس استاندارد C2PA و اعتبارنامههای محتوا مدیریت شود.
در مجموع، رویکرد جدید آنتروپیک نشان میدهد که شرکتهای توسعهدهنده مدلهای هوش مصنوعی بهتدریج از روشهای قابل مشاهده برای شناسایی محتوای تولیدشده توسط هوش مصنوعی فاصله گرفته و به سمت فناوریهایی حرکت میکنند که بدون تغییر محسوس در ظاهر محتوا، امکان ردیابی آماری منشأ آن را فراهم میکنند.
