چرا سیری هرگز شبیه چتجیپیتی کار نکرد؟ راز عقبماندگی دستیار صوتی اپل از زبان پژوهشگر سابق آن
اگر تا حالا با فراموشکاریهای عجیب سیری در مکالمه کلافه شدهاید، مشکل از ناشنوایی آن نیست؛ بلکه سیری برای دورانی کاملاً متفاوت از دنیای هوش مصنوعی خلق شده بود. یکی از توسعهدهندگان سابق سیری فاش کرده که معماری قدیمی، ترس اپل از اشتباهات چتباتها و وسواس حفظ حریم خصوصی، چطور مانع تبدیل این دستیار صوتی به رقیبی برای ChatGPT شده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- دستیار قدیمی سیری بر پایه مسیرهای مکالمه از پیش تعیینشده کار میکرد و کوچکترین تغییر در مسیر یا تغییر نظر کاربر، سیستم را کاملاً به بنبست میکشاند.
- چتباتهای نسل جدید مثل ChatGPT و جمینای با پردازش تمام کانتکست و بستر مکالمه، دیگر دچار فراموشی ناگهانی ناشی از ساختار صلب سنتی نمیشوند.
- برگ برنده واقعی اپل دسترسی عمیق به دادههای سیستمعامل آیفون است، اما وسواس شدید این شرکت در حوزه حریم خصوصی، سرعت ارتقای هوشمند سیری را کند کرده است.
اگر تابهحال برایتان پیش آمده که از دستیار هوشمند سیری (Siri) یک سؤال ادامهدار بپرسید و ببینید طوری مکالمه قبلی را فراموش کرده که انگار اصلاً با او حرف نزده بودید، مشکل لزوماً این نبوده که صدای شما را نشنیده است.
واقعیت این است که این دستیار صوتی برای دورانی کاملاً متفاوت از تاریخ هوش مصنوعی ساخته شده بود.
این تحلیل حاصل صحبتهای نیکولا مرکشیچ (Nikola Mrkšić)، مدیرعامل و همبنیانگذار شرکت هوش مصنوعی مکالمهای PolyAI است؛ فردی که در گذشته مستقیماً روی فناوری پشتصحنه سیری کار کرده است. وقتی از او پرسیده شد چرا دستیار صوتی اپل در تمام این سالها برای رسیدن به یک مکالمه طبیعی، زنده و پیوسته—چیزی که این روزها در ChatGPT و جمینای کاملاً عادی و پیشپاافتاده به نظر میرسد—به دردسر افتاده، پای تفاوتی بنیادین در معماری این فناوریها را به میان کشید.
پاسخ او به یک تفاوت ساختاری در نحوه کارکرد این سیستمها برمیگردد.
مرکشیچ توضیح میدهد: «سیری قدیمی بر پایه قصدها و مسیرهای از پیش شمارهگذاریشده (Enumerated Intents) کار میکرد؛ یعنی مهندسان مجبور بودند تکتک مسیرهایی که یک گفتوگو ممکن است طی کند را از قبل نقشهبرداری و برنامهنویسی کنند. درست از لحظهای که از فیلمنامه از پیش تعیینشده منحرف میشدید، سیستم گیر میکرد و متوقف میشد.»
این اعتراف ساده، خیلی از رفتارهای عجیب سیری را که در طول ده سال گذشته با آن دستوپنجه نرم کردهایم، به قشنگترین شکل ممکن توضیح میدهد.
سیری قدیمی فقط از روی یک فیلمنامه متنی روخوانی میکرد

زمانی که پایههای اولیه سیری گذاشته شد، توسعهدهندگان نمیتوانستند بهسادگی کل تاریخچه یک مکالمه را به یک مدل زبانی بزرگ بدهند تا خودش بفهمد کاربر واقعاً چه میخواهد. در عوض، مهندسان نرمافزار مجبور بودند حدس بزنند مردم چه سؤالاتی ممکن است بپرسند و برای مدیریت هر درخواست، یک مسیر و فلوچارت مجزا طراحی کنند.
تنظیم آلارم ساعت یک مسیر بود؛ پخش موسیقی یک مسیر دیگر و ارسال پیامک هم مسیری کاملاً جداگانه. دردسر بزرگ درست از جایی شروع شد که انسانها مثل یک انسان واقعی رفتار کردند!
کافی بود وسط یک درخواست نظرتان عوض شود، به نکتهای که چند ثانیه قبل گفته بودید ارجاع دهید، یا سؤالتان را با لحن و کلماتی غیرمنتظره بپرسید؛ در یک چشمبههمزدن، تمام آن مسیر با دقت طراحیشده مثل یک خانه پوشالی فرو میریخت.
مرکشیچ میگوید: «در این موقعیتها به نظر میرسید دستیار هوشمند موضوع صحبت را فراموش کرده، اما در واقعیت ماجرا، سیستم فقط در یک بنبست الگوریتمی گیر افتاده بود.»
یکی از کابوسهای اصلی مهندسان در آن زمان، پدیدهای به نام ابهامزدایی (Disambiguation) بود. فرض کنید از سیری میخواستید با مخاطبی تماس بگیرد که نامش تلفظی شبیه به شخص دیگری در دفترچه تلفن داشت؛ تیم توسعه باید سیستمهای پیچیدهای میساخت تا بفهمد منظور دقیق شما کدام فرد است. برای مثال اگر نام فرزندی املای متفاوتی با تلفظ مرسوم جامعه داشته باشد، برای ارسال عکسهایش به خانواده و دوستان از طریق دستور صوتی، حتماً باید نام او را با همان فرم خاص در دفترچه تلفن ثبت میکردید تا سیستم دچار خطا نشود.
مرکشیچ این فرآیند پرپیچوخم را «ساختن هستیشناسی یک مکالمه» (Ontology of a Conversation) توصیف میکند؛ یعنی تلاش برای ترسیم تمام جهتهای احتمالی یک گفتوگو و حفظ ثبات دستورات روزمره در دل این ساختار صلب و خشک.
اما در دنیای مدلهای زبانی بزرگ امروزی (LLM) مانند ChatGPT یا Gemini، مهندسان دیگر نیازی به پیشبینی هزاران سناریوی احتمالی ندارند. این مدلها کل جریان مکالمه را بهعنوان بستر (Context) در نظر میگیرند و بلافاصله تصمیم میگیرند بهترین پاسخ بعدی چه چیزی خواهد بود.
به همین خاطر است که صحبت کردن با حالت صوتی جمینای لایو (Gemini Live) یا صدای تعاملی چتجیپیتی حسی از ریشه متفاوت نسبت به سیری قدیمی دارد.
چرا اپل نتوانست سیری را خیلی ساده به یک چتجیپیتی تبدیل کند؟

در این نقطه یک پرسش کاملاً منطقی پیش میآید: آیا اپل نمیتوانست همان سیری فعلیاش را با یک بهروزرسانی بزرگ به چیزی شبیه چتجیپیتی تبدیل کند؟ پاسخ مرکشیچ منفی است.
او با صراحت میگوید: «حداقل تبدیل آن به پدیدهای در ابعاد ChatGPT غیرممکن بود.»
بخشی از این بنبست به محدودیتهای فناوری بازمیگشت. قبل از ظهور نسل مدرن مدلهای زبانی، اساساً امکان برقراری مکالمات سیال و کاملاً باز و طبیعی با ماشینها وجود نداشت.
اما مرکشیچ معتقد است یک مانع بسیار بزرگتر هم در کار بود: ترس از ریسک.
او تأکید میکند: «سیری هیچوقت با این هدف متولد نشد که یک دستیار همه چیزدان شبیه ChatGPT باشد. مدیران ارشد اپل همیشه محافظهکارانه رفتار کردهاند و آستانه تحمل ریسک پایینی دارند؛ بنابراین هر پاسخی از سیری که حتی احتمال داشت نادرست، توهینآمیز یا سوءتعبیرپذیر برداشت شود، از دید اپل یک خطر حیثیتی و جدی تلقی میشد.»
بنابراین امنترین استراتژی ممکن برای اپل این بود که دست و پای سیری را ببندد و وظایفش را در چهارچوبهایی فوقالعاده سفتوسخت محدود نگه دارد.
وقتی از سیری بخواهید زنگ ساعت را تنظیم کند، ترانهای پخش کند یا قراری به تقویم اضافه کند، اپل تقریباً با اطمینان صددرصدی میداند نتیجه چه خواهد بود. اما اگر به هوش مصنوعی آزادی عمل زیادی برای حدس زدن منظور کاربر بدهید، کنترل رفتار خروجی آن به طرز وحشتناکی سخت خواهد شد.
جالب اینجاست که با وجود پیشرفت چشمگیر مدلهای هوش مصنوعی، این چالش و تنش محافظهکارانه در اپل همچنان پابرجاست.
هوش مصنوعی مشکل کمحافظگی کوتاهمدت سیری را حل کرده است

یکی از اعصابخردکنترین ویژگیهای دستیارهای صوتی کلاسیک این بود که بهراحتی سرنخ مکالمه را گم میکردند و رشته کلام از دستشان خارج میشد.
مرکشیچ میگوید موضوع بهخاطر سپردن حرفهای پیشین کاربر در طول یک جلسه مکالمه، «در سطح مدلهای امروزی اساساً حل شده است». مدلهای فعلی قادر به پردازش حجم حیرتانگیزی از بستر متنی (Context Window) هستند و فضای بسیار بیشتری از آنچه برای یک مکالمه روزمره لازم است در اختیارتان میگذارند.
بنابراین، اگر در آینده دیدید یک دستیار هوشمند ظاهراً حرف قبلی شما را فراموش کرده، دیگر مشکل از خود مدل زبانی نیست.
شرکتها هنوز محدودیتها، پرامپتهای محافظتی و فیلترهای سفتوسختی را دور این مدلها میچینند تا رفتارشان را مهار کنند. به عقیده مرکشیچ، گاهی همین قوانین ایمنی سختگیرانه این حس اشتباه را به کاربر القا میکند که دستیار رشته کلام را گم کرده، درحالیکه هوش مصنوعی فقط با خط قرمزها و دیوارهای امنیتی تحمیلشده برخورد کرده است.
با این حال، یک نوع حافظه عمیقتر و بسیار دشوارتر هم وجود دارد: «شناخت واقعی کاربر». اینکه یک دستیار یادش بماند ۵ دقیقه پیش چه گفتید خوب است، اما دستیاری که حلقه نزدیکان، برنامههای روزمره، متن ایمیلها و پروژههای کاری شما را بشناسد، ارزش و قدرتی هزاران برابر پیدا میکند.
و درست در همین نقطه است که اپل با یک دوراهی بسیار حساس روبهرو میشود.
بزرگترین برگ برنده اپل میتواند به بزرگترین پاشنهآشیل آن تبدیل شود

اپل از مزیتی بهره میبرد که ChatGPT و سایر اپلیکیشنهای مستقل هوش مصنوعی روی گوشی شما خوابش را هم نمیبینند: دسترسی عمیق و بومی به لایههای مختلف سیستمعامل. آیفون شما انبار بزرگی از پیامها، ایمیلها، آلبوم تصاویر، مخاطبان و اطلاعات فوقالعاده شخصی شماست؛ یعنی دقیقاً همان زمینهای که یک دستیار هوش مصنوعی نیاز دارد تا متوجه شود منظورتان از یک دستور دقیقاً چیست.
مرکشیچ در پاسخ به اینکه آیا این دسترسی به سیری برتری میدهد، میگوید: «از نظر تئوری، قطعاً بله. دسترسی مستقیم در سطح سیستمعامل به ایمیلها، پیامها، عکسها و آنچه هماکنون روی صفحه نمایش شماست، دقیقاً همان کانتکستی است که یک دستیار هوش مصنوعی را بهمعنای واقعی کلمه کاربردی میکند؛ امتیازی که هیچ چتبات اپلیکیشنی بدون نصب رابطها و دسترسیهای خاص هرگز به آن نخواهد رسید.»
اما گیر اصلی کار، وسواس بر سر حریم خصوصی و اعتماد کاربران است. اپل بیش از یک دهه روی برندسازی خود بهعنوان قهرمان حریم خصوصی در گوشیهای هوشمند سرمایهگذاری کرده است. دادن دسترسی نامحدود به یک دستیار هوشمند برای خواندن ریزترین اطلاعات خصوصی کاربر، نیازمند بندبازی روی طنابی بسیار باریکتر از توسعه یک چتبات ساده است.
مرکشیچ یادآوری میکند که سیاستهای سفتوسخت حریم خصوصی اپل در طول تاریخ همیشه دادههای در دسترس سیستمهای هوشمندش را نسبت به غولهایی مثل گوگل و متا محدود کرده بود.
او اضافه میکند: «واقعیت این است که ایجنتهای صوتی هر چقدر اطلاعات بیشتری از زیروبم زندگی شما داشته باشند، فوقالعاده مفیدتر میشوند.»
در نهایت، آزمون واقعی و نهایی سیری این نیست که آیا اپل توان ساخت یک مدل هوشمند را دارد یا خیر؛ بلکه سؤال اینجاست که این شرکت حاضر است چه مقدار از اطلاعات شخصی شما را در اختیار این مدلها قرار دهد.
حتی مکثها و لحن ادای کلمات شما مهم هستند

یک دلیل کلیدی دیگر هم وجود دارد که چرا صحبت کردن با هوش مصنوعی بسیار پیچیدهتر از تایپ کردن است: انسانها هنگام حرف زدن شلخته هستند! ما وسط جمله مکث میکنیم، حرف خودمان را قطع میکنیم و بارها نظرمان عوض میشود.
تصور کنید بگویید: «قرار رو برای ساعت ۲... نه، ۳ بعدازظهر بذار.»
یک مخاطب انسانی با شنیدن تغییر تن صدا و مکث شما، در کسری از ثانیه متوجه میشود که حرفتان را اصلاح کردهاید. اما سیستمی که ابتدا صدا را به متن (Speech-to-Text) تبدیل میکند و بعد از روی متن خام تصمیم میگیرد، تمام این جزئیات طلایی را از دست میدهد.
این فرآیند سنتی باعث میشود حسوحال، آهنگ کلام و تأکیدهای صوتی حذف شوند. اما خوشبختانه نسل نوظهور مدلهای صوتی نیتیو (Audio-Native AI) طراحی شدهاند تا مستقیماً روی خود فایل صوتی و ارتعاشات آن استدلال کنند، نه اینکه صرفاً متن پیادهشده را بخوانند. مرکشیچ مدل اختصاصی Dialog-RSN-1 در شرکت PolyAI را نمونهای از این رویکرد نسل بعدی معرفی میکند.
برای دستیاری مثل سیری، درک این ظرافتهای صوتی در نهایت میتواند تعامل انسان را از حالت دادن فرمانهای خشک نظامی به یک کامپیوتر، به یک گپوگفت خودمانی و طبیعی تبدیل کند.
سیری در نهایت باید چه چیزی را درست کند؟
بخش شگفتانگیز ارزیابی این پژوهشگر برجسته این است که خودِ مدلهای هوش مصنوعی دیگر سختترین قسمت پازل نیستند.
فناوری لازم برای اینکه ایجنتهای صوتی بتوانند گفتوگوهای طولانی و روان انجام دهند همین حالا وجود دارد؛ بهعنوان مثال شرکت PolyAI در حال حاضر ایجنتهای مکالمهای خود را در صنایع گوناگونی از جمله بانکداری، هتلداری و بهداشت و درمان به کار گرفته است.
مسئله اصلی برای اهالی کوپرتینو این است که تا چه اندازه حاضرند به سیری میدان عمل بدهند.
مرکشیچ میگوید: «آنچه امروز غایب است، تمایل خودِ اپل برای کاهش این محدودیتهای سختگیرانه است تا سیری واقعاً بتواند باری از دوش شما بردارد و کارها را جلو ببرد.»
نسل بعدی دستیارهای صوتی صرفاً با توانایی پاسخ به یک سؤال دنبالهدار یا به یاد آوردن چند جمله قبلی سنجیده نمیشوند؛ چتجیپیتی و جمینای همین حالا سطح توقع عمومی را بسیار بالا بردهاند. جهش تاریخی بزرگ درست زمانی رقم میخورد که یک دستیار هوش مصنوعی بهاندازه کافی شما را بشناسد و مجوزهای لازم را داشته باشد تا بر اساس کلماتی که به زبان میآورید، در دنیای واقعی دست به عمل بزند.
اپل به دلیل حضور همیشگی در جیب و روی مچ دست صدها میلیون کاربر، در موضع قدرت فوقالعادهای قرار دارد. اما بهرهبرداری از این گنجینه، نیازمند عبور از موانعی است که بیش از فناوری، به فلسفه محصول و جلب اعتماد مربوط میشود.
فناوری ناکارآمدی که باعث میشد سیری قدیمی دائماً همهچیز را فراموش کند در حال مرگ است؛ حالا این اپل است که باید تصمیم بگیرد اجازه میدهد نسخه جدید سیری چه چیزهایی را درباره زندگی شما به خاطر بسپارد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

دردسر بزرگ ایجنتهای هوش مصنوعی؛ چرا مردم عادی روی خوشی به آنها نشان نمیدهند؟
غولهای فناوری آینده خود را روی ایجنتهای هوش مصنوعی شرطبندی کردهاند، اما با یک سد محکم روبهرو شدهاند: مردم عادی علاقهای به این دستیارها ندارند. بیشتر افراد نه تنها تمایلی ندارند کنترل ایمیلها و حسابهای بانکی خود را به هوش مصنوعی بسپارند، بلکه ارزش زندگی را در بیرون از قاب مانیتور و دنیای کار جستوجو میکنند.

از پذیرش تا بلوغ ابری؛ شرط حیاتی کسبوکارها برای نجات هوش مصنوعی از بنبست
سالهاست شرکتها مهاجرت به ابر را پایان مسیر تحول دیجیتال میدانستند، اما با ورود هوش مصنوعی معادلات کاملاً به هم ریخته است. بررسیهای تازه نشان میدهد فاصله میان شکست یا پیروزی در مقیاسپذیری هوش مصنوعی، نه در استفاده صِرف از ابر، بلکه در رسیدن به «بلوغ ابری» و نوسازی زیرساختهای کهنه نهفته است.

خیز ۵ میلیارد دلاری کلیو برای تسخیر دادگاهها با تصاحب هوش مصنوعی مخصوص قضات
شرکت ۵ میلیارد دلاری کلیو (Clio) با خرید استارتاپ Learned Hand، گام بلندی برای بردن هوش مصنوعی به اتاق قاضیها و میز دادگاهها برداشت. این حرکت راهبردی در شرایطی رقم میخورد که دادگاهها زیر بار انبوه پروندهها ماندهاند و کلیو قصد دارد با نفوذ در این بخش، رقبای پر سر و صدایش را پشت سر بگذارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.