«Иллюзия мышления»: исследование Apple показало, почему ИИ не решает сложные задачи

Forklog
2025-06-11 13:07:46

Исследователи из Apple выяснили, что даже самые продвинутые языковые модели с функцией «размышления» (LRM) не способны к обобщенному решению задач. Их способность к логике оказалась ограниченной, а в некоторых случаях — иллюзорной. Команда провела эксперимент, чтобы понять реальные возможности и ограничения моделей вроде OpenAI o1/o3, Claude 3.7 Sonnet Thinking и DeepSeek-R1. Эти системы генерируют подробные цепочки рассуждений перед тем, как дать ответ, что должно улучшать их производительность. Вместо стандартных математических тестов, которые могут быть «загрязнены» данными из интернета, команда использовала контролируемые головоломки. Среди них были Ханойская башня, Переправа через реку и Мир блоков. Такой подход позволил точно измерять сложность задачи, меняя количество элементов, и анализировать не только конечный ответ, но и весь процесс «мышления» модели. Иллюстрация головоломок: Ханойская башня, Прыжок в шашках, Переправа через реку и Мир блоков. Данные: Apple. Коллапс при высокой сложности Главный вывод исследования — производительность всех современных LRM-моделей падает до нуля, как только сложность головоломки превышает определенный порог. Усилия на «размышления», измеряемые в количестве использованных токенов, растут вместе со сложностью задачи, но только до определенного момента. Перед полным провалом модель парадоксально начинает «думать» меньше, хотя у нее достаточно вычислительных ресурсов для генерации длинного ответа. Это указывает на фундаментальный предел масштабирования их логических способностей. Три режима производительности Сравнив «думающие» модели с их стандартными версиями (LLM), исследователи выделили три режима работы в зависимости от сложности задачи: низкая сложность — LLM без функции размышлений справляются лучше и эффективнее; средняя — LRM продемонстрировали преимущество благодаря цепочкам рассуждений; высокая сложность — оба типа моделей полностью провалили задания. Неспособность следовать алгоритму Исследователи предоставили модели точный алгоритм для решения Ханойской башни, который требовал лишь последовательного выполнения шагов. Однако она все равно потерпела крах на том же уровне сложности, что и при самостоятельном поиске решения. Это ставит под сомнение их способность к выполнению точных вычислений и логике. Авторы пришли к выводу, что нынешние LRM, несмотря на сложные механизмы саморефлексии, не обладают обобщаемыми навыками решения проблем. Их успехи могут быть связаны, скорее, с продвинутым сопоставлением с образцом, а не с реальным процессом рассуждения, что делает термин «иллюзия мышления» из заголовка исследования весьма точным. Напомним, в мае биржа OKX выпустила отчет, в котором говорится, что искусственный интеллект и блокчейн открывают новые подходы к получению дохода в различных отраслях. https://forklog.com/news/ai/gallyutsinatsii-ostalis-osnovnoj-problemoj-ii

En Okunan haberler

Jupiter Price Prediction 2025, 2026 – 2030: W...
2025-10-25
Nasdaq-Listed Bonk Holdings Establishes First...
2025-10-25
Tether Set to Hit $15B Profit, Eyes USAT Stab...
2025-10-25
Top 6 Trending Crypto Coins This Weekend: San...
2025-10-25
US CPI Today (Live) Updates
2025-10-24
$3.68B Bitcoin ETF Trading Shows Strong Deman...
2025-10-24
Ripple News: XRP Dominates CME Q3 Crypto Acti...
2025-10-24
Litecoin’s Retail-Driven Growth: 8.7 Million...
2025-10-24

Alakalı haberler

XRP Price Prediction For 25th-31st October
25 Oct 2025
Crypto Trader James Wynn Bets $25K on XRP, Seeks C...
25 Oct 2025
Why XRP Price is Up Today?
25 Oct 2025
How ETH and SOL Traders Are Flipping Gains Into Oz...
25 Oct 2025
Binance Buying Millions in Bitcoin, But Analysts P...
25 Oct 2025
Exclusive Ferrari 499P Auction Goes Crypto with Ne...
25 Oct 2025

Feragatnameyi okuyun : Burada sunulan tüm içerikler web sitemiz, köprülü siteler, ilgili uygulamalar, forumlar, bloglar, sosyal medya hesapları ve diğer platformlar (“Site”), sadece üçüncü taraf kaynaklardan temin edilen genel bilgileriniz içindir. İçeriğimizle ilgili olarak, doğruluk ve güncellenmişlik dahil ancak bunlarla sınırlı olmamak üzere, hiçbir şekilde hiçbir garanti vermemekteyiz. Sağladığımız içeriğin hiçbir kısmı, herhangi bir amaç için özel bir güvene yönelik mali tavsiye, hukuki danışmanlık veya başka herhangi bir tavsiye formunu oluşturmaz. İçeriğimize herhangi bir kullanım veya güven, yalnızca kendi risk ve takdir yetkinizdedir. İçeriğinizi incelemeden önce kendi araştırmanızı yürütmeli, incelemeli, analiz etmeli ve doğrulamalısınız. Ticaret büyük kayıplara yol açabilecek yüksek riskli bir faaliyettir, bu nedenle herhangi bir karar vermeden önce mali danışmanınıza danışın. Sitemizde hiçbir içerik bir teklif veya teklif anlamına gelmez

10071

58.26%