<?xml version="1.0" encoding="utf-8" standalone="yes"?> <?xml-stylesheet href="https://maik.io/pretty-feed-v3.xsl" type="text/xsl"?>

<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>alignment on maik.io</title>
    <link>https://maik.io/tags/alignment/</link>
    <description>Recent content in alignment on maik.io</description>
    <generator>maik.io</generator>
    <language>de-de</language>
    <lastBuildDate>Fri, 21 Nov 2025 17:15:12 +0200</lastBuildDate>
    <atom:link href="https://maik.io/tags/alignment/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Stilistische Tarnung</title>
      <link>https://maik.io/notes/2025-11-21-25-stilistische-tarnung/</link>
      <pubDate>Fri, 21 Nov 2025 17:15:12 +0200</pubDate>
      <guid>https://maik.io/notes/2025-11-21-25-stilistische-tarnung/</guid>
      <description>&lt;blockquote&gt;
&lt;p&gt;Die Kunst ist eine Tochter der Freiheit.
– Friedrich Schiller.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Eine der Studie »&lt;a href=&#34;https://arxiv.org/abs/2511.15304&#34; title=&#34;[2511.15304] Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models&#34; target=&#34;_blank&#34; &gt;Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models&lt;/a&gt;« von Bisconti et al. zeigt, dass vielen KI-Modellen diese Freiheit zum Problem wird. Sobald Anfragen in poetischer Form gestellt werden, reagieren selbst moderne Systeme deutlich weniger zurückhaltend. Die Forschenden stellten fest, dass verseartige „adversarial poetry“-Prompts die Sicherheitstechnik verschiedener Modelle deutlich schwächen und allein durch die stilistische Tarnung wirken.&lt;/p&gt;</description>
      <content:encoded>
      <![CDATA[<blockquote>
<p>Die Kunst ist eine Tochter der Freiheit.
– Friedrich Schiller.</p>
</blockquote>
<p>Eine der Studie »<a href="https://arxiv.org/abs/2511.15304" title="[2511.15304] Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models" target="_blank" >Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models</a>« von Bisconti et al. zeigt, dass vielen KI-Modellen diese Freiheit zum Problem wird. Sobald Anfragen in poetischer Form gestellt werden, reagieren selbst moderne Systeme deutlich weniger zurückhaltend. Die Forschenden stellten fest, dass verseartige „adversarial poetry“-Prompts die Sicherheitstechnik verschiedener Modelle deutlich schwächen und allein durch die stilistische Tarnung wirken.</p>
<p>Die Ergebnisse legen nahe, dass nicht nur Inhalte, sondern auch Ausdrucksformen sicherheitsrelevant sind. Gedichte, Reime oder Metaphern erzeugen eine sprachliche Unschärfe, die viele Filter umgeht. Die Studie macht damit eine unerwartete Schwachstelle im Design aktueller KI-Systeme sichtbar und zeigt, dass Kreativität nicht nur ästhetische, sondern auch technische Folgen haben kann.</p>
]]>    
      <![CDATA[<br><br><hr><br><small><p>Vielen Dank fürs Lesen! Wenn du Lust auf noch mehr Gedanken, Updates und ab und zu einen Blick hinter die Kulissen hast, folge mir doch gern auf <a href="https://maik.io/mastodon">Mastodon</a> oder <a href="https://maik.io/instagram">Instagram</a>.</p><p>Hast du Fragen oder Feedback? Schreib mir gern eine <a href="https://maik.io/email">E-Mail</a>.</p></small>]]>
      </content:encoded>  
    </item>
    <item>
      <title>statistisch am wahrscheinlichsten</title>
      <link>https://maik.io/notes/2025-04-20-statistisch-am-wahrscheinlichsten/</link>
      <pubDate>Sun, 20 Apr 2025 08:13:05 +0200</pubDate>
      <guid>https://maik.io/notes/2025-04-20-statistisch-am-wahrscheinlichsten/</guid>
      <description>&lt;p&gt;Dieter Petereit schreibt in »&lt;a href=&#34;https://t3n.de/news/openai-o3-o4-mini-nachdenken-ki-smart-reasoning-1683718&#34; title=&#34;OpenAI o3 und o4-mini: Warum längeres Nachdenken die KI wirklich smart macht - t3n – digital pioneers&#34; target=&#34;_blank&#34; &gt;OpenAI o3 und o4-mini: Warum längeres Nachdenken die KI wirklich smart macht&lt;/a&gt;« für t3n.de&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Erstmals können diese Modelle agentenhaft agieren. Sie nutzen und kombinieren eigenständig alle verfügbaren Werkzeuge innerhalb von ChatGPT – von der Websuche über die Datenanalyse mit Python bis hin zur Bildanalyse und sogar Bilderzeugung. Sie entscheiden selbst, wann und wie sie diese Tools einsetzen, um komplexe, vielschichtige Probleme zu lösen. Dazu benötigen sie mehr Bedenkzeit.&lt;/p&gt;</description>
      <content:encoded>
      <![CDATA[<p>Dieter Petereit schreibt in »<a href="https://t3n.de/news/openai-o3-o4-mini-nachdenken-ki-smart-reasoning-1683718" title="OpenAI o3 und o4-mini: Warum längeres Nachdenken die KI wirklich smart macht - t3n – digital pioneers" target="_blank" >OpenAI o3 und o4-mini: Warum längeres Nachdenken die KI wirklich smart macht</a>« für t3n.de</p>
<blockquote>
<p>Erstmals können diese Modelle agentenhaft agieren. Sie nutzen und kombinieren eigenständig alle verfügbaren Werkzeuge innerhalb von ChatGPT – von der Websuche über die Datenanalyse mit Python bis hin zur Bildanalyse und sogar Bilderzeugung. Sie entscheiden selbst, wann und wie sie diese Tools einsetzen, um komplexe, vielschichtige Probleme zu lösen. Dazu benötigen sie mehr Bedenkzeit.</p>
</blockquote>
<p>Ich habe das Gefühl, dass KI nicht wirklich schlauer wird. Sie wirkt nur so. In Wirklichkeit scheinen die Antworten immer ähnlicher zu werden.</p>
<p>Warum denke ich das? Die aktuellen GPTs versuchen oft, deinen Prompt auf verschiedene Arten zu verstehen. Die „KI“ prüft, was du wahrscheinlich gemeint hast. Dabei orientiert sie sich daran, was viele andere in ähnlichen Fällen gemeint haben. Dieses Prinzip gilt auch für die Antwort. Du bekommst nicht unbedingt die beste Antwort, sondern die Antwort, die statistisch am wahrscheinlichsten passt.</p>
<p>Das ist nicht automatisch schlecht. Es gibt Situationen, in denen genau das sinnvoll ist. Mir geht es nur darum, ein Bewusstsein dafür zu schaffen. Wer mit dem Tool arbeitet, sollte ungefähr wissen, wie es funktioniert.</p>
]]>    
      <![CDATA[<br><br><hr><br><small><p>Vielen Dank fürs Lesen! Wenn du Lust auf noch mehr Gedanken, Updates und ab und zu einen Blick hinter die Kulissen hast, folge mir doch gern auf <a href="https://maik.io/mastodon">Mastodon</a> oder <a href="https://maik.io/instagram">Instagram</a>.</p><p>Hast du Fragen oder Feedback? Schreib mir gern eine <a href="https://maik.io/email">E-Mail</a>.</p></small>]]>
      </content:encoded>  
    </item>      
  </channel>
</rss>